报码:【j2开奖】深度 | 英伟达Titan Xp出现后，如何为深度学习挑选合适的GPU？这里有份性价比指南_本港台直播_J2开奖直播

参与：李泽南、微胖

4 月初，英伟达发布了 Titan X Pascal 的升级版——新一代旗舰显卡 Titan Xp。它搭载 12G DDR5X 内存，速度为 11.4Gbps，共 3840 个 CUDA 核心（Titan X 和 GTX 1080 Ti 均为 3584 个），运行频率为 1.6GHz，运算速度可达 12TFLOPs。这是英伟达在发布售价为 818 美元的 GeForce GTX 1080Ti 后，对于显卡产品线的又一次调整。「这块新显卡将为用户提供极端的性能，」英伟达在发布公告中表示。Titan Xp 的目标用户不仅在于高端游戏玩家，更包括需要训练神经网络的研究者。随后（4 月 9 日），Tim Dettmers 再度更新了他的系列博客。这次更新主要比较了不同 GPU 产品性价比，补充、更新最终推荐名单。机器之心编译了更新后的博文全文（请注意，加粗部分为本次更新内容）。

深度学习是一个计算密集型领域，而 GPU 的选择将从根本上决定你的深度学习实验。没有 GPU，一个实验也许花费数月才能完成，或者实验运行一天却只关闭了被选择的参数；而一个良好稳定的 GPU 可让你在深度学习网络中快速迭代，在数天、数小时、数分钟内完成实验，而不是数月、数天、数小时。所以，购买 GPU 时正确的选择很关键。那么，如何选择一个适合你的 GPU 呢？这正是本篇博文探讨的问题，帮助你做出正确选择。

对于深度学习初学者来说，拥有一个快速 GPU 非常重要，因为它可以使你迅速获得有助于构建专业知识的实践经验，这些专业知识可以帮助你将深度学习应用到新问题上。没有这种迅速反馈，从错误中汲取经验将会花费太多时间，在继续深度学习过程中也会感到受挫和沮丧。在 GPU 的帮助下，我很快就学会了如何在一系列 Kaggle 竞赛中应用深度学习，并且在 Partly Sunny with a Chance of Hashtags Kaggle 竞赛上获得了第二名，竞赛内容是通过一个给定推文预测气象评分。比赛中，我使用了一个相当大的两层深度神经网络（带有两个修正线性单元和 dropout，用于正则化），差点就没办法把这个深度网络塞进我的 6G GPU 内存。

应该使用多个 GPU 并联吗？

在 GPU 的帮助下，深度学习可以完成很多事情，这让我感到兴奋。我投身到多 GPU 的领域之中，用 InfiniBand 40Gbit/s 互连组装了小型 GPU 集群。我疯狂地想要知道多个 GPU 能否获得更好的结果。我很快发现，不仅很难在多个 GPU 上并行神经网络。而且对普通的密集神经网络来说，加速效果也很一般。小型神经网络可以并行并且有效地利用数据并行性，但对于大一点的神经网络来说，例如我在 Partly Sunny with a Chance of Hashtags Kaggle 比赛中使用的，几乎没有加速效果。

随后，我进一步试验，对比 32 位方法，我开发了带有模型并行性的新型 8 位压缩技术，该技术能更有效地并行处理密集或全连接神经网络层。

然而，我也发现，并行化也会让人沮丧得发狂。针对一系列问题，我天真地优化了并行算法，结果发现：考虑到你投入的精力，即使使用优化过的自定义代码，多个 GPU 上的并行注意的效果也并不好。你需要非常留意你的硬件及其与深度学习算法交互的方式，这样你一开始就能衡量你是否可以受益于并行化。

报码:【j2开奖】深度 | 英伟达Titan Xp出现后，如何为深度学习挑选合适的GPU？这里有份性价比指南

我的计算机配置：你可以看到三块 GTX Titan 和一块 InfiniBand 卡。这是用于深度学习的好配置吗？

自那时起，GPU 的并行性支持越来越普遍，但距离全面可用和有效还差的很远。目前，在 GPU 和计算机中实现有效算法的唯一深度学习库是 CNTK，它使用微软的 1 比特量子化（有效）和 block momentum（很有效）的特殊并行化算法。通过 CNTK 和一个包含 96 块 GPU 的聚类，你可以拥有一个大约 90x-95x 的新线性速度。Pytorch 也许是跨机器支持有效并行化的库，但是，库目前还不存在。如果你想要在一台机器上做并行，那么，CNTK、Torch 和 Pytorch 是你的主要选择，这些库具备良好的加速（3.6x-3.8x），并在一台包含 4 至 8 块 GPU 的机器之中预定义了并行化算法。也有其他支持并行化的库，但它们不是慢（比如 2x-3x 的 TensorFlow）就是难于用于多 GPU (Theano)，或者兼而有之。

如果你重视并行计算，我建议你使用 Pytorch 或 CNTK。

使用多 GPU 而无并行

使用多 GPU 的另外一个好处是：即使没有并行算法，你也可以分别在每个 GPU 上运行多个算法或实验。速度没有变快，但是你能一次性通过使用不同算法或参数得到更多关于性能信息。如果你的主要目标是尽快获得深度学习经验，这是非常有用的，而且对于想同时尝试新算法不同版本的研究人员来说，这也非常有用。

(责任编辑：本港台直播)