
集成71亿晶体管的GK110以其无以伦比的性能证明了它是地球最快的GPU,但没有最快只有更快,如果想要继续提升性能超越极限,NVIDIA的SLI技术行之有效。
SLI的全称是Scalable Link Interface(可升级连接接口)也称速力,是NVIDIA的专利技术。它是通过一种特殊的接口连接方式,在一块支持双PCI Express X 16的主板上,同时使用两块或者以上数量的同型号PCIE显卡。

多显卡并行机制的历史最早可以追溯到1998年初,3Dfx推出了它们的第二代3D图形卡产品—Voodoo 2,当时Voodoo 2拥有90Mps的像素填充率,具备Z-Buffering、Anti-Aliasing、单周期双纹理等当时最先进的3D特性,大幅超越其上一代产品,不过,最令发烧友疯狂的是Voodoo 2所具有的“SLI交错互连技术”,这项技术可以让两块Voodoo 2显卡连接起来并行运作,获得近乎翻倍的3D效能。如此一来,其他竞争者更是望尘莫及。
究其原理,显卡最终生成的是所渲染的3D画面,画面的生成速度即代表着显卡的性能,SLI技术将一幅渲染的画面分为一张张的扫描帧(Scanline),若采用双显卡运行模式,那么就由一个显卡负责渲染画面的奇数帧,另一块显卡渲染偶数帧,然后将同时渲染完毕的帧线进行合并后写入到帧缓冲中,接下来显示器就可以显示出一个完整的渲染画面。不难看出,双卡SLI技术让渲染工作被平均分担,每块显卡只需要完成1/2的工作量。
理想状态下,有几块显卡并行计算,渲染效率就有可能达到单卡的几倍,所以如果想要追求极限的性能,SLI技术无疑是最佳选择,多显卡并行平台也是显卡发烧友的终极装备,所以我们特意召集了三块GTX TITAN进行专门的SLI测试,看看当今最强悍的GPU多卡SLI效率如何,同时通过测试向大家展示一下当今最强游戏平台的性能究竟变态到什么程度!
随着科学、医学、工程和金融各领域对高性能并行计算需求的增加,NVIDIA以无比强大的GPU计算架构来不断创新和满足这种需求。NVIDIA现有的 Fermi GPU已经重新定义和加速了以下领域的高性能计算(HPC)的功能,如地震处理、生化模拟、天气和气候建模、信号处理、计算金融、计算机辅助工程、计算流体力学和数据分析。NVIDIA的新Kepler GK110 GPU大大提高了并行计算标准,并将会帮助解决世界上面临的最困难的计算问题。

通过提供比上一代GPU更强大的处理功能以及优化和提高GPU上并行执行工作负载的新方法,Kepler GK110简化了并行程序的创建,将对会对高性能计算引起进一步改革。

Kepler GK110由71亿个晶体管组成,是有史以来架构最复杂的微处理器。GK110新加了许多注重计算性能创新功能,目的是要成为NVIDIA Tesla和HPC市场上的并行处理动力站。
Kepler GK110会提供超过每秒1万亿次双精度浮点计算的吞吐量,DGEMM效率大于80%,而之前的Fermi架构的效率是60‐65%。
除了性能之外,Kepler架构在电源效率方面也有巨大的飞跃,相对于Fermi 的性能/功率比提高了3倍之多!

之前有人说Kepler GK110更适合超级计算和通用计算,其实这是一种误解。Kepler GK110的以下新功能不仅提高GPU的利用率,简化了并行程序设计,而且有助于GPU在各种计算环境中部署,无论是从个人电脑还是超级计算机,GK110都适用:
Dynamic Parallelism – 能够让GPU在无需CPU介入的情况下,通过专用加速硬件路径为自己创造新的工作,对结果同步,并控制这项工作的调度。这种灵活性是为了适应程序执行过程中并行的数量和形式,编程人员可以处理更多的各种并行工作,更有效的将GPU用为计算用途。
Hyper-Q – 允许多个CPU核同时在单一GPU上启动工作,从而大大提高了GPU 的利用率并削减了CPU空闲时间。Hyper‐Q 增加了主机和 Kepler GK110GPU之间的连接总数(工作队列),允许 32 个并发、硬件管理的连接(与 Fermi相比,Fermi 只允许单个连接)。
NVIDIA GPUDirect–NVIDIA GPUDirect 能够使单个计算机内的GPU或位于网络内不同服务器内的GPU直接交换数据,无需进入CPU系统内存。GPUDirect 中的 RDMA 功能允许第三方设备,例如 SSD、NIC、和 IB 适配器,直接访问相同系统内多个GPU上的内存,大大降低 MPI从GPU内存发送/接收信息的延迟。还降低了系统内存带宽的要求并释放其他 CUDA 任务使用的GPUDMA 引擎。
这里先做简单介绍,详细的内容扩展之前的首发文章已经有详细的说明,这里就不再赘述了。