

智东西10月10日报道,重整旗鼓的英特尔,刚刚放出酝酿已久的重头戏——AI PC处理器Panther Lake、服务器处理器Clearwater Forest,以及最新的全面AI战略和AI执行路线图。
在英特尔技术巡礼活动上,英特尔首席技术及人工智能官、高级副总裁Sachin Katti在开幕演讲中公布英特尔年度可预测GPU节奏,透露正在全力研发一款针对AI推理优化的GPU。这款GPU拥有增强型内存架构、超大容量的存储空间,适用于企业级推理等场景。
英特尔正在全力以赴,全面深化对AI领域的布局,并将其贯穿于全线产品组合,此前宣布与英伟达的合作关系正是英特尔全新AI战略的重要信号。
技术巡礼期间,英特尔高级副总裁兼代工服务总经理Kevin O’Buckley披露了支持AI需求的最新封装路线x Retile size、封装尺寸约120 x 120、>12 HBM;
自陈立武接任CEO以来,英特尔始终处在全球科技圈舆论的中心地带。这个凝聚了硅谷精神的老牌芯片巨头,手握CPU和先进芯片制造两张王牌,却在生成式AI的时代巨浪中被掩住光芒。
本文将详解英特尔的全新AI战略,横向对比英特尔在先进制程赛道的最新站位,并通过拆解Panther Lake的技术细节来呈现英特尔对端侧Agentic AI的策略。
对此,英特尔认为需要打造一个统一软件栈,屏蔽掉异构基础设施的复杂性,提供零摩擦的部署方式,让应用能轻松上线,并自动识别最佳部署方案,与底层架构无缝协同。这个系统的组件不一定来自英特尔,而是可以兼容多种供应商,形成灵活多样的生态系统。
英特尔想构建一个开放的AI软件栈,专门用于跨硬件编排多agent,提供一站式软件来简化AI部署和规模化。
制造、芯片、系统、软件,并已布局晶体管、光子学、先进封装、逻辑扩展及堆叠
英特尔酷睿Ultra系列3处理器(代号Panther Lake),则是承载了英特尔Agentic AI雄心的关键硬件产品。
除了AI性能比Arrow Lake-H提升80%外,Panther Lake还具备时序协同计算能力,并提供专为严苛工业环境设计的扩展温度版本。
在Demo环节,英特尔展示了为机器人等边缘计算平台设计的Panther Lake模块,PCB板上有4个嵌入DRAM的内存插槽。
英特尔全新机器人AI套件是一个开发工具包,与英特尔酷睿处理器完全集成,提供主流机器人模型、多样的参考应用、流媒体分析管线、先进AI算法、视觉语言模型优化,以加速机器人开发和部署。
RibbonFET是英特尔十多年来的第一个新型晶体管架构,属于全环绕栅极(GAA)架构,攻克了漏电难题,能在实现晶体管进一步微缩的同时减少漏电问题发生,从而提高晶体管密度、能效、最小电压(Vmin)操作和静电性能,还实现了更高的灵活性,可根据特定单元需求定制性能特征。
PowerVia背面供电解决了传统设计中混合信号线和电源线会争夺空间资源、造成拥塞的问题,将电源线移到晶体管背面,与信号布线分离,这样可以实现更稳定的电源供应,有效减少IR压降,提高高频信号的抗噪能力和稳定性,
这意味着英特尔成为业界首家在大规模量产节点上结合全栅极环绕与背面供电的公司。
这沿袭了英特尔的XPU思路,让CPU、GPU、NPU协同来提供AI加速支持:
其中,AI加速专用单元NPU的职责非常明确,就是专攻高能效,所以要缩小芯片面积,追求更紧凑的设计来优化功耗。
所以单从AI算力来看,NPU 5相比Lunar Lake里的NPU 4,在提升幅度上比较克制,但是跟前三代NPU以及Arrow Lake-H里的NPU 3.5对比,提升还是很可观的。
具体来看英特尔NPU5架构。英特尔认为上一代NPU4的设计不够高效,因此在NPU5进一步缩小面积,并简化了后端功能,通过MAC阵列规模翻倍,把单位面积性能提升40%。
这跟高通新款AI PC处理器的策略不太一样。高通的设计重点也是Agentic AI,但做法是做大NPU面积,把单NPU算力做到80TOPS,来降低首个token生成的时延和更好支持多任务并发处理,并率先实现对INT2精度的支持。
比如跑Stable Diffusion文生图模型,用NPU5+FP8精度可以将能耗从108J降到70J左右,GPU一直到最后阶段才被用到,用于图像合成。
数据转换器可将不同数据格式高效转换。目前英特尔已将自定义的内部数据库或内部结构统一转换为标准的FP32格式,作为常规的计算数据,实际上是以FP32、FP16等形式存储中间结果,这使得其他IP模块能够读取中间计算结果。
一旦用可编程查找表来实现激活函数,处理工作便从着色器和DSP转移到了神经计算引擎上,此时性能会大幅提升。
在微基准测试中,面积经优化设计的NPU5,在多种不同数据格式下性能均相比NPU4有所提升。
除了硬件外,英特尔还把加速AI的功夫下在软件优化上,构建了从底层到高层的完整生态体系。
英特尔已将超300个模型进行预转换和预量化,并开放到Hugging Face上。
Panther Lake可扩展架构的核心元素是第二代可扩展Fabric,使英特尔可以在下一代CPU中混合搭配各种IP及其分区。
其中,计算单元与GPU tile分离,通过高速互连能像统一系统一样高效协同运行与通信。
12 Xe3配置有96个XMX引擎、16MB L2缓存(翻倍)、2条几何管线。
相比上一代,Panther Lake实现图形性能提升50%,每瓦性能提升40%。
Xe3架构里升级了向量引擎、后端处理功能和光线-bit XMX引擎,L1缓存容量提高33%。
Panther Lake延用混合计算架构,有三种CPU核心:P核(性能核)、E核(能效核)、LP-E核(提高能效)。
Cougar Cove P核架构中,新核心的前端设计层次与Lion Cove基本相同。解码单元保留8位宽,MSROM、uOP Cache、分配单元都没变,分别为4位宽、12位宽、8位宽。
Darkmont也进行了内存消歧、分支预测更新,还提供了更高能效和增强响应能力的动态预取控制,通过精准控制预取策略的层次,灵活实现动态性能。
线程控制器(Thread Director)来调度混合核心,在执行多线程操作时实现资源高效利用。
跑游戏时,GPU的利用率会拉到100%,这时线程控制器一开始就先调用P核,以最大限度地提高性能,然后再扩展到E核。