谷歌发布第七代AI芯片TPU Ironwood:专为推理设计,算力提升10倍至4614 TFLOPs

发布时间:2025-04-10 阅读量:1166 来源: 综合自网络 发布人: wenwei

【导读】当地时间4月9日,谷歌在美国“Google Cloud Next 25”大会上正式推出第七代TPU芯片Ironwood,这是其首款专为AI推理任务设计的处理器。Ironwood单芯片峰值算力达4,614 TFLOPs,较前代Trillium提升10倍,并首次支持FP8计算格式以优化推理效率。其HBM容量增至192GB(Trillium的6倍),带宽提升至7.2Tbps,结合芯片间互连(ICI)带宽翻倍至1.2Tbps,大幅减少数据传输瓶颈。此外,Ironwood能效比达到Trillium的2倍,支持液冷方案,可扩展至单Pod 9,216颗芯片,总运算能力达42.5 Exaflops,为当前最强超算的24倍,适用于超大规模LLM和MoE模型训练与推理。


据介绍,Ironwood是谷歌首款在其张量核和矩阵数学单元中支持 FP8 计算的 TPU,此前谷歌的 TPU 仅支持用于推理的 INT8 格式和处理以及用于训练的 BF16 格式和处理。Ironwood 芯片还拥有第三代 SparseCore 加速器,该加速器首次在 TPU v5p 中首次亮相,并在去年的 Trillium 芯片中得到了增强。SparseCore 芯片最初旨在加速推荐模型,这些模型利用嵌入来跨用户类别进行推荐。Ironwood 芯片中的第三代 SparseCore 编码了各种算法,以加速金融和科学计算,但具体细节未透露。


Ironwood还大幅增加高频宽內存(HBM)容量,每颗芯片的HBM容量提高到了192GB,达到了Trillium的6倍,可处理更大型的模型和数据集运算,减少频繁的数据传输需求,提升整体性能。同时,HBM带宽也大幅提升,Ironwood单颗芯片的内存带宽可达7.2Tbps,是Trillium的4.5倍。如此高速的带宽可确保数据快速存取。


谷歌还强化了Ironwood芯片间互连(Inter-Chip Interconnect,ICI)带宽,双向传输提高至1.2Tbps,是Trillium的1.5倍,如此一来加速芯片间的通信,提升大型分布式训练和推理的效率。


17.jpg

Ironword 封装包括计算芯片上方的中央小芯片,以及沿顶部边缘的HBM上方的另外两个小芯片。这些无疑是谷歌用于将 TPU 芯片电气连接成 pod 的芯片间互连 (ICI) 的 I/O 芯片。更大的 TPU 聚合与谷歌的“Jupiter”光电路开关进一步捆绑在一起。


总体来看,得益于计算核心、HBM等多方面的提升,Ironword单芯片峰值算力可达4,614 TFLOPs,达到了上一代 Trillium的10倍。


18.jpg

近三代谷歌TPU产品比较


在提升性能的同时,谷歌还提升了“Ironwood”能效表现。据介绍,相比 2024年推出的第六代TPU “Trillium”,Ironwood的性能功耗比达到了Trillium的2倍。Ironwood 还可结合先进的液冷解决方案和芯片设计优化,即使持续面对繁重AI工作负载,也能维持相比标准气冷高出近2倍的性能。


Ironwood 根据客户对AI工作负载的需求提供2种规模配置,分别是面向推理的256个计算引擎的版本、面向训练的9,216个计算引擎的版本。


19.jpg


当扩展至每个Pod达到9,216颗晶片时,总运算能力可达42.5 Exaflops,是世界上最大的超级电脑El Capitan的24倍以上,El Capitan每个Pod仅提供1.7 Exaflops。由于Ironwood提供大规模运算能力,能够支持最严苛的AI工作负载,例如用于训练和推理、具备思考能力的超大型密集LLM或MoE。


Ironwood 还配备增强版的SparseCore,这是一种专门用于处理进阶排序和推荐系统工作负载常见的超大规模嵌入加速器。此外,Google DeepMind 开发的机器学习执行阶段构架Pathways,可在多个TPU间达成高效的分布式运算。Google Cloud 上的Pathways让客户轻易超越单个Ironwood Pod的限制,将数十万颗芯片组合在一起,快速推进AI发展。


Ironwood的发布标志着谷歌在AI芯片领域的技术跃进,其增强版SparseCore加速器和Pathways分布式架构进一步强化了复杂推荐系统与科学计算的能力。尽管英伟达仍主导AI芯片市场,但谷歌正通过TPU系列(如Ironwood、Trillium)与亚马逊Trainium、微软Maia等展开竞争。随着Ironwood加入谷歌云服务,其在支持超大规模AI模型和定制化工作负载上的优势,或将成为企业级客户选择云平台的关键筹码。



推荐阅读:


长电科技2024年净利增9.5% 2025Q1预增50% 美国关税政策“基本无直接影响”

智驾未来 芯创生态|ST 2025慕尼黑上海电子展科技盛宴即将启幕

粤港澳大湾区领航全球电子产业革新 CITE2025启幕勾勒AI与低空经济新纪元

SK海力士突破第六代DRAM量产门槛!1c制程良率飙升至80%,HBM领域仍需等待

三星电子启动内部人力大调整 全力押注HBM4争夺AI芯片市场主导权



相关资讯
CIS芯片龙头年报解读:格科微高像素战略如何实现287%净利增长

格科微电子(688728.SH)2024年度财务报告显示,公司年度营收突破63.83亿元人民币,实现35.9%的同比增幅,归母净利润呈几何级增长达1.87亿元,EBITDA指标跃升107.13%至14.15亿元。这种爆发式增长源自其在CMOS图像传感器(CIS)领域实施的"技术锚定+场景穿透"双轮驱动战略,特别是在高像素产品矩阵构建和新兴应用市场开拓方面取得突破性进展。

RS2604 vs 传统保险丝:技术迭代下的安全与效率革命

RS2604作为一款高集成度、可配置OVP(过压保护)和OCP(过流保护)的eFuse开关,专为12V24V母线电压接口设计,兼顾热插拔保护与动态负载管理。其输入电压覆盖4.5V40V,极限耐压高达45V,适用于工业设备、汽车电子及消费电子领域。通过外部电阻灵活设置350mA至2.5A的限流值,结合±7%高精度电流检测,RS2604在安全性与能效间实现平衡,成为复杂电源系统的核心保护方案。

全球汽车芯片市场遇冷,恩智浦如何守住56%毛利率防线?

荷兰半导体巨头恩智浦于2025年4月28日披露的财报显示,公司第一季度营收28.35亿美元,同比、环比均下滑9%,但略超市场预期。在汽车、工业与物联网等核心业务需求疲软的背景下,Non-GAAP毛利率同比下降2.1个百分点至56.1%,自由现金流则维持在4.27亿美元,突显其成本控制能力。值得关注的是,管理层对第二季度营收指引中值(29亿美元)释放出环比复苏信号,但关税政策的不确定性仍为业绩蒙上阴影。

全闪存与软件定义双轮驱动——中国存储产业年度趋势报告

根据IDC最新发布的企业级存储市场追踪数据,2024年中国存储产业迎来结构性增长拐点。全年市场规模达69.2亿美元,在全球市场占比提升至22%,展现出强劲复苏态势。以浪潮信息为代表的国内厂商持续突破,在销售额(10.9%)和出货量(11.2%)两大核心指标上均跻身市场前两强,标志着本土存储生态的成熟度显著提升。

索尼启动半导体业务战略重组 图像传感器龙头或迎资本化新篇章

全球消费电子巨头索尼集团近期被曝正酝酿重大战略调整。据彭博社援引多位知情人士透露,该集团拟对旗下核心半导体资产——索尼半导体解决方案公司(SSS)实施部分分拆,计划于2023年内推动该子公司在东京证券交易所独立IPO。该决策标志着索尼在半导体产业布局进入新阶段,同时也预示着全球图像传感器市场格局或将发生重要变化。