苏州市干将路303号创意产业园
0512-3565 6563
Jackjones@kuaidata.com
联系客服
数据中心托管服务/管理式网络
服务:
400 651 8888
微软云服务:
400 089 2448
markjune@kuaidata.com
内容分布式网络服务:
400 811 0278
云集成与合作:
cloud@kuaidata.com
2026-09-24
AI浪潮前期,GPU与CPU依托HBM和DRAM内存的组合,撑起了大模型训练阶段庞大的运算负荷。随着产业重心逐步向推理环节转移,定制化专用硬件开始获得更多市场关注。
AMD收购推理芯片初创企业Taalas、Etched完成大额融资,叠加多家AI实验室启动自研芯片项目,反映出了行业对专用ASIC的需求正在快速升温。算力硬件在通用算力与专用芯片之间的权衡,正影响着产业链各家企业的产品布局。
AI训练阶段需要处理多样化的算法结构和海量数据,GPU凭借其并行计算能力和可编程性占据统治地位。通用GPU的核心价值在于强大的灵活性,一套硬件架构可以适配训练、推理,覆盖多种网络模型与算法任务,配套成熟的软件生态大幅降低开发者迁移成本,能够快速响应业务迭代带来的多变负载需求。但通用性的另一面是硬件电路存在大量冗余,在面对固定、大规模的推理任务时,能效表现存在局限性。
但AI推理阶段则具备高度重复性和规模化的特征——同样的模型架构被反复调用,计算模式相对固定。这为专用集成电路(ASIC)提供了发挥空间。定制ASIC针对特定工作负载深度定制,剔除多余计算单元,在目标场景下可以实现更高吞吐与更优功耗表现。代价是硬件能力被限定在特定模型架构,跨场景适配能力薄弱,一旦算法发生较大迭代,芯片的价值就会受到冲击。
这两种路线没有绝对的优劣之分,只是它们面向不同业务诉求所形成的技术取舍,这也让头部芯片厂商开始调整自身产品定位。英伟达进一步收敛产品方向,聚焦4位至32位不同精度区间的AI工作负载;AMD则继续保留FP64高精度运算能力,面向高性能计算客户维持完整的通用算力能力,在通用GPU的框架之下做出差异化侧重。
推理ASIC的赛道上,初创企业已经完成从技术原型走向实际部署的跨越。被AMD收购的Taalas推出HC1示范芯片,主打高速Token生成能力,在Llama 3.1‑8B模型上实现很高的生成速度,但产品几乎牺牲通用适配能力。AMD计划将这款ASIC集成至Helios整机机架,和Epyc CPU、Instinct GPU搭配形成异构算力方案,并依托ROCm.ai补齐软件层面的整合能力,把专用加速单元嵌入既有通用算力体系当中。
Etched同样代表Transformer定向优化ASIC的发展方向,其已完成7亿美元新一轮融资后估值攀升至210亿美元,量化机构Jane Street成为其首位落地客户,首套机架已经完成出货并投入实际部署,Etched同时手握超过10亿美元订单,覆盖云厂商与前沿AI机构。其Sohu芯片专为Transformer系列模型设计,能够兼容该架构下的多款大模型,却无法运行CNN、LSTM等其他类型网络。Etched对外宣称在Llama 70B推理任务上实现很高吞吐性能,除芯片本身之外,Etched推进机架、软件、制造工艺的协同设计,提出低电压推理、集群级内存等技术理念,希望从集群层面改善内存共享与整体运行效率。
AI原生企业与公有云服务商也在加速定制硬件的布局,不再单纯依赖外部采购通用GPU。OpenAI对外披露与博通、Celestica合作开发的Jalapeno推理处理器,后续会释放出更多性能细节,补齐自身推理硬件能力。Anthropic也传出与三星洽谈合作,计划利用其2纳米制程与封装技术开发AI训练芯片,即便推进自研项目,企业依旧会继续采购英伟达、谷歌、亚马逊的算力产品,保持算力供给的多元结构。
各大公有云平台早已完成自研芯片的落地积累,谷歌Cloud的TPU、AWS的Trainium以及微软云的Maia,已经形成成熟的产品矩阵服务内部与外部客户。AI行业投资逐步回归商业回报,推理环节的成本压力凸显,如何把硬件效能充分释放,已经成为芯片设计领域新的竞争焦点。通用GPU不会被ASIC完全替代,异构组合、通用底座叠加专用加速单元,成为越来越多企业的选择。
推理算力的竞争并不意味着ASIC将全面取代通用GPU,二者更多是互补共存的产业关系。通用GPU依靠灵活的生态,承接多变的模型迭代与训练任务;定制ASIC在负载稳定的大规模推理场景释放能效优势,却要承担算法迭代带来的技术风险。
从芯片初创企业到AI巨头、云服务商,市场参与者正在根据自身业务定位选择不同的组合策略,异构算力架构会成为接下来一段时间行业的主流形态。未来硬件路线的走向,既取决于ASIC产品持续的实际性能验证,也取决于大模型技术演进节奏,整个算力产业将在通用与定制之间持续寻找新的平衡。