国产AI芯片架构百花齐放,近存计算与可重构路线开辟差异化新赛道

首页 / AI资讯 / 泛AI领域

0:00
0:00
1x
定时

在WAIC 2026的H2算力主题展区一整排像墙一样的黑色机柜引人注目, 华为首次线下展示的昇腾950超节点真机。与此同时以东方算芯、清微智能和中昊芯英等为代表的差异化架构企业开辟了全新的算力路线。国产AI芯片厂商正从单一追赶通用GPU的路线走向通用加专用加架构创新多路线百花齐放的竞争格局。东方算芯在WAIC上全球首发的DF1000 3D堆叠近存AI芯片代表了国产AI芯片在架构创新上的重要突破。该芯片采用成熟14nm工艺搭配存储计算垂直键合架构,访存带宽远超传统HBM方案。

不用最先进工艺,3D堆叠让14nm芯片逆袭

核心思路是通过3D堆叠技术将存储芯片垂直集成在计算芯片上方,大幅缩短数据通路,从而在成熟工艺节点上实现超越先进工艺的访存性能。这一技术路线的重要意义在于不依赖最新的制程工艺。在先进制程受限的大背景下,近存计算通过架构创新弥补制程差距。东方算芯DF1000可覆盖云端推理、人形机器人和智能终端等场景,下半年规划十万片出货量。清微智能推出第三代可重构架构与TX823D堆叠芯片原型,配套千卡级REX81超节点。可重构架构的核心优势在于计算单元可以根据任务需求动态重新配置,在不同类型的AI计算负载之间灵活切换。这种架构在大模型推理阶段尤其具有优势,因为推 理任务往往涉及从Attention机制到FFN前馈网络等多种不同类型的计算操作。

清微智能第三代可重构架构在能效比上相比第二代提升了约40%,显示出技术迭代的持续加速。

能动态变形的芯片,可重构算力新玩法

中昊芯英展出新一代专用TPU芯片须臾,相较于算力性能持平的通用GPU方案功耗降低了50%,可承载万亿参数大模型分布式训练和多智能体协同运算。中昊芯英还与杭州电信和中兴通讯联合宣布落地华东地区首个国产TPU千卡级算力集群。在展馆另一侧华为首次线下展示的昇腾950超节点同样成为焦点,1024张NPU卡高速互联提供1 EFLOPS FP8的澎湃算力。这些超级巨无霸与传统架构创新的小而美形成了差异化竞争格局,共同构成了国产AI算力的完整生态。国产AI芯片从单芯片到超节点再到系统生态的发展路径反映了中国算力产业的独特演进模式。不同于英伟达从GPU到CUDA生态的自上而下路 径,中国算力产业的特色是多条腿走路,既有华为昇腾这样的巨无霸也有东方算芯通过架构创新开辟差异化赛道。

这种百花齐放的格局在客观上降低了整个产业对单一技术路线的依赖。

功耗降低50%算力翻倍,国产TPU的逆袭

然而国产算力产业面临的碎片化挑战也不容忽视,不同厂商的芯片使用不同的开发框架,给上层应用开发者带来了巨大的适配成本。国产AI算力正在经历从单芯性能比拼到系统级生态竞争的深刻转变。围绕国产算力单点强系统弱的结构性痛点,奇异摩尔推出国产化超节点互联全栈解决方案,光合组织则推进开放计算Token谱系计划打通算力生产层、调度层和应用层之间的衔接通道。从芯片到互联、从单机到集群、从硬件到软件生态,国产AI算力的产业协同正在全面加速。正如摩尔线程高级副总裁所言这个基石的牢固程度将直接决定中国在全球AI竞赛中的位置。在WAIC 2026上华为昇腾950超节点的展示引发了行业高度 关注,其背后是国产算力自主可控战略的重大进展。

1024张NPU卡高速互联提供1 EFLOPS FP8算力,这意味着完全基于国产芯片构建的超大规模AI计算集群已经达到了世界先进水平。

多条腿走路:国产算力百花齐放

与英伟达的产品相比华为昇腾在单卡算力上仍有差距,但在集群效率和互联性能方面的追赶速度超出预期。特别是在美国持续加码对华芯片出口管制的背景下,国产算力的自主可控已经从技术选择上升为国家安全层面的战略需求。但国产算力产业的健康发展不能仅仅依靠政策保护,还需要在市场竞争力上真正获得突破。东方算芯的DF1000近存芯片和清微智能的可重构架构代表着两条不同的技术路径。近存计算通过缩短数据通路提升效率,可重构架构通过动态配置适应不同计算负载,这些差异化路线为国产算力产业提供了超越传统GPU架构的可能性。然而技术路线的多样化也意味着资源分散,需要产业联盟和开放标 准来降低碎片化成本。

光合组织的Token谱系计划正是在这一背景下应运而生,其目标是建立跨厂商的算力抽象层,让不同芯片之间能够实现一定程度的互操作,这对于国产算力产业的长期健康发展至关重要。

从单打独斗到系统合力,国产算力生态之战

国产算力产业的未来发展还需要在生态兼容性上做更多努力。当前国产AI芯片平台在运行主流深度学习框架时仍存在不同程度的兼容性问题,PyTorch和TensorFlow等框架的适配优化仍在持续推进中。华为昇腾的CANN计算框架经过多个版本的迭代已经能够覆盖80%以上的主流模型训练场景,但与CUDA生态的丰富度和成熟度相比仍有差距。摩尔线程和壁仞科技等后来者通过兼容CUDA生态来降低用户迁移成本,这是一种务实的选择。长期来看国产算力产业的发展需要一个开放的标准和活跃的社区来支撑,单一企业很难独立完成从芯片到应用的全栈生态建设,产业合作和开放创新是不可回避的必由之路。

来源:证券时报、科创板日报、WAIC H2算力展区 发布时间:2026-07-21