探底国产GPU靠什么决胜未来 | WAIC艾问探展沐曦股份

导语:2026年世界人工智能大会(WAIC)现场,气氛正在发生一种微妙而深刻的变化。走过展馆,几乎没有人再空谈大模型的参数量了。
从智能体(Agent)到长上下文,行业的兴奋点已经转移,而所有的讨论最后都收拢指向同一个底层支撑:GPU。
过去几年,国产GPU的叙事核心始终围绕着“能不能造出单卡”。
但在今年WAIC现场,与沐曦联合创始人、CTO 彭莉进行了一场深度对话后,科技投资人、知名主持人艾诚感受到了一个极其清晰的产业信号:一场关于“系统、超节点、生态建设与集群”的爆发,正式拉开了序幕。


走出WAIC H1馆,艾诚的第一个直觉
今年WAIC,一个细节令人印象特别深刻。走在展馆里,几乎所有的AI初创企业都在谈论 Agent(智能体)。但当你走进最具硬核科技感的 H2 馆,会发现另外一个根本性的变化:大模型公司已经不再讨论参数了。
大家开始频繁讨论 GPU。更准确地说,大家真正焦灼、真正讨论的是——怎样把更多的 GPU,真正稳定地跑起来?去年,全行业的焦点还在于“有没有国产 GPU 芯片”;
而今年,所有走进展馆的投资人、大模型创始人、政企算力买家,都在问同一个极其残酷的问题:“国产 GPU,是否已经真正好用?”
在科技投资人艾诚看来,这标志着中国算力产业正经历一场深刻的蜕变:从实验室里的突破,彻底迈入大规模商业化落地的“工程硬仗”。


GPU真正的竞争,已经不是造芯片
在很长一段时间里,资本市场和舆论评判一家国产 GPU 企业的标准,简单得近乎粗暴:能不能流片?能不能做出对标海外大厂的单卡芯片?
政策端“十五五规划”提出以超常规手段扶持半导体产业,市场和媒体的聚光灯也盯着芯片的发展情况。
但在今年 WAIC 现场,艾诚与沐曦联合创始人、CTO 彭莉深度对话后,一个事实变得无比清晰:造出芯片,不过只拿到了这场超级竞赛的一张“入场券”。
●过去的竞争,比的是单卡跑分:看谁的浮点算力高,看谁的参数强。
●今天的竞争,比的是超节点与系统:当全行业迈入智能体与海量推理时代,算力需求呈现指数级爆发,单一硬件参数早已无法定义企业核心竞争力。
●明天的竞争,比的是生态与稳定:海外巨头靠着CUDA软件生态、数十年积淀的集群工程经验,构筑了高耸的生态壁垒;
而国内不少厂商软件工具链尚不成熟,开发者迁移成本高企,部分仍停留在“单卡交付”阶段,客户买回去后,服务器集成、多卡互联、调度运维全部需要自行摸索,规模化落地瓶颈极其突出。

正如艾诚在现场点评所言:“造出一颗好芯片,对应的是碳基人类的单点技术突破;而搭建一套好用的算力系统,对应的是硅基 AI 的系统化协同逻辑。”
沐曦联合创始人、CTO彭莉与科技投资人艾诚对话中,直言当下产业最底层的矛盾:“我们已经实现了高性能 GPU 从 0 到 1 的单点突破,但单点强,并不等于产业链完整。
半导体产业链极长,上游原材料、晶圆、设备中不少环节仍然存在短板;更关键的是,小规模部署和千卡、万卡的商用集群,是两套完全不同的技术逻辑。超大规模算力集群建设能力,才是国产算力下一阶段的核心攻坚目标。”
彭莉进一步阐述了她对技术传承与系统思维的思考:“我们有很多资深科学家,像老一辈科研工作者,一辈子深耕领域,但知识很难完整传递、沉淀给下一代,碳基生物的知识传承存在天然壁垒;但硅基 AI的智能可以持续迭代、无限叠加,这是硅基最大的特点。大家不必恐惧 AI 替代人类,AI 本质是拓展人类能力边界的工具。
拿我自身举例,我深耕芯片领域多年,但如果让我从零开发软件工具,依然需要从头学习编程语言;
现在普通人借助 AI,无需完整学习底层知识,就能快速完成工具开发。核心是具备复杂系统思维,学会提出精准问题、把单点能力串联成完整解决方案。
放到企业层面,To C 互联网产品可以依靠 AI 彻底重构产品形态;但大型制造、政企组织拥有成熟业务流程,AI 不能颠覆性替换原有体系,最优路径是‘存量系统打通、增量 AI 提效’。”
这恰恰解释了国产算力顶层设计与企业战略的同步转型:超常规扶持不再单纯聚焦于芯片设计本身,而是通过体制优势攻克全产业链短板,同时通过大型智算中心的建设,倒逼企业去啃下大规模集群这块硬骨头。


为什么今年所有人都在讲“超节点”?
如果你仔细观察今年 WAIC 算力厂商的展台,会发现一个有趣的现象:本土头部芯片玩家,无一例外地将“超节点”摆在了最显眼的位置。
为什么今年所有人都在讲“超节点”?艾诚在调研中发现,答案隐藏在底层需求的变化里:
1.开源SOTA模型的示范效应:DeepSeek V4、KIMI K3等最新开源模型架构的快速演进,对集群间的通信吞吐提出了变态级的要求。
2.Agent(智能体)的爆发:智能体需要通过多轮推理和工具调用来完成复杂任务,因此通常需要更长上下文窗口,这意味着算力消耗从“训练为主”迅速转向“海量高并发推理”。
3.单机柜高密度的刚需:传统的服务器堆叠模式,在面对万亿参数模型时,光是线缆损耗和卡间通信延迟就能蚕食掉 20% 以上的算力,“超节点”,成为了良药。
在传统建设模式下,客户部署较大规模算力系统,通常需要协调芯片、服务器、网络互联和软件平台等多方厂商,完成系统集成、兼容适配、性能调优及稳定性验证,整体实施复杂度较高。

面对这一行业痛点,沐曦在本届 WAIC 给出的答案,叫做曦景 S 系列超节点。这一产品的落地,展示了沐曦“芯片—板卡—服务器—超节点—集群”的全链路硬件矩阵:
● 底座全栈自主化:基于全自研的底层架构,搭载曦云 C 系列 GPU打造系统级超节点,实现了核心“发动机”的完全自主。
● 高密度架构:单机柜支持 64 卡高密度部署,柜内采用正交无背板互连方案,最大限度减少线缆损耗,大幅降低多卡通信延迟。
● 平滑扩容能力:架构预留横向扩展空间,能够无缝平滑扩容至万卡甚至十万卡集群。
在技术细节上,超节点的攻坚集中在几大工程壁垒:
- 线性度的极限控制:100 张卡的集群,理论算力绝非简单的 100 倍,通常会因通信延迟和调度损耗打折扣。曦景通过自研的芯片架构、MetaXLink与 MXMACA 调度软件的双向优化,极致压缩算力衰减空间,在集群层面实现更优的效率。
- 马拉松式的长效稳定性:数据中心超节点需要连续多年不间断高强度运转。芯片供电、散热、故障自愈隔离能力,决定了集群能否跑完“马拉松”。沐曦的产品在稳定性上极具优势。
彭莉补充道:“智能化时代催生了全新的产业机会,原有硬件格局被打破。但只有具备‘芯片+整机+集群’全栈能力的企业,才能抓住规模化落地的历史窗口。
模型迭代速度极快,企业必须实行‘在售一代、在研一代、预研一代’的三层产品布局,提前预判技术趋势,否则芯片量产之日,就是落后之时。”


翻越CUDA大山,国产GPU的“安卓路线”与“iOS路线”
谈及国产 GPU 的替代引导,行业里有一句流传甚广的苦笑:“造芯片难,但比造芯片难一百倍的,是翻越 CUDA 这座大山。”
英伟达用几十年的时间建立了 CUDA 生态,拥有极为完整的编译器、算子库、调试工具以及全球数以百万计的开发者依赖。
主流开源大模型和深度学习框架,无一例外地原生适配 CUDA。开发者迁移到国产芯片,如果需要重构大量代码,其隐性时间成本和迁移风险将是巨大的阻碍。
面对 CUDA 构筑的闭环生态壁垒,国产 GPU 厂商走出了两条完全不同的道路:
● 路线一:依靠API工具实现上层部分功能兼容。只在最上层保持与CUDA相同的函数名和调用方式,以API接口形式实现部分功能兼容,内部实现和底层硬件无法做到深度兼容。
● 路线二:底层兼容。从最底层的GPU架构、指令集以及编译器源代码,原生兼容CUDA生态,能够做到几乎无需修改代码、帮助开发者接近零成本实现生态迁移。
沐曦选择的,正是第二条极其艰难但充满战略远见的路线。
彭莉在专访中深邃地剖析了这一布局:“MXMACA 突破 CUDA 壁垒,难易并存。
优势在于,沐曦从芯片 IP 设计阶段就同步构建了MXMACA软件栈并原生兼容CUDA,CUDA 代码迁移改动量可控;难点在于,生态需要以十年计算的持续经营,无法短期速成。”
而这条路,沐曦又通过软件栈开源的方式促进生态繁荣。从2025年2月正式宣布开源MXMACA,沐曦持续扩大开源范围,当下开发者社区已聚集起了超过50万的注册用户,希望打造人工智能时代的“Android”生态。
“开源统一并行计算标准,能够有效降低全行业的适配成本。”
在艾诚看来,开源软件栈具有不可替代的战略价值:1、建立真正自主可控的计算生态底座;2、深度适配企业算力底座自主可控需求;3、聚拢开发者,以“胶水”般的软件粘性,反向引导硬件系统的迭代。


大模型之外,(AI4S)才是暗流涌动的广阔蓝海
当几乎所有国产 GPU 厂商都在大模型训练和通用推理这两个红海赛道里杀得不可开交时,艾诚关注到沐曦在本届 WAIC 上展出的另一张关键牌——曦索 X 系列科学智能 GPU。这是一个聚焦于 AI for Science(AI4S) 的差异化场景。
过去,全球传统科学智能领域长期被海外巨头垄断,新药研发、气象模拟、航空仿真等领域,高度依赖海外超算架构。
传统的科学计算长期依靠 CPU,但在面对高度并行的计算时,其效率存在瓶颈;而市面上大多数通用 AI GPU,为了追求大模型推理效率,大幅裁剪了高精度算力,无法满足科学计算需求。
彭莉道出了沐曦布局曦索 X 系列的底层初衷:“AI 只是工具,只有和行业真实科研难题结合,才能释放最大价值。生物医药、基因测序、新材料模拟,都是关乎国家竞争力的核心领域。
沐曦的底层 GPU 架构天生具有通用性。曦索 X 完美匹配 AI4S 的全精度计算需求。我们不仅提供硬件,还同步配套适配了 GROMACS 等主流科学计算开源框架,联合高校和科研院所推进新药研发与材料模拟。
未来 GPU 的最大价值,绝不会仅仅局限于生成几段文字或几张图片。更大的产业空间,是借助算力去探索未知的科学规律。”
这种布局策略给沐曦带来了独特的反哺效应:科学计算对硬件可靠性、数值精度和长时间连续运行的要求,远高于一般场景。
在 AI4S 极高压工况下磨砺出来的硬件稳定性经验,能够直接迭代反馈给设计研发的有迭代,形成正向的技术飞轮。


资本从热狂到冷静——投资人到底在看什么?
在 WAIC 的专访尾声,作为科技投资人的艾诚抛出了一连串针针见血的快问快答:“国产 GPU 从‘能用’到‘好用’,最大的阻碍是什么?”
“面对那些依然心存顾虑、不敢轻易切换国产算力的客户,你最想说什么?”
彭莉没有回避,坦诚地给出了来自产业第一线的回答:“整个算力芯片行业,需要‘耐心资本’。产业成长周期漫长,希望客户和开发者用长远的视角看待国产 GPU 赛道。
国产 GPU 当下最大的挑战,是规模化落地的实际验证。0 到 1 的单点芯片突破我们已经完成,但十万卡以上大规模集群的稳定商用,仍然是全行业共同的目标。
面向大规模推理需求,我们芯片厂商需要考虑的不只是单颗芯片能力,而是系统整体方案。
在光互联等环节,GPU、交换机和光模块等不同产业链伙伴需要在设计早期便进行协同,以解决复杂的系统级问题;
也需要大模型企业、科研院所和终端客户给出真实的高标准业务场景。我们需要在真实的‘炮火’中反向驱动软硬件的迭代升级。”
在沐曦展台的现场,铺开丰富的行业落地成果,以其“1+6+X”产业战略为核心,展示了“Token工厂”“重点实验室”“金融”“医疗健康”“能源”“教科研”“交通”“大文娱”等场景落地案例;
展区还摆放了卫星实物、人形机器人等,具象化展示沐曦 GPU 在空天算力、具身智能、世界模型前沿领域的实践成果,覆盖从多样场景的广阔应用边界。


结语:芯片只是起点,生态才决定终局
从曦景 S 系列超节点完成硬件全链路闭环,到 MXMACA 以开源姿态助力国产计算生态繁荣,再到曦索 X 深入 AI4S 的的布局,直至沐曦“1+6+X”产业生态的落地实践——站在科技投资人艾诚的视角来看
沐曦在本届 WAIC 上展现的“全栈硬件+开源软件+垂直落地+产业落地”四位一体布局,清晰地勾勒出了国产算力新生态的完整轮廓。

这场对话,恰恰印证了艾诚对资本市场转向的判断:去年,投资人追逐大模型,问的是“谁能做出中国的 GPT”;
今年,投资人重新审视 GPU 基础设施,问的是“谁的产品能在客户的数据中心里稳定跑上一年”。
资本正在从盲目的热潮中冷却下来,转向拥抱有耐心、有系统交付能力、有生态根基的实体底层。
中国 GPU 产业的下一站,规则已经彻底改变:不再是谁先在实验室里流片出一块参数惊艳的芯片;而是谁能率先搭建起一套让开发者愿意长期留下、让产业能够持续运转、在万卡级别高压下依然稳如磐石的算力底层生态。
正如彭莉在结束采访时所言,中国算力的演进需要耐心、恒心与决心。在这场属于中国算力底座的长期主义长跑中:
芯片只是起点,生态才决定终局。


艾诚简介
艾诚(Gloria Ai),主持人、投资人、《艾问iAsk》创始人,曾任中央电视台驻纽约财经评论员,现任《艾问人物》出品人,也担任国内外财智盛会如博鳌亚洲论坛等的常邀双语主持。艾诚是哈佛大学、北京大学和中国传媒大学的校友代表,清华大学苏世民学院业界导师,哈佛大学第一代校友(FGHA)导师,YPO世界青年总裁组织成员。
作为《艾问iAsk》创始人,艾诚一直致力于向世界讲好中国创新故事,已记录近2000位时代人物,实现百家媒体全球传播。曾获《福布斯》杂志2016年度30位30岁以下亚洲人物唯一上榜华人主持以及世界经济论坛2012年度全球杰出青年,著有《奋斗是一种信仰》、《创业的常识》、《创业不死法则》等财经书籍。
艾诚被授予家乡黄山的形象大使,因扶贫助农的女性领导力与公益心,获评全国三八红旗手。
