正文内容 评论(0)
“华为的目标是成为英伟达”。
9月14日,华为心声社区公开了一份监事会主席郭平与新员工的座谈纪要。在被问及华为对大模型的战略定位时,郭平罕见地给出了一个直白的回答。
他同时划定了边界。华为的核心优势不在于拥有自研大模型,而在于支持客户构建优秀的大模型,确保全球各种大模型都能在华为昇腾、鲲鹏、超节点及集群上高效运行。
三天后,9月17日,华为全联接大会2026上,昇腾960超节点、灵衢UnifiedBus互联协议、CANN开源生态、华为云Agentic Cloud、SCALE伙伴体系陆续发布。把这些发布串起来看,郭平那句话不是一次内部对新员工的激励,而是一份有产品路线图支撑的战略说明书。
问题是,这份说明书完成度有多高?目前来看,华为的策略是一块块把版图拼好。
从采购方到竞争者
华为对英伟达的追赶,不是从昇腾发布才开始的。
2020年之前,华为几乎所有芯片都从美国采购,一度是英伟达在中国最大的客户之一。
当时,华为正承受着高昂的成本压力:其智能云硬件平台Atlas在市场拓展上面临的最大阻碍,就是服务器动辄六七十万元的售价,其中仅英伟达的算力卡就占去了40万元。高昂的成本导致这一代产品在市场上的销量寥寥无几,多靠华为内部消化。
然而,转向自研的线索,早已草蛇灰线。
2016年CES期间,华为海思总裁何庭波与英伟达CEO黄仁勋有过一次交谈。彼时,英伟达宣布淡出手机芯片市场,何庭波试探性地询问能否将相关技术授权给华为,遭到了黄仁勋当场拒绝。
这次拒绝让何庭波坚定了布局AI芯片的决心。回国后接触了寒武纪,并选择了其芯片产品,但听完陈天石的演讲后,何庭波判断华为内部同样拥有中科大少年班背景的人才,随即把开发AI处理器的任务交给了廖恒。2017年,代号为“达芬奇”的内部AI芯片预研究项目正式立项。
如今,廖恒已是华为半导体首席科学家。他曾带领团队系统梳理了过去十多年的深度学习成果,发现了一条完全不同的道路。
当时,英伟达走的是“积木拼装”的CMP(多芯粒异构封装)路线。其核心优势在于极其聪明的“多线程协同指挥系统”,能让成千上万个线程同时排队跑。但这更像一个全能选手,并没有将AI最核心的计算优化到极致。
华为想得很清楚,如果像素级模仿英伟达,做出来的产品顶多价格略低,性能却未必跟得上。于是,华为选择了DSA(面向特定领域优化的专用架构)的路线。
传统CPU走的是串行处理,一次算一个。英伟达GPGPU走的是大规模并行,让成千上万个线程同时跑。华为两条都没选,而是把计算单元改造成了三维立体的方块阵列。这种设计,让芯片每瓦功耗能换来的AI算力大幅提升。
2018年上半年,自研昇腾芯片项目正式启动,主要瞄准数据中心推理卡和边缘计算两个场景,明确对标英伟达GPU。
但华为很快发现,光有芯片不够。此前为了自主完成二次开发,华为打造出支持资源池编排、完成二次封装的CUDA层,实现突破。据方兴东所著《晟腾崛起》一书中讲述,当华为向英伟达申请授权时,被英伟达拒绝了。原因是,这不仅触碰了英伟达靠卖硬件赚钱的核心商业利益,还需要英伟达团队贴身参与服务,增加了成本。
这条路走不通,华为决定换一种打法。不跟英伟达比拼单一产品的参数和性能。华为把产品形态改为一台机器、一个机架、一个集群、一个规模化数据中心。这给了华为更大的设计自由度,也避开了单卡竞争的正面战场。
但想成为“中国英伟达”的并不只有华为。
2025年底到2026年初,摩尔线程、沐曦股份、壁仞科技、天数智芯四家国产GPU公司密集完成上市,燧原科技也在2026年9月登陆科创板。媒体给它们贴上了同一个标签,“中国版英伟达”。摩尔线程创始人张建中曾任英伟达中国区总经理,壁仞科技CTO洪洲曾主导华为海思自研GPU,沐曦的核心团队也有英伟达和AMD背景。
但“中国英伟达”这个标签底下,走的是不同的路。四小龙中,摩尔线程、沐曦、壁仞采用GPGPU路线,兼容CUDA生态,让现有代码尽量跑起来;燧原科技和华为昇腾一样选择了DSA路线,但燧原科技选择不兼容CUDA,所以需要重建自己的软件栈。
壁仞科技招股书引用的灼识咨询数据显示,2024年英伟达和华为海思(根据附注线索推断)占据了中国智能计算芯片市场94.4%的份额。
在这极高的头部集中度下,其他国产AI初创势力在2024年尚处于起步或商业化前期,“四小龙”合起来在中国AI芯片市场的份额不到2%,而华为昇腾已经是其中份额最大的国产厂商。
也就是说,喊着同一个口号的公司很多,但真正在系统级、集群级与英伟达正面交锋的,目前只有华为一家。
七年之后,昇腾960是这套系统级打法的第一个完整落地成果。
速度在追赶,代差仍存在
昇腾960系列芯片的提前亮相成为这次大会的核心话题。轮值董事长汪涛在大会上宣布该系列芯片“提前研发就绪”, 并披露了它提速后的发布路线图。
昇腾960DT面向训练,比原计划提前三个季度,2027年第一季度就绪。960PR面向推理,提前一个季度,2027年第三季度就绪。后续970、980将保持一年一代的迭代节奏。
以华为公布的性能参数来看,昇腾960DT的核心算力和存储能力较上一代翻倍。
综合多家行业数据分析,其性能高于英伟达2023年发布的H200 SXM,但低于2025年下半年开始发货的B300。前者是英伟达上一代旗舰,后者是它当前的主力产品。
这意味着,昇腾960的单卡水平大致相当于英伟达两年前的产品,还没赶上它现在的主力。
华为没有回避单卡差距,选择了另一条路径来对冲。
华为内部曾对算力效率做过比较。在单位有效面积里,华为的算力暂时达不到英伟达顶尖水平,只能通过服务器、集群等方式把整机算力密度做上去,代价是功耗高。
这种打法逼着华为去思考大模型到底需要什么样的硬件,其结论是,OpenAI和英伟达在底层紧密联动,就像当年的微软和英特尔,所以华为必须咬住英伟达。
华为自认为比英伟达有一个优势,可以把CPU和GPU彼此相通、协同。但协同的前提是互联,而互联恰恰是英伟达布局更早的领域。
英伟达推出NVLink技术,还收购了Mellanox,比其他公司提早三年预判到了互联的重要性。所以ChatGPT-3.5爆发的时候,华为在互联领域已经慢了1至2年。
差距摆在那里,华为策略是在存储发力,做定制化布局。
据《晟腾崛起》所述,华为内部对英伟达的竞争策略,被概括为一句话,像蛇一样用长链条布局和迂回方式咬住对手。
直到2023年上半年,910B芯片回归,华为才解决了此前架构性缺陷,同时开放底层能力,让用户能基于集群计算提供的工具自行开发。到6月,推理芯片性能达到了英伟达的1.6至1.7倍。这是“咬住”策略的第一个可见成果。
2026年初,华为高层召开昇腾业务研讨会,对“超节点+集群”解决方案给予重视,明确昇腾的战略意义,并决定满足头部客户的大规模算力需求,通过一体机业务解决中小算力场景。至此,中国市场能够实现大规模商用,并且稳定支撑上万个节点集群运行的AI芯片,只有华为昇腾。
这背后的逻辑很清楚,华为的竞争力不在单卡,在集群。
用超节点绕开单卡瓶颈
全联接大会上,汪涛正式发布了采用NPO技术的昇腾960超节点,并公布将在2027年上市。同时,他在会上提到,此前的昇腾910C超节点已部署超1000套,昇腾950超节点已规模商用。
昇腾960超节点到底有多能打?一个超节点,最多塞进4096张卡,算力直接干到8 EFLOPS FP8、16 EFLOPS FP4,内存容量1PB。这相当于把512台普通8卡服务器“拧成”一台机器来用。
华为还推动用5500个自研Hi-ONE光引擎替换4.8万颗800G光模块,功耗降低超过550千瓦,无故障运行时间翻倍,一年内非计划停机不到18小时。
为了解决卡多了“堵车”的问题,华为通过灵衢UnifiedBus将十余种互联协议统一为灵衢协议。带宽从百GB级冲到TB级,延迟从7微秒压到2微秒。全局内存统一编址,4096张卡的内存变成一个共享大池子,谁都能直接访问,不用来回搬数据。
此外,多个超节点再组队,通过二层CLOS四平面组网,最大能拉到51.2万卡。再加多轨道拓扑,理论上能干到100万卡。
汪涛解释,“什么叫超节点?必须是超节点内跨物理节点的内存可以统一编址,意味着任何一个AI芯片可以访问超节点内的所有内存共享池。内存不能统一编址的不是超节点。”
在他的主题演讲中,华为首次公开了一组来自华为马尔科夫实验室的仿真数据。由4K超节点组成的10万卡集群,相比由8卡服务器组成的同规模集群,MFU(模型算力利用率)提升2.75倍。
汪涛同时透露,目前业界10万卡集群的MFU普遍不足30%,约七成时间处于故障及故障修复状态。MFU每提升1个百分点,10万亿参数大模型的训练周期可缩短约3天。
但值得注意的是,2.75倍是仿真数据,不是实测。目前尚未有百万卡级集群在实际生产训练中的验证数据公开。汪涛自己也承认,“100万卡只是技术指标,实际部署中10万卡可以基本满足需求”。
也就是说,系统级路径的逻辑是清晰的。在单芯片制程受限的前提下,用更大规模的互联和集群协同来弥补单卡差距。但代价是更高的系统复杂度和组网成本,收益是绕开了制程瓶颈。
生态在扩大,迁移成本仍是门槛
英伟达最深的护城河是CUDA,华为对此有清醒认知。但汪涛在演讲中宣布“昇腾已跨越生态拐点”。
起点是华为内部一场长达数年的观念转折。华为是做电信和硬件出身的,过去习惯了“卖硬件赚钱”的封闭逻辑,内部专家一度对把核心软件开源“心里没底”。直到轮值董事长徐直军力排众议,先是拍板开源了MindSpore框架,后来又宣布CANN异构计算架构全面开源开放,这才一步步把昇腾从封闭硬件变成开放生态。
六年之后,数据上看,生态确实在改善。全联接大会上,华为披露,CANN开源社区月活开发者突破5200名,其中非华为的外部开发者占比达到61%。昇腾成为了首个被全球主流AI框架PyTorch官网直接支持并提供安装分支的中国算力平台,基于昇腾+CANN的原生训练模型已超过40个。
但“跨越拐点”不等于“迁移零成本”,业界绝大多数代码都是基于英伟达环境写的,迁移成本依然高昂。
多家媒体报道援引参与迁移的工程师估算,对于DeepSeek这类开源模型,借助现有生态支持,通常只需额外增加2至3名工程师、耗时约一个月便可完成训练适配,但对于仅公开权重、不开放源码的商业模型,则可能需要约10名工程师额外投入6个月以上。
目前,中国AI产业的国产替代呈现出“推理先行、训练滞后”的局面。在难度较低的“推理侧”,昇腾的适配相对容易,950超节点也已规模商用。但到了核心的“大模型训练侧”,迁移成本的高低依然取决于模型的开放程度。
针对这一门槛,华为针对性地推出了 “MindSpeed-LLM Agent” 以及自动调优工具,官方强调其能将跨版本适配工作从数天压缩至1小时,正是为了用工具链去填平CUDA的生态鸿沟。
华为不是复制英伟达
市场给出了一个阶段性答案。研究机构Bernstein Research预测,2026年华为将占据中国AI芯片市场50%的份额,而英伟达的份额将从2025年的约40%萎缩至8%左右。另一家研究机构TrendForce的预测更激进,认为国产AI芯片在国内高端市场的份额将接近90%。
此前,英伟达CEO黄仁勋已公开确认,该公司在中国AI加速器市场的份额降至0%,并在采访中直言,放弃中国这样体量的市场“在战略上并不合理”。
但这些数据只是反映了地缘政治驱动下的国产替代进程,而非全球技术竞争格局的彻底扭转。英伟达在中国的退场,更多源于外部的出口管制政策,并非产品核心竞争力的直接易主。
回到郭平那句话。华为在ICT与计算领域的目标是成为英伟达,但华为选择的突围路径与英伟达有本质不同。
英伟达走的是“硬件极致优化”路线,用全球最先进的制程、最强大的单卡,以及最成熟的CUDA生态锁定全球市场。华为走的是“系统创新突围”路线,在单卡性能受制于制程的前提下,用超节点架构、光互联技术、集群规模和开源生态来构建竞争力。
这条路也有代价。关于制程工艺,和国内一些“28纳米就满足”的声音不同,华为明确了7纳米是关键底线。华为发布的白皮书显示,昇腾950系列基于全栈自主可控的制造工艺。这意味着,其在无法直接角逐3纳米、2纳米等先进制程的情况下,转向功耗优化、面积优化、3D堆叠等方向建立差异化。
何庭波发表的“韬(τ)定律”其核心便是如此,以时间微缩替代几何微缩,以系统性降低时间常数为终极目标。华为正在将战场从“单点制程”的比拼,强行拽入“全栈系统优化”的维度。
为了支撑这条系统级路线,全联接大会期间,华为宣布,未来三年将再投入50亿元建设开源开放算力新生态。然而,面对CUDA的生态惯性,华为与之仍有相当距离。
华为不是英伟达,也无法复制另一个英伟达。核心问题不在于华为能不能造出一颗性能指标更强的芯片,而是两件事,CANN的迁移成本是否降到让开发者愿意主动作出选择,以及百万卡集群在实际训练中是否能被彻底验证可行性。
这两个问题的答案,华为还需要两三年的时间去回答。
- 热门文章
- 换一波
- 好物推荐
- 换一波
- 关注我们
-
微博:快科技官方
快科技官方微博 -
今日头条:快科技
带来硬件软件、手机数码最快资讯! -
抖音:kkjcn
科技快讯、手机开箱、产品体验、应用推荐...


