一场 95% 归零的份额更替,一次 CUDA 二十年护城河的真正危机,一轮以系统补单点的国产反攻。
多数人以为英伟达的壁垒是芯片性能。错了。真正的护城河是 CUDA 生态——一座用二十年垒起来的软件高墙。
英伟达发布 CUDA,将 GPU 从图形处理器改造为通用计算平台。华尔街困惑:一家芯片公司为何重金投入软件?
AlexNet 用 GPU 训练,深度学习爆发,CUDA 成为事实标准。
英伟达占据中国 AI 芯片市场 95%,CUDA 开发者突破 200 万。
注册 CUDA 开发者超 400 万;GPT、LLaMA、Stable Diffusion 等主流模型全部构建于 CUDA 之上。
"如果 DeepSeek V4 首发在华为平台上,对我们的国家将是灾难性的。" —— 黄仁勋。一句话泄露了他对 CUDA 护城河被攻破的真正焦虑。
不是英伟达变弱了,而是美国出口管制把高端芯片挡在了门外。空出来的份额,被三派国产势力瓜分。
芯片 + 框架 + 服务一体化交付。2025 年出货 81.2 万片,占国产市场约 50%。
走 CUDA 兼容迁移路线,hipify 工具自动转换 CUDA 代码,迁移成本最低。
聚焦推理赛道,吃下大模型落地后的部署红利。
三派各取一径:华为赌全栈、海光赌迁移、新势力赌推理红利。没有谁通吃,但谁都没退。
国产单卡性能约只有英伟达 Blackwell 的 1/3。硬碰硬必输——于是改打系统级。
推理才是规模化的钱。这里国产已反超——价格差让采购决策变得无需犹豫。
| 指标 | 国产方案 | 进口方案 |
|---|---|---|
| 2025 国产加速卡份额 | 55% | 45%(从 70% 跌下) |
| 2026 外资份额(Bernstein 预测) | 92% | 8% |
| 推理成本 | 1×(基准) | 约 3× |
| DeepSeek V4 推理速度 | 昇腾,35× H20 | H20 特供版 |
| API 成本对比 | GPT-5.5 的 1% | GPT-5.5 基准 |
| 寒武纪盈利状态 | 2025 扭亏;2026 Q1 +185% | — |
国产已非"可用",而是"又便宜又快"。当推理成本压到进口的 1/3,采购方用脚投票——份额反转只是时间问题。
训练是另一回事。能训 ≠ 训得好。国产仍卡在"能训"阶段。
| 训练关键指标 | 国产集群 | 国际水平 |
|---|---|---|
| 片间带宽 | 约 75% | 100%(基准) |
| 故障率 | 1.5× | 1×(基准) |
| 阶段定位 | "能训" | "训得好" |
国产集群训练大规模模型,验证可行性。
摩尔线程 S5000 万卡集群训万亿参数华为 CANN、摩尔线程 MUSA 持续完善。
DeepSeek V4 发布日适配 8 家国产 GPU算力战争不止在数据中心——手机、PC、汽车、AR 眼镜都需要低功耗推理芯片。这是一片 CUDA 优势被稀释的新战场。
端侧跑 7B / 13B 小模型成为标配,NPU 算力军备竞赛。
关键:能效比而非峰值本地推理 + 隐私保护推动 NPU 进入笔记本与桌面。
关键:软硬协同车规级推理芯片需求爆发,功耗与可靠性是硬指标。
关键:车规认证超低功耗实时多模态推理,新形态算力入口。
关键:毫瓦级功耗未来不会是单极世界。英伟达、国产芯片、云厂商三条路线并行,各自卡位不同的价值层。
英伟达想从卡的控制者,变成部署编排的控制者;国产想从可用走向好用;云厂商想把"买卡"变成"买云"。三条路线最终会在部署层正面相遇——那才是 2026 之后真正的算力战争。