为什么AI必须跑在显卡上?那个让英伟达值万亿的CUDA又是什么?
答案藏在每一张你抢不到的A100、H100里。今天我们用"人话"把这件事讲清楚。
2023年5月,英伟达市值突破一万亿美元。一家卖显卡的公司,凭什么?
答案藏在每一张你抢不到的A100、H100里。今天我们用"人话"把这件事讲清楚。
📖 先搞清楚:显卡不是用来打游戏的吗?
GPU(Graphics Processing Unit),中文叫图形处理器,也就是我们常说的"显卡的芯片"。
它最初的设计目的非常单纯——把游戏画面渲染出来。游戏画面是什么?是几百万个像素点的颜色值。屏幕上每一个像素,都需要被独立计算出来。这就要求GPU有一种特殊能力:同时处理海量简单任务。
而CPU(中央处理器)呢?它擅长的是另一件事:快速处理少量复杂任务。
一个精妙的类比:
CPU像一个数学系博士,单挑能力极强,什么线性代数、微积分、逻辑推理都能算。但你让他批改一万份小学生的四则运算卷子,他只能一份一份来——累死也快不起来。
GPU则像一万个小学生,每个人只会做加减乘除。但你把一万份卷子同时发下去,一人做一道,几秒全搞定。
这就是GPU的底层哲学:大力出奇迹——我不跟你比聪明,我跟你比人多。
| CPU | GPU | |
|---|---|---|
| 核心数量 | 几个到几十个 | 几千到上万个 |
| 单核能力 | 极强 | 较弱 |
| 擅长的事 | 复杂逻辑、顺序任务 | 海量简单计算并行处理 |
| 类比 | 数学博士 | 一万个小学生 |
🖼️ 图片建议: 一张左右对比的信息图。左边是CPU——一个戴眼镜的博士坐在桌前,面前堆着一摞卷子,正在一份一份地批改,表情疲惫。右边是GPU——一个大教室里坐满了几百个小学生,每人面前一份卷子,同时举笔在算,黑板上写着"1+1=2"。下方标注:CPU = 一个聪明人串行工作 / GPU = 一群小学生并行开工。色彩明快,人物用可爱简笔画风格,科普杂志信息图排版。
🔥 那AI跟这个有什么关系?
2012年,多伦多大学的一个团队用两张GTX 580游戏显卡训练了一个叫AlexNet的神经网络,在ImageNet图像识别比赛中把错误率从26%干到了15%,碾压所有传统算法。
这件事像一颗深水炸弹——整个AI圈突然意识到:原来显卡不是只能打游戏,它天然适配深度学习。
为什么?
神经网络的核心运算,叫"矩阵乘法"。
别被这个词吓到。你可以这样理解:一个神经网络就是一张巨大的Excel表格。每一层有几百万个格子,每个格子里存着一个数字(参数)。训练AI的过程,就是反复把这张大表的每一行和每一列相乘相加——更新参数,再算一遍,再更新,直到答案越来越准。
这个过程需要多少次运算?GPT-4级别的模型,训练一次需要做的浮点运算次数——是10的25次方量级。
如果用CPU来干这个活,就算是一个博士不吃不喝地算,1后面25个零的运算量,够他算到太阳熄灭。
但如果把这张大表的每一行都同时发给一个小学生呢?一万个小学生同时开工,一人算一行,10秒钟收工。
这就是为什么AI需要GPU。不是因为GPU"聪明",而是因为GPU"人多"。
🖼️ 图片建议: 一张流程图展示"矩阵乘法如何被GPU并行处理"。上方是一张巨大的Excel表格(代表神经网络的参数矩阵),每一行用不同颜色标记。表格下方分叉出几百条箭头,每条箭头指向一个小学生(代表GPU的一个核心),每个小学生只算自己那一行。最下方汇总成一个结果框:"所有行的结果汇总 → 输出"。画面用科普杂志信息图风格,色彩分区清晰,箭头流动方向标注"并行分发"。
📖 CUDA是什么?为什么它让英伟达这么不可替代?
CUDA(Compute Unified Device Architecture)是英伟达推出的并行计算平台和编程模型。它让开发者可以用写C++的方式直接操控GPU上的几千个核心做计算,而不需要懂图形学。
说人话版:
一个精妙的类比:
GPU是一台性能怪兽级的发动机,但这个发动机出厂时只配了一个"方向盘"——专门用来渲染游戏画面。如果你想让这台发动机去驱动一辆挖掘机(跑AI运算),对不起,方向盘不对,你连火都打不着。
CUDA就是英伟达给这台发动机配的万能方向盘。 装上它,你可以把这台发动机用在任何地方——AI训练、科学计算、自动驾驶、挖矿——想开什么车开什么车。
2006年英伟达推出CUDA时,华尔街觉得黄仁勋疯了——花几亿美元做一套让显卡"不务正业"的工具?股价跌成狗。
结果呢?十几年后,全世界的AI框架(PyTorch、TensorFlow)、AI模型、AI应用,底层全是CUDA写的。你想换掉英伟达的卡?可以,但你要把所有软件重写一遍。
这就像全世界的人都习惯了用Windows,所有的软件都是Windows版。你现在拿出一台Mac说"这个硬件更好"——对不起,你常用的那些软件一个都装不上。
这就是英伟达的护城河,也是他们值一万亿美元的原因。
🖼️ 图片建议: 一张三层架构剖视图。最底层是一块英伟达GPU芯片实物图(标注"硬件:GPU"),中间层是CUDA平台(用齿轮+方向盘图标表示,标注"CUDA:万能方向盘"),最上层排列着一圈AI框架图标(PyTorch、TensorFlow、JAX 等,标注"AI应用层")。从下到上用粗箭头连接,表示"硬件 → CUDA → 应用"的单向依赖关系。右侧拉出一个红色警示框:"所有上层软件都依赖CUDA,换硬件 = 重写所有软件"。风格参考科技剖视图,深色背景+亮色标注。
🤔 AMD的显卡不是也有很多核心吗?为什么不行?
好问题。AMD的显卡硬件层面确实也有几千个核心,理论上也能做并行计算。
但问题出在软硬结合上。
英伟达的策略是"硬件还没发布,软件先写好"——每一代新卡出来之前,CUDA的库、驱动、文档、教程已经就绪。开发者拿到卡就能干活。
AMD的策略在过去十年里一直是"硬件造好再说,软件凑合能用就行"。它的并行计算平台叫ROCm,但至今对消费级显卡的支持都磕磕绊绊,生态和CUDA差了不止一个身位。
又一个类比:
英伟达是卖给你一台车,不仅车好,还配了一条专属高速公路——路牌清晰、服务区齐全、导航精准。
AMD也卖你一台车,硬件参数可能不差。但路呢?"你等等,我们正在修。"
🖼️ 图片建议: 一张上下对比的信息图。上半部分是英伟达——一辆跑车行驶在宽阔的高速公路上,路边有清晰的路牌(标注"CUDA库""驱动""文档""教程"),蓝天白云。下半部分是AMD——同样一辆跑车,但前面是一条断头路,路尽头是工地围挡,围挡上写着"ROCm 施工中,敬请期待"。构图上下对称,风格轻松幽默,科普插画风。
🌏 那国产GPU呢?我们能弯道超车吗?
先说事实:目前全球AI训练市场,英伟达的份额超过90%。尤其在训练大模型这个场景里,CUDA生态的统治力几乎是无解的。
但好消息是,"能用"的门槛正在降低。
推理(就是模型训练完后回答问题的过程)对算力的要求远低于训练。很多国产芯片在推理场景里已经能跑起来了。华为的昇腾、寒武纪、壁仞、摩尔线程,都在各自想办法兼容CUDA生态或者建立自己的生态。
再加上美国制裁这把双刃剑——短期是痛,长期是逼着国产替代加速。就像当年禁运GPS逼出了北斗。
所以目前的格局是:
| 场景 | 现状 |
|---|---|
| 训练顶级大模型 | 英伟达暂时无可替代 |
| 日常推理部署 | 国产芯片已能部分替代 |
| 三年后的格局 | 看国产生态能跑多快 |
🖼️ 图片建议: 一张全景总结图,分成左右两栏。左栏标题"为什么AI要跑在GPU上"——三个小框:① "矩阵乘法 = 海量简单计算" ② "CPU:一个博士串行算到天荒地老" ③ "GPU:一万个小学生并行瞬间搞定"。右栏标题"为什么英伟达不可替代"——三个小框:① "CUDA = 万能方向盘" ② "全行业软件都绑在CUDA上" ③ "换硬件 = 重写一切"。中间用一条竖线分隔,底部一行大字:"硬件可以追赶,生态才是真正的战场。" 风格参考科普杂志终章总结页,白底+分区色块。
💡 一句话总结
AI需要GPU,不是因为GPU聪明,而是因为GPU人多。CUDA让英伟达的"人多"变得可用且好用,又让这种好用变成了全行业的依赖。至于未来——硬件可以追赶,生态才是真正的战场。
(如果这篇文章让你对AI背后的硬件世界产生了兴趣,转发给一个同样好奇的朋友。我是面包君,下次再聊。)