硬件脉络与黄仁勋

算法房间里的人能把网络写出纸面,芯片房间决定它能不能在人的寿命里训练完。黄仁勋从 1993 年起到现在一直是 NVIDIA 的首席执行官。他是这间屋子里站得最久的人。站在他旁边的,还有另外两个创始人,以及代工厂、内存厂和光刻机那几间更早的屋子。

开关、集成电路、代工

1947 年贝尔实验室的晶体管,把计算从电子管里搬出来。1958 到 1959 年,基尔比和诺伊斯把很多开关做进同一块片子。1965 年摩尔写下那个后来被叫做定律的观察。1968 年英特尔成立,1971 年 4004 证明处理器可以是一块芯片。

1987 年,张忠谋创办台积电,把设计和制造切开。设计公司不必自己盖晶圆厂。后来的 NVIDIA 是无厂公司,先进芯片做在台积电的产线上。没有这一刀,1993 年那家小公司的路线走不远。

光刻机在 ASML,高带宽内存在 SK 海力士、三星、美光。一张「NVIDIA 的卡」在物理上是好几个国家、好几家公司的产物。黄仁勋拿过以张忠谋命名的领导力奖。这个奖放在这里刚刚好:无厂公司和代工厂是同一条链上的两个人。

黄仁勋这个人

黄仁勋 1963 年生于台湾,童年在台湾和泰国度过,后来到美国。出生城市在传记里有台北和台南两种写法,这页先记台湾,等读到更硬的材料再改。

家人把他送到肯塔基的 Oneida Baptist Institute,以为那是一所寄宿学校。学校的现实更接近管教院,他受过欺负。多年后他接受采访时说,那时没有辅导员可以诉说,只能自己扛过去,然后继续往前。家在俄勒冈重聚之后,他 16 岁高中毕业。

他选俄勒冈州立大学,因为州内学费付得起,1984 年以电气工程最高荣誉毕业。15 岁起他在当地一家 Denny's 上过夜班,洗碗、收桌子、当服务员,一直做到 1983 年。后来他在 AMD 和 LSI Logic 做芯片,同时晚上去斯坦福读硕士,1992 年拿到电气工程硕士。

1993:另一家 Denny's

创立 NVIDIA 的那家 Denny's 在圣何塞东边,不是俄勒冈打工的那一家。1992 年,黄仁勋、克里斯·马拉科夫斯基、柯蒂斯·普里姆经常在那里谈商业计划。咖啡便宜,也比家里安静。1993 年 4 月 5 日公司成立。黄仁勋 30 岁,从此一直是总裁、首席执行官和董事。

普里姆和马拉科夫斯基来自 Sun 的图形硬件。三个人要做的是个人电脑上的 3D 图形。公司名字来自拉丁文 invidia,嫉妒:希望对手妒得发绿。后来拿掉一个字母,也和他们正在做的 NV1 芯片呼应。

黄仁勋后来说,创始的时候这家公司同时面对市场、技术和生态三个难题,成功概率大约是零。他补了一句:那时候的他也不会给这样的公司投资。

从画三角形到可以写程序

1999 年 8 月 31 日,GeForce 256 发布。NVIDIA 称之为世界上第一款 GPU:几何变换和光照做进了芯片,图形管线不再只靠 CPU。个人电脑游戏成为这家公司的第一口粮食。

真正接到今天的一步发生在 2006 到 2007 年。G80(GeForce 8800)把顶点着色和像素着色收成统一的流处理器。2006 年 NVIDIA 公布 CUDA,2007 年 6 月 CUDA 1.0 放出来。科学家可以用接近 C 的语言,把显卡当成并行计算机,而不是只给它三角形。

这一步在当时看起来像一条偏门。游戏市场才是收入。CUDA 先被物理、化学、医学影像用起来,神经网络还没有成为它的最大客户。押注的是「可编程的并行」,不是押注 2012 年的某一篇论文。

中间有过很痛的产品周期。GeForce FX 那一代在和 ATI 的竞争里落下风,公司离危险很近。这页不展开财务故事,只留一句:路线押错的时候,创始人仍然在位子上,所以后面的 CUDA 才有机会被同一个人继续押。

2012:游戏卡走进科学

克里热夫斯基在卧室里用的就是两张 GTX 580。论文自己写道:网络的规模主要受当时 GPU 的显存和可接受的训练时间限制;只要 GPU 更快、数据更大,结果还会更好。

NVIDIA 后来的官方年表把 2012 年写成人工智能的起点,依据就是 AlexNet。更准确的说法是:游戏产业养大的并行硬件,在这一年被一组神经网络的人用成了科学仪器。硬件页和科学家群像在这里钉在一起。

卡开始为矩阵乘法改设计

年份架构 / 产品这页要记住的变化
2006Tesla / G80统一着色器,GPU 成为通用并行机器
2017Volta / V100Tensor Core,矩阵运算有了专用硬件
2020Ampere / A100训练大模型的默认加速卡之一
2022Hopper / H100设计对象明确写成 Transformer
2024 年 3 月BlackwellGTC 上发布。B200 用两块晶粒拼成一颗逻辑 GPU,配套 GB200,以及一柜 72 颗 GPU 的 NVL72
2026 年 3 月Vera RubinNVIDIA 宣布平台进入生产。NVL72 为 72 张 Rubin GPU 加 36 颗 Vera CPU,互联是 NVLink 6

2024 年 3 月 18 日的 GTC 上,黄仁勋发布 Blackwell。叙事从「一张更强的卡」改成「一座机器」:CPU、GPU、片间互联、机柜开关放在一起卖。

2026 年 3 月 16 日,NVIDIA 宣布 Vera Rubin 进入生产,并说合作伙伴基于它的产品从下半年开始提供。发布稿里的效率数字——相对 Blackwell,训练混合专家模型可以用更少的 GPU,推理每瓦吞吐量更高——先当作公司的主张记下来。等机器真的到云上、有独立测试,再回来改这几行。这页写于 2026 年 9 月。

系统,不只是芯片

训练和推理卡住的时候,原因经常不在「算力不够」这四个字,而在旁边三件事:

  • 显存。模型权重和中间结果要放得下。高带宽内存和先进封装(台积电的 CoWoS 一类)往往比晶圆上的晶体管更早成为瓶颈。
  • 互联。一张卡内部、一个机柜里的几十张卡、机柜和机柜之间,是三种不同的网络。NVLink 解决的是近处,远处还要另一套网络。
  • 软件。CUDA 以及围绕它的库,让研究者的代码默认写在 NVIDIA 上。换平台的成本不只是买卡。

所以黄仁勋后来讲的「加速计算」和「AI 工厂」,指的是这一整层,不是某一颗芯片的峰值。

别的房间

只写 NVIDIA,群像会塌成一个人。至少再留三间:

  • AMD 在 2006 年收购 ATI,图形这条线没有断。软件栈是 ROCm。它是对照,也是采购时的第二个选项。
  • 谷歌从 2010 年代中期开始做 TPU,2016 年对外公布。自家模型可以不走 NVIDIA 的账。芯片房间里因此有了「用的人自己造」这一支。
  • 英特尔、超威的通用 CPU 仍在系统里。Blackwell 和 Vera Rubin 的机柜把 CPU 和 GPU 绑在一起卖,说明处理器没有退出这间屋子,只是不再单独决定训练速度。

和笔记其他部分怎么接

训练瓶颈里写的计算、网络、内存,就是这页的三件东西。推理部署里的框架选择,背后是这套硬件假设。读到显存不够的时候,先问是权重太大、激活太大,还是卡和卡之间在等数据,再决定要不要换并行方式。

还想补

  • CUDA 编程模型里 warp、shared memory 这些词,用一张最小的图记在这里,不搬进技术手册。
  • 台积电先进制程和 CoWoS 产能的公开数字,每半年改一次。
  • 一次真实的云上租卡记录:什么型号、什么价格、跑通了一个多小的模型。把发布会数字换成自己的账单。
Keep Hungry · 大模型笔记