哈萨比斯与 DeepMind

德米斯·哈萨比斯的履历看起来像一个人串起来的:国际象棋、游戏、海马体、阿塔里、围棋、蛋白质。坐到论文前面会发现,每一站的作者名单都很长。他是召集人,也是方向的坚持者。DeepMind 是一间屋子。

棋、游戏、脑子

哈萨比斯 1976 年 7 月 27 日生于伦敦。四岁看父亲下棋学会国际象棋,13 岁达到大师水平,当时 14 岁以下世界排名第二,只排在朱迪特·波尔加后面。他带过英格兰少年队。

17 岁在 Bullfrog 和彼得·莫利纽克斯一起做《主题公园》,担任联合设计和主程。这款经营模拟卖出超过一千万份。他随后去剑桥王后学院读计算机,1997 年拿了双优。毕业后成为 Lionhead 的创始成员之一,在《黑与白》里写一只会向玩家学习的生物,那是当时游戏里最复杂的人工智能之一。1998 年他自己成立 Elixir Studios。

工作室结束后,他回到学校。2005 到 2009 年在伦敦大学学院神经学研究所读认知神经科学博士,导师是埃莉诺·马奎尔,题目落在记忆和想象:脑子怎样把场景装出来。博士之后,他拿着 Wellcome 的奖学金,在伦敦大学学院的 Gatsby 计算神经科学单元、麻省理工和哈佛做博士后,和彼得·达扬、托马索·波焦这些人一起,把脑子里的层次结构翻译成算法上的想法。Gatsby 的创始主任是杰弗里·辛顿。两条后来看起来很远的线,在伦敦这间屋子里离得很近。

他自己说得很直:回学术界,是因为想从大脑里找下一代人工智能算法的灵感。

2010:三个人

DeepMind 2010 年在伦敦成立。三个创始人带进来的手艺不一样。

  • 哈萨比斯:游戏里的智能、神经科学、把人聚拢的能力。
  • 谢恩·莱格:首席科学家。他长期追问通用智能能不能被定义、被测量,学术上靠近马库斯·胡特尔那条「普遍智能」的线。
  • 穆斯塔法·苏莱曼:把研究做成公司、做成和外部世界的合作。数据中心省电、手机耗电、医疗场景,早期很多落地是他在推。

公司自己的句子是:先把智能搞清楚,再用它去解决其他一切问题。2010 年说这句话的时候,深度学习还没有赢得 ImageNet,风险投资市场也不把通用人工智能当正经生意。

2014 年 1 月,谷歌收购 DeepMind。《卫报》报道成交价约 4 亿英镑(约 6.5 亿美元),并称这是谷歌当时在欧洲最大的一笔收购。谷歌确认了收购,没有正式公布数字。拉里·佩奇亲自推这笔交易。公司在字母表体系里继续由哈萨比斯运转,研究上长期保持单独的味道,直到 2023 年。

像素进去,动作出来

第一件让外面记住的工作是 DQN。2013 年的版本已经能从游戏画面的原始像素学习打 Atari,同一套网络换游戏,不换手工特征。2015 年论文进了《自然》。深度网络负责看,强化学习负责行动。这是 DeepMind 后来反复使用的组合:少给人设计的特征,多给系统和分数。

大卫·西尔弗是这间屋子里强化学习那一头的核心人物。后面围棋的论文,他的名字排在最前面。群像如果只写哈萨比斯,会把真正把算法做出来的人丢掉。

围棋:外面的人第一次围过来看

围棋被当成人工智能的长期难题,因为棋盘太大,搜不完。2015 年 10 月,AlphaGo 赢了职业棋手樊麾。2016 年 1 月论文上《自然》。真正被世界看见是 2016 年 3 月 9 日到 15 日,首尔,对李世石。五番棋,AlphaGo 4 比 1。现场有超过两亿人次看过转播。黄士杰(Aja Huang)坐在棋盘边,把程序的落子摆到实棋上。

第二局的第 37 手成为这页要记住的细节。DeepMind 事后写道,以人类棋谱估计,这一手被下出来的机会大约是万分之一。职业棋手第一反应是落子落错了地方。李世石抽完烟回来,对着棋盘看了很久。那一手帮助 AlphaGo 拿下第二局。

第四局李世石下出第 78 手,后来被叫做「神之一手」。DeepMind 用同样的万分之一来描述它有多不像常见着法。李世石赢了第四局。人机都走出了棋谱里稀有的手,这比「机器战胜人」更适合留在笔记里。

奖金 100 万美元捐给了 UNICEF、STEM 公益和围棋组织。

2017 年,AlphaGo Zero 不再使用人类棋谱,只靠自己和自己下,论文再次发表在《自然》。AlphaZero 把同一套自我对弈带到围棋、国际象棋和将棋。MuZero 连规则模型都改由学习得到,论文 2020 年发表在《自然》。游戏在哈萨比斯这里始终是显微镜:规则清楚、分数清楚、进步看得见。显微镜不是目的地。

蛋白质:目的地换成科学

蛋白质会折叠成什么形状,关系到它能做什么。实验测结构又慢又贵,这个问题被放在那里大约五十年。

AlphaFold 在 2018 年的 CASP13 上第一次让结构生物学界认真起来。2020 年的 AlphaFold2 在 CASP14 上把预测推进到很多任务里可以当真用。约翰·江珀(John Jumper)是这项工作的第一线科学负责人,哈萨比斯参与方向和整个实验室的组织。2021 年,《科学》把它选为年度突破,《自然》把它选为年度方法。

他们和欧洲生物信息研究所一起,把超过两亿个蛋白质的结构预测放进公开数据库,几乎覆盖科学界已知的蛋白质。数据库免费。2024 年诺贝尔化学奖:一半给戴维·贝克,奖励蛋白质设计;另一半由哈萨比斯和江珀共享,奖励蛋白质结构预测。

同一年,哈萨比斯因人工智能方面的贡献获封爵士。2021 年他还成立了 Isomorphic Labs,把这套方法往药物发现上推。游戏公司出身的人,拿到的是化学奖。这个转折值得单独记一句。

屋子拆开又并上

苏莱曼在 DeepMind 进入第十个年头前后离开研究一线,先在谷歌担任新职务,后来与里德·霍夫曼等人创立 Inflection。2024 年他出任微软 AI 负责人。同一个创始群像,从此出现在两家公司的发布会上。

2023 年 4 月,DeepMind 与谷歌大脑合并为 Google DeepMind,仍由哈萨比斯领导。谷歌大脑那一边是 Transformer、大规模训练和许多产品里的模型。合并之后,「伦敦的游戏和科学实验室」和「山景城的研究与工程机器」写成了同一个名字。读今天的 Gemini,要同时想起这两间旧屋子。

这页想留住的判断

  • 哈萨比斯的路径是一条可以模仿的学习顺序:先在规则清楚的游戏里把智能做出来,再拿着这个直觉回到脑子,再拿着脑子里的层次结构去打科学问题。
  • 每一篇被记住的论文都有一个站在前面的技术负责人。西尔弗之于围棋,江珀之于蛋白质。召集人不等于唯一作者。
  • 第 37 手和「神之一手」要一起记。群像里有机器,也有李世石。

还想补

  • DQN 论文里 Atari 的得分表,挑三个游戏写清楚它到底强在哪里、弱在哪里。
  • AlphaFold 的数据库自己查一个熟悉的蛋白质,把「预测」和「实验结构」的差别看成一张图,贴回这页。
  • 苏莱曼《The Coming Wave》里的说法,和他在 DeepMind 内部笔记里的说法,对一下哪些变了。