预训练没到头,可能也是一种 RL
2025 下半年业内开始说 "pre-train party is over",姚顺宇在 Anthropic 时也短暂买过这个观点,但在 Google 看到了反例。他认为 "pre-train 撞墙"的人 90% 是有 bug 没找出来,而不是 scaling law 真到头。Pre-train 跟 RL 在数据分布外没本质区别 — 都是把模型权重往一个目标分布推。
AI 个人英雄主义已结束,集体主义胜利
这是访谈反复出现的主旋律。姚顺宇拒绝把 Claude 3.7 / Gemini 3 的功劳归到自己头上 — "我对那个事没那么重要,更多的是很幸运,有机会在那个时候加入了一个重要的项目"。每个人都是冲浪的人,本质上是那个浪。
AI 不太需要脑子,最重要特质是"靠谱"
姚顺宇的反智力炒作判断:"AI 这个事不需要脑子,真的不太需要脑子",真正稀缺的是细节、负责任、把简单的事做得比谁都干净。靠谱体现在你做完一个事会再问一句 "我中间漏了哪些因素?" — 这是和学界做研究的最大区别。
Anthropic 跑得最准是因为它能 top-down
OpenAI 学不了,Gemini 也难。难点是:技术 leader 必须同时是公司决策人,既要技术服众,又要为公司负责。Anthropic 的 Jared Kaplan / Sam McCandlish 是 Scaling Laws 论文的合著者 + 公司股东 + 技术一线领导,集三身于一身;而 OpenAI 自从 Ilya 走后没人能填补这个位置。
Coding 是 LLM 第一个真正爆发的能力
三个原因:(1) reward signal 客观清晰 — 输入对输出就是对;(2) GitHub 提供了几十年高质量数据基础;(3) 好代码的标准在好程序员之间有共识(简洁、有抽象、结构清楚)。三个条件同时满足的场景很少,所以 coding 先突破。
"壳"难逃模型公司掌心,只有两条活路
姚顺宇判断的 Manus / Cursor / OpenClaude 们的生存路径:(1) 长得比模型公司反应过来快,边长边自研模型(Cursor 现在走这条);(2) 市场小到模型公司看不上(Midjourney)。两条路之外都难以逃逸。
机器人短期内难有 LLM 那种横向跃迁
机器人还处在"feature engineering 时代"— 给定环境能优化,但泛化能力没起来。LLM 在 Transformer + GPT 之后跨过了"水平提升所有能力"的分水岭,机器人没到那个点。"VLA 这种用语言模型作为底座的尝试",但还没看到决定性的范式跃迁。
拉 Horizon 是 2026 最关键的 bet
姚顺宇当下最高 priority 的两件事:ML coding(让 AI 加速 AI research)+ long horizon(用 finite context 训练实现 infinite context 使用)。核心问题是 — 怎么让模型像人一样选择性遗忘 + 主动 retrieve,而不是死磕扩长 context window 本身。
Gemini 复活靠 Nano Banana + Gemini 3 两连击
单靠模型升级市占率拉不动 — 你在 10% 市占下做模型再好,传播速度太慢。Nano Banana 把流量打起来,Gemini 3 把人留住。现在 Google 市占大约在 20% 左右,组织上预训练变得"非常可控、可预测"。OpenAI 的不进取救了 Google 一命(没把搜索完全吃掉)。
蒸馏分硬蒸和聪明的蒸,字节最有特色
硬蒸 = 直接把 Claude 的 token 强行训进自己模型 — 商业不道德、智力上愚蠢,本质是不知道自己要干嘛。聪明的蒸 = 在自己的训练系统里把别家模型当辅助 / 评价者 — 商业灰色但技术上有趣,中国实验室可能成了真正的 multi-agent 训练先驱。在这条谱系里字节最有特色,豆包语音"全世界最好",但聪明度上不如 Gemini / Claude。
"AI 这个事本来也不太需要脑子。真的不太需要脑子。"
为什么非共识 · 整个 AI 行业的主流叙事是"天才云集 / 智商门槛极高",大模型研究员炒到球星转会价格。姚顺宇站出来反它:这个行业绝大多数活儿"本科生就能干",真正稀缺的是"做事细、对自己做的事负责任"。他承认自己受益于这种炒作,但仍然觉得是不健康的虚高。
"现在每个人都是冲浪的人,本质上是那个浪,而不是你那个冲浪的人。"
为什么非共识 · 主流叙事还在造神 — Sam Altman / Demis / Dario / Ilya 都是个人英雄。姚顺宇反复拒绝把 Claude 3.7、Gemini 3 的功劳归到自己头上:"我对那个事没那么重要"。这跟硅谷"创始人神话"传统几乎对冲,在中文 AI 节目里几乎没有第二个嘉宾这样说话。
"Anthropic 能够实行 top-down 的机制是一个很独特的事。OpenAI 就干不了,Gemini 也比较难。"
为什么非共识 · 硅谷主流推崇 bottom-up + 创新自由。姚顺宇的判断反过来 — startup 阶段 top-down 比 OKR 更有优势,但前提是"技术 leader = 公司决策人"。这是 Anthropic 的 Jared / Sam(Scaling Laws 论文合著者 + 公司创始团队)能做、OpenAI 自 Ilya 走后做不到的事。
"我觉得 pre-train 没到头。我的感觉是在未来的四个月也没有看到头的迹象。"
为什么非共识 · 2025 下半年业内共识在转向"pre-train party is over,转去做 RL/test-time compute"— 这是 OpenAI 长期立场、Anthropic 一度也相信。姚顺宇在 Google 看到反例,他认为 90% 撞墙的人"是有 bug 没找出来",而不是 scaling law 真到头。他强调这是"几个月前还很主流"的争议立场,他和大多数人不同。
"Pre-train 也是一种 RL — 它俩本质区别不在算法,在数据分布。"
为什么非共识 · 业内主流把 pre-train / SFT / RL 当成三种独立范式分组管理(Anthropic、Google 都是这样)。姚顺宇的观点是 — RL 在更宽广意义上是 pre-train 的超集,核心区别只在"数据是 ground truth 专家分布(pre-train/SFT)还是模型自己产出(RL)"。这个框架直接挑战 OpenAI 那种把 RL 单独切出 Strawberry 组的组织设计哲学。
"高能理论博士 5 年,买了一个大教训 — 没有客观评价标准的领域,做的再好对世界影响为零。"
为什么非共识 · 主流叙事会赞美"为科学献身的纯粹学术追求"。姚顺宇明说:他斯坦福物理博士的产出"对这个世界的影响几乎为零",原因是高能理论已经发展到实验完全追不上,缺乏客观评价标准,谁做得好不好"依赖领域内老登的主观判断"。他更愿意做有客观评价标准 + 对世界能产生影响的事。
"没有哪个老登是你的亲属。所以你觉得他傻,他就是傻,就可以直接说他傻。无所谓的。"
为什么非共识 · 中国学术圈和大公司文化普遍讲"对前辈要尊重 / 委婉表达"。姚顺宇反 — "做学生的时候还挺收敛的,后来发现收敛没用,对自己也没好处,对别人也没好处"。前提是"你不是随便喷人,你有一套自己的理论",在有客观评价标准的领域里,直接表达不会伤到自己。
"基于我当下认知,一个关键的重要的 bet 是 — 拉 Horizon。"
为什么非共识 · 2026 业内大多数预测都是 "agentic 应用爆发 / multi-agent 是下一个范式 / 多模态生成 / 世界模型"。姚顺宇的核心 bet 反而是一个看起来更基础设施层的问题:用有限的 context 训练但实现无限 context 使用。这个 bet 选择走"后训练 + context management"路线而不是预训练扩长 — 跟一些大厂的预训练长 context 路线分叉。
哈喽,大家好,我是小俊。AI 业界有两个尧舜禹,一个从 OpenAI 跳槽到了腾讯,一个从 Anthropic 跳槽到了 Google DeepMind。前一位尧舜禹去年来过我们节目,那今年我们邀请了另外一位,这位尧舜禹毕业于清华和斯坦福大学,曾经的研究方向包括费厄米系统、量子物理和高能物理。毕业后从物理转战 AI 2024 年加入 Anthropic 2025 年跳槽到了 Google DeepMind, 出任研究科学家,参与了 Claude 3.74.5 Gemini 3 等模型的开发过程。
除了这些重点模型的开发之外,他有一些很有趣的观点,比如说 AI 的本质是简单的预训练,也是一种强化学习,不要迷信老登 AI, 个人英雄主义的时代已经过去了, AI 从业者最重要的特质是靠谱,等等等。我们的节目录制于 2026 年 3 月,距离我们这次节目录制完,世界又发生了许多意想不到的变化,比如说 Meta 对于 Manus 的收购被撤销, Cruise 可能被 SpaceX 收购, xAI 将终止独立运营并入 SpaceX, 并且更名为 SpaceXAI 等等等。
如果我们的谈话内容有一定的滞后性,还请大家能够多多包含,因为 AI 的世界实在是变化太快,也太出乎意料了,可能还要特别说明的一点是,技术细节会涉及到一些企业机密,有一些是嘉宾不方便分享的,所以也请大家能够多多包容我们,在最大的可能的范围内和大家一起来学习 AI。接下来。就是我对顺宇的访谈,期待 2026 年我们和 AI 共同进步。
Anthropic 作为一个公司来说,它能够实行这种就是比较 top down 的机制。是一个很独特的事。
这对于其他模型公司很难吗?
很难,比如说 OpenAI 就干不了,就是 Gemini 也比较难,大公司和 start up 它打法本来就不一样,因为 start up 重要的是 make bet。就是我得赌一件事。是,我觉得大家现在就是每个人都是冲浪的人。本质上是一个浪,而不是你那个冲浪的人,因为 AI 这个事本来也不太需要脑子。不太需要脑子。真的不太需要脑子。
需要什么?
我觉得这个行业就是最重要的特质就是靠谱,就是做事细,对自己做的事负责任,这是最重要的特质。
硅谷不是有两个尧舜禹吗?你要不要先给大家介绍一下?你自己给大家科普一下两个尧舜禹的区别。
可以,对,我叫姚顺宇。显然也有一个跟我几乎同名的朋友,我们俩主要履历也有一些 overlap, 所以说可能看起来非常的难以区分。对,我以前是做学物理的。我本科时候在清华,那时候做凝聚态理论,后来去斯坦福做理论高能物理和量子信息黑洞相关的一些方面,离开斯坦福之后去伯克利短暂的待了两个星期的 postdoc。博厚就离职了,去了 Anthropic。然后在 Anthropic 待了一年,去年 9 月底 10 月初的时候加入了 Gemini。对,然后如果大家非要区分的话,我觉得最大的区分就是那位姚舜禹,他一开始就是一直都是做 CS, 就是计算机相关的,我其实从某种意义上来说是个半道出家。对,就是我之前是做理论物理为主的,对。
你们是不是好朋友?你们好像大学就认识,而且是一级的,对吧?他是一个什么样的人?你是一个什么样的人?你评价一下他,你也评价一下自己。
对,我们本科就认识,因为我们本科是一级的,然后在清华,但他一开始就是学计算机的,所以他在那个姚班就是计算机科学实验班,然后。我是学物理,所以我在集科班。对,后来他去了普林,我去了斯坦福。这可能也是另一个有点令人费解的点,就是好像这个普世界里觉得斯坦福应该是学计算机的人该去的地方,觉得普林斯顿是学物理人该去的地方,但我俩正好反过来。,所以说也可能产生了一些费解的事情。
对,我俩其实也还真的挺不一样,我觉得他是一个比我有趣的多的人,我觉得我从他身上也是在过去也是能学习到了一些和我很不一样的点,比如说他可能花了很多时间去。思考,比如在 AI 方面他花了很多时间去思考,就是人和 AI 的交互,包括一些产品上的事情,我觉得其实对我来说是一个很不一样的朋友,我也从他那学到了很多东西。
你们之前在硅谷的时候多久见一次面啊?你们现在是不是还频繁打电话?多频繁。
我们在硅谷的时候见面确实挺频繁的,可能每几个星期,但是好像见面主要是为了凑一块玩,。玩啥?就是。真的就是纯玩,就是可能出去散散步,扯扯有的没的。然后可能有时候吃个饭、打个牌之类的,对。对,然后他回去之后,其实我们也,也是,也还是经常会打电话,对。
最近一次电话聊啥了?好像就是前一两个星期。
你怎么知道的?可能就是会过几个月,然后就 catch up 一下,大家过最近的近况,对。
他是不是多次想把你拉过去?
嘶。可能有这个意思,但是我觉得不关键。
你为什么不去?
我觉得对我自己来说我没想清楚吧。我觉得多半是我自己的原因,我也没有去任何中国的地方,我觉得主要原因是因为在去年的 9 月或者八九月这个时候,我觉得那时候我离开 Anthropic, 离开之后决定要去哪的时候,最大的动机是我想学一些不一样的东西,对我来说我可能就没有去考虑。没有更着重的去考虑说能够我去领导一个项目,或者领导一个 project 之类的,我更多的是那个时候,更多的是优先去学习一些东西,所以那个时候我选择去了 Gemini, 对。
我发现你们两个老被放在一起比较和讨论,对你来说是困扰更多还是享受更多?
我没什么感觉,因为我这个人也不太关注社交媒体,所以我其实真的没什么感觉。
因为那位姚舜禹,他之前在去年的时候说 AI 进入了 the second half, 进入了下半场,这个成为了一个非常有名的观点。你觉得今天的 AI 在一个什么样的时期?你能给它一个定义吗?
对,我觉得,对我来说,我可能看得没有那么清楚什么叫做上半场,什么是叫做下半场,或者说这个定义一直以来对我并不是特别清楚,对我来说确实现在 AI 进入到了一个阶段,就是我觉得大家都已经开始不那么担心一件事, AI 是不是能够做得到,而是担心这件事是不是被良好定义。
对,我觉得这是一个很大的区别。比如说我觉得一年之前,就是可能去年年初的时候,那时候我在 Anthropic 呗?然后大家可能担心的事情还是说诶?OpenAI 这个 reasoning 做的这么强,我们有没有机会能够追上?有多大的机会能够超越它?大家还很担心这个事,我觉得现在就是在任何这,至少在 Gemini、OpenAI 和 Anthropic 这三家当中,我觉得没有哪一家会真的担心自己追不上。然后我觉得可能现在对大家更难的事情是想明白要去做什么,是一个我觉得是一个 bet, 是一个赌,但是也是我觉得也是一个很需要人的 insight 的事情,对。
这也意味着模型的能力被拉平了,对不对?它变得同质化,被变得商品化,所以模型没有很大的。区别就是在好坏上没有很大的区别,但是它需要分化。
我觉得从用户的实际体验上来说,这三家的模型是能够感受到区别的,但是难的一点是过去这个区别在纸面上也能看出来。在纸面上。纸面上是指就是比如说像公开的有很多这种 Benchmark 这种测量的规范,然后比如说大家以前能够去看 SWE-Bench, 对,能看 SWE-Bench, 然后可能数学大家那时候会比像简单一点的 AIME, 然后难一点的像 IMO,那个时候感觉就是。
你从纸面上就能看出来诶,这个模型好像 reasoning 强一点,那个模型好像 Coding 强一点。那个模型这个强一点。现在。就是纸面上大家其实都比较相近,你去看纸面上的消息,比如看 Scaling Law, 你会发现,诶,好像好的会比不好的可能高一个百分点或者两个百分点,但其实大家都在 80%附近,那个附近数字高一点低一点其实是 Noise, 就主要是噪声而不是信号。对,但是从另一方面来说,大家使用上确实还是能体现出区别的。我觉得就我个人了解到的信息而言, Claude 目。目前仍然是比较通用的工具,使用类的是 agent 表现最好的。在纯粹 Coding 的方面,可能最近 Codex 稍微追上了一点,把中间的 gap 变小了一点。Gemini 可能在纯的 Reasoning 和一些比较日常的使用环境下,可能目前还是比较好的,在 Coding 和 agent 上还处于一个比较在接近的状态。对。
诶,这些能力他们是有意选择我优先发展哪个方向?还是说他就是好和坏的区别,就是他是能力问题还是意愿问题?
我觉得其实是有意愿的成分在的,尤其在过去的情况下,主要是意愿,就是当大家能从纸面上就看出区别的时候,那时候意愿肯定是占大多数的,因为可能像 Claude 就一直更看重这种使用工具的能力。然后包括 Coding, 那可能 OpenAI 有一段时间非常看重 Reasoning。对,当然他现在也开始看重 Coding 了,在那时候肯定是意愿会占大多数,因为你花你更有意愿的话,就意味着你可能花更多的精力去。构建合适的基础设施,合适的 Infra, 构建合适的数据,尤其数据它是一个从某种意义上来说很花时间、很花精力的事情。
对,所以说那个时候肯定是一元转主导,但是到现在这个时候,我觉得两方面其实都有,因为其实因为纸面上都看起来差不多,其实甚至你就是做一些更内部的测试来说,这个数字也都变得差别没有那么大了,这时候。更难的事情就是你该怎么去定你的问题,定你想要的行为。然后在这个事情没有定义的那么清楚的时候,模型的很多差异其实来自于一些其实是你想不想象不到的事。
对,想象不到的事指的是。
我觉得当然想象不到的事就是你现在去问,其实我很难给你一个特别清楚的答案,可能过一段时间之后回过头来看,我才能给一个清楚答案,但是我可以举一个。想象不到的例子,比如说退回,往回退,可能一年、2 年甚至 3 年的时候,那时候如果你去网上取这些预训练的数据的话,你可能训练一个模型,就会发现模型在写代码,那时候当然没有这种 agentic 的写代码,它都是写一段代码,那时候你会发现模型化写代码会写的很好,但是可能那时候大家不知道为什么,但是这个里面意外的原因可能就是你从网上随便的去,如果不做任何的数据的筛选的话。很自然的,这个 code data 的质量就会比别的高一点,因为你去看网页,你会发现 Github 的质量是显著比别的正常网页要高的。
那在进入我们今天主题之前,我想先聊聊我们最近模型的一系列的近闻。就是你看最近大家都在讨论 OpenClaude。你作为一线的研究员,你对这个新的产品形态是怎么看的?你周围有哪些讨论?
我觉得有趣的是,我感觉这个事情在业外的讨论好像比业内的讨论更激烈。
业内没有人讨论。
业内有人讨论,但是我觉得对业内人来说,它并不是一个特别令人惊讶的事。我怎么说?就是可能在公司内部也有人已经做了类似的这种实验,或者这种的 demo, 只是可能并没有作为一个产品去很认真的宣发,然后把它打磨,然后发出去。对,然后当然事实情况就是你去看这个 OpenClaude 最早版本的 GitHub 的 code, 其实那个 code 也就从某种意义上来说写的也不是特别的干净,但是我觉得它很重要的事是它给大家展示了这种可能性。那可能展示这种可能性之后,未来。像他 OpenAI 作者自己也加入楼盘,那可能就是这些模型的实验室,或者说一些大一点的创业公司会很快跟上,把这个东西打磨成一个真正可用的产品。对。
所以我理解,其实在 OpenClaude 发布之前, Google 就已经有人在做这个事情了,只是还没有发布,因为大公司的流程比较长。
对,我的,我至少我个人所得到印象是这样的,所看到的是这样,对。
所以这种类 OpenClaude 的这种产品形态背后,它本身说明了什么?在今年初的这个时间点上。
我觉得,其实我觉得技术上来说其实并不能说明什么,就是说 OpenAI 这个产品,当然它依赖于模型能做的很多事情。但是那些事情的能力其实并不是到今年年初才准备充足,我觉得可能在去年就是像 Opus 发布 4.5,当然那时候 Opus 其实比 OpenAI 和 Gemini3 在 to use 的能力上都要强一些。所以我觉得在那个时间点,其实你做这个事就已经是可以展示出来了。然后其实它。他一开始发布也没有立即就火,他就发布了之后过一段时间才火起来。所以说我觉得可能对我来说技术上它并不是一个那么令人惊讶的事。
它是模型能力的自然溢出。
对,我会这样觉得,但是我觉得它可能一个对于大家的惊喜,是说以前可能大家都没有意识到。它让大家意识到了这件事可以做。
意识到什么?
就意识到了这个你可以诶,让模型做很,就是你可以控制很多不一样的模型,然后做很多不一样的事情,然后把这个事情汇总之后做一个很长很长很长 long horizon 的这种。这种工作。我觉得可能以前大家并没有广泛的对这个事产生共识,这个事情给大家展示了这样一种可能性吧。
你看从去年出火的是 Manus, 今年出火的是 OpenClaude, 就是从 Manus 到 OpenClaude 变化是什么?是模型能力的变化还是产品的变化?
这也是一个我其实一直没理解的事。就是 Manus 和 OpenClaude 之间的质的区别是什么?是一个我其实自己没太看明白的事情,说实话,。OK。或者换句话说,可能 OpenClaude 这个事火了,但是如果你要回头问我说为什么 Manus 做不了这个事,我不明白 Manus 为什么做不了。可能只是他没做对。
但是你看,不管是 Manus 还是 OpenClaude, 他们都选择了 Manus 卖给了 MetaOpenClaude, 卖给了 OpenAI 这个现象说明什么呢?为什么他们都卖了?
我觉得我自己的感受是一个东西,如果要长久的生存,还是需要考虑一些壁垒的。
壁垒是模型。
我觉得。至少目前来说很多壁垒都是在模型侧,但是未来会不会产生产品侧的壁垒?我觉得是因为大家市场上就是这个都是老生常谈的话题,就很多人就要谈论这个什么数据飞轮之类的事情,目前来说我觉得没有哪一个场景真正的形成了数据飞轮甚至 AI 纯粹原生的应用场景。我觉得目前除了 agentic coding 就写代码之外,没有哪个场景是 AI 真正原生的场景。变得非常成功,因为从某种意义上来说, Chatbot 其实是搜索的一个延伸。
Chatbot 是搜索延伸。对。它为什么不是独立于搜索的?
它是因为你想大家其实和 Chatbot 最多的交互是,我有一个问题就问这个 Chatbot, 然后这个其实是搜索本来干的事,但是它带来的比搜索要远强的一个事情是它变得非常 interactive。就是它有交互性,你可以追问,然后它甚至可以帮你总结出一些通过它获取的一些信息,帮你把它压缩成,浓缩成回答你的问题的那个信息。对。这个是以前搜索给不了你的。对,但它当然就不是完全一样的需求,但是从大的需求上来说是比较类似于搜索之前的需求。
Manus 和 OpenClaude 我觉得都是现在最有名的壳,但是壳最后都卖给了模型,那是不是说明壳还是难以逃脱模型的掌心?逃印速度不够快,是不是。
我觉得壳在目前这个情况下活下来有两种我大概能想象的方式。一种想象的方式,就是像你刚刚说的逃的足够快,就是我增长速度足够快,以至于在模型公司反应过来的时候,我其实已经占领了大量的用户心智。在模型公司追你产品形态的时候,我又自己研发出了自己的模型,我觉得 Cursor 就是试图在走这条路。那 Cursor 其实在这种 AI 原生场景下,几乎是我能想到的创业公司里增长的最快的了。就算这样的公司,它现在也很有危机感。
他有多有危机感?
反正我的感觉是。对于 Cursor 来说,现在和 Anthropic 已经进入了一个非常微妙的关系,曾经他们是亲密无间的合作伙伴, Anthropic 提供模型, Cursor 提供产品。后来 Anthropic 自己有了 Claude CodeClaude Code 现在变得非常成功, Cursor 现在又自己试图做自己的模型,所以 Cursor 在努力的训他的 Composer。所以说我觉得都不用说未来,其实现在就是他们已经处于一种比较竞争的关系了。那如果在竞争中输掉的话,我觉得是比较麻烦的,因为。
代码这个事情, Coding 这个事情,其实它本质上是一种服务于专业用户的专业需求,是一种工效率工具,很容易出现的一个场景就是赢家通吃。我觉得这个是不管对 Cursor 还是对 Anthropic, 还是对任何一个做 Coding 的公司来说,可能都是他们比较担心的事。
对,然后这是刚刚说的就是一条路。要快。就是对,你长得够快,你在别人还没想吃你的时候就疯狂长,等他想吃你时候你已经足够大,另一种方式就是这市场足够的小。小到模型公司根本懒得去管。我觉得 Midjourney 就是这一个例子。就是这个市场小到可能,虽然你说咱们俩努力一把,能不能做 Midjourney 那个事?可能花一些精力、花一些钱、花一些 data 是能做到的,但是足够小,以至于可能咱们俩就不是很会在那上面花时间了。看不上。对,,我觉得那可能也是一种活下去的方式,对。
所以哪怕是 Cursor 今天也没有逃逸出模型的手掌心。有谁成功逃逸了吗?Midjourney。
我觉得大的就我目前还没看到,小的可能 Midjourney 这个例子当然肯定有别的例子,只是我还没看到。对,小的我觉得会有例子。
诶 Lovart 算吗?
我觉得他们有机会。
他们有机会。对。反正就不能做那种通用的场景。
我觉得就是,我觉得这是方德要自己要决定的一件事,就是你要不要。抱着 1/10,000 的生存几率去赌一票大的。还是抱着 1%的生存几率去先吃定一个小的事情。
如果是你,你会怎么选?
如果是我,我内心肯定是想吃一票大的,但是我真诚的想是我觉得第一步是不能一步登天的,所以如果是我,我会选择去吃一个,先吃一个小的,但是我会选择一个有想象空间的小的。
你说 OpenAI 为什么要收 OpenClaudeMeta 为什么要收 ManusGoogle?为什么谁也不收?
Google 也收了 Google 买了 Windsurf 的人。
OKWindsurfOK。
我不理解。
什么叫你不理解。
说实话就是我不理解我觉得 Meta 买 Manus 这个事,我觉得对他们来说最大的用处就是不如果抛掉花了多少钱之外。最大的用处是获得了一批很好的在亚洲的产品团队。
在亚洲说明什么?
因为。我觉得一方面就是显然大家都知道中国的 AI 人才储备还是很丰富的,虽然可能目前从技术上、纯技术上来说,中国的 AI 还没有真的追上美国,但是显然 AI 中国是有很多好的人的,不管是从纯技术上还是从产品上,我觉得可能中国的本质上人才是比美国要更好的。
对,所以对他来说,我觉得 Manus 成为了他在新加坡的一个锚点,就他可以从那里吸引一些,比如说从中国的,或者是新加坡或者东亚的人才。我其实没有特别看明白这个产品本身对 Meta 来说有多重要,或者换句话说就是为什么 Meta 不能自己干这个产品。
但是不管是 Manus 和还是 OpenClaude, 它事实上就是诞生于外面的团队。为什么不是硅谷的这一帮研究员做出来的呢?有没有反思过这个问题?
对,我觉得,对我来说这样这个问题其实我觉得一个公司一旦变大了之后,它的负担也变大了。就说我可能作为一个研究人,我们可以做一些很看起来很有趣、很有特点的产品,但是我一旦把这个产品去公开给公众,那要负责的事情是非常多的。第一你这个产品不可能说一上线告诉所有用户,你得再去买一台电脑干这个事,否则他就有可能会获得你电脑上所有的权限,然后把你系统搞崩。
这就作为一个大公司来说,你不, GoogleGoogle 是不可能提供这样的产品出去的,对吧?所以你产品要花很多时间打磨,你要确认法律上它没有一些风险,用户上又不会损坏自己的品牌,你如果把它送出去了,你可能还要给它比较固定的一些资源去 serve 这个模型,或者 serve 这条产品的线。所以对大公司来说我觉得还是有挺多负担的,但是对于个人来说无所谓,我反正是一个开源的项目,我代码垃圾又如何?你帮我来一起写,对吧?
对。但是我觉得不管是 Manus 还是 open cloud, 它其实指了一个方向,就是可能这也是 2026 年的某种叙事的可能性。你对 2026 年怎么样思考和预期的?
我觉得其实有太多的可能性,对我来说,从模型能力上来说,我觉得模型我有时候特别爱说这个口号,我觉得模型做到 train with finite context use as infinite context。换句话说,你用有限的。这个 context lens 去训练它,但是可以在使用的时候用非常长,甚至接近于无限的 context lens。
我觉得这件事今年是有机会能够做实现的,这件事情实现之后我觉得会解锁很多新的应用,因为举一个最简单的例子,就是你有可能可以让这个模型跟你持续的交互,持续的获得你的信息,它在运行的过程中会持续的根据当前的场景和你的会话,可能把那些它觉得不重要的信息扔掉,就成了大家梦想中的个人助手。
对,我觉得这个从技术上来说,我觉得这件事是会,今年是无论如何是会实现,但是当然我觉得现在大家没有达成共识的是技术上怎么去实现这个事。显然是有很多技术路线,但是现在我觉得更多的是属于在尝试哪条路线能够跑通的同时,可能有好几条路线都能跑通,我们到时候就要去实验上去测在常大用户常用的使用场景下,哪条路线的效率是最高的。对,我觉得现在更多处于这个阶段,而不是说大家没有想法了的阶段,就大家有想法,但是要确定哪个想法是最后的想法。
站在这个 2026 年的 Q1,作为一个一线的研究员,你觉得模型的进步速度在放缓吗?
我觉得完全没有。
完全没有。
我觉得完全没有。
它的速度曲线对比 25 年、24 年的变化是什么?
这个很难,很难量化的说,因为就是你得给一个标准,我才能量化的告诉你。因为如果你给的标准是,比如说我就看在某一个 Benchmark, 比如说随便 bench 上它每一个月涨多少个点,那这个事是肯定会变慢的,因为根据定义,这个 Benchmark 最高就到 100%。所以你越接近,那肯定是越跑的越慢。但是这可能并不代表用户体验这个模型的能力增长变慢了。因为可能从 50%到 60%,他可能感觉好了一点,但很有可能比如说从 70%到 75%,他发现好的比 50%到 60%那个还多。这是完全有可能。
如果是 80%到 90%,90%到 100%,这个感受会更显著。
那也不一定,因为可能过了,可能到 80%到 90%用户就发现没有任何区别,甚至还变差了。
你说完全没有变慢,你是基于什么标准?
我觉得是基于我个人作为一个研究员的感觉,就是我觉得我个人得到的感受是这个模型学东西。的能力越来越强了。以前可能让模型学会干一件事情需要动很多脑筋。但现在可能不需要动那么脑,那么多脑筋了,最重要的事你是要把这问题定义清楚,然后想清楚怎么去构建合适的数据。当然数据,现在数据就更宽泛的,指向环境之类也都在的,包括在内了,然后剩下的事情好像很多时候是顺其自然的了。
对,学习能力变强是为什么呀?模型的学习能力变强了。
我觉得可能一方面。原因可能有很多分,但我觉得可能一方面也是因为。预训练其实在过去的几个月里,我觉得还是越来越强了的。
预训练。
对模型的预训练其实在过去几个月里还是变强了。我觉得这个可能是一个从某种意义上来说比较有争议的事,因为几个月以前我觉得很多人已经在讨论预训练的 scaling law 是不是已经到头了。我的体验是没有,而且我的感觉是在未来的四个月也没有看到头的迹象。
对。觉得到头是为什么呢?
我觉得我显然不知道大家觉得到头的原因是什么,因为我自己没觉得到头,但是我觉得我的猜测是一个人觉得一个规律到头了,无非以下两种情况。一个情况是他觉得这个规律的适用范围到头了,从根本上讲 Scaling Law 就是没有办法无穷延展下去的,维持有可能是对的,但是这是一种猜测,就是这个人可能觉得这个规律适用范围到了。到头了,另一种可能是这个人觉得这个规律其中的有一个条件不能满足了,比如说他觉得数据就已经撞上墙了,那我完全没有办法延展下去了。这是另外一种可能性,但是其实还有第三种可能性,第三种可能性就是其实他这个工作哪里有一个 bug?他自己没发现,所以他觉得到头了。对,我觉得从我的观点,从我的观感上来说,我觉得。可能绝大多数撞到墙的人是因为第三种。
是有 BUG。是哪种 BUG?
我觉得 bug 是有很多种可能性的,比如说一种可能性是你 skinning out 做的时候,一些科学的假设没有做对,比如说你选什么样的 TOKEN horizon 就是每一个大小的模型选什么样的这个期待的训练的数据量,然后怎么这个数据量?这个数据是从哪里选?然后有可能是这些比较科学的选择没有选清楚是一种可能性,但是我觉得还有一种可能性,就是纯粹就有个 bug。这个其实在业界我觉得也不惊奇,很多时候修好一个 bug 带来的进展是远大于一些很神奇的技巧的。对。然后当然还有另外的情况,我就刚才给的这种两种例子,反正是我见到过比较多的情况。
那你们的 bug 怎么办?你们怎么解决 bug 问题的?
我觉得。
我感觉这更像是一个信念的问题,因为当你遇到一个 bug, 你觉得它不能解除,你就会说这个到头了。当你遇到个 bug, 我觉得这个肯定可以解决。那你就觉得这还没有到头,因为肯定每个人都要遇到 bug。
对,我觉得这可能就像你说的,其中有一些比较信念性的东西,但我对我来说更重要的一件事是做事系统,你当你一个事情和你预测的不一样的时候,你能不能系统性的排除各种可能性?这个我觉得是一个很重要的事。这个是我觉得咱们俩和 Anthropic 做的比较好的事。尤其在预选上面,当某一个尺度上的行为可能和你想象中不一样的时候,大家能够去设计合理的我们所谓的 ablation 实验,合理的这种实验能够看出来测你的一些想象中的可能的因素是不是真的因素,我觉得这个系才是关键。对。
你觉得模型能力还能提高,那它的驱动力数据算力算法,你觉得它的驱动力主要来源于哪个?
我觉得其实都有,但是从某种意义上来说,数据和算力两个事其实是很强关联的一件事。
数据和算力嗯。
对,因为你算力上去了,自然就会需要更多的数据。对。数据上去了,你就自然需要更多的算力。对算法上来说,我觉得算法作用往往是有一个相变的,就是算法有一个阶段是你完全没有搞清楚该怎么做。那个阶段就算法会非常非常关键,因为你没有完全没有搞清楚怎么做的时候,你可能就完全没有办法 scale up。然后就可能就卡在那了,但是在某一个点你可能发现了算法当中最重要的一件事,那它可能一下就变成了从完全不能做,变成了能做,然后之后算法的提升更多的是一种比较平滑的提升,就是它可能从某种上提高了你计算效率或者使用数据的效率。
对,然后我觉得举例,比如说从语言模型的预训练来说,那可能这个算法上的这个跳的过程就是发现。就是发展出 Transformer 这个事情。但 Transformer 发现之后。更多的都是慢慢平滑的让它的效率,或者你使用雷达或者使用算力的效率变得越来越高了,对。
所以现在的驱动力是算力和数据。
我觉得在现在比较清晰的框架里面,主要的驱动力是算力和数据。清晰框架是指比如说预训练和后训练,不管是基于强化学习的后训练,还是基于 supervise learning, 就是监督学习的后训练,觉得在这两个就是比较清晰的这种 paradigm 下,确实。算力和数据是主要的驱动力,但是不可否认可能有别的方向,可能驱动力失算啊。
什么意思?
举个简单的例子,比如说多模态生成。那个我觉得可能就是一个算法上来说没有太想清楚的事。
对。所以那个还是一个科学问题还没有解决。对。但是语言已经不是科学问题了。
自然语言的生成,我觉得目前这条技术方案撞到头之前,我觉得在科学上是比较清楚的,但是工程上也还有很多要做的事。
你觉得预训练还能提高多少?通过预训练提升模型能力还有多少多长的路可以走,可以预期到?
人就是这样,就是当你没有撞到头的时候,你其实不知道这个路有多长,我能看到的就是现在还没撞到头,但我也不知道哪天会撞到头,如果真的让我去估计一个时间线的话,就像刚才说我觉得 4 个月,接下来 4 个月是还是会继续有进展,但是 AI 这个方向没有人能预测 4 个月之后的事。
所以过去几个月,你在看预训练和模型能力的时候,你还是很兴奋的。这是你周围的普遍的心态和状态吗?
我觉得是的。
这是在 Google 一个小环境里面,还是说在整个硅谷的环境里?
我觉得很难说在整个硅谷,因为硅谷是个太大的地方,可能做产品人对产品很兴奋,对吧?做产品来说,对他们最兴奋的是可能有份靠。但是对做模型的人来说,可能就是我们会对这种模型的进展更兴奋一些。对,我觉得。
就在对于做模型的人来说,兴奋是一个共识吗?在过去 4 个月。
我个人认为是的。我个人认为是的,在我,至少在我能接触到的范围内,我觉得在 Anthropic 和 Google, 大家或 Gemini 斯,大家可能想的更多的是我们 AI 会不断的进展下去,很快我们就要被替代掉,替代之后掉之后我们该干点啥?哈哈,而不是模型撞到头了该怎么办?
说到这个问题,为什么在过去几个月 Coding 的发展速度是最快的?为什么是这个场景啊?
我觉得 Coding 这个场景。首先 Coding 这个事不只是在过去几个月发展最快,我觉得 Coding 这个事其实从 Claude 3.5 new。可是外界有人管那个叫 Claude3.6。从那个之后一直都处于高速发展的状态。然后我觉得。
那个是去年初还是前年底?
那个是前年的 10 月份。
前年 10 月份,对。
对,应该是。有可能 10 月份或者 11 月份。对,差不多那时候,从那之后我觉得一直都处于高速发展的状态。我觉得 Coding 这个场景有两个最大的优势,第一个优势就是它的 reward signal, 就是它的回馈的信号。是很好定义的。因为比如说像 Software Engineer 这种 task, 有时候经常情况就是我需要写一个 code 实现一个 feature, 一个特征,这个特征需要的是某些输入会得到某些输出,这就是一个很容易能够测试的事情,所以它的回馈信号非常清晰,你输入和这个输出能够对,那就说明你的实现是成功的,不对,那就说明不成功。但这只是一个一个例子,就是在这种和写 code 相关里面有很多。这样是良好定义的回馈信号。
另一个比较大的优势是 Coding 的数据有一个非常天然的基础。这个基础就是 GitHubGitHub 上汇聚了过去几个 decade, 几个几十年很多优质的程序员所写下的代码。然后从那些代码出发是可以构建出非常多环境。我觉得。这两件事从模型的角度上来说是为什么 Coding 可以做的很好?当然我觉得从产品上来说还有另外一方面的原因,就是 Coding 这个产品的使用需求其实是从某种意义上说是比较单一的,它不像你去做一个像社交软件或者游戏,可能每一个人都有不一样的品味,你可能很难就是能够满足每一个人的需求,那可能就是。就是需要推荐算法,但是 Coding 这个事,好的事情在于优秀的程序员写代码,其实风格是比较类似的。
什么风格?简洁干净。
对,就是好的代码,是。不脏。是有一个有一些共同的标准的,比如说像你说的就是这个代码简洁、结构清楚,适于未来的开发,有合理的抽象,当然还有别的很多标准,但是我觉得好的程序员往往是有。有比较共识标准的对这件事,所以这件事从产品上来说,其实让 Coding 这个产品变得更简单了。
那你现在的工作百分之多少会用?Claude Code 写代码,它能帮你提高工作多少倍啊?
你问了一个我差点会被开除的问题,我 Google 不能用 Claude Code。
哦,好的。
对,我觉得对我来说一个保守的估计,可能 90%的 code 是模型产生的,但是可能就是我需要花很多时间去看这个 code 是不是写的合适,写的合理,是不是真的是我想让它写的。我觉得有了 AI 辅助工具之后,可能写 code 这个事最重要的地方变成了,你怎么去设计你这个 code 的逻辑,它需要和哪一个文件相关联?需要做哪些事情?你需要给这个模型,可能给一些合理的 context, 比如说这个 code 你可以做一个 reference 去看一眼,对,真正去输出 code, 我觉得模型比人的能力强太多了。所以说对我来说,你要实际去数有多少行 code 是我自己手写,有多少行 code 是模型写的,我觉得保守估计模型写的超过 90%。不保守的可能就是 99 或者 100。
诶,剩下 10%是它不能写,还是为什么你没有让它写?
保守估计 90%,给我自己点面子,。我觉得它不能写,而我能写的部分已经越来越少、越来越少、越来越少了。
过去可能是什么样的?是它不能写的?
我觉得很早的时候,可能在一年半以前,那个时候市面上其实说白了就是。只有 Claude 一家能够真的写这种软件工程的 code。那个时候模型还是能体会到很多缺陷的,比如说它有时候可能写 code 就只关注这一个文件,它就不会很关注那种多个文件之间的关联。如果一个,比如说一个 class, 它的定义其实藏在很多层以后,或者说它其实没有直接被套在这个直接的树里面,可能这个模型找就找不着。现在我觉得这个事已经越来越少了。真的越来越少了。
作为一个 researcher, 你的写程序的工作量能够是过去的多少倍?
因为从写 code 的角度来说是比较难量化这个事,但是如果说从,比如说我做实验实现一些 idea 的效率的上来说,我觉得可能比起一年甚至一年半以前可能都是 20 甚至 50 倍的这种加速。对,因为现在模型真的变得。就是可以很离谱,就是你可以同时开好几个你好几个 idea, 然后同时的去试,甚至有些时候这个模型可以帮你监控一些实验,监控一些结果之类的,所以说还是真的是一个挺大的效率提升。对,但是如果从个人工作时间上来说,我觉得它好像让我工作时间变更长了。
这是为什么?
就是因为开发的速度变快了之后,就越试越想试,有越来越多的想法要去试,所以说感觉以前你可能存在说,诶?你有一个东西。比如这个文件以前没见过。你可能自己看,你也搞得不是很明白,那可能你要去花时间去找那个人。让你约约那个人,可能就几个小时之后,但现在就不是,你就看到这个文件,你不懂拿去问一下 Claude 或者 Gemini,可能 5 秒钟就告诉你,结果你就接着干了,,所以说从工作时间上来说,我觉得好像工作时间反而变长了,而且工作的密度也变高了。
好, Google 已经不是那个 Google 了,是吗?不是那个养老的,可以养老的 Google 不是那个 work life balance 的 Google。
我感觉在战 AI 这个领域没有谁可以养老,。
所以你现在早几晚几啊。
我一般可能早上 9 点钟开始,然后晚上。
到公司吗?9 点。
我就早上 9 点钟,我会起,可能先起来看一下邮件,然后看一看我前天晚上实验,然后到公司可能一般 10 点左右,然后晚上如果我一个人在美国的时候,我可能就会待到可能 10 点、11 点这样,然后当然我如果我家人在,我老婆在的话,我可能就会早一点回家,但是在家反正也是干,所以我觉得这个在 AI 这个领域没有谁是在躺着的,除非就是你已经完全对技术没有兴趣了,对自己没有追求了。那你躺着其实也没有人管你。但是我觉得大家还是比较。self 追问就是还是自己想干?对。
你觉得其他的领域会出现更多的这样的 Claude Code 的时刻吗?coding 之后会在哪里爆发?
你问了一个好问题,我要是看清楚了,我可能已经出去创业了。对,但是确实就是除了 coding 之外,我们已经能看到就是对很多别的方向已经产生大的影响,但只说那些方向可能并不是一个好的这种市场上的方向。比如说。好多现在的做基础科学的研究,比如做数学,做理论物理。好多人其实已经就大量的开始使用 AI 工具,因为过去你可能像我们做 AI 研究,其实很像,就是说你可能想到一个想法,你想跑一个数值学物理的人又不是很会写 code, 光学明白怎么打开这个编译器,把 code 跑起来可能半天已经过去了,现在就没有这个烦恼了。就是你现在想试 5 分钟之后 code 写完了,你就可以开始试了。
对,甚至像 Gemini DeepSeek 发布之后,有很多基础科学的研究人员就把这种,比如说数学推导、数学证明,甚至就是去看这些不同的这种文章归纳这些事全都交给模型了,所以说已经我觉得对除了 Coding 之外的方向产生了影响,当然就是那些基础研究,你可能很难就是变成一个万众瞩目的事情。除非你就真的发现了一个以前人都没发现的很妙的理论,是吧?比如 AI 产生了爱因斯坦理论这样类级别的东西,那可能会变成万众瞩目,但。那个时刻可能还没到来。但是影响是已经在产生了。
AI 好神奇啊,它为什么首先上来做的都是人类觉得最难的那部分工作?
我觉得这是一个特别好的问题,就是我觉得过去的在我人生的阶段里,大家往往会觉得最智力上有挑战的工作。对。反而是那些比较理性的事情,比较客观的事情。比如说数学,比如说写代码,比如说做 AI 研究。
还有科学研究。
对,就是越是这些事,其实 AI 越容易做好。因为你一旦想清楚这个事怎么去评价,你就知道怎么训练。
对,人为什么比较难呢?我觉得。你看人都是智力分配最高的那部分人,做这些工作。
对,但是可能未来就不是这样了。未来会怎么样?我觉得未来其实会发生了一个改变,就是那些 AI, 就是有很多 AI 其实没有那么容易做,但是反而是人可能做比较好的,比如说做产品经理,我说实话觉得产做好,做一个好的产品经理是一个,我现在想不明白。该怎么训练 AI 去做的事?
这是为什么?因为。标准。
没有标准,就是。刻度。什么叫做一个好的产品?我其实想不太明白,没有一个很客观的标准,你一定是做出来了之后给人用了你才知道它好,大家才会说它好。对。我觉得那个就是一个回馈信号很不明确的事,那个我就不知道该怎么去训练 AI 做。
对,程序员什么时候会被彻底取代吗?会有这一天吗?
我觉得这一天会来,但是它不会是一瞬间的来,就不会是程序员都还在过了一个晚上,第二天程序员全被开除了,不会是这样的,它一定会是一个渐变的过程,但是大家现在已经看到这个渐变的过程了,因为有一些公司已经开始裁员了。对,我觉得从某种意义上来说, AI 是一个,从某种意义上来说,它当然是一个很好的东西,但是从某种意义上来说,它可能也是一个很。很不幸的事就是 AI 是一个很 centralized technology, 它会让少部分人变得更强,但会让大部分人失去他们的独特价值。对,所以说我觉得对于城市传统的软件工程来说,一最后变成的结果可能就是现在 1/1000 的人干了过去所有人的工作,拿着现在 100 倍的工资。
那你对程序有什么建议?
我觉得可能。接收新事物我觉得很重要,我觉得未来程序员可能很重要的一件事是怎么和 AI 去有效地协作。做,比如说有很多事情是 AI 可能做的不是那么好的事,比如说怎么去合理的设计一个事情的实现方案,怎么样设计让它可能跟这个公司未来的发展比较契合,这些东西可能你很难去告诉一个模型,让它理解这些事可能还需要人去做,但是可能像具体的很具体的,像过去很多程序员做的工作就是。你的经理告诉你,实现这个方案下周五之前给我,你觉得这样的工作未来可能就不会再存在了。
那 1/1000 的程序员会是什么样的程序员?他们的特质是什么?
首先,1/1000 是个虚数,我真的不知道是会是 1/1000 还是 1/100000。
也可能是 1%,你不要那么悲观。
我是一个著名的悲观主义者,所以说也不要太那什么。对,然后我觉得未来好的程序员,首先他肯定是从技术上来说,他一定是会是非常强,因为如果你技术上弱,那没有什么道理, AI 不能取代你,但技术强可能不会是唯一,就不会是一个必要条件,它可能是个充分条件。另一个事情我觉得会很重要的,就是你得能够理解你的这部分工作在一个大的组织或者一个大的公司里该去怎么适配进去。这件事情可能也是一个重要。然后当然还有可能别的很多事情,比如说这个人的规划能力是不是足够强?他规划能力强的话,他肯定可以同时把这个大的一个很复杂的事情拆解成很多相对较小的事情,然后交给不同的 AI 去做。
但是现在看这三种能力是重要的,可能 AI 还不能完全做,不代表 6 个月之后不能,可能 6 个月之后你过来问我,我发现最后一个事 AI 已经能干了,那就只剩两个事,再过 6 个月可能剩下两个也能干了,那可能我就我的回答就会变得更悲观。所以说没有人能预计 6 个月之后发生什么,我只能说从现在的观点来说。
刚过去的那个春节,很多人关注另外一件事情是 seedanceseedance 会让 Google 焦虑吗?
我觉得其实。有可能有,但是这个焦虑的情绪目前还没有传导到我这可能让 Google 的负责多模态生成的团队会有一些压力,但是我如果你要问我的话,我觉得我可能不觉得他们有什么可焦虑的,我觉得并没有体现出什么范式上的改变,更多的是我觉得字节在,不管是这个产品的效果,还是可能在数据上之类的这些细节会做的非常非常好。我觉得确实是。字节过去在多模态生成,一直以来都有比较强的优势,但是我觉得至少我个人没有体会到它是一个一个范式上的变化。那可能就不足以说让大家非常的焦虑,对,但是肯定是有压力,对。
seeddance, 它的产品能力来自于模型能力还是产品能力啊。
我没在字节干过,所以我也不知道具体的细节,但是你要让我猜,我觉得可能模型还是占大头的。
模型能力的好来自于什么?来自于数,因为算法可能没有本质创新。
我觉得算法首先就是因为刚才多模态属于,咱们说的就是还属于。
科学问题透多模态的生成属于科学问题。
对,多模态生成还属于一个比较科学的问题,所以说。
多模态理解决了吗?
比生成肯定是要更系统,有更系统的理解了。但是比起 text TOKEN 来说,肯定还是没有那么的那范式,还没有那么固定。对,我觉得生成上可能就是因为它是一个还没有范式上还没有固定的事,可能每家用的技术都会有一些。大的或者小的区别,现在更多的只是能看到说效果上来说,可能字节和 Google 必卖的属于在效果上来说做得比较好两家。
对,所以他可能也是来自于细节做得更好。
对,你如果要让我猜,我会猜数据。数据啊。你要让我猜,我会猜数据,但是就我,我也没在字节干过,所以也是我硬猜的。
你怎么看从 Google 去字节的吴永辉啊。
我何德何能?,评价永辉,我觉得,我觉得我当然过去没有和吴永辉一起工作过,所以我其实真的不是很能。给什么很好的评价?很客观的评价,但是我觉得我去了 Gemini 之后看到的更多的是永辉好的一面,我觉得他是我通过去看他,偷偷去看他以前教过的代码,以及他带过的项目,我的感觉是他是我见到的少数层级非常高,人也很 senior, 但是还。有很强的技术能力,我觉得是非常非常少见,所以我觉得我可能是还没到能够评价永辉的这个水平,但是要让我问我说的话,我觉得永辉是非常非常强的。对。
你说站在 2026 年的 Q1 的拍一张快照,你觉得中美的模型能力差距是在放大还是缩小?差多远?
我觉得如果现在放一张快照去看过去一年的发展趋势,或者过去一年半的发展趋势,显然这个。中美之间的 gap 是越变越小了,但是最后这个 gap 会不会完全弥合,甚至中国超过去?我觉得是一个不清楚的问题。我觉得对中国的 AI 的研究人员来说,研究机构来说也是一个机会。我觉得一个很真实的事,就是中国确实在实际的算力资源上来说是占很大劣势的。这个很大的劣势,可能反而逼出了一些有趣的事。比如说中国的模型公司其实对 distillation 就蒸馏,别人很在行。对。
最近 Dario 不是点名了 3 家公司蒸馏他?
对,我觉得其实可能是一个蒸馏,这个事存在是一个一个心照不宣的事实。但是我觉得蒸馏它也有不同的方式,也有硬蒸和聪明的蒸两种不一样的选择。
硬蒸。叫硬蒸。
硬蒸就是举个最点简单的例子,就是我从 Claude 里面。取出一堆它生成的 TOKEN, 然后强行在上面做训练。这个如果干这样的事,我就觉得首先商业上也不是很道德,然后智力上来说也比较愚蠢,因为干这个事的公司其实本质上来说它体现出来的一件事就是它其实都不知道自己想干嘛,它能干的唯一一件事就是抄别人,然后让自己的模型数据上能看的好看一点。对,但本质上就说明他自己都不知道该干嘛,这是硬蒸。
但是。其实蒸馏也有一些很有趣的科学问题,比如说我是不是有一种可能,就随便举个例子,有没有可能是我生成,我自己生成数据的这个链条当中用到了别的模型作为辅助,或者说我自己模型生成的答案用别的模型作为它的评价者,这个其实是一个我觉得商业上来说比较灰色的地带,但是从技术上来说其实很有意思,因为你想其实。
从某种意义上来说,可能中国的实验室成为了做 Multi agent 训练的先驱。而且是真正的 Multi agent, 因为它如果从不同家的模型里用这种比较聪明的方案把它们融会到一个训练系统里的话,每家模型它可能是分布很不一样的,它的语言的分布是很不一样的,这个是真正的 Multi agent, 它可能比起比如说我用了好几个 Gemini 一块做,是一个技术上更有趣的事。所以说我觉得对我来说聪明的争,我不知道这个商业上最后会不会变成一个很明确错或者很明确对的事,但是技术上其实很有意思。
你这两种争分别说的是谁?
能不能后期把名字逼掉?可以。我首先没有在中国的 live 干过,所以我不知道确切的事实,但是我的感觉就是我们应该是硬争了,然后可能曾经硬争过,但是后来可能慢慢也在努力向软争的方向转化。我觉得比较明显,可能蒸馏的比较少的是字节,我觉得字节是,我感觉到这个模型还是比较有特点。
特点体现在哪里啊?
比如说这个模型,你说它有多聪明呢?我觉得豆包是肯定没有 Gemini 和 Claude 聪明的,但是豆包首先,比如说豆包的语音生成非常强。
诶,这个很难吗?在技术上确实豆包是做的最好的,因为我发现我生活上的问题,我只想问豆包,因为它很快,但是其他模型为什么不优化这个产品功能呢?
我觉得还是跟它的用户群体有关系。在美国,我觉得大家的想法更专注于怎么能够提高工作效率。
你生活没有一些困惑吗?
我生活中有,首先我个人确实是一个生活上比较无聊的人,所以我生活中没有很多有趣的困惑可以去问豆包,我生活中更多的困惑都是技术上的困惑,问 Gemini 这种聪明的模型就是最好的。对我没有什么什么半夜去打豆包,情感电台的需求。
不只是情感,就是很多,比如说你做饭。你可能会遇到一个什么问题?你可能及时需要有人告诉你,但是你又没有不知道,没有这样的人。
那些我觉得可能更多是数据上的问题,然后可能更多的只是说美国的公司现在主要的优先级是在智能或者工作效率上。未来有天会不会变成这些日常的事情?我觉得是有可能的,事实情况是你如果去问这种日常话题,其实你能发现 Gemini 没带。一代到另外一代会做的也越来越好。所以说我身边很多朋友,包括我自己以前,是,也是,就是我以前在英特尔的时候可能写 code 会去问 Claude,但我可能日常查个什么东西,我就会去问 Gemini, 对。
你用过豆包没有?
我其实只用过一两次。
我发现你们都不怎么用,是不是有鄙视链?有智力的鄙视链。
没有,不至于,就是我觉得首先就是就跟在中国的人试图用。美国的模型会有一些复杂的事。一样,我在美国用中国的模型其实也是挺复杂的,第二就是确实也没这个动机,尤其我觉得我可能生活中工作是工作,休闲的时候就是找不一样的工作,所以对我来说我的最好伙伴就是 Claude 和 Gemini, 但是可能对别人来说并不是这样,所以可能也只是我个人的问题。我自己用豆包的那一两次是因为有人给我展示豆包手机。
对。诶,你怎么看豆包手机?
我觉得是一个很好的想法,我个人觉得效果上来说其实做的也不错,当然我不知道的是技术上来说它的优化做的有多好,它我觉得它实现一些任务的实施从效果上来说是没什么问题,但我不知道它会有多大的消耗,如果这个消耗非常非常大,那可能是一个技术上需要解决的问题。因为你并不希望什么让你的模型去给你订了一张高铁票,结果花的钱比高铁票还贵。这个肯定是一个不可以接受的事。对,所以说可以,可能技术上来说,我个人不清楚它有多成熟,我觉得产品上来说对大家来说还是一个挺,不能说惊讶,但是让大家觉得挺兴奋的事。我觉得可能苹果以前也想干这样的事,只是苹果可能自家的模型一直不太行。
苹果好像不是很在意它的 AI 战略。
现在我觉得苹果一定是在意 AI 战略的,因为曾经 Siri 手机助手。是苹果发布会里一个非常重要的闪光点。但是自己的模型没赶上趟,现在可能要通过和咱们来合作来试图做这样的事。至于现在他是不是重视,首先我也不知道,你要让我猜,我肯定觉得是重视,但你要让我解释他为什么从外界来看没那么重视,我的唯一猜测就是如果你外界来看就显得很重视,还做不成,那就显得很蠢。婉尊。对。我不在意。
我们说一下豆包的模型,你刚才说豆包模型比较有特色,你们具体一点,一个是它语音做得很好,这是第一点。
我觉得语音做得很好,是我能感觉到最有特色的事,就是我觉得语音这个效果可能是客气的说,可能是全世界最好的之一,不客气的说,我觉得就是全世界最好的。
这很难吗?
我自己没做到那个地步过,所以我也不知道是不是难,但是我觉得可能是一个很费功夫的事,不管从数据上还是各种优化上来说。
它是个产品的事还是个模型的事?
它一定会是模型的事。它有可能也包含一些产品的部分,但一定是一个模型的事。对,我觉得这是一方面,另一方面我自己感受就不多了,因为我其实用的机会没那么多,那可能就是更多的是来自于就是亲朋好友的反馈,就说,这个豆包这个模型就是 fun to talk, 就是聊起来很有趣,,对,但我觉得那个更多的是一些主观的反馈了。
我觉得它的一个是语音,一个是它生成的很快,也是一个很重要的。因为我很多模型它都在给你展示思维链,但是我就说那个生活上的琐事,我不想看它的思维链。
对,这个事我觉得技术上并不难,只是可能大家目前还没有花更多时间在这个上面。事实情况是如果你去尝试 Gemini 3.1 和 Gemini 3 的话,你会发现 Gemini 3.1 在完成同样一个问题的时候已经会比以前快很多,废话少很多了。所以说我觉得这个不是一个在我看来不是一个技术上的难点。它更多只是什么时候去重视,去做这个事?我觉得可能就是现在美国的这几家还都处于在努力把智能的上限往前不断推进。
而字节呢。
当然他也肯定是在推进上线的,但是我觉得他可能就是在用户的优化上也做的很不错。
最近还有一个话题,就是中国的机器人很火,在春晚上,我不知道你对这个有没有什么观察?
看过一些表演。也在亚马逊上搜过一些,价格确实很惊讶,它居然这么便宜。
买了吗?
没买,我买了也没什么用,但是确实我以前会,我不知道,我以前脑海里觉得这种人形机器人,然后。当然就是软件层面其实没什么,但主要是硬件,我觉得硬件上能做的这么成熟。那可能怎么也得是个什么大几百万美金啊这样的,但是好像我去看了一下,价格比这要便宜很多。我觉得这还是体现出中国在硬件这个产业链上还是很有优势的,但是我并不知道它作为一个机器人硬件来说,我觉得确实是非常强,然后从软件上来说没太看明白,我觉得机器人的模型也是一个目前非共识比较大的事情。对,怎么说?就是说它。我觉得机器人的模型可能更多的处于。feature engineering 的时代,你让你有一个给定的环境,给定的场景,你去优化这个场景,大家是知道怎么做的。但是。
做 RL 做强化学习。
做强化学习,构建合适的虚拟环境,还是虚拟的这种数据,然后你去做训练是可以提高的,但是它没有很强的泛化性。我觉得这个是有没有泛化性?其实是很多 AI 方向它的一个分水岭。一个确定的场景,一个很单一的场景,能不能做好这个事不是最近这几年才解决的。十几年前就能干,对吧?就是像语言也是语言,在这个基于 Transformer 这种类似架构之前的时代里,并不是说完全做不了,对吧?那时候你也可以训一个很强的模型去做翻译。你也可以训练一个很强的模型去做语义分析,但是你不能做的事是我可以水平的提高所有的能力。
这个我觉得是一个分水岭,然后我觉得 Language model 在 Transformer 和。GPT 之后跨过了那样一个阶段,跨过了一个就是可以水平的提高所有能力。你可能在一个点上的训练,它会把这样能力抽象的泛化到所有相关的事情上,但是机器人我觉得没到那个阶段。更多的还是在那个阶段之前,我有一个单一的场景,单一的事情我能够为这个事情去做优化。
所以你怎么看硅谷的这些机器人团队,还包括 Gemini 内部也有很多机器人的人。你会怎么看?那个方向有点,这算什么?这是你们的子方向还是你们的平行方向?还是什么?
一,我觉得过去是一个挺平行的方向,但是现在机器人我觉得大家也在尝试,就是能不能利用语言模型作为一个基底模型?对,然后在那个上面去训练这种类似,比如说像 VLA 这种类似。
特别是多模态的模型。
对,所以现在来说就是和变成了和语言模型这条线比较相关的一条线。我觉得我个人的感觉是他们未来会变得很重要。但是目前还没有找到自己的路。但是他们做的事真的很有意思,我非常推荐大家去看看机器人的实验室比做语言模型的实验室要有趣的多。做语言模型的实验室感觉就是正常的办公室,但机器人他们是真的,就是会有人去操控这个机器人采集各种数据,然后去看这个机器人在什么,在货架里去取不一样的货品之类,干这种事情觉得是很有意思的一件事。
你去的是哪家?
我去,我在 Gemini 自己的实验室。不是 Gemini, 就是那个 Google DeepMind 自己的实验室去看过,然后。还有那个 Physical Intelligence。我也去看过。
他们是个叠衣服的机器人。
对,他们就是可能场景更单一了一点,就是我叠衣服是一个机器人,可能做一些别的事,就比如说倒个水啊之类的,这样,对。
你直观感觉机器人进展相当于大语言模型的哪一年还没有到 GPT 1 的时刻,对不对?
一定没到,我觉得一定是没到的,对。就是相当于大家还没有想明白怎么去 scale up, 我觉得对我来说,不管机器人还是多模态生成都。没到这个点。
那接下来进入今天的主题,我们还是对你非常的感兴趣,聊一聊你是怎么从一个学物理的人进入 AI 的世界的。你从小在哪长大?你是怎么长大的?
我出生在宁夏,一个很小很小的城市,叫是叫那个大武口,看,就是你这困惑的表情已经说明了这个城市有多小。这个城市过去的存在是因为一个煤矿。对,因为石炭井,一个煤矿,然后有了这样一个城市。对,所以我在那出生,但是我。小学的时候跟我父母一块去了上海,所以我小学的后半段和初中、高中是在上海,我上本科就去了北京,就是刚才所说的那些上本科在北京,博士在美国,对。
你从小就成绩很好,是吗?你是物理竞赛保送,在清华和斯坦福读的是理论物理。
对,我不是物理竞赛保送的。,我觉得我小时候挺菜的,。首先我读的。初中和小学都是无名之辈。我觉得我当时读的初中好像就是竞赛,不是一个你该考虑的事,就处于这样一种这么一个初中里,那个叫尚南中学东校,又是一个,大家听了很困惑,一脸一头雾水的学校。
好,既然都说到这,那小学是哪个小学啊?
小学叫啥来着?我的 context management 能力太强了,我已经不记得叫什么了其实。可以。就是那个初中一个班里面一个小的环境,还是有一些想要好好。干事的同学的,但是总体来说,那个初中我觉得是比较躺平的状态。对,然后我觉得就是可能学习还可以。还可以,是。还可以,就是当时的状态,就是上海高中有所谓的,那时候有所谓的四校,就是什么上海中学,然后华二、交大和复旦的附属中学。对,然后我的当时的状态就是能上这四个学校,但上不了四个学校里最好的班,但是我当时特别想搞竞赛,因为以前都没搞过竞赛。
你初中开始搞竞赛。
我初中没搞。我初中没搞过竞赛。
你没搞过竞赛,为什么想搞竞赛?
因为没搞过,所以想搞。
怎么植入的这概念?
我这个人的个性就是总是爱干一些自己不太会的事。对,然后当时没搞过竞赛,但是知道有这么回事,所以觉得义务教育不是义务教育,就是上大学之前得干一把,所以,但是那个成绩也没好到那个份上,所以去四校就是最好,那四个学校是进不了搞竞赛那个班的,但是我当时就发现有一个稍微差点的学校。那个学校就是格致中学。稍微差一点的学校,但是那个学校有一个竞赛班,我感觉这个竞赛班按照现在的话说就是 Underdog。就是用当时的话说,我感觉就是光脚的,不怕穿鞋的。我觉得可以一搞。所以就其实当时那时候,就是那时候上海还有这个所谓的推优生的制度,就是你可以在考中考之前就去和某一学校签约。然后你就提前向预定那个学校的名额,然后就直接去他们那就很自然去了,去搞了竞赛高中,对。
所以你其实是在上海四校的普通班里面,和格致中学的竞赛班里面,义无反顾的选了格致中学的竞赛班。
当然我也不能,我不能说我做选择的时候上最好的 4 个高中是那么板上钉钉的事,虽然后来的分确实够了。那时候还没有中考。那时候还没中考。对,但是当时就觉得就算能上,我也应该去一个 underdog 地方赌一把。
为什么?
因为想干这个事啊。
你想干竞赛的目的是什么?
我觉得当时最主要的事是想体验,我觉得没干过,一定要找机会干一下。
为什么一定要干一下这个?
第一就是觉得它确实难吧。就是确实比。
有一种对难的兴奋感。
对。就是确实,至少当时没搞的时候,大家给我的印象就是感觉这个事比你不搞竞赛学的那些东西要有挑战性的多了。感觉干这个事的人确实强。薄干,你也就只是平庸石头里最光滑的那一个啊。所以我当时觉得要干,所以就去干了,当然干了之后也实际上带来一些好处。就是我后来回想起来,如果当时没去搞竞赛,可能就进不了清华了。
你是有加分还是什么?
当时其实竞赛的保送生制度已经比较锐减了,就只有进国家集训队才能保送我那高中,反正我觉得我当时没进的国家集训队这个水平的,所以就别说了。但是就是我在考高三竞赛之前,阴差阳错的去清华参加了一个夏令营,阴差阳错的在夏令营的最后一天听说了他们在。搞自主招生。但是主要是面向北京的学生,我就疯狂给招生办的老师发短信说我要跟他们一块考。
他答应了。
然后他就答应了我们去考。
你们还是你。
就是就答应了我和我们这高中一块去的那几个人去考,就上海这去那个夏令营的那几个高中同学去考。
哦,你有什么理由说服他?你给他发短信。
我已经忘了这个短信具体怎么说了,但是这个短信大概说的意思就是你,你给北京的同学考,为什么不给上海的考?大家理直气壮。
你当时觉得他。他们开后门是吗?
我也不是觉得他们开后门,就是觉得人家有这个机会,凭什么不给我们?大家都在一条线上竞争嘛。
就是你们当时是同学。
然后所以就发了这个信息,还人家就真让我们去考了。
几个人?
我记不太清了,可能有上海去那个考场里可能有七八个人的样子。
是你发的那个短信。
可能别的高中也有别的学同学发,但我们高中是我发的。
就是,都是上海高中去北京。
参加那个夏令营的同。
参加夏令营的同学。
对,然后就让我们去考,然后。就签了。
这么好说话。
对,所以我从那件事得到的人生最重要的道理就是胆子要大。你不争取是永远得不到的。争取了也有可能得不到,但不争取就绝对得不到。
你当时发那个短信的时候忐忑吗?你当时还高中诶?
我已经不记得了。
当时觉得自己这是个很大胆的事吗?
我当时满脑子想的都是现在就得争取,再不争取明天就争取不到了。
就当天就发了。
就是我在听说的那天,就赶紧去疯狂发短信。
疯狂发,给谁发?
发给招生办的,那清华招生办的老师。
就发给了一个人还是多个人?
不记得了,应该是一个老师。对。
他很快回了吗?
我觉得清华。就说 yes 了。我不知道他们自己有没有讨论了,但是反正最后是说了是统一。
那就一起考试了。
对,所以我为什么我感觉我一直对清华还是挺有感情的,就我感觉这个学校是愿意给大家提供机会。给大家提供平等的机会。
对。那个考试考怎么样?
我当时出来的时候觉得考挺崩的,因为有半道题没做出来,但是我后来发现别人没做出来更多,就果然就招了,,对。
你们那一波上海同学进了几个?
好像两个。
自主招生是减分还是什么?
是降到 1 本线。
降到一本线。对。然后来,你高考得好吗?
后来高考果然没考到清华的分,但是就是除了清北之外的学校都能上。
对。所以为什么网上都写你是保送的?
我觉得就是大家不在,没在那几年上过学的人很难理解清楚那几年到底发生了什么,因为在我的两届之前还是拿了省一等奖就能保送的。
拿了省一等奖就能保送。
就能保送的。
你们那时候呢。
我们那时候就是拿了省一等奖,进了省队,然后再代表省队去考国家的比赛,然后进了国家集训队才能保送。我是进了省队,去考了国家比赛,但我没考进国家集训队。对,所以说我那届我是没有保送生名额的。
哦,你搞竞赛搞得好吗?
我觉得挺菜的,就是难道不是没有干到最好就是很菜吗?然后我显然没有干到最好,所以就是很菜。
你家里人对你搞竞赛这个事情是什么态度啊?
我觉得我爸妈最好的一点就是他们不太管我,他们可能曾经也试图管过我,后来发现管不住。
怎么管不住?
就是我也不听他们的。我觉得可能大多数中国家庭都是孩子,和父母商量已经算是很好的了,我一般都是通知。
你通知了啥通知哦?我去自主招生了。
然后包括中高考填志愿也是,我爸妈甚至可能都没见过我志愿单。
他们比较佛,是吗?
他们我觉得就是。当你没有办法理解别人在干什么的时候,别指手画脚就是最好的。我觉得我爸妈这个道理懂得很好,。
那你是比较叛逆,是吗?
我觉得我是比较,我因为我觉得我的个性是我很 care 我想做的事,如果这件事是我自己想明白了要去做,你就是别拦我。然后我也一定会尽最大努力做到最好,但如果这个事我不想我干也没用,我也不会干。对。
你的胜负欲强吗?
挺强的。对,但我觉得我更多的是在跟自己较劲,不是不太愿意和别人较劲。对,当然就是如果, happen 就是如果,正好是,我觉得这事很重要,你也觉得这事很重要,那我肯定是要干的比你好。
好,那你到了清华就更神了,去学了量子物理。为啥呀?
对,我当时做那个凝聚态理论。
为什么选这个专业啊?
阴差阳错。现在回头,回过头来说,当然能。能编造出一些听起来很合理的理由,但是摸着良心回到当初,我觉得就是阴差阳错。当时我们在基科班有一个非常好的传统,首先基科班它虽然在物理系,但它不限制学生干什么,所以基科班实际上 2/3 的学生都不会做物理。对于那。
你为什么会进这个班?
当时清华的物理系全都是基科班,现在可能不是了,但是当时是它另外一个好的传统,是它鼓励学生在。在实践中学习。所以他鼓励学生尽早的去进到科研的实验室里去,然后去和在科研中学习。然后我当时想很想做理论,然后。
是觉得这个难吗?感觉就是你对难有一种着迷。
可能也是一种病,之后可以再讲讲这个病带来的不良后果是什么。好。对,然后那个,对,然后我就想搞理论达人集客班。或者我们叫学堂班,有一个更小一点班,那个老师就推荐说,诶,高等研究院是个很好的地方。清华高等研究院就是杨振宁先生创立的那个研究院,是个很好的地方,我就去那找老师,正好有一个很那时候还很年轻的老师叫王忠,是我本科的老师。那时候他也没几个学生,我俩就聊,我当然啥也不懂,但他还挺耐心,还给我了,给了我一些这个 paper, 让我去读读,我就跟他讨论,后来又发现。
运态理论,尤其当时做的方案就是跟拓扑绝缘体这些比较相关的方向,其实是一个。很适合本科生上手的方向,它需要的背景知识不太多。它只需要你可能懂,最基本的,你得会量子力学、会统计力学、会固体物理,非常容易学的基础设基础知识,但是它可能很考验你对这些知识理解的深度,所以对于本科生来说其实是一个特别好的方向,你能够很快的上手去做一些实际的项目,我们就一块做了一些工作,其中有可能在开放量子体系里面的工作。现在看来还是一个挺重要的工作。
对,然后从某种意义上来说,我觉得现在回头来看,做工作、做那段时间的科研其实和现在做 AI 特别像,就是它更多的是你有一个想法,你有一个理解,你可以在那个阶段,就是你可以做一个数值的实验,去验证你这个想法和理解是不是对的。你发现 AI 其实也这样, AI 也是你有一个想法,你有一个理解,你去设计一些实验理,验证你的理解是不是对的。然后你设计一些模型上的训练的这个 pipeline, 来把你的。你的想法实施出来。对,所以说其实这两个事很像。对。
你能不能讲你这个非厄米系统的研究?
可以讲,我尽量说人话。但是也有可能实际上说的鬼话,所以要是不想听的人可以跳过。
划一下进度条。
划一下进度,到时候可以在进度条上设置两个戳,对非厄米系统是这样,量子力学一个最基本的假设是一个孤立系统,它的演化被幺正演化所描述。幺正演化话是个鬼话。对不起,幺正演化话的意思就是它是一个。一个线性的过程,这个线它可以被一个算子叫做哈密顿量来描述。哈密顿量从某种意义上来说,它有点像这个体系的能量,但不完全是,就是有点类似于,所以它决定了这个体系随着时间的演化,如果是一个孤立系统的话,这个哈密顿量会是一个厄米的矩阵,厄米的矩阵就是你转置一下,做一下共厄,它和原来是一样,但是真实的系统绝大多数都不是孤立系统。
比如说你,我作为人肯定要和外界有信息交互,有物质的交互。材料也是一样,就是你一块材。材料放在那,除非你抽特别真空的,你总得和衬底有交互,你得和外界环境有交换。所以真实体系绝大多数时候都不是孤立系统,它就不会被一个幺正的过程去描述,它所对应的哈密顿量,也不会是一个厄米的哈密顿量就是这个非厄米这个词的来源,它本质上是为了研究开放量子系统,就和外界有交换的量子系统,它的行为。当时发现一个很困惑的事是我们一开始是试图研究这个开放量子系统里的一些拓扑现象。然后就发现手算出来的理论的结果和数值死活也对不上。然后更确切的说就是手算这个结果是假设了这个体系是一个周期的边界条件,比如它在一个环上,或者在一个轮胎的表面上,然后数值的话就会是因为就和实际的情况比较类似,它就会算一个开放边界的,比如说一个方块这个材料上的行为,就发现这两个结果死活也对不上,然后就试图理解这个事,后来就发现大家过去用来描述厄米系统的一个。
一个基本的范式就是所谓的布洛赫波,就假设物体的本征态都是一些波的线性组合。算一些正弦预先波,这种波的线性组合假设其实在费米系统里里面会 break down, 就是会变成错的事实情况就是后来我们就发现在费米系统里,其实它的这些能量的本征态都会有可能会聚集到这个体系的一边去。对,我们就系统的建立了这套描述的方法。
建了一套体系去描述一个开放边界的非厄米系统,它的本征态该怎么去描述,进而描述它的一些随时间演化和一些动力学,所以这个是当时这份这个工作后来就有很多,因为它其实是一个范式上的更新,所以后来就有很多很多 follow up 的工作,但是后来其实我换方向了,所以就没有太在这个方向继续做了。
你为什么不也让他做?很难抓住一次范式的变化,是不是?
很难抓住一次范式的变化。是的是的,这就是人性的弱点。就是我感觉我总爱。挑战一些自己不会的事,,尤其当时就我不知道,我当时的感觉是在那个方向,可能那个工作从再过几年回头来看,就会是这个方向最重要的工作。后面你再去做一些工作,可能确实会让你更有名,获得更多的引用,写更多好的期刊的文章,找到一个好的教职,但是感觉作为一个科学生涯来说就没那么令人激动了,所以我当时就想换个东西做,换一个自己不太会的东西做。对,然后所以就读博士的时候就换了一个方向去做高能理论。高能理论。对,高能理论,物理,对。
所以你本科和博士也是不一样的。
也是不一样的。
还不是从物理跳到了 AI, 其实你本科和博士看起来都是物理,其实也方向也已经发生了很大的变化。
对,是两个几乎没有任何联系的方向。
哦,你这个很神奇,还包括你选竞赛去那个格致中学也很神奇。
对。
这是你的什么人性?
我觉得就是说难听了,就是爱折磨自己,。说好听的是挑战自己。
被折磨开心吗?
我觉得如果为了被折磨而被折磨,那这个人就是有心理疾病。但是如果一个人是为了学习更多的东西,丰富自己的经历和能力而被折磨,我觉得是值得的。
你本科那个老师?王忠老师也是个 Underdog, 是吧?算吗?
不算,人家做的挺好的,怎么可以这样说他?
在那个时候,你刚才说他是很年轻吗?
没没没,他,他很年轻,但是他。我对他的印象一直都是,他是一个很 sharp 的人,能看问题,试图理解问题理解很清楚的人,确实可能不像很多老师那样很有名气,在社会上或者很光彩夺目。至少那时候不是,现在已经很有名气了,那时候还没有那么有名气。但是我觉得从能力上来说,我觉得他是很强的。对,其实他一开始是他读博时候是和那个守成老师、张守成老师学习,所以说。能被首成老师挑中的人,基本都不会太差。
他对于你博士换方向说过什么吗?
没说过什么,我觉得他是一个不爱干涉别人的人。,我不知道他内心是怎么想的,但是我觉得他是一个不爱干涉别人的人。
量子物理整个是一个什么样的世界观?他跟。
我觉得最大的区别就是我觉得。有很多和经典物理有很多不一样的地方,但是我觉得。
它们两个是一个对应的概念,是吧?经典物理和量子物理。
它俩是一个在不同能量和时间或者空间尺度下的理论。就是说本质上我们这个世界都是量子的,当然就我们现在也不知道比更小的尺度上会是什么,对吧?就更小尺度上有很多不一样的想法,比如说弦论是一个想法,然后可能其他想法就是圈量子引力也是个想法之类的。但那些都没有办法验证被验证的小尺度上的有效理论。就是量子物理。
最小的尺寸。
对,就是被实验上能够验证的。最小尺寸的有效理论就是量子,当然这里面包括了量子力学和量子场论。然后经典物理是当你看所看的空间尺度和比较大的时候,这个量子物理会慢慢慢慢退化成经典物理。所以说它更多的是在不同尺度下的,有不同的有效理论。对,这个事其实在物理上是一个很深刻的想法,就是所谓的重正化群。重正化群说的事就是说在一个描述一个体系的理论,在不同的能量尺度下可能看起来是完全不一样。对,然后哪怕他们可能从根源上来说都是一个大一统理论,当然在现在没有什么什么真正的大一统理论了。不是,如果存在的话,他们哪怕在根源上是同一个根,但是他们在不同尺度上可能看起来也是完全不一样。然后所以经典物理和量子物理更多是两个不同尺度下的描述。对。
讲到量子物理,有几个词好像是相关的?比如说蝴蝶效应。比如说量子纠缠。能不能讲这些?对。我觉得这个可能是大家能听得懂的,我也不懂物理,大家不要骂我。我也不懂量子物理,嗯。
对,我觉得量子纠缠确实是一个大家比较耳熟能详的量子物理比较独特的事情。量子纠缠就是很简单的,就是说我有两个粒子,比如它属于一个纠缠态,我可能它们实际上相隔很远,但实际上我可能对其中一个做一些测量或者微扰,它也会影响到另外一个的状态。
这个是真实存在的。
对,真实存在的,对。
什么样的会有量子纠缠?什么样两个物体?
有很多,就是有很多实际的情况,实际上当你足够看得足够细、足够微观的时候。绝大多数的粒子可能都处于纠缠态,但是实际上来说,你可以比如说制造一个自旋和另外一个自旋,你先把它俩靠在一块,然后把它俩探测到一个纠缠态上,然后你可以把其中一个拉得很远,它俩就成了一个,就是一个距离很远的纠缠态。然后甚至好像我记得几年以前还有人专门去做,就是把一个细菌和一个什么什么东西出,然后制备在一个量子纠缠态里。
什么叫制备?在一个量子纠缠态里,这个是可以人为操作的。
这是一个可以人为操作的,是吧?
为什么?怎么操作?
一般来说就是通过一些测量和演化算符的作用,能够把它制备到这个状态上,但是这里面难的其实是实验上怎么实现这个过程?就是你可以想象,就是说你做一些量子测量和一些所谓的量子门的操作其实是比较难的,因为你和因为就又回到刚才这种,就是每一个体系它其实都不是孤立的,你可能这两个自选,你觉得诶?我这么制备一下它不就拉到纠缠态了吗?那我再把它拉开不就完了?但是实际的问题是,这两个粒子其实活在我们这个世界里,会不断有别的粒子撞它一下。或者外面的热量来扰动它一下。他一下这个状态就没了。最难的是怎么具体实验上去实施这个过程?对,然后纠缠的另外一个例子可能更耳熟能详。我其实应该提那个例子,就是薛定谔猫。
薛定谔的猫啊。
对,那就是一个更耳熟能详的例子,就说它的状态其实是叠加了某一个放射源发出粒子和猫,这是一个状态,另外状态是放射源没有发出粒子,猫活着。这两个东西的叠加状态,其实比如说你去测量一下那个放射源发射,发现放射源放出粒子了,你就知道猫。不管是茂海,这方向远离多远。对。所以那是,这是纠缠,但是。
蝴蝶效应是一个另外的事,蝴蝶效应这个事,蝴蝶效应就是耳熟能详的部分,其实反而是经典物理,就是大家经典物理听到的蝴蝶效应就是那个著名例子,就什么可能南美洲一个蝴蝶扑棱一下翅膀,半个月之后什么北美洲刮了个台风,但是它从更数学的表述来说,它就是说在时间起始的时候,你如果做一个很小的扰动。然后你去测量这个扰动产生的影响在未来有多大。你会发现这个扰动的变化是指数级变大的。
对,这是他数学上对经典蝴蝶效应的一个描述,但是之前大家比较费解的一件事,就是这个事情在量子体系里怎么可能存在?因为量子体系刚刚说了就孤立量子体系是一个幺正演化,它是一个很线性的过程,所以说从某种意义上来说,就是你如果一个状态就是一个矢量和另外一个矢量开始的时候夹角不太大,那经过一些演化之后,这个夹角应该不会变。所以怎么会存在这种初始状态?变得离得很差别很小,在未来哗变得就是指数级变大了。
好像在量子力学上看是诶,不太可能实现的事,但刚刚又说其实我们的世界是在微观,是量子,然后在宏观就变成经典了。那它俩是一脉相承的。怎么可能这有那没有,这是大家是都理解的事。那当然这个后来大家就有一些更好的理解,就是说其实你讨论这个量子里面的宏观效应时候,不应该讨论两个态之间的这个变化,而是应该讨论一些所谓的 local observable, 就是局域的观测量的变化。那个其实是对应了经典物理里的,你的看到的那些变化。
那你读了 4 年的量子物理以后,你当时在想什么?你觉得物理对你的帮助是什么?在你大四要毕业的时候。
我觉得本科期间读物理最大的帮助就是第一想问题要想清楚,就是读书不在于读的多,而在于读的深。你读的多不代表你能够发现新的东西,但如果你对一件事有和别人不一样的见解,那个才是对这个社会来说更有价值的事。这一件事,另外一件事就是别太相信理论,别太相信纯理论,因为。
得出了这个结论。
因为当时那个事发现的主要原因还是因为能做数值,就一开始是因为数值和理论对不上,才仔细的研究那个问题,然后发现了这个事。对。
那你博士为什么去读了高能物理?也是一个理论啊。
这也就回到了刚才这个话题,就是总爱挑战很难的事,有时候也是会带来一些不好的结果的。
什么不好的结果?
比如我就感觉,我觉得我这个博士就是对我自己来说学到很多东西,成长很大,但是于这个世界来说没有产生什么贡献。,就高能理论这个方向就是足够难,非常非常难。但它不好的事情在于它其实不是特别可以验证。没有什么客观的评价标准,因为高能理论已经发展到了实验完全追不上的这个阶段了。实验完全追不上你在理论讨论的那些,不管是能量尺度还是。还是这种微观的尺度。对,所以说。
它是怎么进步的呀?它的进步依赖于什么呀?如果不是实验。
小一个,一个一个进步的来源是来自于数学上的自洽性。就比如说你提出一个框架来描述这些事情,那你能不能和现有的已经被验证的更低能标下的理论相自洽?就比如说你研究弦论,那可能自然大家问题就是弦论能不能在低能情况下回到量子场论。既要回到经典的物理,那这个自下线是一个判定方法,我觉得这个是很合理的,就是很科学的一件事。当然也有一些不科学的因素,就是当这个领域完全没有实验,没有客观标准的时候,肯定不会只有一个框架出现,肯定不会只有一个自下的框架出现。这个时候谁做的好,谁做的不好,其实就依赖于领域内一些老登的主观判断。
你是被谁伤害了是吗?
我,我也没有被谁伤害,只是我在。那个领域待时间越长就越觉得这件事蠢。就是人这一辈子也没多长,为什么要把自己的时间浪费在伺候老邓身上?对,所以感觉是花了 5 年学了很多知识,买了一个大教训。
这个教训是。
这个大教训就是。
要做实验。
要,就是要有做有比较客观评价标准的事。或者从另一个角度来说,就是要做对这个世界。能够产生影响的事。
所以你其实你本科还是比较顺利的,对吧?在量子物理这个研究领域很快。你很快就有了非常好的学术成果,而且是范式级的变化,但是你很快觉得没有吸引力了。所以你想到博士去挑战一个更难的事情。对。然后在博士期间其实是比较落寞的。
至少从结果来说是这样的。
外界看不出来,外界看都是非常光鲜的履历。你博士在 Stanford?
对,我觉得从实际的科研产出来说。我觉得没有人会说我博士期间的文章不好,但是摸着良心说对这个世界有多大的影响?我觉得几乎没有零,没有影响,几乎为零。对,所以对我自己来说,我自己很不满意的,但是我觉得确实也没有不满意到说我会担心有人说我在混日子,确实也没在混日子。
就是你还是能达到所有的外界标准的。对。这是怎么做到的?就是。我觉得。这个还真的是,很多事情冷暖自知,对吧?
对,是的,我觉得达到外界的标准或者达到一个小的圈子的评价标准是像训练模型一样,就是一旦有了这么一个小的圈子,你知道他们的评价标准之后,做的好是很容易的,但是。
就是其实你哪怕不认可这个标准,你是可以达到的。但是你还是知道你是不认可的,因为有时候你哪怕不认可,你达到了,我也可以蒙蔽自己。就继续往前走。
但我后来就发现,我蒙蔽不了自己,骗不了自己。对。
是哪一年发现的?
我觉得可能从。博士最后的 2 年吧。就会有这样的感觉,但是那时候确实也没有想好,没有想清楚,如果不做这个该去做什么,那可能就花一些时间去,会去了解一些不一样的方向,比如说一开始我可能更多的是去了解是量子计算或者量子信息这样的方向。拿了 postdoc offer, 就是博后的 offer 之后感觉这个事更紧急了,因为离开在学校里的时候,你还可以一个学生的心态,离开学校之后就是自己的 career。你得给自己找一条路,当时就是觉得可能量子计算和 AI 是两条,我觉得给年轻人给小灯机会比较多的。对。
所以你博士后的方向是啥?
博后没有方向,就博后其实就是理论物理这个方向,博后是一个很独立的职位,就是你自己想干啥就干啥。对,他更多的是从某种意义上来说有点像搞慈善。
谁搞慈善啊?
就是有一些可能,不管是在意科研的国家组织还是个人组织,他会给学校捐一笔钱。或者给学校批一笔钱,然后学校用这笔钱来招一些博士后,再。一个系里面就做他的研究,然后把自己的研究广泛的告诉系里的,别的人觉得他更多的是一种社会氛围的这种工作。对,然后所以其实没什么限制,就是你其实想干什么干就干什么,但是我其实也没做多时多长时间的博后,就我实际可能到了伯克利待了两三个月,但官方来说就只了待了两个星期。
官方来说是什么?
就是我其实在入职之前已经去那,因为我反正人就在湾区嘛。我觉得入职之前就去那,但是我入职之后其实只待了两个星期就辞职了。
对。这两个星期发生了什么?
这两天啥也没发生,我本来都不准备入职的,但是伯克利人就是太好,就是你没事,就是等事情定了再说,能来多久就来多久。
你告诉他们,你其实在跟 Anthropic 谈。
对,我告诉他们,其实我觉得我可能会去做 AI 了,我要不就别入职了。但是伯克利不止伯克利,我觉得就是湾区这两个学校的老师都人很好,就他很照顾你,他就觉得你还没有完全谈定,那还是先把现在的工作先拿着。对。
你觉得物理对你后来做 AI 有什么帮助吗?
我觉得硬实力上其实没什么帮助,纯工具性的技能上来说,其实从物理到 AI 的转化是非常非常少的。但是我觉得可能非要问的话,我觉得可能主要的不能说能力,就是性格,可能是可能做物理人会更想刨根问底。更想理解一个事,然后更想做事很系统,因为我们习惯了这种很系统性的,不管是做实验的方式还是做理论的方式,所以我觉得这个可能是。
一个一个比较好的地方,但是我也不觉得这个事是做物理人独特的。就是为什么做计算机人没有这个特性?我觉得我认识很多做计算机的人也有这个特性,那很多做化学的人也有这个特性,学生物也有这个特性,所以我也不觉得他是做物理独特的。对,但是事实上就是可能比较有趣,就是这个领域里面确实有很多,尤其就是语言模型这种比较,就 large scale 的这种 AI 确实有很多物理出身的人,然后做的很成功。对,尤其是 OpenAI 这个公司。对。
因为很多人在描述这一代 AI 的时候都会说是黑盒,你能用科学的角度来理解一下这个黑盒吗?就人工智能的运作源。
我觉得这世界上所有东西都是黑盒。就是哪怕像物理这种大家觉得很理解的东西,其实也并不是真的有一个从它微观的行为一路演化到了宏观体现的这种理解。像不管是刚刚说的量子力学还是量子场论,其实都是描述那个能标下的行为,本质上这个系统还是一个黑盒,你还是不知道它最微观的地方是怎么什么样的动力学。
AI 也是一样,黑盒不黑盒其实都是一个相对的事,我们确实对语言模型没有理解到,神经科学手术刀级别,不是说我理解这个行为,能理解到说这个行为是由于哪一个 Neuron, 哪一个人工神经元的,哪一个激发产生的这个行为。没有,不会有这个,没有到这个层面的理解,除非就是在一些很稀疏、很小的这个网络里面,像 Anthropic 有这个所谓的 Interpretability 就可解释性团队,他们可能会做一些类似的工作,但是在实际能够使用的语言模型里都没有达到这样的理解。但是也不代表我完全没有理解,比如说 skilling law, 它就是一个描述了尺度下模型,随着模型大小和数据是怎么在 perplexity 就是这个指标下变得越来越好的。所以你说是完全没有理解吗?那如果说 skilling law 不算是理解的一个小部分的话,那是不是我们也可以说我们其实对这个世界也完全不理解?这个世界也是一个完全黑盒?
所以 skilling law 是一种科学规律。
它是一种经验规律。
经验规律。
对,但是经验规律和科学规律它之间的界限是很模糊的。比如说我们回头去看这种热力学的,各种不一样的定律,第一定律,第二定律,什么克拉伯龙方程乱七八糟,这些东西在当年被发现的时候也都是经验规律。但是只是说后来,诶,随着时间的发展,我们慢慢知道了它的微观机制,那它可能变成了一个科学规律。对,我觉得可能像 Scaling Law 或者类似的这样的东西,它目前肯定还是很惊艳的。但是未来当技术它比较变得比较固定,大家开始越来越多地理解它微观的过程的时候,会不会变成一个科学规律?如果这个事这个定义是存在的话,我觉得是有可能的,对。
能不能用科学的表达来解释一下所谓的智能涌现?
首先这个话就不太科学,所以自然也没有办法用科学的话来表达一个不科学的事。
智能有限吗?
对,就是我觉得。智能涌现对我来说它更多的是一种主观的感觉,而不是一种客观现象。就是当很多人说智能涌现的时候,他脑子里想的可能是以前的语言模型只能做某一个方向的事,比如只能翻译,只能做分析,只能做什么,但现在的模型好像诶,可以做所有的事,但是这个事 again 我觉得像是对我来说它更多的是一个技术上的涌现,而不是一个行为上的涌现,说是我们通过研究发现了该怎么去做这种大规模的。的训练能够水平的提升所有能力。我觉得这个是一个更本质的事,至于智能涌现这个事,其实我觉得每个人可能心里的定义都不太一样。
对,你的定义是。
对我来说就是没定义,,对我来说本这个唯一质的区别就是有没有发现发生一个技术上的改变,使得我们可以做 Scaling Law, 可以水平的提升所有的能力。这个对我来说是一个良好定义的事。
你最后是在量子计算和 AI 之间选择了 AI, 这个是怎么发生的变化?
对,我觉得还是花了时间一些时间去了解两个方向的瓶颈在哪。我觉得。
好处是他们都给年轻人机会。
好处是都有机会。
但是量子计算对你来说好像是离你的主线更近一些,在那个时候,对不对?
诶,这就是为什么要去了解一下细节,因为了解细节之后就发现不是的,是反过来的。因为量子力学不是量子力学,就是量子计算,我觉得它现在的主要瓶颈其实在实验上,并不是你怎么去设计那些算法,或者设计那些算子,更多的是你怎么在实验上实现它,那个事反而是我不擅长的,反而是和我过去很多。我有兴趣的事其实是很比较不相关的,反而跟我相关的事是更多,像 AI, 就刚刚说的就是 AI, 其实它更多的是你有一个想法,你可以用一些数值去验证这个数值在 AI 里面可能就是训练一个模型,或者怎么样,对,这个反而和做物理很像,它甚至是为什么我之前一直爱把这个和 18 世纪的物理学做比较,它。热力学。对,更像那个时代的物理,就是那个时代就理论和实验不分家。没有什么理论物理学家,实验物理学家,你就是搞物理的。你自己可以做实验,然后也可以做理论的推测。我觉得 AI 就有点像那个时代。
所以其实从理论物理跨越到实验物理的距离比你直接跨到 AI 要远。
要远。其实要远,而且从兴趣上来说也更远。
你不喜欢实验物理?
我觉得。
你想做实验。
我觉得确实不是我的兴趣所在,虽然我不自己不愿意做,但是我确实很有兴趣知道别人实验做的怎么样。
AI 不用做实验吗?
用,但是它是更多是要数值。对,他不太像,你实验室去搭一个光学平台。什么?你还要我觉得实验真的是一个可能,因为是我不懂,我没有达到那个境界,所以我有些事在我看来挺玄妙的。比如说。就是大家都知道这个光学平台怎么搭?但有的人就能给你搭出来,有的人就是耗了 6 年都没搭出来。
这个是动手能力。
我就是没搞明白,,我有时候觉得真是很有点玄妙。
所以还是数值实验。对。清晰很多。
对我来说,做数值实验或者像 AI 就是训练模型,研究各种不一样的技巧,然后看某些细节,这些事对我来说反而是我能想明白他为什么要这么干。在搭台子这个事上我就是一头雾水。
你做过,是吧?
我当然就是大家可能都做过基本的,就读物理的人肯定都做过基本的实验培训,但是更多的就是我有很多做实验的朋友,不管去看他们的实验室,然后看他们怎么做实验的,还是。跟他们聊这些怎么设计实验。我就感觉很多事我其实不太能够理解,但是他们确实有的人就是做的好,有的人做的就是不好。
所以你说现在从事 AI 研究,像 17 世纪热力学研究,其实在表达,虽然大家没有办法很清晰的从科学上去解释和理解这个事情,但是他没有并不会阻止他的发展。
对,就是他更像是在为什么他比较那个时代热力学,就是那个时代大家其实不理解什么是热的微观理论,就大家不知道热是什么东西。
就像现在不能理解。
对,就像现在大家不能理解这个 language model 里面哪一个矩阵元是在干什么?其实大家也不理解。但是不妨碍你有一些好的经验定律,比如热力学的各种定律和现在的各种 skating law。所以说从这个角度来说是,就从这个方向的角度来说,是这个层面上来说它是类似的。然后从研究人员的角度来说,就是刚才说的另外一个问题,就是它理论和实验其实不太分家。对。
那你是怎么去面试 Anthropic 的?你这个 Anthropic 的历程是怎么展开的?
我觉得其实主要还是因为有前同事在 Anthropic。前同事。对,就是 Anthropic。其实有很多做物理出身,尤其是做理论物理出身的人。
为什么呀?这他们从人的选择上为什么会选择这一拨人?
我觉得当然就是很多很多人可能会找一些原因说,做物理人擅长这个或者擅长那个,但是就我个人的视角来看,我觉得主要的原因还是 connection, 就是联系。就是因为 Anthropic 的创始团队里面,两创始人里面其实有 3,当时有三三四个比较技术的人,然后其中有两个现在还很在技术一线领导的人,他们俩都是做物理出身的。他们可能招的一些人也是做物理出身的,所以就这样一直延续下来,但其实到了现在这个阶段,就在我之后,其实也几乎没怎么再招,完全没有 AI 背景的人了。对,所以说也是一个,我觉得也是一个一个时代的产物。对,然后我反正是当时我决定去做 AI 了,所以我就试图去联系一些地方,然后。
你只找了 Anthropic 吗?
没有,我还找了 OpenAI 和 Google DeepMind, 就 Google DeepMind, 但 Google DeepMind 因为它那时候速度太慢了。所以没有,最后没有出现在考虑的范围内,但是。
速度太慢了,是指他们面试的速度慢。
但是后来,显然后来 Noam Shazeer 这个事就获得了长足的提升,后来动手就非常快。对,然后 Anthropic 就是。
OpenAI 呢。
OpenAI 也联系了,但是 OpenAI 可能没有找到特别合适的事和人。然后 Anthropic 是因为我当时联系了,后来就是我的第一任那个 manager, 我第一任经理。他以前也是做这个理论物理的。他当时就说我们在尝试做强化学习,尝试做这种大规模强化学习,有很多科学问题要去理解,那个时候 24 年 9 月、八九月的时候,那时候其实强化学习还没有像现在这么成熟。那时候大多数人其实都不太知道怎么做,因为 O1 其实还没发布,那时候 O1 只是。快发了。就是,只是大家都知道有。但是大家都还没看到结果。
但 Anthropic 当时其实不知道怎么做的。
当时是大体上知道。但是有很多细节需要仔细去研究,所以他就跟我说,有这么一个事,你要不要来面试一下?我觉得他觉得,哎可能是一个好的机会。
你当时怎么认知?强化学习啊?
没认知啊。
你大概知道 pre trainpost train。
对,我大概知道这个流程,但我其实不太知道具体的这种业工业级别的语言模型是怎么训练的。只能知道就是像学术界是怎么训练的。对。其实现在谈那时候的认知,其实在我现在看来就是没有认知。对,更多的还是我当时觉得这个事是一个不确定的事。然后是一个好的机会。所以我就去干了。当然也有些面试的准备和面试过程,对。怎么准备的?聊啥?我当时。跟谁面的?小伟,后来我的一些同事当时面的,然后面试题也不太难,反正,,对,但是对我来说,我也,我当时也不知道怎么准备。然后我就去把我能找到的那些课。自己能学的学了一遍,能做的作业做了一遍,自己手搓了一套。Andrej Karpathy, 他有一个著名的项目好像叫 nanoGPT, 还是叫什么?反正就是他有一个可以在一个 Google 这个 Colab Notebook 里面就能训的一个很小的 GPT 模型,我就手搓了一下,那个就去面了。对。
然后很快拿到了 offer。
然后就,对,然后就拿到 offer。
然后你第一个方向就是大规模的强化学习。
也,当时其实是有两个组来。两个组的 manager 来跟我聊,一个是做 evaluation, 就是模型评测,另外一个是做强化学习,我是选择了强化学习。
你当时选择强化学习是因为它更加的不明朗。
对。对,然后那时候其实 Anthropic 也不像现在是一个大公司了,那时候公司其实也很小。
多少人?
我去的时候我们的大的 team 才只有 10 个人左右,不是 10 个人或者 11 个人,反正。
大 team 叫什么?
叫 Horizon。对,那个时候那个大 team 也就。
这个大 team 的平行 team 有什么?
那个大 team 其实后来几乎就是强化学习的方方面面都在这个 team 了。对。
所以它的整个大组就是一个强化学习。
整个大组,首先这个创业公司你也很难说这个组的目标是什么。因为它可能曾经也有过很多不一样的目标,但只是那个阶段可能主要的目标是做强化学习。对,当然底下也有做更数据的组,更做环境和 Infra 和基础设施的组,也有更做这种。research 和。和算法的组,然后我去的那个组是比较偏 research 和算法的组。对。
那时候 Anthropic 多少人?
那个时候可能七八百的样子,总共。七八百。对,是整个的公司七八百,对。
你一进去对这家公司的印象是什么呢?
我觉得我对 Anthropic 的印象其实还是挺就挺 consistent 的。就是我觉得进去之后,我对这家公司的印象就是执行力非常强。就是它其实是一个比较 top down 的公司。对,所以很多事情决定了之后就会全力去做。公司其实员工之间的氛围也很好,就大家都不会藏着掖着,尤其刚去的时候很小,所以就是大家也都认识,所以就氛围很好。我觉得如果是做只是做语言模型相关的事的话,其实现在回头来看,那是一个非常非常好的学习机会。就是你能够接触到这个模型训练的方方面面,然后都能找到对应的人去问,对。
那个时候的 Anthropic 已经有了,现在我们都知道它那个非常坚定的 bet 了吗?
有的。
这个 bet 来自于哪里?为什么会有这个 bet?
我,我不知道它完全的来源在哪,我自己能看到的一个显然的来源就是前一代模型 Claude 3 放了之后。Twitter 上那时候可能还没叫 XTwitter 上有很多人在讨论说。那个 Claude 好像写 code 比 GPT-4 强。那个年代 GPT-4 还是一个和大家 gap 很大的模型,所以你能有一件重要的事比 GPT-4 强就很厉害了。
所以是试出来的。
我觉得至少是一其中一个原因。就是很快的对这个市场做了反馈,对,这也是我觉得这公司很强的一点,就是他 execution 执行力非常非常强,一旦给他一个信号,让他觉得是很 reasonable, 这公司该做的事,那就会扑上去,他没有那些。大组织内容冗余。对。
为什么它的 Coding 会比 GPT-4 要好?
不能说。
是有原因的。
是有原因的,对。
但是是个随机的原因,不是一个我这么选择,所以有了这个结果的原因。
是一个纯技术原因。但是确实我不能确定一开始是随机试着的还是故意选择的,你要让我猜,我肯定会觉得是随机试着的。
纯技术的原因。对。是有某个人做了某个事情。
是,确实有某一个团队做了某个事情。
是自上而下的还是自下而上的?
我觉得最开始可能是最自下而上的,但是后来就变成了一个自上而下的事。
就是要快速捕捉到一些市场,对,就是内部和市场的信号。
对,我觉得这个是。
然后要赶快要扑上去。
对,我觉得这是 Anthropic 非常非常强的一点。对,他非常非常的 reactive, 反应非常快。
他的执行力来自于哪里?来自于 Dario 这个人,来自于他的某种特质。
我感觉就是 Anthropic 作为一个公司来说,他。它能够实行这种比较 top down 的机制。是一个很独特的事。
为什么呀?
因为实行 top down 其实有一个很难的点。就是你做技术的决策人,必须也得是公司本身的决策人。首先就是你技术上得能服众,那下面的研究员才会你才能够信服下面的研究员去做这个事。另一方面就是你得是公司的决策人,你得能为这个公司负这个责任。Anthropic 有这个条件,就是说他的技术上的 leader 的领导人其实是公司口风的。那是。
你指的是谁?不是 Dario。
就是 Jared, 像就是 Jared Kaplan 和 Sam, 然后像他们俩就是公司口方的。然后他们自己做这个决定,那是人家的公司,所以他有权利做这个 top down 的事。
那 Dario 作为 CEO, 他会 say yes 和 no 吗?
我不知道他们决策层的讨论里面。OK。Dario 起到了什么样的作用?我只能说。
就技术 leader 是有决定权的。
我只能说,对我当时的工作来说,我接触的最多的就是 Jared 的。
可是这对于其他模型公司很难吗?
很难,比如说 OpenAI 就干不了。
伊利亚在的时候难道不行吗?
伊利亚在的时候有可能可以,但是伊利亚后来一方面我也不知道因为什么原因,他好像就是失去了这个做决策的能力,然后就走了,所以就。
其他公司呢。
其他公司我觉得都比较难,就是 Gemini 也比较难,但是我觉得 Gemini 就是另外一套打法不太一样。就是说我觉得就是大公司和 STARTUP 它打法本来就不一样,因为 STARTUP 重要的是 make fat。就是我得赌一件事。我如果想要赌就意味着有风险,所以就意味着我能够去很快的做一些决策,然后很强力的推进一些决策。那可能在这种情况下 top down 我觉得是一个很有优势的事,所以我觉得 top down 从组织上来说是比 OKR 更有优势的,但是作为大公司来说,它可能就是另外一套想法,因为大公司的想法可能是我不仅能尽量减少做赌的成分,而是我能在方方面面都有储备。任何一个事成了我都能跟上。然后如果有事我自己做成了,我可能还能领先,这可能是大公司的心态。所以说在 Gemini Google 是一个很传统的就很 bottom up 的组织,就是公司层面是可能有一些比较良好定义的框架来看你的工作是好是坏,来引导你做一些公司需要的事,但是本质上还是你自己来决定自己做什么。
所以你觉得 Anthropic 能 make best 是因为它的独特的文化。
组织和文化,对。
这个听起来其实应该是其他公司也能做的,但是却非常奇怪的发现,其他公司很难做,而 Anthropic 可以做到。
对,我觉得还是。需要技术的或者公司的 leader 有公信力,这个其实挺难的,我觉得。
你说的还不是 CEO 有公信力,是技术的一号位有公信力。
对我来说,我觉得技术的一号位有公信力很重要。
但是与此同时, CEO 可能没有成为一个阻力。
对。
这个难吗?
这个我觉得就得看你这个 co- founding 的这个 team 有没有足够的互相信任。这个也很关键,我觉得 Elon Musk 这点也是在 startup 里很强的,就是他 co- founding team 没有一个人离开公司。他们,如果你看他们过去履历,那是一群真正一起打过仗的人,就过去。
他们源自于。
他们都是以前 OpenAI 的。
OpenAI。
对,然后像他们甚至好多人都是,就是在一系列关键的文章上的合著者。因为你像 Scaling Law 这个 paper 是 Jared Kaplan, 然后 Sam, 然后当然还有 Dario, 然后还有一些可能 Tom Brown 也在吧?我不太记得 Tom Brown 在不在了。然后 GPT-4 的 paper 就是 Tom Brown 在,然后 Ben Belin 在,然后 Jared 和 Sam 也都在, David 也都在,其实他们是一块趴过战壕的人。我觉得互相之间的信任还是很关键。有很多公司可能就是干着,连这个小集体都团结不住了。那你怎么能指望这个大公司能团结住呢?
你在说 OpenAI 是吧?你加入 Anthropic, 公司正在做的最重要的项目是什么?你参与到那个大项目里面了吗?
对,就当时做,就是为了做大,能做大尺度的强化学习。然后能够用它来提高。Coding 的能力。这个就是当时最重要的事。然后我们当时做组,当时的研究重心就是这个事。这也是这个组为什么后来就慢慢变大,然后变得越来越重要的原因。然后最终带来的结果就是大家一块 train 了这个 3.7Claude,3.7 这个模型,对。
你说内部叫有一个 3.6,这个是。
不是内部叫,就是外界的 Claude3.5 其实有两个版本。一个可能是 6 月的版本,另外一个 10 月的版本,然后。你也可以看出 Anthropic,这个公司曾经也是没啥产品能力的,居然管两个模型叫一个名字,,所以后来外面人为了区分管那个 3.5,后面那个版本叫 3.6。所以 Anthropic 跟随着外面的这个习惯。就叫 3.6 了。管这个新再新的模型叫做了 3.7。所以就是你去看实际的这个时,公司的产品时间线其实是 3.53.5new3.7。
怎么会有一个 3.5 new?这个是怎么想的?
你这我只能说那个时候的 Anthropic 可能真的是没有什么产品上的想法。
所以你第一个项目是 3.7 还是 3.5?3.73.7。还是 3.5 new?
3.5 new 其实我没参与,几乎没参与,因为它。
但 3.5 new 就已经看到了 Coding 的迹象,是吗?你刚才刚开始的时候。
3.5 new 的时候已经看出 Anthropic 的模型在 agentCoding 会比别的模型强了。
这个是为什么?
不能说。
所以你进去的时候刚刚好就是他们有,他们知道了这件事情,就是管理层也知道这个迹象。然后他们要 make best 的时候,你这个运气很好啊。
我觉得,对,我觉得我进去的时候是大家肯定已经看到了这个事能做成且重要。但是不太清楚怎么去把它做成,然后我去的时候是跟大家一起去研究怎么把它做成。对。
所以方法是大尺度的强化学习。
对,这是从大的角度来说是,但是当然就是有很多技术细节是需要去研究的。
这里面有什么 NDA 啊?
有好多 NDA 的内容呢。
有很多就是会写的这么详细的吗?
其实原则上来说。员工是不能在职期间和离职之后透露任何跟公司内部相关的信息的。OK。当然实际上来说就是大家可能心里都有一个度,就是说如果这个技术没有公开的话,肯定是不会。去谈的,但是我觉得,虽然我不能公开去谈,但是我觉得把简单的事做的比谁都干净是最关键的。
什么叫干净?你刚才也用过这个词。
对,就是我觉得有很多花里胡哨的技巧,比如说做强化学习,最简单的 algorithm 就是 policy gradient, 但是不代表这是唯一的 algorithm, 它还有别的算法,比如说各种复杂的搜索算法之类的东西,但是不是这些复杂性是必须的,这些复杂性可能给你带来了一些 efficiency, 也就是效率上的提升,但它可能给你带来一些比如说基建 infra 上的困难。那你怎么去 trade off 这些事其实做研究需要去理解的。就是怎么去 balance 这种不同的因素,然后选到最好的那条,最稳定的那条路。对,然后我觉得很多的农号其实都是在这些细节里面怎么去处理这方方面面?细节里面,对。
那个时候怎么来描述 Coding 很重要呢?
我觉得。
他认为是大语言模型的一个分支。一个重要的分支还是什么呢?
我觉得每个人可能想法不一样,对我来说它重要的原因有二,一个原因就是一个原因,当时 Anthropic 一直在讲的事,就是说 Coding 本身也是做。语言模型研究的一部分,如果你能够把 Coding 做的很好,那可能会让你的研究效率有翻倍的提升。就是形成一个研究上的飞轮了。这是一方面原因,对我来说,另一方面原因是因为 Coding 其实是模型使用工具和环境交互的一个很好的抽象。首先这个抽象刚刚已经说过的,就是这个抽象的好处在哪?比如说这个回归信号清晰,然后数据充分,其实你是很难在别的场景下找到能同时有这两个特质的使用工具场景的。所以对我来说这是一个好抽象,在这里面做的一些研究可能是对更通用的那些使用工具和环境交互的能力的一些有用的 lesson 有用的课。对。
那时候 Cursor 是什么状态啊?
那时候 Cursor 还是一个纯产品公司,我觉得从某种意义上来说,好像在我去染到这个之前的那段时间里, Claude 和 Cursor 都属于比较 underdog 的状态。消耗在 3.5N 就是 3.6 外界的 3。就这一代的时候,首先是这个模型能力上去了,然后 cursor 又发现这个模型真的能够做了这种 agentic coding 的工具了。它这两个是壳。对,但是这个壳包着这个模型一下子让公众体会到了,不是公众就是公众,是指就是软件工程这个圈子,当时。体会到了,诶,这事好像是真的是效率工具了,所以后来就是这个一下子就起来了。
所以那时候他就 anthropic, 就意识到 cursor 是未来的竞争对手。
那就不知道了,盖文 Dario 哦。
3.7 是怎么做出来的?这个是一个分水岭,对于 Anthropic 来说是一个分水岭式的模型。
我觉得对于 An- Anthropic 的后训练来说是一个分水岭,就是在 3.7 之前,后训练都是处于一个比较小规模,可能修修补补模型的这种一个状态。
大家不重视后训练是吗?
也不是不重视,就是一开始大家其实很长时间大家都没有搞明白后训练该怎么 scale up。但是在那个阶段,不管是 OpenAI 还是 Anthropic, 还是包括像中国的 DeepSeek。对。他意识到了这个事该怎么去 scale up?
该怎么 scale up?
就是你得找到。合适的环境,这个环境它的回馈信号足够的清晰,这个环境本身也是一个很强的数据源,在这个上面其实能让这个训练非常稳定,这事就能做成。对。
对,我记得那个时候其实大家都不知道 OpenAI 的保密项目是什么,就知道它叫 Strawberry,叫 Strawberry, 大家觉得会带来一个新的范式,新的范式就是后训练的强化学习。但是。更多的就不知道了。
对,其实我觉得我去 Anthropic 的时候,大家已经比较清楚这个事该大概该怎么做,大概的这个方向是怎么做。当然后来随着我对这个领域知道越来越多之后,我就发现其实那个时刻其实 OpenAI 做的方式和 Anthropic 其实还是差别挺大的。怎么说?就是具体这种算法和使用数据的方式其实是不太一样的。
虽然都叫后训练和强化学习。
虽然都叫这个,但是当然就是我觉得那些不是本质区别。就是本大的方向来说他们是同一个,就是找了一些,找一些这种很回归信号非常清楚、非常客观,数据本身又比较干净,对于模型来说是可学习的,在上面做稳定的强化学习训练。大的方向来说都是这个方向,但具体实现其实是差别比较大,但后来事实也证明就是具体实现其实每家方向都不一样,但是都能做成。对。
而且当时 OpenAI 的目标也不是 Coding。当时我了解到的叙事是说预训练作为第一个范式,已经金矿快挖完了,所以我们现在开启第二个金矿。就是后训练和强化学习,然后来让 Scaling Law 继续。
对,我觉得很长时间 OpenAI 都是这个想法,我不知道他们现在想法有没有变。我觉得对我来说,我的想法经历过摇摆在 3.7 那个时代,我其实觉得我当时也抱着这个预训练,已经快 Party is over 这种感觉,然后。
就在你要入职的时候,是吧?
就我刚入职,然后当时在做这种 3.7 相关的这种实验的时候。我当时也曾经报过这个想法,但是后来随着了解越来越深入,我就觉得发现就是其实还有做的空间的预训练,它预训练 SKING law 这个事,它也不是告诉你你要一直变大。它其实本质上是一个很系统的框架,能够告诉你做什么样的事是更有效的,对。所以后来就发现其实还有很多做的事实情况是后来 Anthropic 和 Gemini 的预训练也一直在不断的进展,那我后来自己卡了很久。
他现在又重视预训练了吗?
他应该已经重视预训练挺久了,就是最近可能刚刚有点进展。
所以预训练和后训练作为两个范式都没有达到他的平台期。
我觉得都没有。
但是你说要去预测到达多少,这个做不到。
对,就我觉得到达平台期有两种可能性,一种可能性是技术本身到达了,就是你明明还有想让模型要干的事,但是这俩技术就死活教不会了。另一种可能性是你想干的事到平台期了。我觉得现在就是后者。
就是我们现在知道了有一个 chatbot。你可以教它干这个。然后又有一个 Coding, 你可以教它干这个。对。后面就不知道了。
对,就不知道该教点它啥好。
就是说就是模型,还是一个非常聪明的小孩。对。你其实可以教它很多东西。对,但是我们人类作为老师现在还不知道下一个东西该教什么。
或者说该怎么去合理的教它用现在的这些范式?
说到 3.7 还有什么能好?这是几个月做出来的?
这个最后林总从开始训练到发布可能花了四五个月的样子吧。对。
就是从你刚进去。
就是从开始大家做为了这个事做研究,那可能花了两三个月,然后后来开始训练到训练结束,中间磕磕绊绊很多事情要处理,然后有很多新的基础设施,其实基础设施真的是很重要,很花时间。然后又可能花了,可能两个月这样子。
你在其中做的重要的工作是什么?
我觉得我也没什么重要的。我觉得我对我个人的贡献,我觉得我对我个人,对任何一个模型的贡献,我的陈述都是,我觉得我自己对那个事没那么重要,我觉得我更多的是我很幸运有机会在那个时候加入了一个重要的项目,做了一些事。因为从某种意义上来说,我觉得 AI 在现在最近这几年。这个事本身是一个不可阻挡的事。他不在于你这个人去干或者不干,你不干自也有别人一样能干出来的。所以我觉得在这个时代,其实所有给个人贴金的事,其实都有点炒作的嫌疑,但是确实我觉得对我来说我是很幸运能在那个阶段加入一个重要的事。然后,诶,学习了一些知识。
好的,那你在幸运的在那个阶段,在 Anthropic 这家公司的大尺度强化学习的团队里。做了什么?
我觉得 3.7 那个时候可能主要做的还是在 RL 里做 agentic coding 这件事。这件事怎么把它 scale up?或者怎么去准备各样?怎么去制备各种各样的环境和 data?包括算法上会遇到什么样的问题?当时主要的研究都在这部分。
这里面有什么 Tips 吗?
现在来看没啥特别有用的 Tips, 我觉得说到说技术的 Tips, 其实这个事是一个大家很一方面很愿意听。公司又不让你说,但实际又没啥用的事。
为什么?
因为很多算法设计其实并不独立于算法,它是强,非常强的,依赖于你基础设施的。举个简单的例子,就是有些公司它可能就大家经常讨论一个问题,就是说在强化学习时候,这个 sampler 就是给你产生这些 trace, 这些 TOKEN 的那个机器。和 Trainer 用来实际训练这个模型,然后改变这模型权重的这个机器,这两个机器可能会有不一样。当然不一样,有一些原因是因为数值上的不一样,有些原因是因为使用了这种异步的训练架构,所以说它自然就是。就是从根本上来说就不一样。那你不同公司可能这个不一样,程度是不一样,所以你算法的设计也会不一样。有些公司它可能很这两个 difference, 这两个区别非常非常大,那你算法可能最大的部分就是在于怎么控制这个,怎么让这个训练稳定,可能对于训练的实际的效果之类的权重就会稍微小一点。但有可能有的公司它的基础设施建设就特别好,这两个差别没那么大,那你可能就可以花更多精力在这个训练的效果上。
所以说很多这种小的 tips 其实是没有什么用的,就很多 knowhow 其实是没什么用。我是因为我确实也发现了很多别的 lab 不是在这三家 lab 里的人可能很想知道哎 Ansatz 怎么做这个或者 Gemini 怎么做那个,但其实我有时候不愿意回答一个主要原因是因为我觉得本质上我回答这个问题也是在误导他,就是现代的 AI 训练是一个大的系统。你其实要把要了解这个系统的方方面面才能有一个全局的认识,什么事是因为什么而变得有用了?而不是说这个事本身有用。对。
从。3.7 到 4.5 又发生什么呢?
这个预训练和后训练都有,对,然后当然就是一个,就是 scale up 上做的更多了,然后 data, 不管是 data 还是训练的这个算力都更大的尺度了,但是我觉得从范式上来说就没有特别大的改变。对。
到你离开 Anthropic 的时候,它已经多少人了?
很接近 2000 人了吧。
扩了一倍多。对。所以你在 Anthropic 时期,刚好是它就最剧烈转变的一个时期。
我可能就是踩在了它还是个小公司的尾巴。其实我觉得进去之后,过了可能三四个月这个公司就已经开始,诶,就人一下就变多了。
文化有变化吗?
还是经历一些比较混沌的阶段,可能,尤其可能就是在我离开的那段,快离开的那段时间,我觉得文化上还是经历了一些混沌,因为从外面来了一些人,然后可能跟本来的文化有一些冲突。对,然后。
之前的文化是。
我觉得之前就是。简单。对,就很简单,就是它像,更像是一个小作坊。大家都是朋友,然后。大家都知道对方在干嘛,也没有人特别会做过多的个人宣传还是怎么,就是做一些没有用的事,也没有人做没有用的事,大家都是有很多事要处理,公司那时候紧,可能紧迫感也更强一些,后来可能就觉得这样人多了,这样的文化肯定会受到一些冲击。
对,带来了什么风气啊?
我觉得确实有一些。人我个人不是很喜欢,当然你不代表他们真的不好,就是我个人不是很喜欢,就是可能我不太喜欢在这个领域里面说很多话的人,我觉得 idea is cheap 想法是便宜的,很多想法其实很显然所有人都知道难的是怎么把它实现,怎么把它变成一个一个小的可实现的步骤,把它做出来。我觉得我不太喜欢那些一天中很多时间花在 SlackSlack, 是美国用的一个办公的这种软件,在 Slack 上花很多时间在那。讲一些大道理,我觉得就是没啥用,,对。
你后来为什么突然离职了?你是完成了什么阶段性的工作吗?当时酝酿了多久?
我觉得可能酝酿了一两个月,一个多月,一个月多一点。那很快。对,我觉得一个方面是我其实。不是太别,特别认同 Dario 这个事。我觉得他作为一个公司的 CEO 来说,对他个人来说,他做什么样的观点我觉得都无所谓。但是作为一个公司的 CEO 来说,我觉得把一个观点推到这么极端的地步是一个非常情绪化的体现。
对,然后这是一个一个比较小的原因,当然大的方面有很多公司,就像刚才说的,公司的文化上有些冲击,然后包括我自己可能也想去学习些不一样的事情,就说 Anthropic, 他毕竟非常的专注。然后你可能做,如果你很想做和语言模型相关的方方面面做这种使用工具,这种 agentic, 然后 coding 这种事,那在 Anthropic 其实很好,能学到很多东西,但是 Anthropic 有很多不做的事。比如说 Anthropic 完全没有人做,这种多模态生成,你想学没地学, Anthropic 可能也没有花太多的精力在这种更底层的工程的技术架基础设施上。对,所以可能想要学习更多的东西,也是我当时离开的一个动因。对。
访华占百分之多少比例啊?因为 Dario 的个人原因,我在公开场合说 40%,但是这个数字反正就是听听就好,这个数字就是告诉你它不是主要原因,但它确实是一个很大的原因。对,就没有控股,不是个控股原因,对,不是个控股原因,但是一个 majority HOLDER 的原因。,对,你这个选择也很神奇,因为大多数人在一个他还是一个 Underdog 的时候加入会更有感情,会愿意陪公司走更长时间。但你反而跳去了 Google, 因为很多研究员一进去 Google, 他会觉得 Google 给的 scope 不够。他,所以他会反而想跳去像 xAI 或者 Anthropic 这样的更小一点的组织。你这个反行动好像也是反的。
对,我觉得其实取决于你自己想要的是什么。如果你很想要的是我有一个很明确的,像你说的很明确的 scope, 然后这个事和我的最后的产品的模型息息相关。我一定要把我其中的一个想法送到这个模型里去。那可能 Google 是一个很差的地方。因为毕竟有那么多的研究员,有那么多已经成熟的组织做这件事情是很有很复杂的这个过程。但是我觉得 Gemini 很,如果你想要的是你有研究的自由,有探索的自由,想去学能从更广泛的人类学习,我觉得这个世界上可能找不到第二个比 Gemini 更强的地方,所以就是我觉得本质上还是取决你要自己想要什么。但是我觉得很多人离职,不管从哪离职,换到另外一家之后可能。会觉得不开心的主要原因是因为没想明白自己想要什么。比如说你要是到了 Google, 你可能该是,如果你刚开始想的是我有要有研究自由,然后学更多的动机是学习,然后你去了之后发现还是想要有产品 impact, 那你可能就会很难受。
那你不追求 impact 吗?你在,你也跟说这个,现在一个 AI 是一个非常大的系统,是一个很大量的人协作的一个东西,你在里面追求什么?
我觉得分阶段,就是我觉得在安苏菲经历了太多和产品息息相关的事之后,我可能也想给自己换个脑子去学习一些不一样的东西,但是你说有没有哪一天我可能又换回这个脑子,又想去产生一些产品的影响,也是有可能的。
产品影响力怎么量化?这个内部都很清晰,是吗?
不好量化,就是我觉得。
因为发论文的时候他还是有一作这种作者,主导作者现在呢。
其实没有办法量化。实际情况就是没有办法量化,这也是为什么。我觉得在这个时代,其实谈每一个个人个体的影响是一个很虚无缥缈的事情,我觉得本质上还是这个组织做了这样一件事,或者这个世界需要这样。
所以产生产品 impact 是个主观感受。
在模型侧至少是这样的,在模型侧至少这样,对,然后当然实际上你可以,我觉得可以细节谈的是说你自己做过哪些事情,具体的技术的贡献,然后它在技术上产生的效果。这个是可以客观的去谈论的,但是比较主观的事是你说这个效果在最后的产品里占了多大的比重?这个没有人能说清楚。对。
诶,在 3.7 上你能描述一下吗?我觉得。什么样的技术性的工作对模型是产生影响?
主要还是跟也针对 Coding 的环境有关的工作,有也有一些算法上主要是怎么让这个训练变得更就更稳定,说实话就是,但是我觉得算法上肯定是有一些提升,但是也没有达到特别理想的效果,说实话。比之前的算法肯定是要好的。对,但是那个我觉得也不是我个人的贡献。我觉得也是大家集体的贡献。
对,我每次问你,你都会说这是集体的贡献,不是一个个人英雄主义的时代。
对,我觉得个人英雄主义时代对于 LLM 什么的来说可能过去了。
什么时候是啊?
就是在。
Transformer 那个时刻。
对,就是在那个技术还没到 Scale up 那个点之前,那找到了那个技术的人可能是一个英雄,或者找到那个技术的一个小团体可能是个英雄。找到那技术之后可能很长一段时间,从模型侧来说都是,我觉得更多的是集体主义。就是这个集体能不能一起工作?能不能为了一个目标?一起花自己的时间,花自己的精力,这个是最重要的事,而不是每一个个人提供了什么样的东西。
说集体主义的原因是因为其实能力是来自于 AI, 是吗?
我说集体主义的原因是因为我觉得 AI 这个方向本质上是简单,就是没有哪,我觉得没有哪个,除了可能跳变那一下。那个 idea 可能是得有一些很深刻的洞见。在之后的那个过程中,很多想法其实是非常 trivial, 就是非常愚蠢的,就是谁都能想,谁都能干。只是你运气好,撞着了一个机会去干了而已。对。
包。或你在描述 Anthropic 做 Coding, 好像它也是某种随机性,但是你要抓住它。
对,对。但是就是我觉得做 Coding 可能还比做模型侧的这些技术上的东西可能还更稍微有点公司英雄主义,就是说你能不能足够快的赌这件事。那确实还是一个 Anthropic, 很强。
但如果今天没有 Anthropic 做,可能别的公司也做了。
我觉得是,就是一个必然的事。
所以它都是 AI 在涌现能力。
对,我觉得。
是看你能不能抓住那个能力,不管是公司还是个体。
对,我觉得就是在这个可用的语言模型,大尺度语言模型出现之前。那个时候很多事情是一个非必然,就是有没有一个人能够发明一个东西,一个语言模型,能够大尺度的做训练。然后以及 GPT 这个范式能不能被发现出来?那是有很多不确定性的,但是你说,比如那个时候你说如果没有 Google Brain, 那可能 Transformer 就不会被发现,可能要过很多很多年才被另外一个有钱又有人的组织发现。那可能就是一个很大的影响。但是进入那个阶段之后,尤其到了现在已经反过来,就是你任何一个组织想要停止 AI 进展。是做不到的。Anthropic 有,Anthropic 很担心 AI 安全,那 Anthropic 有没有这个能力阻止 AI 发展它?没有。你阻止发,你停止发展,别人会发展,你的话语权还会变小。对,其实现在是,其实更多是这种这样一种状态,是这个世界在推着我们前进,而不是我们在推着这个世界前进。
感觉未来我们会更加难以阻止 AI。
我觉得已经阻止不了了,就是我觉得。试图去阻止 AI 里的一件事发生,可能本身就不是一种正确的想法。这也是刚才聊到,因为刚才聊到是 Anthropic, 就说 Anthropic 其中一个很重要的动因是所谓 AI 安全,我觉得它在 AI 安全事这件事。
这是它创立的时候的动因。对。现在跟它有什么关系?
现在的关系比较复杂,就是说一个一个一个自然的问题是大家可能会问一个做 AI 安全的公司,为什么现在开始训前沿模型了?Anthropic 的解释是说。我首先得拥有一个最前沿的模型,我才有话语权来推进我的 AI 安全。所以说他其实一直以来的想法是说我要做这个世上最好的模型,你大家不得不听我的来推进我的安全政策。但其实从我个人角度来说,我觉得这个想法是非常幼稚的,就这个事现在看来他是不会发现,不会发生的,更有可能发生的就是大家都有很好的前沿模型,而你没有办法阻止这个事任何事发生。对,你觉得可能对于。
对于这个事来说,现在更多关注的更多该想的事是,如果你真的想要避免 AI 带来一些危机,什么才是一个更自动化的事?对,举一个自动化的例子,就是比如说核武器,就是那核武器也是一个可以大家觉得诶,可能有毁灭世界力量的事,但核武器最后最终受到控制的方法就是 multiparty party control。就这个世界上大家有很多个有核武器的国家,他们互相都有毁灭对方的能力,所以通过这样一种制衡才稳定住。我觉得你要阻止 AI 干一些不好的事,可能最终是需要一种类似的机制来实现的,而不是希望既希望说一家公司制定一个法律来干一件事。
对,而且他自己制定,他也只能管得了自己。对。对。你刚也提到 Anthropic 有个可解释性团队,是吗?这个它的可解释性到达哪一步了?
在一些比较简单、比较稀松的神经网络里面,他们能够做一些有趣的研究,比如说,诶,看看某一个。输出了或者输入的文字或者图片,它的,它内在的表示是长成什么样的?你可能把那个表示什么?反一下之后它后面输出一个什么样的东西?做一些这样的研究,他们。
你刚才还提到一个观点,就是 AI 本质是简单的,你这个能描述一下这句话,这是一个结论。
对,我觉得这是,这甚至不是一个结论,就是这是我的一个 statement。是我的一个陈述。它可对可错。然后我对这个。
这是你的观点。
对,我对陈述的解释是它,我觉得它本质上简单的点在于它能做实验,就是它和比如说本质上难的东西,比如说物理,它的区别在于那个东西你没有那个能标下的实验数据,你就是理解不了那个能标下的理论。但是 AI 不被这个所绑的,目前。
你理解不了,没关系,我也可以往前发展。
而且就是我现在事实就是能够做任何我能想到的实验。只是可能说我需要一些时间去把计算量提上来,或者把基础设施准备好,但是没有什么本质上的困难。对,所以我一直说就是觉得 AI 就是没有给人感觉它碰壁的原因就是首先很多东西你都能试,其次现在不是说大家已经想空了脑袋,没有什么想法可以试了,更多的情况下是有太多的想法,得一个个试,花时间。
感觉人好渺小啊。在这个实验面前。
是的,所以说我觉得很快可能 AI 就会开始自己做实验了。
很快是多快?
4 个月内。我觉得未来的 6 到 12 个月。
AI 就会自己做实验。
我觉得其实当然就是这话不太良好定义。对不起,我说了一个很模糊的话,就是 AI 自己提高自己,或者自己来加快自己的发展过程,这件事其实已经在发生了,对吧?就像我们刚才最早的时候聊过,就是它已经开始是帮我们能够去实现一些我们想要的东西,然后很加快我们实验的速度。但是我觉得未来 6 到 12 sorry 他目前还做不到的事情是什么?是说他能不能。
从头到尾的把一件 AI 研究的事做完,就比如说他不仅能写这个 code, 他还能跑这个实验,还能看到这个结果,还能分析这个结果,知道他哪做的不对。然后提出新的假设,设计新的代码,跑新的实验,这个这条链条目前还没有完整,但我觉得这条链条可能是下一步会慢慢变得完整的事。对。
基于你的各种原因,在你离开,决定离开 Anthropic 那一刻。你对这家公司未来的预期是什么呀?
我觉得我离开的时候,我对这公司其实挺悲观的。但后来显然是我过度悲观了。
为什么悲观?
我当时悲观的原因是因为我觉得我当时离开 Anthropic 的时候,Anthropic 其实主要的收入来源都是 API, 就是卖 TOKEN 这个。
个差生意。
是差生意,因为这个生意只有对一个公司是好生意,就是 Google。因为这个生意最后就是得打价格战。这一般处理就是要打价格战,你没有完整的链条是没有什么太多优势的。但是后来 Anthropic 显然在产品方面我觉得确实有很多巧思,做了很多好的事,不管像是 Claude Code 也变得越来越好用了,然后 Claude work, 然后和各种各样的和工作和效率相关的事情都慢慢汇聚起来了。所以感觉他现在反而变得比我当时觉得你要问我 OpenAI 和 Anthropic 哪个会先。先死,但是就不会真的死,就是哪个会先变得没那么重要,我当时会觉得,诶,可能是 Anthropic 会先变得没那么重要,但是后来首先 OpenAI 被 Google 揍了一拳。然后 Anthropic 自己又上道了,所以现在看来,好像 Anthropic 更占优势一些。
你后悔过没有?
不太后悔,我觉得对我个人来说,我个人的动机还是想要去换一个地方提高自己。我觉得对于这件,对于想做的这件事来说,这个选择没有什么错误,对。
你也提到 on topic 的产品,有很多巧思。特别是今年,就是像 Claude on Work 这些。对。这个来自于哪里啊?
我觉得我没看到 Claude on Work 的发展过程,所以我不知道。然后 Claude Code 我觉得。人产品可能还真的是。有一些个人英雄主义的机会。我觉得。
是研究员还是产品经理?
BorisBoris 就是那个我觉得 Claude Code 几乎至少这个事的开端是他自己想要做这个事,提高自己或者同事的工作效率。最后变成了一个对所有人都很重要的事。
Boris 是一个什么样的人?
我跟他没有太多的个人接触,我更多的只是看到他的工作在公司的时候。
他是个 researcher, 是吧?
对,但他主要是在产品那边。对。
所以 on topic 是有专门的产品部门的。
以前没有分得那么开,后来有单独的。
对,这个 Anthropic 感觉是很懂。AI 的产品啊。
对,我觉得这就为什么刚才刚开始说的时候,觉得这个产品经理可能还是目前挺难被 AI 取代的,。好的产品经理。
而且他好像不是上一代那种产品经理,他不是那种 feature 的摆放什么的,他好像是知道怎么跟 AI 协作的某种产品经理。
对,我觉得上一代产品经理可能,但也不全是,就上代也有一些就是交互方式级别的变化,但每一次交互方式级变化其实就带来一很大产品,比如说就是。可能这个抖音就是一个交互方式级别改变的产品。那它一下就带来了很大的打开了新的方向,然后我觉得可能 Claude Code 也是一个这样级别的产品,对。
Claude Code 和 Claude on Work 都是 Boris 吗?
我不知道 Claude on Work 是谁做的。OK。我已经离开了。
行,那说你到了 Google deep mind 以后的工作,工作重心发生变化没有?
还是发生了一些变化的。然后我反正我自己主要在站外,就是做。ML coding 和一些比较 long horizon 的事,这两个事其实刚才都大概提了一嘴, ML coding 其实它主要就是想要实现刚刚说的这个完整的 AI, 自己研究自己的这个历程。那当然这个过程当中有很多实际的问题,有很多实际的细节要去解决。我觉得大的方向上来说,大家其实是比较有共识是该怎么去做,但是还是回到细节,就是细节上有很多要处理,比如说怎么样去选取合适的 data, 怎么样去还选取合适的回馈信号。以及它又带来新的基础设施的挑战,现在就是要把这些事情要慢慢摸,慢慢摸清楚。像 long horizon 就是刚才说的另外一件事,就是说想要能够实现,说这个模型能够在。
Train with finite but use as infinite.
你,我觉得想要把这个训练的长度一直变长,可能并不是单个这个训练的这个语段的长度一直变长可能并不是一个很现实的方案,但是很现实的事是你如何在有限的 context 下去做更长的工作,其实你其实去想人其实就是这个样子,人的 context 其实很短很短。你现在问我昨天晚上吃的什么,我是一点也想不起来了。你可能还能想起来,我是一点也想不起来了。因为什么?因为它对我现在这个场景来说不关键,对吧?就是我现在知道昨天晚上吃什么又能怎么样?所以我选择把它忘掉,所以人本质上 context 是很短,但他能够选择性的遗忘,然后让他选择性的对去 retrieve, 就是去把这些重要的跟当前场景相关的信息再抓回来。
对,所以说我觉得那个可能也是一个对我来说很有趣的这种方向,这两件事其实是有点相关,有点互补的。为什么?就是说这两个事其实都在模型使用工具和环境,以及不同的模型、不同的人交互的这个大的范畴内,在这个范畴内大家最过去完成的那个节点就是 agentic coding。就是又是工具,又和环境,就是虚拟机虚,或者你自己的电脑做交互,然后。
这个事其实它横向就会长出不同的使用场景,作为 AI research 其实就是横向这个场景里的另外一个场景,这个场景它其实不仅横向上是一个新场景,它在纵向上也让这个事情的尺度变得更长。因为你可能完成一个一个代码的补全之类,是一个很快的事,但你做一个完整的 AI 研究,或者做一个这种计算机科学的研究,那是一个很长的过程。对,所以说它其实就是像一个 T 字形一样,就是横向也有延展,纵向也有延展。对。
Long Horizon 是不是还是个科学问题啊?
有科学问题,也有工程问题,我觉得它的科学问题更多的是怎么把不同的方案尝试一下,以更科学的方式尝试之后来找到一条最后我们要走的这个方案。
这个有哪些方式啊?
我可能不能太说太细的,但是粗的来说,从有一些方案是从 pretrain 的角度。从预训练角度来说,有一些方案就是类似于这种。稀疏的 attention, sparse attention, 这个比如说 DeepSeek 也有一些工作,学界也有很多工作,从后训练的角度也有后训练的方案,比如说像外界,比如说你每天用什么 cursor 这些,他们就是很强的 context management 管理这个 context 能力,比如说他可以让这个模型去选择,诶,我把这个中间某一段觉得不重要就扔掉了,那一段重要就存在某个文件里,到时候再取回来这两种大的来说,这两种方案都有人在研究。
当然他具体实施细节是不止我刚刚说的这些例子,刚刚说这些例子就是比较公开的例子,是具体实施细节,当然就每个公司还有自己的小秘密,当然我觉得其实也就是一最终也都会,大家都会互相知道的。然后我个人是比较花很多时,更多更多的时间在候选人的这部分。的方案上,因为当然首先因为我自己本来就没有花正式的工作时间在预训练上,预训练对我来说更多是一个就是兴趣,我想学习的事。但是我自己其实没有在那上面做太多的工作。另一方面是我觉得后训的这个方案其实更符合我自己对这个事的理解,就我对这个事的理解就是刚才一直在说的这件事,就说能不能用短的 context 去训练,但是它能做长 context 的事,预训练这些方案其实本质上还是需要你有长 context 训练。
它需要数据里有。
对。所以说,所以它不太符合我对这个问题的哲学。对。
所以你现在看可以吗?用短的去训练长的。
我觉得可以是一定可以,但是我们不清楚哪个方案最有效。
Gemini 的长文本做得很好,好像为什么呀。
有些技巧,,有一些让我很惊讶的技巧,。
这是预训练的事,是吧?
长文本做得很好,一定是两边都有的。但是我只是说对我来说,预训练那边那个技巧还是挺让我惊讶的。
对, OpenAI 做的没有 Gemini, 好在长文本上。
但是也有说法也不一样,就是有些人也说 Gemini 3 这一代长文本反而变差了一点之类的。对。
Again 你加入 Gemini 的时候,感觉大家对 Gemini 预期不高。
没,我对 Gemini 当时预期已经挺高的了。
你那是几年几月?
我是 2,就去年的 9 月底,那个是 Gemini, 放 Gemini 3 之前。
你对它的预期高。其他人呢。
我觉得业内的人当时对 Gemini 都还是印象不错的,就是我觉得。
之前一直觉得 Google 很有危机,在 OpenAI 的冲击之下。
我觉得大家的感知可能在 Gemini 2.5 这一代。产生了变化。因为 2.5 是一个明显,你能看出来 Google 开始上道了,当然之前就是 Gemini 的 1.5,也有一些就是小的事情,某一个具体的方面做的已经算很强了,就是很明显它已经不是很落后,但是 2.5 是真的一代,就是我觉得开始有人开始用的模型。反正我自己其实也用过 2.5,用的挺多的。
你是看到 2.5 去的 Gemini。
我去, Gemini 跟这没关系。主要还是我知道 Gemini 它大概是一个什么样的氛围,就是有很多人在做不一样的研究。我也知道一些人其实做的研究很有意思,很多 Gemini 工程师我觉得技术是非常强的,我觉得我是从他们身上学到了非常非常多。对我来说那是原因,但是我觉得从大家的感知上来说,可能我觉得业内的人在看到咱们的 2.5 之后,就可能就已经意识到了,说咱们是要赶上来了。对。
那对你来说,是不是你加入了 Gemini 的一个信号,是吧?
不是,我加入它的一个信号。
那你为什么加入 Gemini?
那就是刚才说的就是主要是因为我当时想做事,其实我想要去有。
但你知道 Gemini 人强,对吧?
那个是因为就是他们来找我的时候,肯定会,也会让我去和他们的人去聊嘛?那从聊的过程中其实是能够,其实能看出来状态怎么样的。
是他们来找你。
对,但是我觉得最后就变成双向奔赴了,所以,。
你当时 OpenAI 不是选择吗?如果你想从 Anthropic 离职。
对, OpenAI 也是当时的选项。
OpenAI 当时应该还是比 Gemini。从势能上要强在那个时候。
但是。
不过那个时候是不是各种内部的内斗开始出现了?
我觉得对,就是 OpenAI 确实也是我当时一个选项,当然还包括像 xAI 之类的。我觉得 OpenAI 最后没有去的一个主要原因还是我对它的文化,至少当时来看,我对它的文化是有比较大的担心的。就是我觉得用粗话来说就是感觉踏实做事的人没有 Gemini 多。也更没有 Anthropic 多,对。这个我很 care, 。
对。所以一种文化和人的亲近感让你去了 Gemini。
对,在。
然后你又赶上了到 3 的那个转折点,是吗?Gemini3 应该对他来说是一个很大的转折的一个时期,是吗?
我觉得从实际的效果来说,我觉得是两件事让 Gemini 产生了一个大的转折,就变成了一个市场里举足轻重的 player 的玩家,是 Nano banana 和 Gemini3 两件事连着。就是。你,我觉得如果只有 Gemini 3,可能也不会有现在这么好的效果,因为当你的市占率连 10%都不到的时候,你这个模型好一点坏一点,其实等它传播出去就是太慢了。
但是 Nano Banana 做到了一件事,首先市场上这件事很爆款,大量的人去下载了 Gemini 的 APPGemini 3,又紧接着放把这个部分留下来了。所以现在它就变成了一个举足轻重的玩家,觉得可能就是没有 Gemini 打这么一拳,那。其实 OpenAI 的位置很爽,就它市占率已经高到。你其实模型上干点啥,对他来说可能影响都没那么大。甚至说实话,我觉得就是真正普通人用模型的时候,对于模型的这个能力的感知其实是很弱很弱的,绝大多数人甚至都不用 o 系列模型,绝大多数人都用普通的展那个 GPT 的。对,所以说我觉得对于咱们来说,这个一个拉到保纳把量打起来,然后咱们仨又把人留回来是一个很关键的事。
他有事实上抢走多少 ChatGPT 的用户啊?
我不知道现在具体的比例。但是我的感觉是 Gemini 可能市占会在 20%左右吧。但是我确实没有仔细去检查过现在的数据。
这是从事后归因来看,这两个因素共同促成了 Gemini 今天对于 OpenAI 的冲击,但你从内部视角肯定能更前置的知道为什么发生了什么, Google 会有这样的变化。
对,我觉得首先就是 Google 的这个技术储备一直是够。
人够。
对,人一直是够的,然后。组织上来说就是后来变得越来清晰了,有一个更好的框架来让大家干一起干这个事了,所以说可能会慢慢慢慢有些进展。对,然后我觉得从某种意义上来说,我作为一个局外人,从某种意义上来说,我觉得 Open 还是救了 Google 一命。就是因为大家以前一直都担心说这个聊天机器人会不会完全把搜索取代掉?对。如果这个事真的发生了,那 Google 其实很难受。对吧?但是好在就是 OpenAI 先把这事做了,然后让 Google 意识到了这个事很重要,但是他这又没有把这个事做到底,没有把这事做到极致,又完全没有完全把 search 搜索干掉,可能就吃掉了一些份额,结果让 Google 自己把聊天机器人也追上来了,那现在难受就是他了。你要万一,比如说有一个公司,就假如说虚,在一个虚构世界,有一个公司不仅做了 chatbot, 而且还一路高歌猛进,越做越好,真的把你。一把就把你搜索吃掉了,完全没有给你反击的机会。那就很难受了。
那 ChatGPT 没有吃掉搜索,是因为 OpenAI 干的不好还是为什么呢?还是因为这个形态干不掉搜索?
我觉得两方面其实都有,就是说首先目前的 ChatGPT 这种交互方式其实不会完全吃掉搜索。因为它比搜索强,就像刚刚最早时候说过,它比搜索强的一点是说它有很强的交互性,你可以追问,然后你可以把它可以帮你把一些很复杂的信息去浓缩。这是它很强的地方,所以这部分使用场景它确实会把搜索的人抢掉,但是搜索里还有一些非常愚蠢的场景,就是你有一个特别简单的事,你根本不想浪费这个时间在聊天机器人身上。比如说我就搜买大米,我就一搜买就完了,我还非得去问 ChatGPT, 我还得非得问哪个好,然后它还在那转圈转半天,然后给你个链接,你再一点,再跑到网页再去买,对吧?没有那个必要。所以说,从事实的使用上来说,它目前的形态并不足以把搜索完全吃掉。对,然后。当然从另一个角度上来说,他可能在聊天机器人这个事情上也没有做到登峰造极,就他还真的让别人让 Google 把他给赶上了,那就是他自己的问题。
现在还不算赶上在产品上。
我觉得在产品上不算赶上,但是在模型上已经是赶上了。
但是要投资人投 OpenAI, 他们会说他们下注的时候是认清楚 OpenAI 其实是个产品公司的时候,它的护城河其实是产品和品牌。那从今天来看的话,似乎 Google 还没有在这件事情上能够。不能说超越 OpenAI, 赶上 OpenAI 吧。
对,就是我觉得这其实是,反正这都是我作为一个局外人观察者的视角来说,就是。
你今天是点评家。
观察者的角度来说,我觉得 Google 传统上在产品就是有点慢,是一直都比较慢。然后所以你说 OpenAI 会不会在产品上有优势?我觉得是有可能的。对,然后。那 Google 特别擅长的一件事是什么?是找到一个极为简单的产品形态,大家都长一个样,它就疯狂给你卷技术,你就卷不过它。对,所以那个事是 Google 擅长的。
因为搜索引擎就是这样的一个事。
搜索就是一个典型的就是大家都是一个框、一个键,但它就是比你搜的快,搜的比你准,你一点拿它一点办法也没有。所以这个为什么就是我感觉就是一直以来 Google 都处于一个做的很好。华尔街都不太认可的状态,就是大家总觉得。这公司壁垒到底在哪?也没有什么产品的巧思,也没有什么留存的机制,但是他就活到了现在。
所以他技术好的原因是啥?
我觉得还是。就人好吗?我觉得还是氛围,就说是一个特别重视,以前就是特别的重视工程师,后来就是特别重视研究的这样一个氛围。
所以他很适合那种通过技术能力溢出的产品能力。的产品。对。如果从这个角度来看的话,那你觉得 OpenAI 的位置是稳固的吗?现在?
我觉得现在谁的位置都不稳过。对,我觉得就是 AI 的形态还有很长的路要走。没有到什么终局之战这个地方的感觉,对。
感觉国内已经有点这意思了。
对,我不理解,就是。为什么不理解?我很费解,就是。
那国内觉得我们在争夺一个 Super AppSuper APP, 就是此消彼长的呀。
我觉得 Condition on 聊天机器人这个事就是 Super APP。那可能可以争夺一下。但是问题是你这个形态是不是 Super APP 的那个形态?会不会别人就是哪天出了一个完全不一样的形态,然后你的功能变成了那个东西的一个子集?
这是很有可能的,是吗?
我觉得我没有什么,我觉得我看不出什么不可能。
为啥 ChatBot 不是那个终极形态,但是这么多年我们也就看到这个了。
对,就是。
都是一个对话框。
我觉得我在这个事上我确实没有什么,没有什么理性或者量化的标准来说明更多的是你觉得这事很蠢,就是这个模型明明有那么多的能力,但居然用的方法是 ChatBot。就是不太 make sense, 知道吧。
所以需要一个产品经理来解放一下模型的能力。,人类到现在只通过 chatbot 去跟 AI 沟通,让你觉得很蠢,是吧?
很蠢,就是。
那应该用什么去跟 AI 沟通呢?
没想明白,要想明白我就干了。
你没有告诉我 Google 内部到底发生了什么变化?然后有了外界看到的它模型能力的突飞猛进。
对,就是刚才说的就一个,我觉得组织上更清楚了,然后组织上一旦清楚的话。
组织变化了吗?
对,尤其像预训练现在变得非常非常清楚,就是谁负责什么事情,然后每一个点、每一个这个节点上谁是负责。这些事情都很清楚。
以前是混沌的吗?
以前最早时候很乱,我没有最早时候在那待过,但是就是同事,根据同事或者我以前认识的人的描述,以前还是更混乱一些的。然后现在就是至少预训练也是变得非常清楚,然后加上这个 Google 一直有的这种就是比较强的技术背景,然后他做事也比较系统,所以觉得预训练在 Google 是一个非常可控的事。可预测的事,你能够知道下一代。不会差。然后可能你还会知道它会有多好。
对,通过 Anthropic 这种自上而下的管理它也不错。那 Google 是这种自下而上的,它依然是自下而上的,是吗?
它比以前肯定要更自上而下了。比起最早的时候。但是它比 Anthropic 来说还是更自下而上了一些。
就好像不同的文化都可以,是吗?对,就是。对于模型的训练来说。
就我觉得大公司有大公司的打法, startup 有 startup 的打法。
所以大公司是以你刚才也说它是一个完全不一样的叙事,它是一个不一样的方法。Google 是什么方法?现在?
我觉得 Google 更多的说是像这种比较确定性的事,比如说像预训练已经是一个比较确定性的范式了。那可能 Google 就会更像把它做成一个工程项目工程, Google 的工程管理能力又很强,所以说它就能慢慢把它做好。
什么叫工程项目?
工程项目的意思就是你其实是非常 top down 的一个组织,很清楚我们下一阶段要做的是什么事情,去做这个事情中间需要有哪几个节点被处理掉。哪怕是做研究,也是说就是有一个很清晰的框架,告诉你怎么去验证你的结果是好是坏。evaluate 你的结果是好是坏。
对,所以这个是 Google 很强的事情,在过去的任何的一个大的工程项目上,所以说就是预训练,其实我觉得就是现在进入到 Google 的舒适区里了。然后训练当然就是有很更多的不确定性,那可能后训练现在来说还是更 bottom up 一点,就大家可以更广泛的试对。
你说 pretrain 也是一种 RL, 为什么这么说?
就是我觉得就是你很难从纯技术的角度。说 Pre-train 预训练和或者说监督学习 SFT 和 RL 的本质区别是什么?因为预训练和 SFT, 但是预训练和 SFT 本质也没啥区别,就是你无非就是把你拿到的那些数据当成你的 Ground Truth。然后你就把那个当成你的 Expert, 把那个当成你的专家输出,然后你朝那个专家输出的分布上靠强化学习可能就是更宽广的一个级别,一个级它就是说我。
首先就是这个本来输出的东西也不是一个给定的专家,而是我自己产生的一些东西,我里面又有好的结果,又有不好的结果,我好的结果要往上靠,不好的结果要远离它之类的这样的东西。所以说从某种意义上来说, Pre- Training 和 SFT 是强化学习的一个子集,但是这两件事确实在现在这个时代是有区别的。它我觉得对我来说它的最大区别在数据上就是 Pre- Training 的数据更多的还是要 distribution 够好,就是分布足够的广,或者足够符合你想要覆盖住的那些范围。但是数据的质量并不需要非常非常的高,但是后训练就反过来就是说它分布上来说可能要远窄,但是它在有的那些数据质量上会要求非常高。对,所以我觉得目前来说,对我来说它俩最本质区别还是在数据分布上的区别,而不是在算法或者训练范式上的区别。
那像不同的 lab, 它是怎么分这个组的呀?预训练和后训练有不同吗?还是都一样?
Anthropic 和 Google 比较类似,两个都是,就是预训练一个组,然后训练是后训练一个组。OpenAI 可能比较混沌。最早的时候,我一开始的时候他是分三个组,他有预训练,他还有强化学习,就是 Strawberry Strawberry 组。他还有一个 post training 组,我没在那干过,但是我的理解是他的 post training 其实是不是他的那个 RL 组?就 Strawberry 和他的 post training 其实是别的公司的 post training 和产品。然后他可能是以一种不一样的方式给他切了。
他把后训练当产品做。
就是他的一部分后训练,其实是和产品,是在做产品。
他是不是只是名字没改过来呢?
也不完全是因为绝大多数公司的产品其实不太训模型了,他更多的是把需要的特指、模型、特指告诉训练模型的团队。但是他好像就是他的 post training, 既从某种意义上说自己又是产品,但自己又能训模型。
这是不是他对于产品的理解?就是需要?有可能。训练模型的人来做产品。
对,有可能是件好事,对。但是他后来又也这个组织变化很多次,就我现在也不知道他们组织成啥样了。
你们最近发了几个模型,我看到你也都参与其中。
Gemini 3 DeepthinkGemini 3.1 Pro。
那我觉得可能只能说是有幸参与。对, again, 就是感觉都是集体工作。
你为什么现在都变成了明星人物?然后每次都被拎出来单独写一下?
我不明白,我觉得其实不太好,每次看到之后我都感觉明天该怎么去办公室见同事呢?
会有异样吗?在办公室。
就还好,我觉得同事可能。可能还是人比较好,就是他们可能也不是特别看重这些事,但说实话,我是觉得我参与过的任何一个项目,不管是在 Google 还是在没有我都会发生,都一样会发生,效果也不会变差。我这是,我觉得大家现在是每个人都是冲浪的人,本质上是那个浪,而不是你那个冲浪的人。
浪是 AI 吗?
对,就是 AI 这个事情本身是这个浪,它会往前走,不管你冲不冲这个浪,这个浪都会拍到岸上。只是说有人可能去冲了这个浪。有人就可能晚了一点,没赶上那个浪尖。对。
好,你有幸的参与了这两个工作的什么?
主要可能就是一些有一些算法上设计的小的细节,又会一块讨论有一些数据上的东西,但是数据上的东西我觉得可能对之后的工作会影响更大一些。对。
这几个模型有范式变化吗?
我觉得没有哪个变化大,到了从不知道怎么做大尺度的强化学习到大尺度强化学习那个级别的变化。没有哪个变化大到这个地步,肯定都是会有一些小小的变化。
这几个小小的变化你们讲一讲,就这几个新的模型不能讲哦。
好。很不幸,对不起。
最近我感觉模型已经发麻了,国内一堆模型,国外也是很多模型 OpenAI 你们国内 GLM 字节 DeepSeek 一直期待还没发 Kimi 你能不能给大家划划重点啊?
我觉得从某种意义上来说都没那么值得关注。
诶,大家在争什么?现在感觉群魔乱斗。
我觉得有一些争的事情,其实现在看来已经,现在在这个时代已经没那么重要了,就是因为过去带来的惯性是大家会争各个 Benchmark 的第一名。证明自己模型的基本能力很强,这个事情其实到现在已经到了,就是公众关注那些 Benchmark 都有点打满了。
其实你想最早大家关注这个 SWE-Bench 大家都打了 80 多,幸亏没有人超过 83,因为最近 OpenAI 刚放一个 post 说超过 83 那个有的题目都是不良好定义的,幸亏没人超过谁,尴尬反正。然后大家以前 reasoning 就是打完 AIME 打 IMO, 打完 IMO 打什么像什么 ARC-AGI 这些 benchmark, 然后 ARC-AGI 可能在 GEMM3 之前,大家可能最高的都。我忘了,那时候可能十几这样子,大家觉得哇登天难, Gemini 才给变成 30 多了, Claude 4.4.5 还是 4.6 变成 4.6 应该是变成 60 多了。Gemini 算 DeepSeek 一下打到 80 多,所以这个也打满了。所以现在就是感觉光靠打这种公众认知的模型能力其实已经没啥太大的意思了。所以从这个角度来说,我本质上就是没有什么太多的重点。虽然大家发的很快。
发的快也说明其实这道题对大家所有人来说都变简单了,大家都知道弄好了没有什么秘密了已经。
就是还是这个,还是那个冲浪理论,就是还是这个浪在往前走,对。
那大家下一个可能在寻找的目标是什么?那下一个范式级的变化是什么?还会有吗?
我觉得我刚才自己聊的那两个事是,我觉得。
ML coding 和 long horizon。
对,然后这两个事我觉得是一个可能没有到范式级变化,但是我觉得是对于 Google 来说会很有价值的事情。因为首先 ML coding 是因为 Google 首先自己是一个 AI research 大户,然后它自己又是 AI research 最全栈的,就是它不仅有这些训练模型这些部分,它还有涉及硬件的部分,从硬件接到模型的部分。这一整套东西如果能被加速会或者说被更好的管理,那可能对这个公司来说是很有价值。老 horizon 就不说了,就所有人都知道,就所有人都很都都都觉得很重要。
对,所以说我觉得那个可能是对我来说,不能说是范式级别的,绝对是不到范式级别的,但是是一个我觉得是很有价值,需要去在未来几个月之内能够看到曙光的事,然后我觉得范式级可能就还是那些非更非确定性的东西,就是什么。多模态生成,那个我觉得可能会有一个英雄,或者会有一个英雄集体,,然后对,像那种可能会有一些。
还有聊比较多的 continue learning。世界模型呢。
我觉得 continue learning 和这种 long horizon, 刚刚说 long horizon 没有本质的区别。因为大家以前觉得这俩事差别很大,是因为 continue learning 会改变模型的一些权重,然后你做这种,比如说像开放开源了,大家做很多这种 context management。
是不会改进变模型权重的,但其实你想这俩事没有本质区别,因为 context 里那些词自己的 KV 不也是一种权重吗?所以说你觉得这两个方案就是以最后谁能更有用,在长久来说更有用我觉得是不清楚的,但是他们本质上都是为了做刚才 on horizon 这种类型的事情。然后世界模型,一万个人有一万个世界模型。
啥意思?就是定义不清晰。
就是,首先我不知道什么叫做一个世界模型?其次就是每个人在说他们做的世界模型时候,可能也在说不一样的事。比如说咱们俩做的世界模型可能就和,比如说像。像飞飞、李飞飞他们做的世界模型就不是一个事。对。
描述一下,区别是。
我不是特别了解像外面,像李飞飞他们这些 lab 做的事情到底是怎么样的,但是 Gemini 的世界模型更多的是一种是种 end to end 的这种级别的训练,他想要的结果是说我一个是,比如视频生成,是大家能够给定一个描述,然后生成一个视频。但他想要的达到结果是我不仅能够生成一个视频,我是能生过一生成一个场景。
什么叫一个场景?就是说我生成了这个时刻的状态,我还可以再给他一个 condition 一个条件,这个条件是我在这个状态下做了一样什么样的什么动这样的动作。然后他下一个时刻状态会变成我上一个时刻状态和动作的函数,然后他是按 turn 的去训练这样的能力的。对,所以说这个可能是一种方案,我首先也不知道大家最后想要的到底什么结果,我也不知道大家对自己世界模型的定义到底是什么,所以我觉得更多还是一种探索状态。
刚才我们一直没有聊到一个组织,是 xAI。我们刚才聊了 Anthropic, 聊了 OpenAI, 聊了 DeepMindXAI 呢。
xAI 我是聊不明白。
作为点评家来说一下。我。他们怎么最近这么动荡?
我觉得他们一直都挺动荡。那为什么最近这么动荡?我也不知道。然后我,其实我跟 xAI 接触的没有那么多,我接触的一些人现在也走了。其实我也不知道他们发生了啥。
诶,对了,你刚才说 Anthropic 的时候,他你说技术的一号位能被 make Docs 是非常重要的。那在 Google 这样的一号位是谁呀?这个英雄是谁呀?
我觉得英雄在可能在不同的阶段是不一样的人。但是英雄的背后都有一个人,就是 Sergey, 就是 Google 的那个 CO- founder。对,就是我觉得最终很多很多大的决定。可能不是由他来决定怎么做,但是最后拍板得他来拍。对。
现在也是。Demis 呢。
我觉得可能更多的在一线出现的是 Corey。对。就是 Demis 的 CTO, 然后他现在也是那个 Google 的 SVP。对 Demis 在负责什么?我觉得 Demis 可能管了更多那种就是偏 science 的事情,就比如说那个药物的 design, isomophic lab 那些事情。对。
对。佳美娜她管的不多。
至少从我的视角来说,我看到的更多的人是 Corey。
OK。
但是有可能就是那公司那个管理层的事,其实有很多很多是我看不到的部分。那就我就不清楚了。
你刚才也提到 AI 是整个是一个系统嘛。你对于怎么系统性的做 AI 有什么认知吗?现在经过了你这两年的工作。
有几方面,一方面是从整个系统来说,它需要一种比较科学的态度,就是你要清楚的像 Scaling, 就是你要清楚的理解自己做了什么样的预设。然后我在做一个改变的时候,其实有哪些因素是和它相关联?哪些关因素是不相关联的?对,这是从组织情况下来说,从人的情况下来说,其实需要人很 reliable, 需要很负责任的人。其实每一个系统、每一个评价框架都是很容易被 hack 的,因为你总可以做一些事,让你的指标看起来很好看,但是一个值得信赖或者踏实的人,他其实是会想自己做的这件事如果效果好的话,是不是。真的,比如说在大的尺度上效果好,是不是我中间漏了哪些因素?对,所以说其实把事做系统听起来是一句话,但真正做起来是很复杂的事。
就是有很多细节。
有很多阻力会因为它其实是违不违背人性的。因为每个人的人性可能都是为了让我自己做的东西能够体现的更好,但是对一个公司或者说一个组织来说,最有利的事是把整个公司的系统性做的非常扎实、非常严谨。
这个能不能举一点例子?好像有点抽象。
对,他确实有点抽象。
所以这也是你说没有那么多的个人英雄主义的一个表现。对。就人要变成一个更可信、可靠的一个,它是一个系统的组件。
我可以举一个可能也是比较鬼话的例子,比如说做强化学习,你可能可以做一个算法出来效果比别人好,但是可能最更关键问题是你要去问,比如说在真正的大大的尺度下,我是不是能够保持稳定性是一样好的。然后以及我比别人的东西效果好,是不是因为我用了不一样的 data?以及我是不是用了更多的 training 的 flow?是不是用了更多的 sampling 的 flow?我具体在真的这个生产的最后这个大的跑的这个 production run 里面,到底哪个才是我的限制因素?我该看训哪个指标?这个其实可能都是需要研究员自己对于这个系统怎么运作有一个好的理解,以及对公司负责任才能做到。
对,否则就是你很容易做到一件事,就是你可能比如说你在考虑 training 的时候是比别人好的,但你考虑 training 加 sampling 时候比别人差了。你总可以选择,你只是有 training。但这就很糟糕。对,所以这个就是既需要你个人的负责人,又需要说组织。所建立的体系里,能够能尽量的发现这些有意的或者无意的这种边界的事情。
但是你作为个体的话,你不知道怎样是对全局最好的呀。
其实是需要,我觉得如果一个研究员做不到对全局去考虑的话,他就不是一个好的研究员,在现在这个时代。就是这个和我觉得这个和你就是在学术界做 research 是很不一样的事,因为在学术界做 research 本质上是一个人吃饱全家不愁的状态,就我为我的项目负责。对吧?我为我的可重。父亲负责,但是在一个公司里,你其实更多的时候是我得为这个公司负责,对,这是两种完全不一样的心态。
那你这种自觉性从哪里来的?
不知道,我觉得我可能就是拉不下脸。
拉不下脸是什么?
对,就是你对一个公司负责任,是你和这个公司的契约的一部分。其实我觉得没什么道理不这么做。这么做是没有原因的。
所以个人英雄主义会破坏这种整体性。
我觉得如果只是为了个人英雄主义而做事的话,很有可能是会破坏整体性的。当然实际可能你能力很强,然后你真的成了一个英雄,那也是有可能。
因为你也经历了两个组织了,你觉得什么样的组织更能够激发智能?在这个时代?
我觉得其实这是一个很有争议的事,就说。因为刚才也聊了,就是不同组织可能有些比较自上而下,有些比较自下而上。那一个自然的问题说,比如说这两种组织哪个更能够激发创新?过去的观点就是自下而上是激发创新的必要条件,因为就是你得每个人有自由,自由才能有创新。但是完全自下而上,你就发现其实也不行,因为它就乱。
那就是 Google 之前的样子,是吗?
对,至少在我印象里,就是在我了解到的印象里是这样,就是它就乱,就是大家甚至都不知道我做这个事有什么用。那可能也不好,所以就可能要需要有一个人,或者有一个小的集体,能够把这两件事稍微融合一些。对。这就为什么我觉得其实一个组织运行的好不好,看起来是组织的问题,但其实归根结底是技术 leader 的问题。就是这个技术 leader 有没有特质能够把这个组织运行的很稳定?因为最好的那个状态往往都是最不稳定的那个状态就很容易往不好的那个方向塌缩的。对,所以得有一个 leader 来控制这个事。
那你觉得都是技术 leader 来做这个事情,而不是 CEO 来做这个事情?
当然每个公司的 CEO 可能有不一样的职责,但是得有一个 leader, 我觉得至少得有一个 leader, 他能有两个特质。才能去做这个事,一个特质就是说他自己有救火的能力,就不是说他光嘴上说要做什么、要做什么、要做什么,而是说有一件事真的遇到困难了,他能自己下场去带人把这个困难解决掉。当然绝大多数时候可能一个 leader 是不会有时间去做这个事,但他至少有这个能力,有第二个重要的特质,就是他得能够。理解别人就哪怕一件事,可能是他不做的事,但他能够理解到为什么别人做那事重要,能够容得下别人,那可能是另外一个小特质。对。
你觉得 Google 的 TPU 在哪些方面表现的比 GPU 更好?劣势是什么?
我觉得从纯硬件的角度来说,很难说哪种硬件真的好或者坏,尤其是在这种大规模商用的情况下,因为本质上来说, GPU 和 TPU 在使用上来说最大的区别就跑掉硬件的区别来说,使用上来说最大的区别就是 GPU 它有比较好的开源生态。GPU 没有。但这个事其实在大规模商用的时候并不是一个问题,因为比如 Google 自己用 TPU, 那自然会花时间去搭这个基础设施,而基础设施是一个你可能,比如说你只跑 1000 张卡,那可能是一个很大的负担,但你跑一个几十万张卡的集群,那搭一个基础设施也不是一个多大的事。
从实际,所以从实际上这种大规模商用来说,没有哪个孰优孰劣,但是这两个确实有一些设计理念上的区别。就比如说 GPU, 至少我可能后来这几代 GPU 没怎么用过,比如像 Hopper 那代 GPUH 系列 GPU, 它的设计是说我一个 Pod 里面可能没有多少张卡,就比如说就 8 张卡。然后这 8 张卡之间可以两两互联, NVLink 非常快,所以这一个 pod 几乎就是没什么,没有什么 communication 的 bound。但是 TPU 它可能就反过来,它就是说我抛弃了卡与卡之间两两互联,但是我能尽量的把尽量多的卡放在一个大的这个架子里边,那它就是有这种这个三维 Torus 的这种设计,所以它就一张卡就只有在三个方向,连三个最近邻的,但是它整个集群可以连成一个大 Torus。然后如果你的 compiler 或者你的 shading 的。的逻辑写的足够好的话,你是可以利用这样的东西,其实就等效来说,你会获得更大的储存空间,然后也会减少很多通信的 bond, 对。
劣势是什么呀?
我觉得一个劣势就是它肯定是比起 GPU 来说,至少在小的 skill 上来说,比起 GPU 是更加固定的一种结构,所以说它的。它的易用性或者它的通用性可能没有那么强。对。
最近硅谷有很多 new lab 出现,你怎么看这个趋势?为什么他们都出去从这些模型大厂跳出去成立 new lab?
我看不太懂,,我的感觉是绝大多数的 new lab 都会死。我我觉得就是可能有一些 lab 是真的有好的人的,像有些 lab 可能确实也开始在做一些事,比如说像 thinking machine, 它还是在 deliver 一些新的东西的。然后但有些应用 lab 就是请帮我把名字逼掉,。好。比如说我就完全不知道他们到底要干嘛,然后这俩人其实已经远离这个专业好久了。
我觉得 26 年国内会非常的看重 C 端的趋势,谁成为 super APP?你怎么看?你觉得这个好像在硅谷没有人讲这个事。
对,就是因为美国 enterprise, 就是公司或者说效率软件这个市场太大,而且利润也太高。所以说对于美国来说,其实 C 端之前就只有 ChatGPT 一家做,其实也没啥油水,没有什么利润。所以说就是现在大家可能重心都会先放在这种效率软件或者 enterprise 上。然后。
所以中美的趋势已经发生差异化了。
我觉得不只是 AI, 也就是过去的整个互联网都是都不一样,就是中国很强的就是 C 端,就是他能够想出一些诶非常复杂的产品的性质或者结构,然后用一种很你觉得很间接、很不自然的方式把这个利润滚起来。
比如说什么叫很间接?
就比如说像抖音这种东西,它并不是说你看视频,我看一个视频收你两毛钱,对吧?他说你可以免费看视频,但是我可以偷偷加广告,我可以偷偷做直播,我可以偷偷做电商,但是这个做效率软件没这个事,做效率软件非常直接,就是我让你帮你写 code, 我成本一个月 150,卖你 200,我挣 50,就是非常直接的事。对,我觉得美国在过去的体现就是在这种很直接的产品上能够把技术做到极致。但是一直没有哪个产品让我觉得就是。复杂到说让你离不开它,你又感觉不到它在挣你的钱,但它实际上挣了你的钱,对。
你这么说,我突然觉得 Meta 就应该抄字节做。
对,但我觉得 Meta 没字节强。
因为 Meta 它也找不到自己的生态位,然后美国又没有一个做这件事情的公司,就豆包这个生态位还没有人找到,那 Meta 就抄豆包它也不需要那么强的模型能力。
对,但我觉得还是美国做产品的,本质上做 C 端产品的人不行。比中国来说差远了。对。
这是过去 10 年的积累,是吗?
对。
因为过去十年在美国的正反馈都来自于做 Tob 的很多。对。
enterprises 的事情。对,或者就是在美国这地方挣钱太容易的时候,你就不会费脑筋去想怎么挣钱。
诶,不是很多人来都要找你聊聊吗?有什么好玩的人不?很多国内的人来科技公司来。
对,我觉得都挺好玩的。确实,发现国内的人做产品可能还是。想法更复杂一些。更复杂一些。对,就是想的更。这个想的这个回路更长一些。对,跟美国还是风格不太一样。
美国是。
我觉得美国就刚才说了,就是。
做个什么就拿这个卖钱了?
对,就是简单,就是这个事就是需要这个能力,有了这个能力之后就是要比别人便宜,我就能挣的比你多。拿我一点办法也没有。好。
中国呢。
中国感觉都是这种,什么一开始不挣钱,但是一旦他开始挣钱,你就拦不住他,就是他是真的能形成币那个自己的圈的。你就是他真的把那个圈转起来的时候,你再想往。一插就插不进去了。
哦,那你觉得美国公司现在看懂字节跳动没有?
我的感觉是没有。
还没有,他都这么大了。
哦,你说就是不是重视他?那肯定是重视的,就大家肯定都知道字节是一家被严重低估,从他的市值上来说是被完严重低估的公司,这是我觉得大家很明确的事。然后我觉得也很明确,就是说在消费者市场这一端,其实我觉得没有哪个美国公司能和字节竞争的啊。但是它毕竟是家中国公司,至少从公众的公众意识上来说,它毕竟是家中国公司。对。
所以看懂它了吗?
我不觉得大家看懂它了,但是你看 Meta 其实也在主动的从字节挖人嘛。
你在 AI 行业有什么偶像吗?或者欣赏的人?虽然你在 AI 行业很短。
没啥,我感觉我来这行业的时候,个人英雄主义时代已经过去了,所以也没有什么英雄。有时候你甚至觉得旧时代英雄有点蠢。对,所以说真的没有什么。
你觉得谁比较蠢?
这个还是不说了, no comment。对,我觉得和做物理时候还是不一样,我觉得做物理时候还是存在着一些我觉得真的比我聪明太多的人。比如我读博的时候,我那个年轻老板就是我觉得他 Doga Drukker, 我觉得他就比我聪明太多了。我觉得他。可能也是看到他,我才觉得自己待在那个领域也没什么用。有他了还要我干嘛呢,对吧?
得跑到 AI 来降维打击一下,是吧?
也没降维打击,但是反正就感觉 AI 这个事本来也不太需要脑子。
不太需要脑子。
真的不太需要脑子。那需要什么?我觉得这个行业就是最重要的特质就是靠谱,就是做事细,然后对自己做的事负责任,这是最重要的特质。你说那些东西有多需要脑子?我觉得都是一些本科生就能干的活。
可是你说 AI 没有个人英雄主义,现在一个 AI 研究员的价格炒得多高?跟球星转会一样。
我不知道是好事还是坏事,对我个人来说我当然很高兴,我受益于这个,对吧?但是实际上来说,我并不知道这个事是不是一件好事。
你觉得为什么价格会变得这么高?
我觉得可能一方面是大家觉得这个事很稀缺,但是它实际上可能确实也没那么充足,就是因为训练一个人,虽然这事没那么难,但是你训练一个人是需要一个环境的,就你得有那个机会去接触这件事,你才能学会这件事,你没有那个机会,你就是再聪明也没用,那可能过去能撞到这个机会的人没有那么多。所以说在市场上来说可能是比较稀缺,从这个角度上来说。但是我觉得另一方面也是可能对人的炒作有点过分了,对。
非常喜欢神话个体现在。
对,我觉得真的就是再说一次,这是个集体主义的事。
那很多人也会很好奇。因为可能很多公司也想招 AI 的人,那你觉得最重要的他是要靠谱,这个有什么衡量指标呢?就怎么能够快速的判断一个人靠不靠谱,做事细不细?
每个人都有一些自己衡量的方法,我当然也有一些自己的 trick, 我以前反正有出一道面试题,那个我可以大概讲一下,这个应该不涉密,所以我也可以应该可以讲。那面试题其实很简单,就是说我需要这个人在 24 小时之内。完成一个强化学习的项目,从 0 到 1,就是他要自己去选用什么样的模型,我告诉他他有的资源是什么样的,他自己选用什么样的模型,用什么样数据,用什么样的算法把这个模型训出来,24 小时之内我给他,让他 24 小时去完成这个事。然后 24 小时结束之后,他会跟我有一个小时的讨论,这个事其实在 AI 时代没有那么难过,没有 AI 时候这个是不可能的,没有人通过 24 小时之内把它做出来,但有了 AI 之后其实特别简单,因为 AI 能帮你全套做,但为什么还要做这个事?有两个原因。
有很多原因,其中设计成这样的两个原因,一个原因是因为我觉得在这个时代去,还去考察别人,比如说代码写的好不好其实没用,因为绝大多数人都不用自己写代码,他更重要的是他能不能有效的利用 AI。那这个事一个方面是考察这个问题。第二方面是这个事其实有一个陷阱,就是如果你全盘让 AI 做了,但你最后没有试图好好理解 AI 为你做了什么,那在那一个小时的讨论里面会露馅。那是一个,那个是一个会挂人的地方。对,所以说那个考验的另一件事就是说你有没有真的和 AI 形成了协作?还是说你就全权扔给他了?那个是我,我觉得我个人很看重的事。那个其实也是,他就是这个人是不是做事靠谱的一部分?当然这个题目的设计本身也有一些比较阴暗的巧思,就是说为什么设计成 24 小时,就是为了看这个人有多看重这个机会。
可能熬夜。
对,如果他足够熬夜,他就能撑住这 24 个小时。如果他撑不住,那只能说他可能对这个机会也没有那么看重。
诶,那对于比你更年轻的人,你觉得他们现在来 AI 还是一个很蓝海就是很有机会的地方吗?
我觉得纯做语言模型已经不是一个蓝海了。我觉得晚了,就是末班车已经发车了。
末班车已经发车。末班那班是哪一班啊?
我感觉我入行就是那个末班车。然后可能有,确实在我入行之后,当然还有我些新的人,但我觉得他们就没有机会能接触那么好的机会了。就是能在一个还没那么小、没有那么大的团体里做一件事情。他们可能就很少能遇到这样的机会了,对,然后但是我觉得就是 AI 它是一个很大的方向语言模型,只是其中的很小很小一个部分。
还有很多别的事情,比如刚刚说的多模态生成,那可能还有很多机会,机器人那可能更机会更多,对吧?然后包括更夸张的,就是有,比如说你能不能用 AI 去帮助一些真正的科学问题,比如说帮助这个做量子调调、量子调控之类的,那可能就是更蓝海,那都是 blue sky 的事了。对。所以说我觉得。对于足够年轻的人来说,可能做现在最热火的事并不是一个正确的选择。做现在没有人做到的事,可能更多的是一个好的选择,对。
你自己未来会怎么发展?你会在 Google 很久吗?
我觉得应该不会。
这么公开的说吗?
我觉得应该不会。我觉得我还是会尝试去挑战自己的。对,然后。
要折磨自己。
对,要折磨自己。对,但是我就是可能需要找到一个值得折磨我自己的事。
如果 AI 不是本质的难的话,你会不会做的觉得无聊?你对你的挑战在哪啊?
我觉得它虽然不难,但是你知道和不知道还是有一个 gap 的。就是你从完全没不知道这其中细节,到慢慢理解这其中的细节,理解它怎么运作的之类的这些事情我觉得还是需要花时间、花力气的,然后当你理解之后,我觉得对这个事也是会对你未来做,比如不管你是做产品相关,还是说往往别的 AI 的方向去发展,我觉得都是长期来说会有帮助的。
你未来想在哪里去发展?
我觉得都有可能。没想好该怎么折磨自己。
你不应该不会再跳去另外一个公大公司了吧?
应该不太会了。
你觉得你在 Anthropic 上学的和在 Google deep mind 学的有什么不一样?
我觉得还是挺不一样,我觉得在 Anthropic 就是你可以把一个事了解很,把一条线就是 language model 这条线的方方面面的了解的很透。他给你这样的机会,然后在 Google 它更多的是一种横向,就是它有很多不同的方面,有不很多不一样的人,然后也能见到不一样的视角,也能见到不一样的研究方向。对。
就是你都可以看见。对。Anthropic 是因为它。BAT 的足够的坚定。对,所以你能理解的更纵向。对。你有想过用 AI 去解决物理问题吗?你们那个。
有人在干。理论物理嗯。有人在干,所以我觉得不需要我去干。
你对这个没有本质的兴趣。
我觉得这个事就是首先我觉得目前对我来说不是最高优先级,我觉得如果哪天我觉得我把我手上最高优先级的事解决了,我又没有找到别的事干,我可能会去干这个事。
你现在最高优先级是什么?
我现在最高优先级是,就是把我刚刚说的这两个事情能够。
ML coding。能够把它。Long horizon。
把它至少推进到一个和同事能够把。推进到一个比较我觉得比较稳定的状态吧。那个我觉得是我的最高 priority, 但是可能之后也会有别的 priority, 但是自用 AI 做物理,我觉得是一个已经有很多人在试着做的事,多一个我不多,少一个我不少,不如就让别人先干。
你有特别崇拜的物理学家吗?也没有。
有。那有。但是有点多,不知从何说起。
物理学家有人工智能科学家没有。
但也是跟人的成长经历有关吧。就我觉得就是。一个成年人是很难真的崇拜一个人的,那一个儿童可能会。
崇拜过谁啊?
我觉得就物理学家其实还是有很多就真的挺强的,当然就是大家都说的那种,什么 100 年前那种人就不说了,就什么什么爱因斯坦、海森堡这些就不说了,然后包括大家后来都知道的什么像范皮阳,就是杨振宁这些也都不说了。然后像我之前做拓扑逻辑体系的时候,其实有一个他后来也拿过奖,就是那个霍尔丹,就是你会发现这些人他。他有些异常的远见,就是他在他那个时代显得格格不入。但是你看好蛋,最开始做好蛋 model 和这些分数、量子或者相应相关的事的时候,离最后大家搞明白这些拓扑物态过了好几十年。
在那个时候他能够觉得这事重要,然后一直在自己在推进这事,我觉得这是一个很不容易的。当然我觉得你要非要在人工智能找一个类似的人,我觉得可能 Jeff Dean 是吧?就是在大家都觉得这事吧。可有可无或者不那么确定的时候,他一直在这个方向做。那我觉得这可能是一个英雄级别的人物。
在他之后呢。
AI 吗?AI 在他之后我觉得可能也有一些英雄的集体,就是比如像 Transformer, 就 Noam Shazeer 和那些 Ashish VaswaniNiki Parmar, 他们那可能是一个英雄集体。对。
但你讲过一个特别让我印象很深的话,我在这个行业又没有什么导师,又没有什么旧友,我想喷谁喷谁。
这可能就是不做 AI 的好处,,不做 AI 出身的好处,对。就是真的没有什么负担,就是没有哪个老的是你的亲属,所以你觉得他傻,他就是傻,就可以直接说他傻,没有无所谓的。
你以前也这样吗?
我觉得我做学生的时候还挺收敛的。但我后来发现收敛没用,对自己也没好处,对别人也没好处,还是更直接的表达自己的想法是最关键的。我觉得直接表达自己的想法是一个短期一定会有人恨你,但长期大家会欣赏。事情。
哦,你最近听谁说话?特别蠢?
把这个名字逼掉,谢谢,我亏你是挺蠢的,而且蠢的始终如一。
他有没有可能是那个对的人呢?
我觉得他说的话用 Pauli 的话来说就是 not even wrong, 因为不良好定义,你很难说他说的是对是错。对。就是有一天可能有一个不一样的范式发生了,他就可以跳出来说,诶?我当年说过这个,但是你就发现可能如果范式是另一种状态,他也能说一样的话,这就是我为什么很讨厌这种很模糊的人的原因。因为一个事模糊就是没有意义的,对。
你为什么觉得他说话很模糊?没有正确定义?
就是。
是一种模棱两可。
如果他有正确定义的话,我可以解释他为什么有正确定义,但他没有正确定义的话,我没有办法解释他为什么没有正确定义,因为他真的没有正确定义,。我觉得起码就是还是一个很良好定义的事,就是他是要做。然后他的方式可能更偏这种更传统的这种 new network modeling 的方式,而不是更 end to end 的这种方式,我觉得至少他是良好定义的,至于他是对是错,那我觉得是未来会检验的事情,对。
就大多数老登其实都还好,就是我觉得人年纪大了不一定会变成老登的。人年纪大了会变成两种状态,一种。状态叫做德高望重。就是他会可能少指手画脚,还会花自己的力气去培养年轻人。另一种人就是老登,就自己也不懂,还爱指手画脚。所以人老了不一定会变成老登。
你是受了谁的刺激啊?
我也不知道我受了谁的刺激,但我确实见过不少老登。
你是从什么时候变化的?就是说话非常直接,开始不收敛了,就是你过去都是这么想的,但是你不说。
我觉得我过去可能也。会比较直接,但是没有这么直接,但是做了 AI 之后就更直接。
是没有束缚,是吧?
一是没有束缚,二是这个领域足够客观。就是你其实不用太担心因为自己的观点而惹到什么人,只要你的观点就是自洽的,就是你有一套自己观点的理论,你不是说随便喷人,那肯定是会惹到人。但是你是有一套自己的理解,我觉得其实大家是会尊重你的,因为最终你在这个领域做的怎么样,是有客观的评价标准的。
好,我们每个嘉宾都会推荐一本人生之书。要这本书真的对你产生过重要的影响,你要说的这本书是什么?
这是今天最难的一个问题,我感觉你还是高看了我的文化程度。,我真的没有什么人生之书,说实话。真的没有什么。
最近读了一本书。
最近。
上课,上次那个季一超说的是线条小狗。
最近读的书就是汤川的自传,汤川秀树的自传。吕人。对,然后你要非要说就是可能有印象的书,首先我这人确实不爱读书,我感觉就是我这人文化水平比较低。,我读的书除了专业性的书之外,所有的书感觉都是闲书。像什么汤川的自传,其实本质上也是本闲书,但是我觉得写的挺有趣的。你能看到一个后来看起来如此成功的科学家,在他年轻的时候有一种挣扎感就很真实。对。可能就还有一些什么闲书,像小说之类的。有本小说我很喜欢,来自新世界,是一个日本的小说。对,我觉得你要非让我推荐闲书的话,我可以推荐那个。对。
你最近有看什么电影?什么电视剧?玩什么游戏?什么都没有。一个全球范围内你喜欢的食物。
寿司吧。
一个全球范围内你喜欢的地点。
全球范围内喜欢的地点,我觉得现在你要非让我选,我可能会选夏威夷,因为我很喜欢海。对,但是也很难说,因为之后我可能去了更多海的地方,就另有新欢了。
一个少有人知道,但是可能需要知道的知识点。
别相信老登算吗?
你有迷信过吗?
我本质上没有迷信过,但是我觉得有些时候可以靠迷信来安慰自己。
或者说你有迷信过老邓吗?
迷信老邓啊。
从来没有吗?
真的没有。好。但是我以前可能没有这么恨老登,后来就变得越来越恨老登。为什么?可能就是当你自己有越来越多判断的时候,那些蠢的人就显得更蠢。
那他们也没有伤害你,为什么会恨他呢?
我觉得就是厌蠢症,每个人都有厌蠢症。
你的 MBTI 是什么?
不知道。
为什么这些年会有一个对于,就是年轻人,对于年龄大的人这么不友好的一个词出现?它的来源在哪里?
不知道,没有研究过,可以问问 Gemini,让她 deep s research 一下,看看老登这个词是哪来的。
那你心目中影响 AI 进程的几篇论文?
Sequence to Sequence 是一篇,那个我觉得是 Language model 在 feature engineering 时代的高峰。Scaling Law 是一篇,就是 Jared Kaplan 他们。在 OpenAI 的那篇 Scaling Law 是一篇把这种体系化的研究方式引进到这个领域的一篇。当然最后实际上 Scaling Law 的做的方法可能它那样并不是正确的,但是第一篇。把想法引进来的,我觉得这很关键。
基于你当下的认知,一个关键的重要的 bet 是什么?
long horizon。
我们工作室叫语言,即世界工作室,第一次听到这个名字的时候,你在想什么?
我觉得这个名字有点正常的,太平庸了。可以。对,其实我觉得名字是一个,可能放在十年以前是一个很。很独特的视角,那现在可是主要大家共识太多了。我觉得 10 年以前确实就是。可能现在不止 10 年。对不起,我感觉我年纪也大了,可能不止十年了,就是可能在就是什么 1415 那个年代,大家都会觉得视觉是最重要的事,在那个时候我觉得意识到语言是承载智能的重要载体的人,可能是一个不一样的事情。对。
不过我觉得我们这个名字不是在 AI 的语境里面讲的。
那就值得深思了。
好。好了,今天的节目就是这样,这里是商业访谈录,是一档由语言及世界工作室出品的深度访谈节目,你可以到公众号关注我们的工作室,获取更多的信息。我们的公众号是语言及世界 Language is world, 我们希望和你一起从这里探索新的世界。
We' ll explore the new world from。