Matthew Berman · Interview · 2026-08-24

How to Understand the Next Wave of AI Before Everyone Else

Tibo Sottiaux 访谈 · 在所有人之前看懂 AI 的下一波

Tibo(Thibault Sottiaux)现在管着 OpenAI 的核心产品——API、agent 基础设施、 企业版、整个 ChatGPT,以及 Codex。这场 44 分钟的对话里,他讲了为什么 Codex 和 ChatGPT 必须合并、为什么十几个 agent 并行是退步、递归自我改进实际发生在哪一层,以及那个没有审批 流程的「重置按钮」是怎么来的。

来源:YouTube · Matthew Berman 时长 44 分钟 本页为要点精读,非全文转录
TL;DR · 速读

OpenAI 核心产品负责人怎么看接下来 12 个月

  1. Codex 两三个月后就会显得原始

    "Codex will seem primitive in two to three months. We're about to go through another major evolution. The next generation of models need more than your laptop."

    "I'm going to start with another one of your tweets because you know these are bangers."

    笔记本是按人的产出速度设计的,模型没有这个约束——所以下一步必然是云端。

  2. 笔记本本身成了瓶颈

    "The amount of work that you can do on a laptop — it was designed for humans."

    "Another thing that you realize when you have very very powerful models is that your laptop kind of becomes a constraint in and by itself."

    开多少应用、打字多快、能想多快,都是人的约束。模型同时开一百个应用没问题。

  3. 够快之后,瓶颈不再是模型

    "Any kind of overhead in the stack becomes the limiting factor."

    "When you have token speeds that are 14 times faster than what fast is, the bandwidth constraint changes — the CPU now becomes the bandwidth, literally tool calls."

    14 倍 token 速度之下,工具调用和网络往返成了新天花板。解法是同时做多件事,把瓶颈挪走。

  4. 十几个 agent 并行不是进步,是认知负担

    "What I was doing before, multitasking like 10 agents — I don't want to really go back to that."

    "I find myself kicking off 10 15 agents in parallel and that becomes a pretty significant cognitive overhead for me, that context switching."

    够快之后你待在心流里,不用来回切上下文。Tibo 把这个目标叫「对你的注意力友好」。

  5. 合并 ChatGPT 和 Codex 是模型逼出来的

    "Our future models want us to be merged."

    "The feedback we had initially was like, why do you merge them? Do you really have to do it?"

    同一套技术、同一个 harness。界面该按人自适应,而不是让人先声明自己是不是程序员。

  6. 「工程师」「设计师」只是人类发明的抽象

    "These are just human concepts that we have invented to deal with abstractions, because the reality is too complex for us to handle."

    "There's a spectrum of people. But individuals are individual, they have their own, they're somewhere on the spectrum."

    终局是你和你妈用同一个界面,它按个体自适应,而不是分技术版和非技术版。

  7. 他不看竞争对手

    "I don't tend to look at the competition that much. I really look at what can we do uniquely well and what are our values."

    "There was a period of time in which Anthropic was kind of sucking all the oxygen out of the room. What's your read on the market today?"

    Codex 当天宣布 2000 万用户,增长曲线由平转垂直。他把功劳归给合并后借上了 ChatGPT 的分发。

  8. 重置额度没有审批流程

    "It's not done in partnership with marketing or finance. I can press the button whenever I want, whenever it feels right."

    "There isn't really a whole lot of scrutiny behind it."

    起因是自己把服务弄挂了要补偿用户,后来成了一种文化。现在真有一个实体按钮。

  9. 递归自我改进在发生,但不在大家以为的那一层

    "What we are seeing a ton of success with is using those models to develop the infrastructure that is on the critical path of using those models."

    "Recursive self-improvement is obviously a huge topic right now, and it's most often applied to research and models developing other models."

    不是模型训模型,是模型去重写推理栈和 CUDA kernel。产出:三个月内速度约 +60%,Luna 降价 80%。

  10. 暂停前沿 RL 训练是为了加固系统

    "The pause was sort of necessary to allow the teams and the individuals to really understand and harden all parts of the system."

    "As we increase the capabilities of our models, it is very obvious that the alignment and the safety aspect of it is ever more important."

    安全团队主导,边走边定,最后落到一组「达到就可以重启训练」的明确原则。

  11. ultrafast 的收益取决于你在干什么

    "If it's a lot of tool calls, you'll only feel like a 3x or 4x speed up. You'll not get that full 14x."

    "It works amazingly well when there's not that many tool calls involved, or it's a lot of generation of context."

    猛写代码(原型网站、小游戏)能吃满十倍;工具调用密集的活只有三四倍。

  12. 一两年内这个速度会接近默认

    "Maybe a year or two these speeds will become, if not the default, very close to the default."

    "This is not just the inference speed. This is also just how token efficient the models are."

    不只推理变快,模型本身越来越省 token。但永远会有再上一档的付费档位。

Chapter 01

Lessons from Google & DeepMind

在 DeepMind 看着 LM Chat 出不了门
00:45 — 04:22 · DeepMind · LM Chat · 为什么没能发出来

Tibo 在 DeepMind 做的是「加速研究的基础设施和产品」。语言模型组当时已经跑出不错的结果, 把它变成一个能聊天的东西是自然而然的想法——内部产品 LM Chat 就这么出现了,比 ChatGPT 早大约一年,而且团队有把它公开出去的野心。

没能发出来的原因他说得很直接:DeepMind 不是一个为发产品搭起来的地方。他之前发过一条推, 说 DeepMind 被禁止发布任何可能冲击 Google 自身业务的产品。他补了一句相对公道的话——那是个 大计划的一部分,只是对他个人来说不是对的地方。

他说当时就觉得这东西特别:第一次意识到能拿到连贯的文本、能得到有用的回答。 「一开始更多是好笑,不是有用,然后逐渐变得越来越有用。」

"DeepMind was not set up to ship product. OpenAI is a very very different place in that sense."
Chapter 02

Building OpenAI's Culture

自下而上,但不能变成大杂烩
04:22 — 07:23 · 文化 · 给创业者的建议 · 能力是发现出来的

他形容 OpenAI 是自下而上、赋权型的文化:人可以自己冒出想法、凑到一起、 很快发出去,对新产品想法「几乎没有阻力能量(stop energy)」。他要保住的是这个。

但他同时强调另一半——别让它变成大杂烩。一堆功能、没有整体方向和连贯性, 是失败模式。所以要用简洁性和对产品质量的自豪感去对冲。他举 ChatGPT 的 iOS app 当标杆, 说团队在「愉悦感、性能、效率、简洁」上投了很多。

给创业者的建议有三条:有信念;想办法拿到用户并从反馈里快速迭代; 愿意颠覆自己——识别出该投新东西的时机,哪怕意味着从主营业务抽调资源。 他说最后这条对成熟公司尤其难,但极其重要,而这正是 Google 当年没做到的。

还有一个容易被忽略的点:模型的能力是训完之后发现的,不是预测出来的。 benchmark 不告诉你全部,得自己拿模型玩才能意识到「哦它还能干这个」。新语音模型上线后, 他现在每天早上拿手机口述一堆事情,模型接着就去做——这种事在有好的语音模型之前不可能, 而它直接改变了产品该怎么想。

"Benchmarks don't tell you everything. We have to play quite a bit with the models themselves."
Chapter 03

The Future of AI Agents

现在的 harness 到处在打破幻觉
07:23 — 11:18 · skill 文件 · 记忆 · 子 agent · 笔记本的天花板

他先承认现状的笨拙,而且承认老练用户已经习惯了这种笨拙:skill 文件要自己维护, 时间长了很难维护得住;记忆「算是有,但不总是记得住」;有子 agent 就得操心子 agent, 它构造出一张小网络。「幻觉在各个地方被打破。」

他要的东西是反过来的:一个深刻理解你的搭档——懂你的目标、你的日常、 甚至你团队在干什么;既能响应,又能主动;而且全程不打破那个「完美小伙伴」的错觉。

第二个约束更硬:笔记本本身不够用了。笔记本是按人的吞吐量设计的—— 你打字多快、能想多快、需要同时开几个应用,全是人的约束。模型没有这些约束, 「未来的模型显然需要比你笔记本更多的资源」。这就是云端 agent 的理由。

Berman 追问 ultrafast 之后会怎样:token 快 14 倍,带宽约束就变了, CPU、网络、工具调用的开销成了新的限制因素。Tibo 的解法是并发—— 一边探索、一边写测试、一边编译、一边验新假设,同时进行,把瓶颈挪走。

"Really what you want is just something that deeply understands you, understands your goals, understands your day-to-day."

"But then you know you can compensate by doing multiple things concurrently as well. So you're shifting the bottleneck around."

「但你可以靠并发做多件事来补偿。这样你是在把瓶颈挪来挪去。」

Chapter 04

How AI Changes Developer Workflows

对注意力友好,比堆并发重要
11:18 — 14:27 · 注意力 · 心流 · 两类问题

Berman 描述了自己的现状:同时开 10-15 个 agent,每个要等 30-45 分钟, 上下文切换成了巨大的认知负担。他猜 ultrafast 之后可能变成同时三四个, 而且这也许是好事。

Tibo 给了个我觉得值得记的说法——「对你的注意力友好」。他说这是团队很在意的事: 归根到底是给人造东西,所以要围绕人的多任务能力来设计,还要判断一件事是现在弹给你, 还是三十分钟后再说更好。

速度够快加上语音,体验就变了:这东西的运转速度追平甚至超过你,于是你留在心流里, 能边想边看到原型、实时生成小报告。他说到这里那句话很直接——之前那种同时盯十个 agent 的干法, 「我不太想回去了」。目标是让技术适应你,而不是你适应技术。

他把要解的问题分成两类。一类是个人 AGI:和你在同一个心流里、会主动提想法、 极其贴合你个人,技术问题非技术问题都能接。另一类是完全自动化: 能吃下复杂流程的智能系统——看生产日志自动做性能优化、发现回归自动打补丁; 安全领域尤其明显,扫描器报了漏洞就自动修,把漏洞敞口时间压到接近零, 人只在高风险动作上点确认。

"Managing your attention and being much more friendly to your attention is something that we care a lot about."

"We're trying to bring that sort of experience that is just really natural but also feels built for you, where you don't have to adapt. The technology adapts to you."

「我们想做的是那种很自然、又像是专门为你做的体验——你不需要去适应它,是技术适应你。」

Chapter 05

ChatGPT & Codex Merging

合并不是产品决策,是模型的要求
14:27 — 17:00 · 合并 · 单一界面 · 谱系而非标签

外部最初的反馈是质疑:为什么要合并?非合不可吗?他的回答只有一句—— 「我们未来的模型希望我们是合并的。」底层是同一套技术、同一个 harness, 高度多模态、语音优先、极致高效,而且它不在乎你是不是在写代码。

接下来这段是这一章最值钱的:他说「软件工程师」「设计师」这些标签, 是人类为了处理复杂现实而发明的抽象——真实的人是分布在一条谱系上的个体。 所以正确做法不是让你先选「我要程序员界面还是非程序员界面」, 而是造一个按你的个体特征自适应的界面。

Berman 追问终局:是不是最后就一个界面、连产品下拉框都没有?他说是—— 你和你妈会用同一个东西,它是你的个人 AGI;你们接不同的工具、带不同的需求, 它各自往最大化你收益的方向调。

"Our future models want us to be merged. We're just going to do it because it is the simple and proper thing to do."
Chapter 06

The Future of Human-AI Interaction

自然语言之所以赢,因为它本来就是人的东西
17:00 — 20:25 · 幻觉 · 非语言信息 · 环境智能 · 语音起量

Berman 抓住他反复用的「illusion(错觉/幻觉)」这个词追问终局体验。 Tibo 的回答绕回到自然语言:LLM 之所以成功,是因为自然语言本身就是人的概念。 你写封信给我,我读得出情绪,读得出言外之意——这些都是深度人性的东西。

所以他要避免的失败是那句「你误解我了,因为你没读出我的语气」。技术应该是 人已有行为方式的自然延伸,而不是让人去迁就。

关于非语言信息:他认为重要。他描述的未来是环境化(ambient)的—— 他走进办公室在白板上写个想法,这东西应该也在场、能理解,然后就着它自然地用语音聊下去。

一个可验证的信号:新语音上线后,纯靠语音跟 ChatGPT 交互的用户在快速增长。 他从中提炼的规律是——每次你往更自然的方向靠,用户就跟过去,因为 人总是走阻力最小的路。在小框里打字对某些人自然,但不是对所有人。

"Humans just choose the path of least resistance."
Chapter 07

OpenAI vs. Anthropic

两千万用户,和一句「我不太看竞争对手」
20:25 — 23:37 · Codex 20M · 增长曲线 · 分发

开场是个硬数字:Berman 恭喜他当天早上宣布的 Codex 达到 2000 万用户, 并说增长曲线「有一阵是这样(平),然后突然就垂直了」。

问到与 Anthropic 的竞争——Berman 直说有一段时间 Anthropic「把房间里的氧气都吸走了」。 Tibo 的回答是这一章的题眼:「我不太看竞争对手。我真正看的是我们能独特地把什么做好、 我们的价值观是什么,以及怎么最大限度地朝那个方向加速。」

他把增长归到分发上:合并 Codex 和 ChatGPT 的动机之一,就是让产品经理、设计师、 销售、市场、公关都能用上,然后借 ChatGPT 已有的巨大用户盘子快速铺开

被追问品牌调性的差异时,他给的答案是社区——透明、大量采纳社区想法、 「说实话这事儿本身就很好玩」,团队的能量有一部分来自这里。

"I really look at what can we do uniquely well and what are our values, and how do we maximally accelerate towards that."
Chapter 08

Why OpenAI Keeps Resetting Limits

那个没有审批流程的按钮
23:37 — 26:41 · 重置额度 · 「你可以直接做事」 · 实体按钮

这一章解释了那个让开发者盯着他推特的「重置」。起点很朴素: 迭代过程中他们把东西弄挂了,或者配错了,于是补偿用户—— 「谢谢你用这个产品,我们刚把它弄坏了三十分钟,这儿是一些额外额度。」

他把这件事归因到文化:「OpenAI 是一个你可以直接做事的地方。」 关键细节是——这事没有审批流程,不和市场部或财务部联合决策。 「我想按就按,觉得对的时候就按。」原则是:我们想造出很棒的东西, 没做到的时候我们会补上。

后来它超出了补偿的范围,也用来庆祝节点、或者推人去试新东西 (「你还没用过 ultra 吧,给你点额度去试试」)。Berman 类比亚马逊的退货政策—— 不满意就退,靠这个建立起「这家公司在乎你」的认知。

顺带:现在真有一个实体按钮

"It's just like I can press the button whenever I want, whenever it feels right."

"I think caring for your users does a lot. You can pay lip service and say that you care, or you can be like, we actually care."

「我觉得真在乎用户这件事很管用。你可以嘴上说在乎,也可以真的在乎。」

Chapter 09

Efficiency, Compute & Recursive Self-Improvement

递归自我改进发生在推理栈,不是训练场
26:41 — 34:13 · Luna 降价 80% · 三个月快 60% · 暂停前沿 RL

切入点是个具体事件:Sol 优化了 Luna 的效率,Luna 价格下调 80%,Terra 也降了。 Berman 问这是算法收益还是算力规划做得好。

Tibo 的答案是两者都有,但重点在后半段。算力是提前很久规划的—— 他提醒说两年前 OpenAI 因为在算力上投太多而被质疑,现在很庆幸有这些。 很大一部分算力投在研究上。

真正的机制是这个:把能力推到前沿,然后用这些最强的模型去重新设计和改造自己的服务栈, 从而拿到显著的效率和性能收益。他强调不只是成本——速度也快了, 排除 ultrafast 不算,现在比三个月前大约快 60%。而且承诺是不把收益揣兜里, 直接传导给用户,Luna 就是这么降的。

谈到递归自我改进,他做了一个我觉得最有信息量的区分:这个词现在多半被用在研究上、 指模型开发模型;但他们真正跑出成果的,是用模型去开发「使用这些模型的关键路径上的基础设施」 ——推理栈、CUDA kernel、以及更高效的新产品形态。「这是一个大系统。」 他补了一句:「如果我们不这么干,那才叫傻。」

最后是 Sam Altman 宣布暂停最前沿 RL 训练那件事。他的说法是: 能力越强,对齐和安全的分量就越重,OpenAI 在这上面的投入正在激增; 这次暂停是为了让团队真正理解并加固系统的所有环节, 然后才能有十足把握地重启训练。决策归安全团队,是个边讨论边发现的过程, 最终收敛到一组明确的原则——达到了就算到位。

"We haven't just improved the cost efficiency, but we have also improved the speed efficiency."

"It's all one big system. Inference stack, the kernels, CUDA kernels that we use, developing new products and new ways to interact with those models that are more efficient."

「这是一个大系统。推理栈、我们用的 CUDA kernel、以及开发更高效的新产品和新的模型交互方式,都在里面。」

Chapter 10

What Ultra Fast Unlocks

出事故的时候才给你用
34:13 — 41:19 · 事故响应 · ADHD · 10x 还是 3x · 会不会变默认

内部什么时候用 ultrafast?答案很具体:赌注高的时候。 出线上事故时,事故指挥官和响应团队拿到 ultrafast——每一秒都算数。 另外,正在做(或自认为正在做)关键事情的团队总会来申请。

有个有意思的分歧:重度多任务的人从 ultrafast 里获益反而更少, 受益最大的是不喜欢频繁切换上下文的人。Berman 和 Tibo 都有 ADHD, 但方向相反——Tibo 说自己在上下文切换和做大量小决策里如鱼得水,Berman 则很难受、 只想同时盯两三件事。

收益的边界也说清楚了:生成密集、工具调用少的场景吃得满—— 原型一个网站或小游戏、要它写一大堆代码,快十倍; 但工具调用密集时,开销在网络或 agent 轨迹的别处,只能感觉到三四倍, 吃不到那 14 倍

一个反直觉的运营细节:OpenAI 员工并不是人人都有 ultrafast。 他说员工有能力把所有生产 GPU 吃光,所以内部做了限制——用一些以便理解和改进产品、 也享受递归自我改进的红利,但绝大部分容量留给外部客户。

他最期待的解锁方向是非文本交互:共享画布上作业、生成多张图再挑一张、 快速出一个原型然后用语音或文字实时调整,眼看着它变。他说工程师常常要先坐下来 设计整个系统、想清楚取舍和需求,但也许一分钟就能造出来看看实际效果, 这样更在心流里、也更能摸到手感。

会不会变默认?他判断会越来越普及:速度月月在涨, 而且不只是推理速度,还有 token 效率本身——Sol 比 Terra 明显省 token,下一代还会更省。 「一两年内这些速度会变成,如果不是默认,也非常接近默认。」 但他也说,永远会有再上一档:更多硬件、更贵的取舍,换一点额外的东西。

"We see it used a lot when the stakes are high. When we have an outage, the incident commander and the response team get access to ultra fast, because every second matters."
Chapter 11

Reassuring People About AI

前沿会变便宜,这是他给焦虑者的全部答案
41:19 — 44:29 · 效率即普惠 · Luna 的成本 · 给还没试过的人

被问到怎么安抚那些对 AI 感到不安的人(工作被取代、环境影响、或只是觉得陌生), 他没有讲愿景,讲的是效率:效率直接对应广泛可及和实用性, 服务成本越低,你日常能从中拿到的就越多。

他的证据是 Luna:一个小得多的模型,效率高得惊人, 但倒回六个月前,它会是前沿水平。而它现在的成本「相当惊人」——Berman 接话说「便宜得离谱」。 Replit 已经在免费档里给出去了。

由此他给出那句结论:「现在是前沿的东西,六个月后运行起来会便宜得多得多。」 技术就是有这么一种越跑越高效的规律。

对还没试过 AI 的人,他给的是最朴素的入口:不用看多远——ChatGPT 在很个人、 很深的层面帮到人。除了写作,还有个人建议、医疗建议;他们上了健康和金融, 他自己经常用,觉得得到了平时很难得到的支持,比如去看医生前能问得更明白。 他建议从「听别人怎么用、被别人的用法启发」开始。

"Whatever is a frontier now will become way way cheaper to run in six months."