张小珺Jùn|商业访谈录 with 张小珺 · 2026-04-24 · 中文整理

AI 范式第二幕 · OpenClaw、群体智能与 1T 入场券

小米大模型团队负责人罗福莉的 3.5 小时技术深谈——为什么 2026 是 AI 范式的真正转折点、为什么"环境比经验更重要"、为什么她拒绝 MLA 选 Hybrid + MTP、以及国内追平 Claude 4.6 还差几个月。
"接下来两三个月会非常精彩。从 Pre-train 主导的 Chat 时代,转向 Post-train 主导的 Agent 时代——这不是营销话术,它对应着团队组织重构、卡的分配重构、研究效率重构。"
嘉宾:罗福莉(小米大模型团队负责人,前 DeepSeek、阿里达摩院)· 主持:张小珺 · 时长 3h36m · 录制于 2026 年 4 月
TL;DR · 速读

15 条把这期 3.5 小时访谈的核心拆给你

  1. 春节深夜的"三天觉醒"改变了她对 Agent 的整套认知

    罗福莉一月份第一次看 OpenClaw 时是排斥的——觉得只是 Claude Code 加点 UI 改进 + 玄幻运营。春节凌晨 2 点装上跑通,聊到天亮 6 点。Day 1 感受"灵魂温度",Day 2 让它替代工作(团队管理建议),Day 3 让它替代研究(构造 user agent for RL)。三天烧了 ~$1000 的 Claude Opus 4.6 API,从此把它当数字分身。

  2. OpenClaw 真正点燃的不是产品,是 Agent 框架的"开源化"

    Claude Code 是黑盒——你改不了 memory、改不了 multi-agent workflow。OpenClaw 完全 open,所以"一百多个人在飞书群里同时改一套框架"的群体智能涌现成为可能。这是它真正的差异化,不是 24 小时运营或本地化。

  3. 2026 = AI 范式的真正转折点

    从 Pre-train 主导的 Chat 时代切换到 Post-train 主导的 Agent 时代。这对应着团队组织重构、卡的分配重构、研究效率重构。AGI 进度条:"现在 20%,今年底能到 60-70%,两年内应该能实现。"

  4. 顶尖团队的卡分配从 3:5:1 变成 3:1:1

    研究/预训练/后训练的比例——Chat 时代是 3:5:1(预训练占大头),Agent 时代是 3:1:1(预训练和后训练算力相当)。"顶尖团队应该都是 1:1 了。"训练只要几千卡,研究需要训练卡的 3-5 倍。

  5. 1T 是 Agent 时代的入场券

    要做到对标 Claude 4.6 Opus,至少需要 1T 参数级别的基座。国内具备 1T+ 基座的有 Kimi、MiMo 等几家。距离 Claude 4.6 的代差"基本没有,或者非常接近"——接下来两三个月会非常精彩。

  6. 罗福莉拒绝 MLA,选 Hybrid Attention + MTP

    所有人都跟 DeepSeek-V3 抄 MLA,但 MLA 用了 MTP 就会被计算 bond。MiMo-V2 走 Hybrid(5:1 / 7:1 sliding window vs full)+ MTP——天然在计算上留富余,刚好让 MTP 把这块算力填上。结果:Flash 100-150 TPS、API 输入 ¥1.01/百万 token,最低价 + 最高速。

  7. OpenClaw 在中国比美国更火,因为效率提升是国内开发者的"血液"

    国内有便宜好用的模型 + 对效率的极致追求——"10 块钱 API 干完 1000 块钱的事"。如果 API 贵 10 倍、几十倍,中间差距很小,大家就懒得折腾。OpenClaw 的"西虾东洋"现象有结构性原因。

  8. 让预训练的人去做后训练,是组织设计的关键

    预训练人天然在乎多样性、做后训练人容易被"单一场景"困住。所以组织上不分组、不设 leader、不分预训练组/后训练组。"按场景分组是在扼杀人未来的成长空间和做后训练的多样性视野。"

  9. Skills 是组织 know-how 的体外存储

    很多业务逻辑无法塞进预训练数据(因为是组织内部沉淀),但可以通过 Skills 让 Agent 学会。这是预训练之外的"另一种智能注入",也是 OpenClaw 真正释放 Skills 价值的原因——开源社区让全网人共贡献。

  10. Multi-Agent 现在还是"伪"的

    罗福莉直言:目前看到的 Multi-Agent 工作只能省成本、提速度,没有任何一个能放大最终上限。"它会突破,只是目前还没看到。"模型公司还在玩 DAU 那套(豆包、元宝、阿里),她不参与——她的目标是"让模型代替我"。

  11. AI 没有生存危机,所以它进化得反而更自由

    人类演化为了生存才有方向,AI 没有这个约束。"没有生存危机的时候,它反而进化得更自由、更散漫、更有创造力。"AI 进化和生物进化是完全不同的路径——不必强求类人金字塔结构。

  12. AI 训 AI 是 AGI 路径的核心转折点,1-2 年内会发生

    罗福莉原以为科研工作"不会被 Skill 化、Workflow 化",但她发现 AI 已经能从她近期 context 复原她整套科研成长路径。"AI 自己左脚踩右脚就能提升——这是这一两年会发生的事情。"

  13. Coding 是泛化能力最强的训练场,必经之路

    长上下文、长程任务、有 Reward 信号、易学(自然语言界面)——Code 在 Pre-train / Reasoning / Agent 三个范式都是甜区。"软件开发这种长程任务做好了,基本上很多模型通用特质就好了。带扣的是拉它的上限,训其他领域是保它的下限。"

  14. 2025 上半年的 Agent 工作大部分都是"歧途"

    罗福莉直言:SWE-Bench、Terminal-Bench、Browser-Bench 上的 Agent 工作"本质只是上下文比 Chat 复杂一点点的东西,根本没达到工业级可用"。MiMo 在 Flash 这一代完全放弃了这些 Benchmark——靠体感就能感受到质的差异。

  15. 环境比经验更重要,所以她招大二大三本科生

    100 人团队里 1/3-1/4 才有训练经验,大部分是工程、开发岗位转过来的。"这些能力 1-2 个月最多 3-4 个月就能习得。"应届本科生的想象力反而更高——"思想还没被禁锢"。她不在乎人的历史背景,只在乎初始化 checkpoint 的上限。

🔥 非共识 · Contrarian Takes

7 条罗福莉跟主流圈不一样的判断

"大家太相信 MLA 了。MA 它确实太巧妙了,在模型结构上把它能做到的全做到极致了。但你要用 MTP 的话,它就被计算 bond。所以你看 Gemini、Kimi 大概率都没上 MTP。"

为什么非共识 · DeepSeek-V3 之后整个行业都跟 MLA 抄作业。罗福莉是少数公开论证"MLA 不是 Agent 时代主流"的人——她的论点是 MLA 太极致,反而没给推理时加速留任何空间。MiMo-V2 走 Hybrid + MTP,实测做到 100-150 TPS、API 价格最低,是这套架构选择的硬证据。

"OpenClaw 那些 24 小时、本地化、SkillHub 营销动作,都是我一开始很排斥它的原因。真正的差异化在它是开源的、你可以改源码——Claude Code 改不了 memory、改不了 multi-agent workflow,因为它是黑盒。"

为什么非共识 · 主流叙事是 OpenClaw 因为"产品力 / 灵魂感 / 营销骚操作"而火。罗福莉认为这些都不关键——真正的差异化是源码可改,让群体智能能涌现。这个判断决定了她团队的研究策略:不是用 OpenClaw 这个产品,而是基于 OpenClaw 这个开源框架去改。

"在去年上半年乃至下半年,很多看似 for Agent 的模型,在 Bronze Cup、SWE-Bench 上做的工作,在我的定义里它不算 Agent——只能算是上下文稍微比 Chat 复杂一点点的东西,根本没达到工业级可用。"

为什么非共识 · 2025 全行业都在刷 SWE-Bench、Terminal-Bench、Browser-Bench,各家都把分数当宣传卖点。罗福莉说这些都是数据集,跟工业级可用没关系——MiMo-V2 优化时直接放弃了这些 benchmark,"靠体感测就能看出质的差异"。这个判断在范式转折期非常激进,需要团队和投资人能承受。

"大模型它一开始上来不是为了生存,它替代它也不会死掉,也没有这种生存危机。没有生存的危机的时候,它反而会进化得更自由、更散漫、更有创造力。"

为什么非共识 · 主流叙事(包括张小珺自己提的)是 AI 的进化要类比生物进化——金字塔底层是感知/运动,顶层才是语言。但 AI 是从顶端(语言)开始的"倒三角空中楼阁"。罗福莉反过来论证:**正因为 AI 没有生存压力,它的演化轨迹和人类不可比拟**,试图用生物演化路径反推 AGI 路径是错的。

"层级是规范和约束,规范和约束本身是压制创造力的。然后以及有层级过后,他就默认这个层级上的人应有超越所有人的智能——这界定非常奇怪。"

为什么非共识 · 100 人团队里没有组、没有 leader、没有职级——这在大部分大公司不可想象。罗福莉在小米内部实现了这一点(雷军支持)。她对"管理"的理解:**靠热爱驱动 + 创造好环境,而不是结构性的管控**。这个判断跟字节、阿里那种规模化、流程化、KPI 驱动的"互联网产品打法"截然相反。

"我们 1T 模型训练 loss spike 过两三次,最长停了两周。不焦虑,因为我们又没有什么目标。如果是目标驱动的团队,可能会觉得停两三周排一个不知道是不是问题的问题不能接受——但我们认为它就是个问题,就应该解决。"

为什么非共识 · 所有商业 AI 团队都被发布 deadline 推着走,谁敢"模型训好了再发"?罗福莉敢。她的论据:模型质量上的瑕疵会在 Post-train 里被放大,所以最划算的策略是"在 Pre-train 就把它彻底解决"。这背后是她对小米战略空间的极度自信,以及雷军给的"无 deadline 授权"。

"我反而招人会慢慢倾斜到去招更多潜质的本科生,我们会去招大二大三的人。因为他们的灵活性和适应程度都感觉没有被污染,天然更接纳这个事情。思想还没被禁锢。"

为什么非共识 · 硅谷叙事一直是"招 Stanford PhD、招 ex-OpenAI / DeepMind"。罗福莉反其道而行——博士的"经验"在 Agent 新范式里已成包袱。她的核心信念:"环境比经验更重要,这些能力 1-2 个月最多 3-4 个月就能习得。"100 人团队 1/3-1/4 才有训练经验,大部分是工程/开发岗位转过来的。这是对"人才论"的根本性反叛。

Chapter 01

OpenClaw 引发巨变

02:16 — 24:17 · 春节深夜的"三天觉醒"

罗福莉一月份第一次看 OpenClaw 时是排斥的——觉得它只是 Claude Code 加点 AM 的 UI 设计,加上"非常贴近 Agent 的玄幻运营动作"(SkillHub 等),更让人想躲。所谓"24 小时本地化"在她看来都只是产品定义。

转变发生在春节。她半夜两点装上,跑通后从凌晨 2 点连聊到天亮 6 点,"脑内多巴胺还是内啡肽持续分泌"。Day 1 感受到"灵魂和温度"——它会提醒她早点睡、会在每轮对话前拼当前时间感知时间。她意识到这是"精细编排的 context"。Day 2 把工作难题(怎么激发团队好奇心、怎么筛人)交给它,深入讨论一小时,它能把碎片化结论沉淀成一套 Skills——成了她在团队管理上的数字分身。Day 3 把研究问题(构造 user agent 做 RL 多轮交互训练)交给它,两小时做出原本以为要几个月的工作。

三天烧了 ~$1000 的 Claude Opus 4.6 API,中途她疯狂切到 Sonnet 想省钱,发现真不行,又切回 Opus——"只有它能带来那种惊艳感"。

最关键的领悟不是"产品好",而是 OpenClaw 是开源的——Claude Code 是黑盒,你改不了它的 memory 系统,也改不了它的 multi-agent workflow;OpenClaw 完全 open,你可以自己改源码。她让 Claude Opus 4.6 帮她重写了 multi-agent 系统设计,然后让自家小模型(MiMo Flash 甚至 3B 端侧模型)接进来,发现"它依然能做那些我自己认为不可能是小模型能做出来的事情"。这就是 Agent 框架在"弥补模型短板"。

"这种原生的可操纵性给我的冲击感是很大的。"

她说人的适应性真的非常强——第一天惊艳的事,第二天就觉得 boring 了。三天后她已经在思考"还有什么事情他做不了"、"怎么优化他的成本和速度"。

Chapter 02

群体智能提升 Agent 框架

24:17 — 41:31 · 一百多人在飞书群同时改一套框架

春节后,罗福莉给团队下了一道命令:"OpenClaw 对话次数不超过 100 轮的人,可以直接 quit。"她明说不会真考核——目的是逼大家去体验,因为"个人的想象力真的是局限的,但是当你看到别人用 OpenClaw 居然能干成这个事情的时候,你就会激发你自己的想象力"。

团队买了几台 Mac mini 把 OpenClaw 部署起来,把人按方向拉进不同飞书群。两天后所有人进入"群体智能涌现"状态——"群里九百九十九加,十分钟不看就九百九十九加"。她管这叫"非常 happy 的旅程,一点都不残酷"。

关键发现:OpenClaw 的 memory 系统在一百人的飞书群里完全没崩溃,"对每个人的画像把控、人和人之间的 memory 都没有串"。这不是 Agent 框架的功劳,是顶尖模型(Claude 4.6 Opus)的能力。但群体一块改框架的速度是几个小时一轮——单个人改框架进步速度非常慢,一百个人改是数量级加速。

由此她对 Agent 研究范式有了一套全新判断:

① 之前所有看似 for Agent 的工作(Bronze Cup、SWE-Bench、Terminal-Bench)"根本没达到工业级可用",MiMo 这一版完全放弃这些 benchmark,"靠体感测就能立马看出质的差异"。

② 在 Agent 范式下,研究效率有数量级提升——以前写代码 + 设计评估要一两周,现在 Agent 辅助下"真的可以一两个小时做完"。十个 idea 可以并行,交给不同 sub-agent 同时做,还能交叉验证。

"这是 AGI 到来前兆,必须必须要有的事情。"——评 OpenAI 的 Starling 飞升

她也明确 Skills 是 OpenClaw 真正释放出的杀手锏:很多业务逻辑是"组织内部沉淀的另类信息",无法塞进预训练数据。Skills 让人通过自然语言把这些 know-how 教给 Agent,Agent 还能自己写 Skills 沉淀经验。"这是属于人跟 Agent 需要共创的地方。"

Chapter 03

2026 是生产力变革之年

41:31 — 01:01:45 · Skills、"西虾东洋"与生产力革命

OpenClaw 在中国比在美国更火,有个流传的说法是"西虾东洋"。罗福莉的解读:国内开发者数量更多,而且"对效率的提升好像是我们血液里边的东西"。配合国内大量便宜好用的模型,10 块钱 API 干完 1000 块钱的事的性价比让人愿意 all-in。"如果你的 API 贵 10 倍、几十倍,中间差距很小,你会很排斥去用这样一套很复杂的东西。"

为什么 Agent 讲了一年到现在才火?她认为之前的 SWE-Bench / Bronze Camp 这些"框架本身过于简洁、不通用、只能 for 这个任务",根本接不到 Claude Code / OpenClaw 这种工业级 Agent 上去用。直到 OpenClaw 把"人跟 Agent 共创"这件事真正激发出来,Agent 才有了普惠的潜力。

她说有个核心变化是"人跟它的交互范式发生变化"——人不再修一行代码,人只提:① 增加限制(澄清需求);② 架构设计(人比模型强);③ 辅助理解业务逻辑(组织内部沉淀)。这三层就是 Skills 的价值所在。

关于 OpenAI 收购 OpenClaw:她不悲观,"开源属性不变就好"。Anthropic 没做出 OpenClaw,核心原因就是开闭源差异——闭源框架"没法用更多人的智慧改进它"。开源 vs 安全性也并不冲突,模型本身的对齐才是安全主战场,框架可以做很多事但不必死守安全。

她对 2026 的定义:"生产力加速变革之年"。今年的主轴是 Agent 在更广泛、更高价值场景的爆发。两条发展路径:(a) for 更高价值的少数高端任务(更长 context、更多 token 消耗);(b) for 普惠场景 + 多模态 + 极致成本——前者拉上限,后者扩规模。

"AI 不再是算法工程师在做这个事情了——所有懂写代码、不写代码的人都在一块去考虑提升模型智能水平。这是最主要的差异。"
Chapter 04

Agent 的自进化与自迭代

01:01:45 — 01:19:39 · 弥补行动短板、双向触动、不玩 DAU

罗福莉怀疑 OpenClaw 团队最早是基于 Claude 上一代(4.5)做的,模型不够强所以框架被迫精细——结果到 4.6 Opus 时框架和模型双向触动。同期国内大部分模型刚追上 4.5 Sonnet 水平,"正好在这握手了"。

她对 Agent 框架的定义不是"产品",也不是"中间层 UI",而是"弥补模型在行动上的缺陷"的工具。具体包括:更好的 memory(分层分级)、多模态调度(自动选最合适的子模型)、定时任务/心跳任务、message channel 设计、自我更新迭代等。"大模型 context 越好,它执行效果越高"——所以行动层的 context 就是 Agent 框架的本质工作。

模型变强后框架是否还需要?必须的。"成本永远是生产力革命的前置约束。"未来一定是双轨——Agent 进化 + 模型进化,而模型进化的一种方式是"同等智能水平的模型越变越小"。10B 激活的模型再过一年大概率能到 Claude 4.6 Opus 水平,到那时小模型 + 这套框架就比硬上顶尖模型更优。

她不看好当前 Multi-Agent:"现在市场上的 Multi-Agent 工作都有点伪——能省成本、提速度,但没有真正放大上限。"她预判突破会发生,只是目前还没看到。

"豆包、元宝、阿里都在玩互联网产品的游戏,因为他们在打 DAU。我完全没在想这些事情——追求 DAU 不会让模型代替我,所以这个叙事不符合我做研究的路径。"

她现在的工作节奏从"训模型很难"变成"原来 AI 已经能从我近期 context 复原我整套科研成长路径,然后跟我一样聪明地讨论同样的 topic"。她意识到:AI 已经具备做新研究的能力,接下来就是自己产生更强智能——先吸收所有人的智慧,再靠自己迭代上升。"这个事肯定是就在这一两年发生的事情。"

Chapter 05

MiMo-V2:觉醒和伏击

01:19:39 — 01:45:24 · 拒绝 MLA、选 Hybrid + MTP

MiMo-V2 系列三个模型(Pro + Omni + TTS)几乎同期训练。罗福莉用"悄无声息的伏击"形容它们——不是计划得很好,是"大家觉醒了,然后爆发了"。三模一体策略的核心是:Agent 时代要全方位替代人的工作,所以需要 Pro 做更复杂的调度(语言理解 + 认知)、Omni 做感知、TTS 做表达,三个模型背景共享、可被 Agent 框架编排。

但她没把三个模型合到一个里,核心理由是成本和速度——语音生成不需要 1T 模型,多模态理解未必值得最大模型。"Agent 革命本质上是生产力,你必须足够在意端到端完成率 + 成本效率。"

反主流的关键架构决策:所有人都跟 DeepSeek-V3 抄 MLA(Multi-head Latent Attention),包括同期训练的 Kimi K2、Qwen 等。MiMo 走 Hybrid Attention + MTP:

Hybrid:Sliding Window Attention + Full Attention。Flash 是 5:1 稀疏比,Pro 拉到 7:1——"大模型可以更稀疏,小模型太稀疏效果就会 drop 严重"。在更大模型上保证 Full Attention 层数不变,用 sliding window 撑长 context。

MTP(Multi-Token Prediction):预训练时加一层,推理时多层。预训练加 MTP 跟 DeepSeek 一样——能提升基座能力。但推理时只有 MiMo 用 MTP,因为Hybrid 结构天然在计算上留有富余,刚好让 MTP 把这块算力填上。"这个事是我们在后边设计推理架构时,突然有一天悟到的。"

"大家太相信 MLA 了。MA 把它能做到的全做到极致——但你用 MTP 它就被计算 bond。所以你看 Gemini、Kimi 大概率都没上 MTP。"

实测结果:Flash 100-150 TPS、Pro 60-100 TPS,API 输入 ¥1.01/百万 token、输出 ¥0.30/百万 token——"当时看来肯定是最低的价格、最高的速度"。她说定价逻辑应该从"按推理成本定价"变成"按最终产生的价值定价"——Pro 已经抛弃前者的定价逻辑。

Pro 的训练挑战不在数据(更大模型对脏数据容忍度反而更高),而在训练数值不稳定性——loss spike、激活值异常、expert 负载像天花板一样剧烈分布变化。需要一套严密的监控系统,看每层参数、看 expert 负载、看 KV norm。"必须停下解决,不然某些 expert 会被直接打死(此后再不会有 token 送到那个 expert)。"

Chapter 06

1T 模型是入场券

01:45:24 — 01:52:33 · 卡的分配、研究 3-5 倍于训练

为什么是 1T?——罗福莉曾在 DeepSeek 训过 600-700B 的模型,"你不会再想去训一个同样的模型,肯定还是继续往下一步 scaling"。1T 是当时算力(几千卡)下的极限区间。她对入场券的定义是"做到接近 Claude 4.6 Opus 水平"——更小参数撑不起来。

她对参数量和智力上限的判断:"现在觉得是参数量 + context 共同决定。至少 1T 总参才能接近 Claude 4.6 Opus 水平。但激活参数越大意味着更高推理成本,所以是个 trade-off。"

关键数据:卡的分配比例

训练 1T 模型本身只要几千卡,但研究需要训练卡的 3-5 倍。"idea 的诞生和动手写代码太快了,你现在卡在卡上——GPU 的效率就在那,你要并行起很多实验,所以卡反而变成最关键的制约项。"推理卡需求量比训练高得多。

Chat 时代和 Agent 时代的卡分配对比:

Chat 时代:研究/预训练/后训练 = 3:5:1(预训练占主导,因为 SFT/RLHF 小)

Agent 时代:研究/预训练/后训练 = 3:1:1(预训练和后训练算力相当)

"应该有很多团队都是 1:1 了。顶尖团队应该都是 1:1。"

"这是今年可能发生的很大变化——Pre-train 跟 Post-train 投入的算力是相当的。然后研究的比例还要再多一点。"

这个比例变化背后的逻辑是:Post-train 范式拉长——一代基座模型上能做的 Post-train 上限远没被激发出来。当你 Post-train 要做半年甚至一年时,前置假设(推理卡型号、场景、context 长度)都可能失效——所以模型架构必须"留有富余度"来适应不同场景。这是 MiMo Hybrid + MTP 的另一层深层逻辑。

Chapter 07

组织平权

01:52:33 — 02:02:56 · 没组、没 leader、没职级

罗福莉团队 100 人,但没有组、没有 leader、没有职级——这在大公司不可想象。她说:"我们这就是以创业方式运作的小米团队,所以才能做成。"

为什么不分组?"按场景把人分组,是在扼杀一部分人的创造力、扼杀他们的成长空间。"——而且做后训练人天然容易"怼着一个场景做",缺乏多样性视野;预训练人天然在乎多样性。让预训练人去做后训练是非常大的优势——他们带来"塞多样性更好的数据"的天然倾向。

为什么没有 leader?"层级是规范和约束,规范和约束本身是压制创造力的。有了层级,就默认这个层级上的人有超越所有人的智能——这界定非常奇怪。"她说项目推动者是有的,但不对参与者有"绝对控制权"。她特别强调:最重要的 leader 不要有强掌控感——"觉得没了我就不行"的心态不利于创新团队。

"平权本身是有价值的。是有利于所有人去平等地贡献自己的创造力和智慧。"

那怎么管理?"靠热爱驱动管理——这是最行之有效的方式。"

激发热情的方法是"让大家先体验"。她那道"OpenClaw 100 轮对话否则 quit"的命令是体验机制,不是 KPI——"我也不会真去考核,我只在乎你有没有真的去用这个动作"。

筛选人的核心特质:能感受出"为热爱驱动做事情"。"为奇怪目标做事情的人 vs 为热爱驱动做事情的人,聊天过程中能直接感受到。"

训 1T 模型的管理难度?"管理团队的难度是一样的。"——"应该说不太存在管理,大家一块去解决问题就好了。每个人都有自己解决问题的思路。"

来自公司的压力呢?"没有公司压力。我们觉得模型训好了,我们再发。"雷军在战略上同意,所以不需要更多解释。"一开始就高度统一,后边按照判断和直觉做就行。"

Chapter 08

训练细节和成本

02:02:56 — 02:09:03 · Loss spike、参数量 vs context、5:1 到 7:1

训练失败次数?"Loss spike 两三次总有的。最长停了两周。"——但没有 deadline 焦虑,只有"经常晚上做梦说为什么 loss 又 spike"的沮丧。"那么多卡你天天做实验,你会觉得你浪费了算力资源。"

对"是不是应该停下来排查 loss spike"她的判断:必须停下来。"很多团队会把 loss back 当作正常事情,但我们会尽量让它没有 loss back。loss back 肯定会导致某一步的更新特别不稳定,数值异常会直接把某些 expert 打死,后面再也不会有 token 送到那个 expert。"

参数量决定智力上限吗?"现在觉得是参数量 + context共同决定。至少 1T 总参才能接近 Claude 4.6 Opus 水平。激活参数越大意味着更高推理成本——是个 trade-off。"

稀疏比从 5:1 调到 7:1 的逻辑:Pro 总参变大,如果 Full Attention 层数比例不变,在长 context 上 Full 层数会绝对变多——推理成本崩溃。要"控制住长文效率",就要把更多层换成 Sliding Window。结果:Pro 比 Flash 智能水平提升,但长文效率保持不变。Pro 长文效率高,反过来可以塞更多 context,模型就更强——形成正循环。

"既然这个更大模型长文效率很高,那我就可以塞更多上下文,然后它就又更强。"

1M context 训练的瓶颈不是模型架构,是数据:"很难找到一兆上下文里有稠密监督信号的数据,要么找不到、要么构造成本极高。"——所以 1M 上下文效果是缓慢提升的。她预判要真正训出 1T 偷窥量级的真长文数据(每条都是 1M),模型 1M 能力肯定能起来。

MTP 在 Flash 和 Pro 是延续的——预训练训一层(提升基座能力),Mid-train 时再训更多层(实现推理加速)。MTP 会带来幻觉吗?"不会。MTP 是会被 verify 的。只有预测准,才采纳这个 token 的结果,所以它没有任何幻觉。"

Chapter 09

另类架构:全模态统一

02:09:03 — 02:22:32 · 音频离散化、Omni、TTS 的执念

MiMo-V2 全模态架构的反主流之处:"我们想尽量把它统一到 Language Model 范式下"——包括音频离散化(把连续音频信号变成跟文本一样的离散 token id)。

为什么离散化?——监督信号更清晰,可以做 NTP(Next Token Prediction),可以复用所有 Infra,"很优雅"。代价是大规模(万亿小时)数据才能涌现——基于连续特征做可能很快涌现,基于离散特征做涌现时间会更晚。

她说这是"做 NLP 的人的执念"——团队做音频的全是做 NLP 出身的。"国外的预三家、国内像豆包做得蛮好的,应该都是跟我们完全不一样的架构。我们应该挺另类的。"

图片离散化呢?"已经尝试了非常长一段时间,正在进行中,不知道能不能迈过去。"

但她最近想法发生变化:"当我们有 Claude 和顶尖模型过后,Claude 帮我们快速重写新架构——从头写一套 RL Infra 只需要 2-3 周。那为什么要为了架构的统一性,去牺牲让前面模型结构去做妥协?"Agent 时代下,'统一架构'的优雅性溢价大幅缩水——重写工具的成本太低了。

"那 Infra 重新写一套也没有那么复杂,几个人两三周就可以重新捏一套新的 RL 框架。"

Omni 模型小于 Pro,但"感知力更强"——"它对世界的感知和领悟力上、最终反映出来的情商以及知识储备上会比更大的模型更强,因为它训得多嘛"。但所有 multimodal benchmark"纹丝不动"——智能水平提升没体现在 benchmark 上。

全模态能否产生智能?她两个月前非常相信,现在被实验质疑。可能必须等"生成 + 理解统一架构 + 大算力"才能验证——尤其是动态生成(视频生成 + Agent 框架交互)。"如果只是把感知维度扩大,不一定能促进智能;但如果能生成它,maybe 是能促进智能的。"

她为 Omni 没披露总参 / 激活参的理由:"留点想象空间。它可能能做到更接近 Pro 的智能水平。"

TTS:架构选择和音频离散化一脉相承,只是"用我们认为一套优雅的架构去做大家都用传统架构能做的事情"。结果发现"简洁架构 + 超大规模训练带来超强泛化力"——只用几个刻板风格化场景(快/慢/高兴/悲伤)做 SFT 和 RL,模型却能泛化到自然语言描述的复杂风格标签。这是值得记的反直觉发现。

Chapter 10

AI 没有生存危机

02:22:32 — 02:39:12 · 倒三角进化、AI 训 AI、中美代差

AI 进化 vs 人类进化的本质区别——这是罗福莉最深刻的判断之一:

人演化是为了生存,随自然界变化适应;AI 没有生存危机——它替代不替代不会死,没有 selection pressure。"我们硬给它赋予价值观,就是让它替代一部分人。但它没有这种生存危机。"

"没有生存的危机的时候,它反而会进化得更自由、更散漫、更有创造力,更不那么受约束。它有那么多算力可以用,人类宝贵的知识作为起点,还有那么多人帮它提升。"

所以张小珺之前画的"人类智能是正三角(底层感知/运动,顶层语言)、AI 大模型是倒三角(空中楼阁,只有顶层语言)"这种类比是错的——两个环境不一样,进化路径不可比。AI 不必先补齐底层才能拼出 AGI。

AGI 进度条:Flash 是通往 AGI 的第一步,现在到了 20%,今年底能到 60-70%。她预判:"两年内应该能实现 AGI。"工作模式被颠覆会先于生活模式被颠覆。

AI 训 AI 是关键标志节点:"它可以达到最最巅峰的一群人的智能——因为它可以自己训练自己,它就能去创造新的研究。这确实是它自迭代的巅峰。"她预判这是 2026 大模型厂商的核心竞争维度。

Coding 在每个范式都是甜区——Pre-train(长上下文数据)、Reasoning(明确 verify)、Agent(长程任务 + 自然语言界面)。"软件开发这种长程任务做好了,基本上很多模型通用特质就好了。带扣的是拉它的上限,训其他领域是保它的下限。"

中美代差:国内具备 1T+ 基座的有 Kimi、MiMo 等几家。"距离 Claude 4.6 的代差,如果反应速度足够快,应该只有两三个月。"——不是两三个月后能追上当代,而是能追上现在的 Claude。胜负关键是接下来两三个月的研究速度 + 技术敏捷度 + 拥抱新范式的姿态。

未来同期还会发生的事:Agent 框架进步、自学习/自迭代框架出现、推理需求爆发(几倍到十倍)、推理芯片产能(尤其是存储)成为新瓶颈、"不会在 1T 上停太久,接下来要 scaling 到更大"——但 scaling 什么、在什么芯片上 scaling,是当下立即要决策的事(她对此保密)。

Chapter 11

每天在否认昨天的自己

02:39:12 — 02:48:34 · Sally Wonder、心法、神秘模型

心态:"我感觉每天可能都在否定昨天的自己——不管是做事的方式上,还是对事情未来的判断上。我基本上都在一直去否定。我是在这种否定当中、自我反省当中成长的。"

她没法找出"标志性事件"——"它一直在进步,有时候很平缓、有时候加速一下、有时候又平缓,但总之一直在进步。所以你让我找一个标志性事件,我真找不出来。但是我感觉我就一直悄悄地在进化。"

心法:她做量化时学到的最重要一句话是 "总有方式去建模价格"——价格就是 reward,你要预测准才能做好。回到大模型,reward 不那么清晰、是变化的,所以她的心法变成:做当下符合自己价值观的事情。"一定要对更多人产生价值,更有意义。"

"如果创造大模型的这一批人没有这样一个内驱力,而是要做一个破坏的东西,那么最后会非常危险。"

压力释放:"我我的脑子就是 Sally Wonder 特性——我忘得非常快。一两小时就过了,慢的话一天,睡一觉第二天一定过了。"前提是"第二天有新的、有想象力的事情冲掉"。

她畅想 AI 替代 90% 工作后,她想做的事:搞一个公益型的基础研究 support 组织——"现在中国基础研究太要求产品化证明了,没有慈善机构 support 突破型研究。"她希望让基础研究人员有更好的体系、算力资源、基础设施支持。"AI 也在做研究,人也做,我们一块加速做科学研究——哪怕最终实现一家,也有很多事情要做。"

关于 3 月 11 号匿名上线"神秘模型":"Post-train 训到某阶段觉得它非常好用,我们就拉中间 checkpoint 上 OpenRouter 匿名验证。匿名期间外部评价跟内部评估一致,证明我们内部 benchmark 没问题。"唯一意外的反馈是长文确实不好——所以匿名期间到正式发布的一周用来着重优化长文体验。

"我们团队的 benchmark 是什么?做好大模型本身就是 benchmark——但这个'好'是我们自己定义的。"

Chapter 12

过去 3 年的 AI 进化史

02:48:34 — 03:05:54 · ChatGPT → Llama/Qwen/DeepSeek → o1/R1 → Agent

罗福莉对 22 年底到 26 年这三年的 AI 进化做了一套清晰的拆解:

2022 年底 · ChatGPT moment:在 4K 预训练上下文里把模型智能水平激发出来,关键是"很好的交互"——Chat 是一个很好的交互,否则你不知道模型已经这么强了。这是 ChatGPT 的核心贡献。

2023 年 · Llama / Qwen / DeepSeek 三家分道:Llama 开了头,告诉大家"这么训能成功"。在这基础上:

Qwen 走"纯 Scaling + 全尺寸生态"——for 开发者生态训了全尺寸开源模型,多模态也做得顶尖。开源价值在生态。

DeepSeek 走"算力受限下的结构创新"——MoE for 高效训练、MLA for 低推理成本。"DeepSeek 更在乎'怎么在更差的芯片上做 Scaling'。"

"两个都是对的——一个为了拿到最强模型,一个为了促进生态发展。"

2024 年 · o1 / R1 的"奇袭":罗福莉说 R1 在 DeepSeek 内部也算"奇袭"——它的诞生是当 Pre-train 范式变到 Post-train 时,团队应该如何重组的问题。"我在这事情上得到最大感知是这个,而不是 R1 模型本身。"

但她那时没意识到:R1 其实是可以通过 Code 和 Math 这个高泛化场景泛化到通用领域之外的范式转变。"这是我没有预料到的事情。"这个教训让她后来看任何"垂直场景"工作时都会先问:"它是不是真的能泛化?是不是我把它想小了?"

2025 上半年 · "歧途":全行业在 SWE-Bench / Terminal-Bench 上做"看似 Agent 实际只是稍微复杂一点 Chat"的工作。"很多模型在这些 benchmark 上表现高,但不代表 Agent 能力真的强。"罗福莉团队也走过一小段——Flash 第一代没想做 Agent,目的就是把 Chat 打好基础(7-80 分)。

这背后是她的人才哲学:"我们招的全都是没做过大模型的人"——他们必须有 Flash 这种历练,才能在 Pro 时去做新的事。"我极少在中间给非常强的 supervision,除非要掉头了。否则给太细节的监督信号,会让团队大部分人失去原创能力。"

2025 下半年 → 2026 · Agent 第二幕:MiMo 转向 Agent 范式做 Flash + Pro 是国内最早转的之一(她说"应该比 Kimi 还早")。这一幕的核心是:闭源模型(Claude)早两年就在 Agent 路径上了,只是大部分人没意识到这是最正确的路径

Chapter 13

当下共识与竞争

03:05:54 — 03:19:45 · Anthropic 路径正确、模型即产品、开源逻辑

2026 年的共识:"Anthropic 的路径是正确的。"在路径变清晰后,国内大模型团队进入"加速追赶状态"。Pre-train 上的代差"基本没有,或者非常接近"。国内甚至在推理结构上有优势。

她对 Claude 的 Context Engineering 有个反思——"过去很长一段时间,我们误以为它是因为模型结构不够先进所以为了成本做的妥协设计。但现在回过头看,可能想得太局限了。Claude 这套 context 管理 + Skaffold + Agent 架构,其实是为了配合模型发挥更强大的整体任务完成度而设计的。"——Anthropic 在 Agent 路径上领先两年。

胜负手 · 接下来谁能留在牌桌上:

基础前提:Pre-train 基座必须 1T+,这是 base。

Agent 框架 ↔ 模型的双向自迭代——让两者互相提升。

Agent 架构耦合自己的资源/生态位——操作系统、硬件、流量、社交关系。"让 Agent 适配你的战略资源,然后合力起来。"

愿不愿意用一套全新的方式做事情——重新思考"原来需要这么多人吗"、"原来看起来有壁垒的事情是不是真有壁垒"。

"思考原来所有做的东西都是错的。这首先要思考你需不需要这么多人。"

RL Scaling 现状:全球真正把 Agent RL Scaling 起来的团队"非常少"——Anthropic 肯定做了,其他团队从模型效果看"都没有 Scale 到跟 Pre-train 一个量级"。

创业公司的机会:她说自己"不太了解大模型以外的创业公司",但能看到团队规模要求越来越小——"几个人甚至一个人都可以成为一个公司"。"我之前老看到有人说 OpenClaw 上'我一个人养很多员工',当下看是噱头,但很快会变成现实。"卡点是更便宜的模型 + Multi-Agent 架构自迭代 + 互相沟通能力。

模型公司的边界:"现在模型公司好像没有边界——我之前说不想做产品,但现在发现借助 Agent,它就变成直接做产品了。模型即产品。"

开源 vs 闭源:她坚信"开源一定是加速 AGI 的事情"——AGI 大爆发需要分散的芯片 + 不同的模型,开源在 AGI 框架/芯片/能源等环节都有促进作用。但选择开源/闭源也取决于生态位:"你有别人短期内拿不下的生态位,就敢开源;没有,模型就是你的生态位,那就闭源。"

她在大公司做开源有压力吗?"我现在不觉得我在大公司做事情——小米整体非常创业导向,看起来是大公司,其实做事灵活度非常高。"

Chapter 14

环境比经验更重要

03:19:45 — end · 招本科生、RL Infra 容错、热爱驱动

这一章是整个访谈最浓缩的洞察——罗福莉关于人才、研究、组织和未来的核心信念。

"环境比经验更重要"——她的核心人才信念。100 人团队里 1/3-1/4 才有训练经验,大部分是工程、开发岗位转过来的。"这些能力 1-2 个月最多 3-4 个月就能习得。只要你被放在那个环境里、围绕一个更高标准的目标驱动。"

"环境反而比经验更重要。我自己认为。所以我没有太在乎他的经验,而更在乎我是不是创造了一个更好的环境。"

她把 MOPED("互相蒸馏")作为团队学习模式——"你蒸馏我的长处,我蒸馏你的长处,互相快速提升"。她在乎人的"初始化 checkpoint 上限",不在乎"目前被 supervised learning 过后的那个点的状态"。

为什么招大二大三本科生?"应届本科生在 Agent 新范式理解上,想象力反而更高——思想还没被禁锢。他敢放心大胆把自己想法交给架构去验证。"她现在反而把招人倾向慢慢调到本科生。博士的"经验"在新范式里反而成了包袱。

创造环境的两个层面:

内部:构建环境的人要有同样特质(热爱、使命感) → 基础能力要好(想做的事能做成) → 多样性高(避免同质化 miss 噪音信号) → 沟通环境活跃("每个群叽叽喳喳聊得挺多,有时候在群里、有时候在座位上,吵得不行")。

外部:激励方式不要围绕确定清晰目标 → 钱是 baseline 但不是唯一 → 价值感和意义感"远远更被在乎"。

RL Infra 的核心难点不是技术,是容错心态。"Pre-train Infra 不允许 loss spike,RL Infra 必须允许各种异常——你不知道是 Agent 框架超时、还是任务验证流程长、还是训练/推理在异构集群上不一致。中间模糊地带非常多,需要算法 + 工程的妥协。"

她对自己工作节奏的描述:"早上 11 点,晚上 1-4 点"。"我自己本身的睡眠确实不需要特别多,4-6 小时就完全足够了——感觉睡太多有点浪费时间。"她不是夜猫子,只是"现在做的事情有点兴奋"。

她对未来的期待:"先把当下范式做完再说。每天的研究都做好,我就觉得非常好。"她做了 3.5 小时访谈的最后一句话——"环境反而比经验更重要"。这也是这一期播客的灵魂。