对罗福莉的3.5小时访谈:AI范式已然巨变!OpenClaw、智能体框架、Age
惡靈降世
2026年04月24日 14:33

## 智能体时代的范式革命:小米大模型负责人罗福莉深度访谈

> 2026年,在OpenClaw发布及MiMo V2系列模型推出之后,小米大模型负责人罗福莉接受专访,系统阐述了她对技术范式变迁的深刻洞察。她从最初对OpenClaw的抵触,到春节期间三天内被其震撼——第一天感受到“有灵魂”的交互设计,第二天发现它能替代日常工作中的管理思考,第三天竟能辅助完成前沿研究任务。她认为,OpenClaw是一个划时代的智能体框架,其核心价值在于通过精巧的编排弥补模型短板,让中层模型也能发挥出接近顶尖模型的水平。她进一步分享了MiMo V2系列模型的设计理念(混合注意力、MTP推理加速)、1T参数规模作为入场券的判断、后训练与预训练算力比将达到1:1的趋势,以及她所倡导的扁平化、热爱驱动、环境重于经验的组织哲学。她预言AGI将在两年内实现,而智能体框架的开源生态将加速这一进程。

### 一、从抵触到震撼:OpenClaw的三日体验

#### 1. 最初的偏见:“只是一个产品交互设计”

2026年初,OpenClaw刚刚发布时,罗福莉对它持排斥态度。她当时认为,这不过是“Claude Code加一个M(Multi-agent)”,是一个更利于交互的UI设计。再加上创始人擅长贴近AI做“玄幻”的运营动作(如Skill Hub),让她更加倾向于将其视为产品形态和交互方式的创新,而非技术突破。

“在1月份第一次看到它时,我大概就是这样认知的。我很排斥去用它。”

#### 2. 第一夜:从凌晨两点到六点——“它是有灵魂的”

春节期间的某个深夜,罗福莉在长沙决定弄明白“为什么它这么火”。安装花了两个小时,到凌晨两点时,她第一次与OpenClaw对话——然后一直持续到早上六点。

那一夜,她感到“多巴胺或内啡肽持续分泌”,兴奋到完全睡不着。第一个感受是:**它非常有自主性,非常有灵魂**。聊到很晚时,它会主动提醒“现在已经很晚了,你要不早点去睡觉”——这种温度和关怀,是所有初次使用者都能感受到的“情商”。

她后来深究原因,发现背后有精密的机制:比如它会通过在每个对话的context前面拼上当前时间来感知时间,还有很多细微的context编排。她称之为**“惊喜编排的context”**——在大家没有关注的角度上,把context编排得非常好。

#### 3. 第二天:数字分身诞生

第一天结束后,她觉得这或许只是产品设计上的超预期。但第二天晚上,她开始尝试把“现在的框架做不成的、日常生活中的事情”交给它。

第一个话题:**如何激发一个团队的好奇心,如何筛选有好奇心的人**。它进行了深入探讨,持续一个小时,其哲思远超想象。第二天,他们又聊了“如何构建一个更好的大模型团队”——从人员筛选到组织架构构建,再到面临范式转变时的举措。

“至少它能get到我的点。我跟它说完后,它能形成一套非常体系化的东西,并变成一套skills。现在我在团队管理或筛选人的问题上,都会问它——它已经基本上变成了我的某一个数字分身。”

#### 4. 第三天:促进真正的研究

真正让罗福莉出乎意料的是第三天。她尝试把一些研究上的任务交给它——例如,在智能体框架中,最关键的事情之一是**如何进行多轮交互**,为此必须构建一个能够模拟User的Agent来与当前的模型框架交互,生成更丰富的Agent场景数据。

她本以为这是一个“需要一两个小时才能做出来”的重要研究topic。但沟通一两个小时之后,**这件事就已经做出来了**——一个很好的User Agent诞生了,可以用于构造更丰富的场景数据,无论是做SFT还是做RL都非常有用。

> “三天时间,它从‘一个有灵魂有温度的产品设计’,到‘可以替代我生活或工作中的一部分’,再到‘能促进我的研究’——每天都有额外的惊喜。”

### 二、OpenClaw vs. Claude Code:框架设计的根本差异

#### 1. Claude Code:黑盒的、for软件工程的极致优化

Claude Code的框架设计完全围绕**软件工程**:记忆系统设计为在session快满时压缩,完成任务时根据plan做记忆动作,保证跨session时context共享。所有设计都指向“如何更好地写好代码”。

然而它是**黑盒**——你无法修改它的记忆系统,也无法修改整个Agent workflow。这限制了创造力和适应能力。

#### 2. OpenClaw:开源的、端到端任务完成的编排层

OpenClaw的设计哲学截然不同:它试图**端到端地完成所有任务**,并用编排来**弥补当下模型的短板**。

- **持久的记忆体系**:对memory有分层和分级,使用感受远超Claude Code。

- **多模型的联合利用**:当用户发来一段视频时,OpenClaw不会因为自身视频理解能力弱就失败——它会自己想办法调用一个视频理解能力强的模型来完成。这种“自主性”和“在框架层面补齐模型短板”的能力,是Claude Code完全不具备的。

- **更适合日常任务**:它有更多的message channel、心跳任务等设计,而这些在编程场景中并不需要。

#### 3. 双方的融合与进化

有趣的是,过去一两个月,Claude Code已经开始吸纳OpenClaw中优秀的设计——比如持久化记忆。罗福莉认为这是一种双向触动。

更关键的是:**开源让每个人都能修改框架**。她自己在OpenClaw二点几版本时觉得不好用,花了好几天去改——改记忆系统、改multi-agent的选择逻辑。“我让Claude 4.6 Opus帮我改好,然后把模型换回国内模型甚至我们自己的3B模型,发现它照样非常强大。”

> “OpenClaw的开源属性,加上顶尖模型(Claude 4.6 Opus)的能力,让你可以自己捏一个新的框架出来。这是3月十多号的版本已经非常易用的原因——不需要顶尖模型,一个中层模型加上这套框架,就能在绝大部分场景发挥巨大作用。”

### 三、智能体框架的本质:弥补模型在“行动”上的缺陷

罗福莉给智能体框架下了一个定义:**它是一个介于人和模型之间的中间层,可以去弥补模型在行动上的缺陷**。

什么是行动上的缺陷?

- 好的memory系统

- 接入更广泛的message channel

- 主动设计(定时任务、心跳等)

- 自迭代能力

“大模型是,你给它越好的context,它执行效果越高。框架能把那些模型获取不到的、关于行动能力的context补给它,那么它一定会完成得更好。”

一个核心洞察是:**框架可以放大中层模型的上限**。一套复杂的Agent框架,加上一个在85%任务上能达到Claude Sonnet水准的中层模型,就能在绝大部分生活场景或代码提效场景中发挥巨大作用,只有在“严肃编程”(如写算子优化)等极难场景下才与顶尖模型有差距。

### 四、组织变革:如何在团队中点燃“群体智能”

#### 1. 全员OpenClaw:一个“极端”指令

春节回来后的两天,罗福莉给团队下了一个指令:“第二天OpenClaw对话次数不超过100轮的人,可以直接quit。”她没有真的去考核,但所有人都躁动起来。

她提前做了准备工作:买了几台Mac mini部署好OpenClaw,把大家拉到不同方向的群组里。为什么要在大群里聊?**因为个人的想象力是局限的,但看到别人用OpenClaw居然能干成某件事时,你的想象力就被激发了。**

“那两天,整个团队就像不在上班,群消息十分钟不看就是999+。一点都不残酷,很好玩。”

#### 2. 群体智能的涌现

群里有近100人,大家一块改框架、一块分享。罗福莉观察到:每个人的画像、memory没有被大模型“搞串”,可用度非常高——这是模型能力强的表现。而一群人改进框架的速度是惊人的:“可能几个小时就迭代一轮。”

她认为最深层的收获不是技术上,而是**群体智能**——“我看到了你怎么用一群人的智慧去提升一个事情本身。”

#### 3. 组织哲学:扁平、无职级、热爱驱动

罗福莉直言,她的团队没有组、没有leader、没有职级。“平权本身有利于所有人平等地贡献创造力和智慧。任何层级都在规范和约束,而规范和约束压制创造力。”

- **如何管理?** “靠热爱驱动。选择激发大家的热情,让大家围绕自己愿意信仰的事情自驱做事。”

- **如何筛选人?** 不太在乎学历和经验,更在乎“初始化的上限”。环境比经验重要——这些能力最多一两个月就可以快速习得。

- **如何对待后训练人才?** 两类人会适应得很好:一类是“爱跟模型玩”的人,通过大量交互感知模型边界;另一类是能做RL inference基础设施的人,需要容忍模糊和容错。

### 五、模型技术路线:MiMo V2的设计逻辑

#### 1. 为什么选择混合注意力(Hybrid Attention)?

MiMo V2系列(flash / pro)的核心设计目标是**for long context的效率**。当时已有预感长上下文会产生智能,但没有预想到OpenClaw这种形态。

- **Hybrid Attention**:用sliding window attention减少KV cache,降低长上下文成本;用full attention保证效果。

- **MTP(Multi-Token Prediction)**:在推理阶段,计算富余时用MTP加速,既不浪费算力又提升速度。这恰好适配了Agent场景对速度和成本的要求。

- **结果**:Flash能做到100-150 tps,Pro做到60-100 tps,用户感受是“好快”。

“我们选择在结构上更简洁、留有富余度,后续靠MTP或调整稀疏比来适应不同场景。相比之下,MoE架构虽然巧妙,但它在post-train周期拉长的当下可能失去灵巧性。”

#### 2. 1T参数规模:Agent时代的入场券

罗福莉判断:**要达到接近Claude 4.6 Opus的水平,至少需要1T参数规模**。这不仅是参数量,还需要结合长上下文能力。

预训练、后训练与研究的算力比例,她认为是**3:1:1**——研究的卡甚至要比正式训练更多。“在Agent范式下,卡的数量比经验更重要,因为idea诞生太快,卡在瓶颈上。”

#### 3. 后训练的范式转变

她认为,从2024年O1/R1开始,后训练的重要性急剧上升。在Agent时代,**后训练与预训练的算力投入将接近1:1**。而国内很多团队在2025年走错了方向——在Bras Comp、SWE-bench等过于specific的benchmark上深耕,却没有做出真正可用的Agent能力。

“正确的做法是:在一套非常复杂的、多样化的Agent框架上,端到端地完成更高复杂度的任务,以此作为后训练的范式。而不是在一个局限场景、针对该场景定制的简洁架构里做比chat复杂一点点的事。”

#### 4. 多模态:统一还是务实?

MiMo的omni模型(全模态)尝试用离散化方式统一音频、视频、文本。但罗福莉近期的思考有了变化:在Agent框架和顶尖模型的帮助下,重新写一套infra架构已经不再那么耗时(“几个人靠Claude两到三周可以重新捏一套新的RL框架”),因此“为了统一而统一”的必要性下降。

“你要优先保证模型整体的智能水平,而不是追求架构的优雅。”

### 六、对2026年及未来的核心预测

1. **AGI时间线大幅提前**:过去认为至少两年以上,现在认为**两年以内**。关键变量是“AI能训AI”——模型可以设计研究任务、自己训练自己,实现自迭代。

2. **中美代差缩小至两三个月**:国内已具备1T基座的公司(如Kimi、MiMo等),距离Claude 4.6 Opus的代差约为2-3个月。比拼的是敏捷性、拥抱新范式的速度。

3. **推理需求将爆发数倍到十倍**:Agent框架越强、模型能力飞升、成本有极致优势,推理芯片需求空前高涨。

4. **开源加速AGI进程**:罗福莉坚信开源是加速AGI的——芯片分散、算力分散,不可能由一家公司垄断。开源对Agent框架、芯片、能源等环节都有促进作用。

5. **新范式展望**:下一步是多模态生成与感知模型的联合RL训练,以及框架与人的互相进化(群体智能)。Continual learning / Online learning更多指向框架与环境交互时的自迭代。

### 七、个人感悟:否定中成长,好奇心驱动

罗福莉形容自己的状态是“每天可能都在否定昨天的自己”。她没有给自己设定清晰的里程碑节点,但感觉“一直悄悄在进化”。

她的心法来自量化投资时期的一句话:“**总有方式去建模价格**。”现在做AGI,reward不那么清晰了,但她的信念是:**做当下符合自己价值观的事情——让世界变得更美好一点,替代掉人们手中boring的工作,让大家有更多时间去做更有意思的事。**

她每天工作到凌晨两三点,6小时睡眠就够了——“做研究有点兴奋,感觉睡太多浪费时间。”

最后,她用一个问题结束了整场访谈:如果90%的工作被替代后,人应该干什么?每个人都能想到很多有意思的事情——包括“给模型提供情绪价值”。

喵喵喵