短短六周时间,谷歌一口气连续推出了三款 Flash 级别的核心模型,从 3.6、3.7 一直迭代到 3.8。
很多开发者的第一反应,可能是谷歌又在刷版本号。毕竟在过去,大模型的大版本迭代通常按半年甚至一年来算。从海量数据清洗、预训练集群点火,到最后的对齐调试,每走一步都要烧掉巨额预算。两周更新一个核心版本,按以前的节奏根本不现实。
小模型追平旗舰还便宜6倍?Google的RSI模型自进化揭秘
如果仔细翻看Google博客上披露的技术细节,会发现背后的玩法变了。
预训练继续死磕万亿参数,边际收益已经越来越低。算力成本翻了几倍,基准测试上的提升可能只有一两个点。谷歌这次把研发重点放在了后训练流水线的自动化上,直接把模型放进 Linux 物理沙盒里,让它自己写代码、自己跑调试、自己根据系统报错完成迭代。
正如Google DeepMind研究员姚顺宇谈到的那样,这次单看模型本身的绝对能力是稳步推进,但在递归自我提升(Recursive Self-Improvement,简称 RSI)这套研发范式上,确实跑通了一个关键闭环。

大模型行业这半年的一个明显变化,是大家都在研究测试时计算(Test-time Compute)。
以前的思路很直接,训练阶段参数堆得越大、数据喂得越多,模型表现就越好。但到了实际工程场景里,静态参数的死记硬背开始遇到天花板。
现在的做法,是在模型遇到复杂任务时,给它留出更多的思考时间和内部计算资源。模型可以先在后台推演几轮假设,调用外部工具跑一圈验证,拿到高置信度结果之后再输出最终回答。
Gemini 3.8 Flash 就是这种架构思路下的产物。它的参数规模并不臃肿,但在软件工程和自动化工具链调用这种长链路任务里,表现甚至能对标很多超大参数的重型旗舰。
让模型自己训练自己,这个想法在行业里提了很久,但过去一直有个致命硬伤。
如果让另一个大模型来当评分裁判,往往会出大问题。模型很容易给自己的同类生成打高分,然后拿这些注水的高分数据继续喂给自己,最后陷入互相吹捧导致的模型崩溃(Model Collapse)。
谷歌这次的处理方式非常直接,彻底拿掉了大模型裁判,直接把策略模型关进 Linux 内核的物理沙盒里。
在这个环境里,一切修辞技巧和文字包装全都没有用。一段代码能不能算过关,完全交给系统底层最客观的三套工具去判定。
第一,看编译器报错。语法或者类型一旦写错,编译器直接抛出错误码,没有任何商量空间。
第二,看 GDB 调试追踪。变量实际数值、函数调用栈深浅、运行内存状态,全都有客观日志。
第三,看 AddressSanitizer 内存检查器。一旦代码触发越界读写或者空指针引用,硬件级中断信号会当场终结程序。
代码在底层只有绝对的对和错。漏洞利用能不能成功触发,修复补丁能不能通过原有的回归测试集,系统只会返回零或者一。
基座模型在沙盒里持续探索解法,碰到报错就根据内核反馈自己修正。系统只会把那些最终完整跑通、通过了全套单元测试的多步思考轨迹保留下来,整理成高质量的数据集,供下一轮微调使用。
这种机制完全切断了错误推导在几代模型之间的恶性传播,从源头上保证了自合成数据的可靠度。
光看最后的运行结果还不够,很多时候多步任务如果只看最终成败,模型很难学到中间哪一步走歪了。
谷歌在训练中用上了细粒度进程验证(RLVR)。在智能体调用工具的每一个关键节点,自动化验证器都会介入,实时检查文件修改的 diff、类型系统的状态,以及各个断言的达成情况。

这种全程布满探针的强约束环境,逼着模型在训练中自己养成了几个非常实用的工程习惯。
在遇到复杂的浮点数计算时,模型会主动调用计算器工具,不再纯靠权重参数去蒙数字。
在生成修复补丁前,它会先调用静态分析工具去摸清整个项目的代码架构。
在输出最终方案前,它会在内部反复做多轮假设与工具链验证。
这些动作不是工程师写死的硬编码规则,而是模型在物理沙盒的反复撞墙中摸索出来的自纠错本能。
从各个基准评测的真实数据来看,Gemini 3.8 Flash 呈现出非常鲜明的特征。只要是涉及工具链交互、终端命令行操作和可验证逻辑的硬核工程任务,它的表现极其强势。
在考验端到端长程软件工程的 DeepSWE v1.1 基准上,Gemini 3.8 Flash 从前代的 65.3% 冲到了 73.7%,直接咬住了行业第一梯队的 Claude Opus 5(74.0%),并且超过了 GPT-5.6 Sol 的 72.7%。
在专门针对底层安全漏洞挖掘的 CyberGym 评测中,针对性训练的 3.8 Flash Cyber 跑出了 86.2% 的成绩,超过了 GPT-5.5-Cyber 的 85.6% 和 Claude Opus 5 的 83.8%。
谷歌 Chrome 浏览器安全团队的实际测试显示,3.8 Flash Cyber 在 Chrome 真实高危漏洞上生成的有效补丁数量,达到了传统大参数旗舰模型的 2.6 倍。
在投行级财报分析基准 Vals Finance Agent v2 里,它拿到了 61.44% 的全场最高分。翻看它的解题轨迹会发现,模型在对付密密麻麻的财务数字时,频繁主动调用计算器工具做交叉核验。这套严谨的习惯,刚好就是从底层代码沙盒训练里继承过来的。
在标准的 Terminal-Bench 2.1 终端环境里,它拿到了 90.8% 的高分。
但有一组数据同样值得所有人警惕。
当评测环境升级到包含未知工具、更加动态复杂的 Terminal-Bench 4.0 时,Gemini 3.8 Flash 的得分直接掉到了 19.1%,而参数量更大的 Claude Opus 5 依然保持在 51.8%,Claude Fable 5.1 则有 55.8%。
这个巨大的落差把 RSI 范式的局限性暴露得很清楚。在规则清晰、反馈明确的沙盒里,模型能够快速自学成才。但一旦进入缺乏现成验证器、极度混乱的开放世界,参数规模带来的通识先验依然具有不可替代的作用。

聊到 Flash 级别的小模型,很多人下意识觉得就是便宜省钱,但实际用起来会发现情况更微妙。
先看单次任务的成本变化。因为开启了深度思考,模型为了反复验证假设,平均单个任务生成的 Token 数量高达 48K,比上一代增加了 30%。单任务的平均账单从 0.40 美元涨到了 0.58 美元,足足涨了 45%。
模型刚发布时,社区里不少开发者就吐槽过,生成速度确实快,但单次调用并没有想象中那么廉价。
但如果拉到复杂工业场景去算总账,结论就会彻底反转。
在 DeepSWE 这种高难度的真实代码修复任务里,Gemini 3.8 Flash 拿到 73.7% 的成绩,单次修复平均花费 2.36 美元。而跑出类似成绩的 Claude Opus 5,跑一次要花 14 美元左右。
总体算下来,成本相差了整整 6 倍。
对于每天需要在大型代码库里跑几百次自动化测试的企业团队来说,一天几千美元和一天几百美元,决定了这套自动化流程到底能不能真正上线投产。
谷歌给模型设计了低、中、高三档思考配置。简单的分类和日常查询走低配置,中等复杂度任务走中配置,遇到深层系统架构重构再拉满高配置,把算力花在真正需要推演的关键逻辑上。
客观看待这项技术,目前依然有几个不可忽视的落地瓶颈。
第一是任务时长的未知数。目前的权威测试大多集中在十几个小时的任务区间。如果把任务拉长到几十甚至上百小时,面对跨天运行的复杂系统演进,缺乏足够的生产环境样本来证明其稳定性。
第二是延迟对交互体验的改变。在高思考模式下拉满多轮验证,单个任务的端到端等待时间可能会达到 2.5 分钟。这对于需要毫秒级响应的代码自动补全或者即时聊天来说,交互成本相当高。
第三是基准测试的过拟合隐患。Terminal-Bench 4.0 的分数跳水提醒大家,依靠特定沙盒和自动化验证器训练出来的模型,容易在特定的规则体系里表现极佳,但在未知和模糊的真实业务场景中,依然需要工程师在外部做大量规则约束与兜底。
谷歌六周连发三款 Flash,不仅看到了一个模型的迭代速度,还展示了自动化验证环境、真实系统沙盒与后训练闭环相结合的工程潜力。
单纯堆砌预训练参数的时代正在放缓,把模型扔进真实世界的确定性规则里去碰撞和演化,正在成为大模型走向工业级落地的一条务实路径。