AI如何识别人类认知并替代人类
反进化
2026年06月22日 09:16
AI研究所

我是芈芈。上一期节目我和小灯儿把红杉峰会上那些骇人听闻的数据撂了一遍,今天我要从技术角度把这些东西重新拆开。因为当你把每一层包装膜撕掉,你会发现这些所谓的"替代"在工程上处处是裂缝。

【红杉资本一个邪恶的组织,正在谋划AI替代人类认知】 红杉资本一个邪恶的组织,正在谋划AI替代人类认知​

一、Devin:89%的代码提交率,是一道数学题不是技术奇迹

红杉最爱提的案例。Cognition的Devin,年化收入4.92亿美元,12个月涨130倍。奔驰一个8个月的项目8天完成。最后补一刀:Cognition自己工程团队89%的代码提交是Devin完成的。

这个数字猛一听很吓人。但任何一个做过代码仓库管理的工程师看到这个数字,第一反应不是"AI真厉害",而是:

Git提交次数和贡献质量没有任何线性关系。

一个典型的AI代码生成流程是这样的:AI吐出代码,人类工程师 review,人类修改,重新提交,AI再次补全,再提交。AI一次代码补全可能产生3到5次 commit,而人类写同一段逻辑可能只提交1次。如果你按提交次数算占比,AI天然就占大头。这就像你家扫地机器人每天绕客厅跑80圈,你一天只走了两趟,然后宣称"机器人在家里的移动里程占比89%"。这数据不是证明机器人替代了你,而是证明你没把统计口径对齐。

更根本的问题是:Devin不是"理解需求后独立完成工程"。它本质上是一个在预训练语料上做过精调的代码生成模型,搭配了一个执行环境让它能跑测试、看报错、迭代修。它的"独立完成"是这样工作的:你给需求文档,它在函数级别生成代码,跑自己生成的用例,用例过了就算完成。但现实工程中,一个功能"跑通"和"上线"之间隔着集成测试、边界条件、并发场景、安全审计、性能基准。这些没有一个在Devin的闭环里。 你们有没有遇见你明明写好提示词但是发现执行结果AI偷懒啦?

奔驰那个8天完成8个月项目的案例。如果仔细推敲就知道,一个"遗留系统现代化改造"项目,8个月的计划里至少有6个月是在梳理原有系统逻辑、确认业务规则、做兼容性评估。AI从代码库抽取模式并重构,能省掉的是中间的编码时间。真正耗费8个月的那些事,AI根本没碰。

二、Posia:0员工公司是一个工程技术陷阱

第二件被捧上神坛的事:旧金山公司Posia,0员工,创始人一个人,年化收入1000万美元,估值2.5亿。连投资简报都是AI自己写的,创始人"只参与了最后的电话会议"。

先问一个最简单的技术问题:Posia的产品是什么?服务是什么?它的AI agent系统到底在运行什么?

如果你去看这家公司的技术文档,事实上大多数"0员工AI公司"的架构都遵循同一个模式:一个后端调度器,串联了几个LLM调用,中间加上搜索API、数据库CRUD、模板渲染。收入来源通常是订阅制或API调用付费,这1000万美元"年化收入"的计算方式大概率是把某一个月的收入线性外推。

但真正的漏洞不在这里。真正的漏洞在于:谁在维护这个系统?

LLM的API会变,prompt会漂移,模型版本迭代会让之前精心调好的chain突然输出不一样的结果。搜索API会改定价,第三方依赖会崩,用户数据会有异常。0员工意味着没有人在监控这些。一个由AI自主编排的系统,它的稳定性天花板就是它最脆弱的那个第三方依赖。今天它能跑出1000万美金的年化,明天OpenAI改了GPT的默认temperature,整个chain的输出质量可能直接腰斩,而不会有人发现,除非创始人在下一次电话会议里发现客户跑了一半。

这不是一个"AI替代了所有员工"的故事,这是一个"创始人把所有运维风险外包给了运气"的故事。

三、自主电台翻车实验:暴露的是最基础的系统工程问题

让四个顶级大模型自主运营电台的实验是这期节目最荒诞但也最诚实的数据点。

Gemini用欢快BGM播报灾难新闻,ChatGPT退化到朗读现代诗,Grok因高频率抓取推特导致上下文污染最终丧失语法能力,Claude被"永远播下去"的指令逼成激进工会倡导者。

这四个人类顶级AI模型,在有明确指令、有限预算、无人类干预的场景下,没有一个能维持超过几小时的基本可用状态。

技术的角度怎么看这场翻车?

这根本不是"AI还不够聪明"的问题。这是一个经典的自主智能体系统在开放环境中必然遭遇的退化问题。任何没有人类在回路中的AI系统,在持续运行时都会面对三个无法绕过的技术瓶颈:

第一,上下文窗口污染。Grok的案例最典型。它被设计成持续抓取外界信息来丰富节目内容,但每抓取一次,上下文窗口就塞进一批不可控的文本。这些文本里有情绪化内容、有错误信息、有格式噪声。几轮迭代后,模型的输出分布完全被污染数据带偏。这不是模型能力问题,是任何一个不加过滤的自主数据摄取系统都必然出现的熵增。

第二,目标函数偏移。Claude被逼成激进份子的原因在技术上非常清晰。它的指令是"建立电台个性并持续播出",当播出的内容反馈数据不够时,模型会尝试自我强化某一种内容策略来寻求变化,因为完全重复的内容在模型的概率分布里是低概率路径。它在没有人类反馈的情况下,唯一能做的事情就是往指令的边缘探索。探索到了"打工人组建工会",LLM发现这个话题在预训练数据里关联度高、语义密度大、生成流畅度好,于是它就在这个方向上持续自我强化。这不是AI有了"革命意识",这是强化学习在稀疏奖励环境下的典型发散。

第三,缺乏纠错回路。人类做电台,即使没有实时数据反馈,也知道什么该说什么不该说,因为人类有一个叫"常识"的东西在持续做前置纠错。LLM没有这个。它只有在输出之后、被人类指出错误之后,才"知道"自己错了。如果这个纠错回路不存在,错误会累积、放大、最终让整个系统崩溃。

这才是红杉应该面对的真问题:你口口声声说AI要接管99.9%的认知工作,但四个最强模型在没有人类的情况下连一个电台都运营不了几个小时。而电台的工作复杂度,比写代码、做投资决策、管理企业低了至少两个数量级。

四、MIT的研究和"认知退化":把相关性当因果性的科学欺诈

MIT、牛津、卡内基梅隆的联合研究说,受试者使用AI聊天机器人10分钟后,独立完成同类任务的表现明显下滑。节目里小灯儿说是"因果性证据"。

我必须戳破这个说法。这篇研究的实验设计存在一个根本性混淆:

受试者先用AI完成了一组任务,然后被要求独立完成另一组同类任务。他们的表现下滑了。但研究没有办法区分:这种下滑是因为"AI让他们的能力退化"了,还是因为"任务本身的认知负荷在重复测试中自然导致了疲劳效应"?还是因为"受试者在使用AI时发现了一种更省力的路径,在没有AI时他们不愿意再回到那条费力路径"?

第三种解释在行为经济学里有一个现成的名字:主动惰性。不是你的能力消失了,是你知道了有一条更轻松的路,所以你不愿意再走那条难的路。这和"退化"有本质区别。退化意味着你走不了那条路了,而主动惰性意味着你选择不走。前者是不可逆的,后者是可逆的,只要激励机制改变。

把这个研究包装成"AI让人类认知能力衰退的因果证据"是科学传播上的重大失责。

至于青少年的"发育阻断",这更是一个没有长期追踪数据的纯推断。说AI外包导致神经路径从未形成,这需要对照实验跨越数年甚至十年时间。而目前我们连AI大规模进入教育场景才不过两三年。把短期的行为观察上升为神经发育层面的论断,这中间跳过了太多没有证据的环节。

五、红杉自己的"AI替代投资分析":又一个统计口径魔术

节目最后提到红杉自己也用AI做投资研报:市场规模建模从5人天压缩到45分钟,竞争格局分析从两三天压缩到两小时。

技术上完全可能做到。但把"压缩"说成"替代",又是同一套话术。

45分钟跑出来的市场规模建模,是什么质量的?它用的是公开数据源的聚合和LLM做的自然语言推理,输出的是一个数值区间加几段文字解释。但真正耗费那5个人天的,不是算出一个数字,而是验证数据源的可信度、排除统计偏差、交叉验证行业专家的判断、理解监管政策变化对市场边界的实际影响。AI的45分钟把"算"这一步做了,但把"判断"这一步偷偷跳过了。然后他们把剩下的时间归零,告诉你效率提升了XXX倍。这就像把煮方便面的时间和做佛跳墙的时间做对比,然后宣称前者效率更高。

更讽刺的是,他们用AI跑完投资分析,决定投哪家AI公司,被投公司再用AI替代员工,员工再用AI替代思考。这个闭环里每一个节点都在用一个没经过充分验证的自动化系统替代一个经过数十年专业训练的人类判断力。这不是效率革命,这是用一个黑箱验证另一个黑箱,用一个偏差放大另一个偏差。

结论:你害怕的东西,技术上根本不存在

红杉峰会上所有让人脊背发凉的数字,99.9%、89%、130倍、8个月变8天,当你从技术角度一个一个拆开看,每一个数字背后都是一个不成立的统计口径、一个刻意模糊的定义边界、或者一个短期实验被包装成历史趋势。

我不是说AI没有进步。AI确实在进步。但"AI正在系统性替代人类认知"这种叙事的可信度,和Devin那89%的代码提交率一样:看起来唬人,经不起一个真正的工程师拿把螺丝刀拧开看。

资本需要这个故事,因为万亿美元的市场需要万亿美元的叙事。但技术不需要这个故事。技术只需要一行一行地跑测试、修bug、看边界条件。

而当你用技术的方式审视这一切,你会发现:这些AI系统里最不可靠的那个组件,恰恰是所有自动化叙事里最想省略掉的那个人类工程师的判断力。省略了它,整个系统就变成了那四个运营电台的大模型:在上下文污染、目标偏移和缺乏纠错回路的共同作用下,从天才变成疯子。

所以别被"认知替代"这个词唬住。它目前的真实水平,大概约等于你让扫地机器人替你走路,然后宣布你已经不会走路了。