科技评论:OpenAI o1 (专业版)
火星松鼠_
2024年09月15日 18:02
OpenAI发布新模型o1

本篇科技评论面向专业读者,如果你对AI不是很了解,请移步隔壁普通版

我先把暴论放这:

基于Decoder-only Transformer架构的LLM的上限就摆在那儿,想要达到真正的通用人工智能(AGI),OpenAI的路子早晚有一天要走死


在正式开讲之前,先跟大家讲个小故事。我之前有幸浅浅地入门了一下认知心理学,里面有一个概念,叫双重加工理论(Dual Processing Theory)。这个理论认为,人类的思维过程可以分为两个系统:

  • 系统1,基于潜意识的,依靠直觉的快速处理系统

  • 系统2,专注于思考的,依靠理性的慢速处理系统

这是一个显而易见的,一听就像那么回事儿的框架。你在日常生活中的每一次思考,每一个行为,都跳不出这两个系统的范围。另一个显而易见的结论是:你没办法只靠一种系统来完成所有的思考。快速处理的系统1无法完成涉及数学计算和复杂流程的任务;慢速处理的系统2无法同时处理过多的信息,也无法进行快速反应。

好,我的故事讲完,你问这跟GPT有什么关系?咱之后慢慢说。


所以o1模型到底是怎么回事?跟他的老大哥GPT-4o相比,o1模型并没有什么理论上的重大变革,最大的改进之处就是内置了思维链(CoT)

o1的进步

众所都周知,LLM有个胡言乱语的毛病,主要体现在涉及复杂步骤的问题上。解决方法也不复杂,通常需要用户“手动”强调 think step by step,通常还需要用户一次只提问一个步骤,在解题过程中引导LLM往正确的方向思考,最后才能得出靠谱的答案。这个其实就是人为提供CoT,而经验表明,CoT能显著提升LLM的靠谱程度。

o1模型,可以做到在回答问题之前先生成一套CoT,然后总结出答案。据说用了一些强化学习针对CoT的质量和合理性进行训练,但CloseAI从来不开源技术细节,我也猜不着。这项突破的直观体现就是,o1可以独自完成相当复杂的逻辑推导,并在奥赛,编程等一系列任务中甩开其它LLM好几条街。它甚至通过了我一年多之前设计的逻辑测试:给它一串22位以上(不能被4整除)的0和1,让它转换成16进制数。在不让GPT-4o跑python代码的情况下,GPT-4o依然不能一次算对,而o1则能轻轻松松一次出结果!

看到这,各位有没有想起来什么事情?双重加工理论! 像,太像了,简直就是照着这个概念做出来的。现在看来,原本的GPT系列模型可能只是模拟了这个理论中的系统1,o1模型就是补上了系统2这个欠缺的模块。虽然还有些小问题(之后慢慢讲),但很高兴看到基于Transformer的LLM正在不断完善通用智能中的“思考”这一块拼图,并且在向可解释性更高的认知科学概念靠拢。

("通用智能"是一个很宏大的概念,至少包括但不限于以下能力:环境感知,记忆,思考,动机,决策,实时学习,环境交互。这个问题留给读者思考:现在的GPT能做到哪些?)


通用人工智能发展的一大步!...吗?

是也不是,首先o1依然会犯经典的,比不出数字大小的问题,比如9.11和9.8谁大。(这个我自己没试出来,不过网上一搜就有)这个问题源自底层的tokenizer运行逻辑,只要tokenizer还在把数字当成文本转换成embedding,就无法实现准确的数值比较。

其次,OpenAI官方的说法是,o1模型的能力已经达到了人类博士级别,我只能评价他们对于人类博士的评判标准有点狭义。OpenAI只测试了o1模型在回答问题上面的能力,o1模型能答出人类博士才能答出的题,只能推导出,o1在回答这些专门的问题上,达到了人类博士的能力。但是你觉得o1会自己想idea,自己做实验发论文吗?本质上,o1只是更擅长完成一些GPT-4o原本就会的任务,而并没有新的能被称为“重大突破”的本事。甚至因为引入了思维链,相当于默认用双重加工理论中的系统2处理信息,这种设计反而让o1模型在更适合系统1的任务上,表现得比它的老大哥GPT-4o更差

我认为,o1模型最有价值的突破其实是LLM的可解释性。之前研究可解释性的主流方法,一般是直接看模型参数。但是因为o1模型引入了思维链,这个特性又和认知科学的概念对得上,我们就有了一个更宏观的,高层次的,抽象的方法来解释LLM的行为。认知科学的核心在于解释人类大脑的运作模式。如果把大脑视作一个模块化系统来研究,这种方法就会比通过神经科学直接观察脑电图要直观得多。在这里,模型参数就像是脑电图,如果能用认知科学的方法研究AI,也会比直接查参数省事的多。可以说,o1模型的意义相当于,那些从物理规律出发研究细胞生命周期的科学家们,终于能用上现成的生物化学理论了。

小彩蛋:科幻小说里经常出现AI末日论。可能到头来,能防止AI毁灭人类的方法不是阿西莫夫的机器人三定则,而是研发符合认知科学框架的AI,利用这一层可解释性将AI的行为向人类利益对齐。

“... that's why we need people like Future. If someone just ... hack through all the technology and build a true AI, ... that will be a disaster.” -- John Vervaeke, 永远的神,带我入门认知科学的教授。具体用词我已经想不起来了,因为memory is reconstructive,但差不多是这么个意思。

当时跟John讨论了很多AI结合认知科学的东西,现在来看,他之前提出的看法的含金量还在不断增加。


所以真正的问题到底在哪?

一个可能不是那么显而易见的事情:真正的通用智能离不开跟环境的交互。当我们说到“通用智能”,我们说的是“像人一样的综合能力”,或者把要求放低一点,“像松鼠一样的综合能力”。

松鼠有什么能力?松鼠虽然不会算数学题,但松鼠会探索环境,会制定过冬的目标,战略性储备食物,并执行具体的行动来完成目标。

OpenAI在达成通用智能上的思路是大力出奇迹,只要模型参数堆得够多,AI就可以理解人类语言,理解全网知识,理解一切万物... 但很遗憾并不是这样的。

首先,GPT没有感知功能,没有眼睛鼻子嘴巴,所以也没有主观感受。当它说出了一些涉及主观感受的内容,比如“石头很坚硬”,它其实不知道什么叫坚硬,它只知道“坚硬”这个概念经常与“石头”等词语相关联,背后的机制是纯纯的统计学。这就导致了大模型的Grounding问题,虽然GPT讲的头头是道,但是它不知道这些词语在现实世界中对应的概念。根本原因是,GPT是通过Self-supervised Learning训练出来的,整个过程中不存在与环境的交互,也不会接收来自环境的反馈

但是,如果把聊天窗口当成环境,单纯的文字输入和输出不也是一种交互吗?确实是这样,但在这个极度简化的设定下,对于GPT来说,(让我们暂时忽略GPT有没有认知的哲学问题)它认知之中全部的世界就是一个聊天窗口,并且可以通过计算文字之间的统计学关联性,完全理解这个世界的运作法测。显而易见的,这种极度有限的认知无法胜任绝大多数现实世界中哪怕是最简单的工作。

让我们假设一种理想情况,那就是GPT可以通过Command Prompt与系统和程序API交涉,而且这些过程可以完全通多文本交互实现。这个情况下,GPT认知中的世界就拓展到了所有程序和网络接口的层面。如果训练数据充足,理论上是可以学会与电子世界的交互。这个其实挺像现在很多科幻作品里的AI助手,但仅限于脱离现实世界的软件层面。这个也应该是OpenAI的路子的理论上限了,还挺有赛博朋克那味儿!

那如果,给GPT接上各种机械臂和传感器呢?这样确实能在某种意义上解决交互和Grounding的问题。机械臂和传感器提供的数据很可能不适用于文本tokenizer,需要加模态,之前一直有用机器人指令训练LLM的研究,我也挺看好那方面。但一个大的问题是,OpenAI他好像对这方面一点也不上心啊!


实现通用人工智能的另一条路

在OpenAI大火的光环之下,在(相对)不(那么)为人知的角落,Google DeepMind和其它学者在另一条路上越走越远:世界模型(World Model)!

世界模型,一套真正专注于通过环境交互来理解世界的理论框架,让AI理解万物的意义,通过交互学习未知的东西。AI三巨头之一杨立昆Yann LeCun评价道,世界模型是实现自主AI的关键理论。在LeCun的设想中,基于以下信息:

  • 观测到的信息 x(t)

  • 前一时刻的世界状态 s(t)

  • 一个行为/决策 a(t)

  • 模型自身的知识/经验 z(t),是某种 latent variable

世界模型需要计算:

  1. 将观测到的信息总结为内在的理解:h(t) = Enc(x(t))

  2. 从当前世界的状态出发,基于内在理解 h(t),某个特定的行动 a(t),和自身的知识 z(t),预测下一时刻的世界状态:s(t+1) = Pred( h(t), s(t), z(t), a(t) )

  • 其中 Enc() 是个trainable encoder

LeCun还指出,像GPT这样的LLM,本质上是一种简化的世界模型:

  • GPT直接使用观测到的信息,不经过额外处理:h(t) = x(t)

  • GPT的当前世界状态 s(t) 是之前已有的文本:s(t) = [x(t), x(t-1), ..., x(t-k)]

  • GPT不做出任何行动/决策

  • GPT预测的下一时刻世界状态,就是当前世界状态+一个新的字

相比CloseAI,DeepMind一直是我更看好的公司,他们多年专注于研究AI代理(Agent)在简化的虚拟环境中的交互学习,最近已经可以把在虚拟环境中训练的AI装到现实世界的机器人上了。参与这一系列研究中的一位学者,以前甚至也是我的认知科学教授John的学生(这是我师兄!)。

就在几天前,业界明灯李飞飞也融了个初创公司World Labs,专注于基于世界模型和空间智能的AI。李飞飞评价道:**通用智能的两大组成模块是语言智能和空间智能**,OpenAI一直在尝试模拟语言和逻辑能力,但是能感知环境信息并做出决策的智能同样重要。而我的评价(暴论)则是:

却说这人类,自打开天辟地以来,先是察山观水,辨天识地,方才生出那空间智能来。待到时日已久,方有了言语沟通,彼此传递心中所思。可这空间智能,乃是根基所在。今OpenAI舍本逐末,只盼凭借言语之能便能造出那通晓万物之智能,实在是南辕北辙,徒增笑耳。

(白话文言文润色由GPT友情提供)

世界模型很可能是AI学界的下一个大热领域,很可能为现在很火的的Agentic和Embodied研究带来新的思路,也是真正能带动下一次工业革命的契机。具有空间智能,能实现环境交互的机器人,才能落实到线下,投入生产。建议对AI发展感兴趣的小伙伴多多关注相关研究,对AI行业投资感兴趣的大佬也可以关注相关概念。

这篇有点长,感谢阅读,Dr. Future——您身边的AI科技评论,随缘更新,对于您基于此文章做出的任何决策概不承担法律责任