科技评论:OpenAI o1(普通版)
火星松鼠_
2024年09月15日 18:15
OpenAI发布新模型o1

本篇科技评论面向大众读者,如果您对AI已有了解,请移步专业版​,那里有更少废话和更多细节。

我先把暴论放这:

基于Decoder-only Transformer架构的LLM的上限就摆在那儿,想要达到真正的通用人工智能(AGI),OpenAI的路子早晚有一天要走死


在正式开讲之前,先跟大家讲个小故事。我之前有幸浅浅地入门了一下认知心理学,里面有一个概念,叫双重加工理论(Dual Processing Theory)。这个理论认为,人类的思维过程可以分为两个系统:

  • 系统1,基于潜意识的,依靠直觉的快速处理系统

  • 系统2,专注于思考的,依靠理性的慢速处理系统

这是一个显而易见的,一听就像那么回事儿的框架。你在日常生活中的每一次思考,每一个行为,都跳不出这两个系统的范围。另一个显而易见的结论是:你没办法只靠一种系统来完成所有的思考。快速处理的系统1无法完成涉及数学计算和复杂流程的任务;慢速处理的系统2无法同时处理过多的信息,也无法进行快速反应。

好,我的故事讲完,你问这跟GPT有什么关系?咱之后慢慢说。


所以o1模型到底是怎么回事?跟他的老大哥GPT-4o相比,o1模型并没有什么理论上的重大变革,最大的改进之处就是内置了思维链(Chain of Thought,简称CoT)

思维链是什么?

众所都周知,大语言模型有个胡言乱语的毛病,这主要是因为大模型的底层运作原理不涉及思考。这个毛病主要体现在涉及复杂步骤的问题上,比如早期的GPT算不过来数学题,方程解到一半就开始抄错公式了。

有的小伙伴可能不了解大模型是怎么运作的,这里解释一下。大模型只干一件事:根据之前已有的字词(包括你输入的和它生成的),计算并生成下一个可能出现的字。这个过程反复执行,直到大模型觉得说完了。

怎么解决这个问题?这个通常需要用户“手动”告诉大模型一步一步思考,think step by step。通常还需要用户一次只提问一个步骤,在解题过程中引导大模型往正确的方向思考,最后才能得出靠谱的答案。

这个用户不断引导的过程,本质上就是帮助大模型搭建一个思路链条,从一个结论得到另一个结论,再基于上一个结论一步一步来。经验表面,这个方法可以有效帮助大模型思考复杂的问题,提高做数学题的正确率。

o1模型,通过某种训练方法(CloseAI从来不开源技术细节,我也猜不着),让它在回答问题之前先生成一套完整的思路,然后总结出答案。宏观上看,就是o1模型不需要用户带着它一步一步思考,会自己生成思维链了。这项突破的直观体现就是,o1可以独自完成相当复杂的逻辑推导,并在奥赛,编程等一系列任务中甩开其它大模型好几条街。

它甚至通过了我一年多之前设计的逻辑测试:给它一串22位以上(不能被4整除)的0和1,让它转换成16进制数。在不让GPT-4o跑python代码的情况下,GPT-4o依然不能一次算对,而o1则能轻轻松松一次出结果!

看到这,各位有没有想起来什么事情?双重加工理论! 像,太像了,简直就是照着这个概念做出来的。现在看来,原本的GPT系列模型可能只是模拟了这个理论中的系统1,o1模型就是补上了系统2这个欠缺的模块。虽然还有些小问题(之后慢慢讲),但很高兴看到基于Transformer的大模型正在不断完善通用智能中的“思考”这一块拼图,并且在向可解释性更高的认知科学概念靠拢。

  • "通用智能"是一个很宏大的概念,至少包括但不限于以下能力:环境感知,记忆,思考,动机,决策,实时学习,环境交互。这个问题留给读者思考:现在的GPT能做到哪些?

  • 可解释性是另一个AI发展中的至关重要的一环,后面细说


通用人工智能发展的一大步!...吗?

是也不是,首先o1依然会犯经典的,比不出数字大小的问题,比如9.11和9.8谁大。(这个我自己没试出来,不过网上一搜就有)这个问题源自底层的tokenizer运行逻辑,在不大改架构的情况下很难彻底解决。

其次,OpenAI官方的说法是,o1模型的能力已经达到了人类博士级别,我只能评价他们对于人类博士的评判标准有点狭义。OpenAI只测试了o1模型在回答问题上面的能力,o1模型能答出人类博士才能答出的题,只能推导出,o1在回答这些专门的问题上,达到了人类博士的能力。但是你觉得o1会自己想idea,自己做实验发论文吗?本质上,o1只是更擅长完成一些GPT-4o原本就会的任务,而并没有新的能被称为“重大突破”的本事。甚至因为引入了思维链,相当于默认用双重加工理论中的系统2处理信息,这种设计反而让o1模型在更适合系统1的任务上,表现得比它的老大哥GPT-4o更差

我认为,o1模型最有价值的突破其实是大模型的可解释性。什么叫可解释性?简单来说就是,你知不知道为什么GPT会给你这个回答,而不是别的答案。之前研究AI可解释性的主流方法是,直接看AI的参数,这个方法效率很低,费时费力。但是因为o1模型引入了思维链,这个特性又和认知科学的概念对得上,我们就有了一个更宏观的,高层次的,抽象的方法来解释大模型的行为。认知科学的核心在于解释人类大脑的运作模式。如果把大脑视作一个模块化系统来研究,这种方法就会比通过神经科学直接观察脑电图要直观得多。在这里,大模型的参数就像是脑电图,如果能用认知科学的方法研究AI,也会比直接查AI的参数省事的多。可以说,o1模型的意义相当于,那些从物理规律出发研究细胞生命周期的科学家们,终于能用上现成的生物化学理论了。*

研发可解释的AI至关重要,这直接关系到我们有没有能力应对有风险的,甚至有害的AI程序。

小彩蛋:科幻小说里经常出现AI末日论。可能到头来,能防止AI毁灭人类的方法不是阿西莫夫的机器人三定则,而是研发符合认知科学框架的AI,利用这一层可解释性将AI的行为向人类利益对齐。

“... that's why we need people like Future. If someone just ... hack through all the technology and build a true AI, ... that will be a disaster.” -- John Vervaeke, 永远的神,带我入门认知科学的教授。具体用词我已经想不起来了,因为memory is reconstructive,但差不多是这么个意思。

当时跟John讨论了很多AI结合认知科学的东西,现在来看,他之前提出的看法的含金量还在不断增加。


所以真正的问题到底在哪?

一个可能不是那么显而易见的事情:真正的通用智能离不开跟环境的交互。当我们说到“通用智能”,我们说的是“像人一样的综合能力”,或者把要求放低一点,“像松鼠一样的综合能力”。

松鼠有什么能力?松鼠虽然不会算数学题,但松鼠会探索环境,会制定过冬的目标,战略性储备食物,并执行具体的行动来完成目标。

OpenAI在达成通用智能上的思路是大力出奇迹,只要模型参数堆得够多,AI就可以理解人类语言,理解全网知识,理解一切万物... 但很遗憾并不是这样的。

首先,不管是GPT还是o1,它们没有感知功能,没有眼睛鼻子嘴巴,所以也没有主观感受。当它们说出了一些涉及主观感受的内容,比如“石头很坚硬”,它们其实不知道什么叫坚硬,它们只知道“坚硬”这个概念经常与“石头”等词语相关联,背后的机制是纯纯的统计学。这就导致一个很严重的问题,虽然大模型讲的头头是道,但是它们完全不知道这些词语在现实世界中对应的概念,大模型可以针对文字和图片输入进行反馈,但没有办法在真实环境中运作。造成这个问题的核心原因则是,大模型的训练过程只涉及文字和图片,训练的方法则是不断预测下一个字,整个过程中不存在与环境的交互,也不会接收来自环境的反馈

但是,如果把聊天窗口当成环境,单纯的文字输入和输出不也是一种交互吗?确实是这样,但在这个极度简化的设定下,对于GPT来说,(让我们暂时忽略GPT有没有认知的哲学问题)它认知之中全部的世界就是一个聊天窗口,并且可以通过计算文字之间的统计学关联性,完全理解这个世界的运作法测。显而易见的,这种极度有限的认知无法胜任绝大多数现实世界中哪怕是最简单的工作。

让我们假设一种理想情况,那就是GPT可以通过程序指令与外界交互。就像是你打开B站刷视频,本质上也是通过系统后台下达了几串指令,重点是,这些过程可以完全通多文本交互实现。这个情况下,GPT认知中的世界就拓展到了所有程序和网络接口的层面。如果训练数据充足,理论上是可以学会与电子世界的交互,可以完成电脑手机上能完成的所有任务。这个其实挺像现在很多科幻作品里的AI助手,但仅限于脱离现实世界的软件层面。这个也应该是OpenAI的路子的理论上限了,还挺有赛博朋克那味儿!


实现通用人工智能的另一条路

在OpenAI大火的光环之下,在(相对)不(那么)为人知的角落,Google DeepMind和其它学者在另一条路上越走越远:世界模型(World Model)!

世界模型,一套真正专注于通过环境交互来理解世界的理论框架,让AI理解万物的意义,通过交互学习未知的东西。AI三巨头(2018年图灵奖得主)之一杨立昆Yann LeCun评价道,世界模型是实现自主AI的关键理论。世界模型依然是一个前沿的研究课题,目前还没有像大语言模型一样成熟的体系,主要研究也还在探索阶段。在LeCun的设想中,世界模型需要:

  1. 将观测到的信息总结为内在的理解

  2. 从当前世界的状态出发,基于内在理解,某个特定的行动,和自身的知识/经验,预测下一个时刻的世界状态

LeCun还指出,像GPT这样的大语言模型,本质上是一种简化的世界模型:

  • GPT直接使用观测到的信息,不经过额外处理

  • GPT的当前世界状态是之前已有的文本

  • GPT不做出任何行动/决策

  • GPT预测的下一时刻世界状态,就是当前世界状态+一个新的字

相比CloseAI,DeepMind一直是我更看好的公司,他们多年专注于研究AI代理(Agent)在简化的虚拟环境中的交互学习,最近已经可以把在虚拟环境中训练的AI装到现实世界的机器人上了。参与这一系列研究中的一位学者,以前甚至也是我的认知科学教授John的学生(这是我师兄!)。

就在几天前,业界明灯李飞飞也融了个初创公司World Labs,专注于基于世界模型和空间智能的AI。李飞飞评价道:**通用智能的两大组成模块是语言智能和空间智能**,OpenAI一直在尝试模拟语言和逻辑能力,但是能感知环境信息并做出决策的智能同样重要。而我的评价(暴论)则是:

却说这人类,自打开天辟地以来,先是察山观水,辨天识地,方才生出那空间智能来。待到时日已久,方有了言语沟通,彼此传递心中所思。可这空间智能,乃是根基所在。今OpenAI舍本逐末,只盼凭借言语之能便能造出那通晓万物之智能,实在是南辕北辙,徒增笑耳。

(白话文言文润色由GPT友情提供)

世界模型很可能是AI学界的下一个大热领域,很可能为现在很火的的Agentic和Embodied研究带来新的思路,也是真正能带动下一次工业革命的契机。具有空间智能,能实现环境交互的机器人,才能落实到线下,投入生产。建议对AI发展感兴趣的小伙伴多多关注相关研究,对AI行业投资感兴趣的大佬也可以关注相关概念。

这篇有点长,感谢阅读,Dr. Future——您身边的AI科技评论,随缘更新,对于您基于此文章做出的任何决策概不承担法律责任