过去五年,大型语言模型(LLM)的推理能力成为研究热点。传统的大型模型在许多任务上表现出色,但在复杂推理任务上往往力不从心,需要引入类似人类“逐步思考”的机制 [1]。为此,研究者提出了链式思考(Chain-of-Thought, CoT)等方法,使模型能够通过中间步骤推理,提升复杂问题求解能力 [2]。另一方面,新一代“推理模型”如 OpenAI 的 o1/o3 系列内置了模拟思考流程,被称为系统2风格模型,而传统模型则更类似于快速直觉的系统1 [3]。本文将从定义与本质区别、训练方式比较、性能表现与应用、以及推理模型的训练方式四方面,对比分析“非推理模型”和“推理模型”的核心差异,并引用近五年顶会(NeurIPS、ICLR、ACL、AAAI等)和期刊的权威研究成果与基准实验数据进行论证。
非推理模型通常指传统的大型语言模型或深度学习模型,它们在回答问题时并不显式展开中间推理步骤,可以看作是没有“思考”的模式,更接近心理学中的“系统1”——快速、直觉式决策 [3]。这类模型接受输入后,利用其在海量数据上训练所得的模式匹配能力,直接生成输出答案,内部不存在人为可见的逐步推理链条。GPT-3、BERT 等预训练模型在默认情况下都属于此范畴:它们倾向于依据相关经验直接给出回答。
推理模型则指具有显式“思考”机制的模型,能够将复杂问题分解为一系列中间步骤来推导答案,类似“系统2”——慢速、深思熟虑的推理过程 [1]。这种模型的核心在于链式推理机制,例如链式思考(CoT)提示可以引导模型在作答前生成一连串中间推理步骤 [2]。通过逐步演绎,模型在每一步“思考”时利用上下文和知识,最终得出结论。最近OpenAI推出的 o1、o3 模型家族就是明确以推理为目标设计的:o3 模型采用了一种称为“模拟推理”的过程,使模型在回答前可以暂停并反思其内部思路 [4]。这比简单的链式思考提示更进了一步,成为更高级的自我分析和反思机制,能模仿人类通过识别模式、逐步推导来进行逻辑推理 [4]。因此,推理模型的内部往往会生成和评估一些隐含的中间推理状态,再产出最后答案。
“思考”和“不思考”在模型内部实现上是否只是模式开关? 从以上描述可见,两类模型的行为差异显著,但部分差异可以通过提示触发。研究发现,大型语言模型中潜藏着推理能力,只需通过特定提示即可引出。例如,在零样本设置下给模型的回答部分加上“一步一步思考”(“Let’s think step by step”)的指令,就能令其先输出推理过程再给答案,从而大幅提高推理类任务表现 [5]。Kojima 等人(2022)证明,在无需额外训练数据的情况下,直接在提示中加入“让我们一步一步地思考”的字样,模型在数学推理等基准上的准确率显著提升:如MultiArith算术推理任务准确率从17.7%飙升至78.7%,GSM8K数学问答从10.4%升至40.7%(使用text-davinci-002模型) [5]。这表明同一模型内部同时具备“不思考”和“思考”两种潜在模式,通过合适的提示可以在一定程度上“切换”模型的推理行为模式。进一步的研究甚至发现,即使不提供显式的链式思考提示,只要改变解码策略也能挖掘出模型的内在推理路径:采用非贪心的采样搜索多个可能输出,可以发现模型本已内隐学习到的链式推理序列常存在于次优候选中 [6]。换言之,大型预训练模型往往隐含学到了推理模式,但默认贪心解码选择的是直接答案,使得这种“会思考”的能力被掩盖了 [6]。
然而,尽管提示或解码策略可以在一定程度上触发推理,大规模推理模型与普通模型仍存在更深层次的差异,并非仅靠一个开关切换那么简单。首先,只有参数规模足够大的模型,才能成功利用链式思考提示产生有用的推理步骤。较小的模型即使强行要求其输出思考过程,往往也是语无伦次或南辕北辙的,中间步骤并不能帮助得出正确答案 [7] [8]。Wei 等人(2022)在研究中指出,链式思考能力是在足够大的模型中自然涌现的特性;他们实验证明,只有数百亿参数级别的模型才能可靠地利用CoT解题,而小模型基本无效 [7] [8]。这一点也从反面印证了推理模型需要更强大的内部表示能力。其次,新一代推理模型在架构和推理流程上做了专门设计。例如OpenAI的 o3-mini 模型提供了思考深度可调的模式:用户可以选择low / medium / high三种推理程度,直接影响模型回答时“思考”的深入程度 [9]。在o3-mini-high模式下,模型启用最高级别的推理,花费更多计算和时间来生成输出,从而在复杂任务上获得更高准确性 [9]。这种通过调整算力或推理步数来增强思考的机制,说明推理模型在推理深度上是一个连续谱,并非普通模型中简单的有无某标志位那么浅层。再次,推理模型往往在训练过程中就融入了“思考”过程,这使得它们即便不靠提示,也会主动以推理方式作答(如OpenAI的o1-preview模型内置了Chain-of-Thought风格的回答) [10]。综合而言,非推理模型注重模式匹配和直觉式回答,而推理模型在内部加入了显式或隐式的多步骤演算机制,从而在本质上更擅长处理复杂推理任务。虽然有些大型模型可以通过提示表现出推理能力,但真正的推理模型通常在结构和训练上进行了特别的优化,使“会思考”成为其固有属性。
训练数据与策略差异:
非推理模型和推理模型在训练阶段可能采用不同的数据和目标。传统非推理模型通常采用大规模通用语料进行预训练,优化目标是语言建模(预测下一个词)或类似目标,在此过程中模型并未被显式要求展示中间推理步骤。这意味着模型主要学习到语言模式和知识,但缺乏针对性解决复杂推理问题的监督信号。相反,推理模型为了具备“思考”能力,往往需要在训练中引入特殊策略。例如,研究者可以构造含有中间推理步骤标注的数据集,对模型进行监督微调,使其学会先输出推理过程再给答案 [11]。这样的数据可以来自人类标注的详细解题过程,也可以来自模型自己生成的“思考记录”(后文将详述)。以数学问题求解为例,Minerva 模型在PaLM基础上进一步训练了一个118GB的大型数学和科学语料库,其中包含大量带有LaTeX公式推导过程的文本 [12]。通过在这种定制语料上继续训练,模型掌握了数学推理所需的步骤推导技能 [12]。因此,推理模型的训练数据更注重过程监督(过程导向的标注)而不仅仅是输入到输出的结果对。
在训练策略上,推理模型可能采用分阶段训练或辅助损失来强化推理链生成。例如,一种思路是先预训练、后推理微调:先让模型作为普通语言模型习得广泛知识和基础能力,然后再通过在推理任务上的微调来“教会”它链式思考。这样做的好处是利用了预训练模型强大的知识和语言表达能力作为基础,再叠加上推理技巧,相当于“非推理模型 + 推理能力”的组合 [1]。这一点与人类相似:人类需要先积累常识和知识(基础模型),再学习解题方法(推理微调)。训练策略上还包括反馈式训练和强化学习等。例如OpenAI的o3模型引入了“深思熟虑对齐(deliberative alignment)”的安全训练方法,实际上是使用模型的推理能力去审视和过滤自己的输出,确保其符合安全规范 [13]。这种方法本质上让模型在生成最终答复前进行内部推理评估,也是训练中融入推理过程的体现。总的来说,推理模型在训练环节可能需要额外的步骤和目标,以确保模型学会“想步骤”而不仅是“背答案”。而非推理模型训练更简单直接,但因此欠缺了解决复杂推理的显式手段。
优化方法与参数规模影响:
值得注意的是,增大模型的参数规模和训练数据量本身也可以部分弥补推理能力的不足。近年研究揭示了一系列涌现能力(Emergent Abilities),即模型在参数达到一定规模后,会突然表现出之前不具备的新能力,其中就包括复杂推理 [2]。Wei 等人在链式思考提示论文中报告,规模较小的模型基本无法利用CoT提示解题,而当参数增至数百亿乃至更大时,模型对这些提示的响应能力急剧提升 [7] [8]。例如,PaLM模型从62B扩展到540B参数后,在数学word问题上的链式推理错误率显著降低:许多在62B模型中出现的一步推理遗漏或语义理解错误,靠提升规模到540B便自动消除了大部分 [14]。这表明**“更多的参数 + 更多通用训练”确实赋予模型更强的内隐推理能力** [14]。因此,一种弥补推理能力差距的策略是简单地“更大更全”的预训练。然而,这种方法存在效率和成本问题,小模型用户无法奢求动辄千亿参数。此外,大模型的推理能力虽然涌现,但未经过专门优化,往往还不够精细,可能需要精心设计提示才能发挥出来。
“思考模式”引入的专门训练:
如上所述,真正要让模型具备可靠的推理模式,往往需要在训练方法上做文章,不能仅依赖规模。引入思考模式通常会导致训练方法或策略的变化。一个典型的问题是:如何让较小的模型也学会链式推理? 近期研究探索了知识蒸馏和指导微调的方法。例如,Ranaldi 和 Freitas(2024)提出通过链式思考指令微调(Instruction-tuning CoT)的办法,将大模型的推理能力对齐并迁移给小模型 [15] [16]。具体来说,他们用一个强大的教师LLM(如70B参数的Llama2或GPT-3.5)来针对大量问题生成高质量的链式推理示例,然后用这些带推理过程的示例去微调较小的学生模型(如7B或13B参数) [17]。结果显示,小模型经过这种有链式示例的指令微调后,在各种问答和数学推理基准上的表现明显优于未微调的小模型基线 [18]。甚至在一些跨分布的测试中,小模型也展现出比肩更大模型的推理能力 [18]。这证明通过训练策略的调整(加入教师生成的中间过程数据),小模型也能部分弥补自身推理能力不足。这种方法等于在训练中直接注入“思考范例”,而非仅靠增大参数“憋”出推理。本质上,这是用数据和任务范式来弥补推理能力差距的案例。
还有一些研究着眼于模型推理模式的自我引导学习。例如 自学式推理 方法 (Self-Taught Reasoner, STaR) 就是一种不用大规模人工标注推理过程、而让模型自己提升推理能力的训练策略 [11]。具体做法是:先用少量带推理过程的示例引导模型对大量未标注问题生成链式推理和答案,然后检查这些生成答案是否正确。对于答案错误的案例,提供正确答案再让模型重新尝试生成推理,最后把所有最终答案正确且推理链有效的问题-推理对收集起来,用它们微调模型 [11]。通过反复迭代,模型不断“用自己的推理训练自己”。实验证明,STaR显著提高了模型在多个数据集上的表现,相比直接微调到答案的小模型有大幅提升,并且其效果可媲美一个参数量大30倍的模型在CommonsenseQA等任务上的成绩 [19]。这意味着通过巧妙的训练策略(迭代生成并学习推理过程),即使不一味扩大模型规模,也能赋予模型强大的推理能力 [19]。总之,引入“思考模式”往往需要定制化的训练流程:从利用大模型指导小模型,到模型自我生成强化,都是为了在训练中显式灌输推理技能,以弥补仅靠数据量和参数量难以弥合的推理鸿沟。
推理模型 vs 非推理模型的任务表现:
在需要复杂推理的任务上,推理模型往往表现远胜于非推理模型,而在某些不需要推理的任务上,两者差别不大甚至前者可能稍逊。以数学和逻辑推理任务为例,链式思考的引入彻底改进了模型的成绩。一项经典基准是GSM8K(小学数学文字题) [20]。GPT-3一类的不带推理过程模型在该数据集上的零样本准确率非常低(不足20%),即使通过少量示例提示也只能解对约30%的问题 [21]。然而,当引入链式思考提示后,一个5400亿参数的PaLM模型在GSM8K上达到74%以上的准确率,一举超过了此前最先进的用GPT-3微调+验证器架构得到的成绩 [21] [22]。具体而言,PaLM 540B 在仅提供8个链式推理示例作为提示的情况下,取得了GSM8K当时的最高准确率,超过了甚至经过微调的GPT-3+Verifier模型 [21] [22]。这凸显了推理过程对复杂算术问题的重要性:没有中间步骤推导,模型很难凭直觉直接算对答案;而给模型“思考”的空间和例子,它便能逐步推算得到正确结果。再如在多任务综合测评基准MMLU(涵盖人文、科学、数学等57个科目),推理能力强的模型也展现出优势。GPT-4作为当前最先进的推理模型之一,在MMLU五-shot测试中成绩约为86.4%,接近人类专家水平 [23]。相比之下,OpenAI上一代的GPT-3.5模型(被认为不如GPT-4擅长深度推理)五-shot仅得约70% [24]。十多个百分点的差距反映了GPT-4在理解上下文、逻辑推理和跨领域知识整合上的显著提升。这种提升部分归功于模型规模和训练,但也离不开更好的推理策略和对话式思考能力的引入。总的来说,在数学、逻辑推理、复杂问答、代码推导等需要多步思考的任务(即通常所说 STEM 领域问题)上,具有推理机制的模型往往大幅领先。Google 的Minerva模型就是一例:作为专门面向定量推理的语言模型,Minerva在数学和科学问题上通过生成逐步解题过程取得了当时最佳表现,能正确完成许多需要符号推理和计算的题目 [25]。其成功秘诀在于结合了链式思考提示、scratchpad草稿推理以及多数决策等推理技巧,从而在STEM任务上取得突破 [25]。相较之下,非推理模型如基础的PaLM(未特殊微调版本)在这些复杂任务上远逊于Minerva。这再次说明,没有显式推理过程的模型难以胜任需要系统思考的领域。
非推理模型反而胜出的情形:
有趣的是,也存在某些情境下非推理模型的表现能持平甚至超过推理模型,尽管这种情况相对少见而且通常有特定原因。Liu 等(2024)探讨了在某些任务上链式思考反而降低模型性能的现象 [26]。他们受认知心理学启发,设计了一些任务,这些任务中对人类来说“过度思考”会适得其反,比如隐式模式学习(根据字符串隐含规则分类)或视觉识别(根据文字描述识别人脸)等。在这些任务上,他们对比了模型使用CoT推理和直接作答两种策略的表现,结果发现带推理的模型准确率显著下降 [26]。一个典型例子是OpenAI的o1-preview模型(该模型回答时内置了链式推理说明),在一项人工语法模式学习任务中准确率比不带推理的GPT-4基础模型低了36.3个百分点 [27] [28]。也就是说,引入推理步骤使模型错误大幅增加。这种反常现象的原因在于:对于某些需要依赖直觉或快速模式识别的任务,逐步分析可能反而干扰了模型原本有效的“瞬时判断”。在人类中也有类似情况——过度思考有时会让人错过直觉能捕捉的简单模式。模型在这些任务上的行为似乎也类比了这一点:当任务本质上不适合显式分步推理时,强行让模型逐步考虑可能引入不必要的复杂性,干扰其基于整体模式的判断 [26]。除了上述认知型任务,在一些纯粹依赖记忆或关联的问题上,非推理模型也可能并不吃亏。比如简单的常识问答、陈述事实、翻译等场景,如果问题可以直接通过训练语料中的模式来回答,那么直接输出答案即可;此时链式推理并不会明显提高准确率,反而可能显得冗长。还有模型训练目标的因素:推理模型由于需要生成完整的思考过程和答案,训练时可能在平衡“推理正确”与“答案正确”两个目标。而非推理模型训练只需关注最终答案对错,可能在特定评测指标上略有优势(尽管缺乏解释性)。当然,总体现代推理模型在设计上已尽量避免对简单任务产生负面影响,很多时候它们可以识别出任务难度,不会无谓地展开冗长推理。不过上述研究提醒我们:链式推理并非万能钥匙,在某些特殊任务和条件下,非推理模型的直接决策反而更有效。因此,学界也在探索如何让模型自主判断何时该快速直觉回答,何时该启动深入推理,以结合两种模式的长处。
模型架构和目标对性能的影响:
推理模型与非推理模型在架构上的差异也会影响性能表现。一些推理导向的模型可能引入额外模块或循环机制来实现多步推演,例如利用递归或循环神经网络在内部反复推理,或者借助外部工具(如程序执行器、计算器)辅助思考。这使它们在特定任务上有更强的算力或表示能力。而非推理模型通常是一次性前向计算完成,对这样的多阶段问题难以胜任。此外,推理模型训练时的目标通常不止于预测正确答案,还可能包括生成有逻辑的中间过程。若这些中间过程的质量不佳,可能拖累最终答案准确率。因此推理模型有时需要对“中间思路正确性”进行约束或优化(提高链的忠实度),以确保推理步骤真正有助于求解 [29] [30]。不然就会出现模型给出看似详尽的推理过程但最后答案依然错误的情况,这对性能是不利的。相比之下,非推理模型完全以最终答案为导向优化,每一步计算都在服务于直接输出答案。综上,推理模型在大多数需要复杂思维的应用领域表现更佳,但在某些主要依赖直觉匹配的情境下要谨防过度推理带来的性能下降。实际应用中,常结合两类模型的优点:简单任务走“快捷通道”,复杂任务调用“深度思考”,从而获得最佳的综合性能。
非推理模型是推理模型的基础吗?
在当前主流范式下,答案是肯定的:优秀的推理型大模型几乎无一不是从优秀的非推理基础模型演化而来。大规模预训练模型为下游推理奠定了必要的基础,包括广博的知识、语言理解与生成能力,以及一定程度的模式联想能力 [1]。这些能力相当于“常识”和“直觉”,是进一步训练推理技能的底座。如果基础模型能力不足,推理过程将无源之水——中间步骤可能每步都有谬误,再精妙的推理框架也无法得到正确结论。正如一句谚语所说:“巧妇难为无米之炊”,推理所需的事实和概念仍来自基础模型的记忆库。研究指出,当基础模型更强时,经过适当微调,其推理性能相应地更强 [1]。例如,OpenAI 的 o1/o3 推理模型据报道是在 GPT-4 等强大基础模型的底子上,结合新的思维框架训练而成 [31] [32]。良好的基座模型使推理微调事半功倍:模型不需要再从零学习语言和知识,只需专注于学习如何更好地运用已有知识进行多步推导。Google 的Minerva也是基于PaLM这样的顶尖基础模型,再经由定制的学术数据语料微调而成 [33] [12]。实验显示,相比直接用同等规模的数据从头训练一个推理模型,采用预训练基座微调能更快收敛并取得更高性能。因此可以说非推理基础模型提供了知识与语言能力,推理微调赋予逻辑思维,二者缺一不可。这解释了为何学界常把提升基础模型能力(更大的模型和更优的预训练)视为增强推理能力的前提条件之一:地基牢固才能建高楼。
利用推理模型自行生成的数据进行训练:
这是近年非常有趣的一个方向,即让模型在训练中部分扮演教师角色,用自身的推理输出来教会自己或较弱的模型。与此对应的是传统方法:使用非推理模型(或人类)生成的标注数据来训练模型。两者相比,各有优劣。使用推理模型自身生成的链式思考数据进行再训练,有以下优点:首先,这种方法能大幅扩充训练数据规模且成本低廉。模型可以针对海量未标注问题生成带推理过程的解答,远超人工能够编写的数量。[11]提出的 STaR 方法正是典型案例:只需极少人工示例起步,模型即可自我迭代地产生更多推理数据,并不断提升性能 [34]。经过若干轮次后,模型不仅学会了原先不会的复杂推理题,还达到了媲美30倍大小模型的效果 [19]。这表明让模型学习自己产生的思考过程是可行且高效的。其次,模型用自己的“语言”和方式生成推理,更贴合其内部表示。当我们用模型本身的推理链来训练它时,相当于让模型巩固自己已经能部分理解的模式,因而学习效率可能更高。同时,模型生成的过程往往覆盖它觉得有意义的思路,这有助于挖掘模型固有的推理长处。
然而,直接用模型自生成的数据也有挑战。最大的风险是错误推理的累积:模型一开始生成的许多推理可能是错误的,如果不加筛选地拿来训练,模型可能强化这些谬误模式。为此,需要设计过滤机制,只保留正确且高质量的推理过程用于训练。STaR 中的做法是要求模型最终答案正确才算一条有效样本,并且可以在生成错误时给予正确答案提示再重试,从而提高保留下来的训练样本质量 [34]。如此一来,模型主要从自己成功的推理中学习,避免了“以谬传谬”。另一个问题是多样性:模型自身的思考方式可能相对一致,反复微调可能让其推理模式变得过于固化。对此,可以引入多样化的推理路径(例如通过不同提示、不同随机种子生成多种解题思路)再训练,以丰富模型的推理策略。相比之下,基于非推理模型的数据进行训练(例如只有问答对而无中间过程)虽然不会直接灌输推理能力,但在模型规模足够大时,也能让模型通过记忆大量问答模式来间接解决一些问题。然而,这种训练缺乏对推理步骤的监督,使得模型在遇到新问题时无法像推理模型那样灵活推导,只能寄望于相似题目的模式匹配。因此,完全依赖问答对训练的模型,即使参数很大,也往往在需要举一反三时显得力不从心。
比较两种方式的优劣:利用推理模型自身数据训练可以看作是一种知识蒸馏或自蒸馏。大模型先通过推理能力解决一批问题,再把这些“解题思路”教给自己或小模型。这有点类似人类解题时写下过程供复习:过程本身蕴含了通用的方法和关键思想,学会过程比只记答案更有助于举一反三。但自蒸馏也需要确保过程是正确的——就像学生不能向错误的解答学习。在实际操作中,一个折中方案是大模型教师 + 自身迭代:先用一个很强的推理模型产生高质量思考数据,微调学生模型;然后学生模型再用自身生成更多数据精炼自己。这样既保证初始数据质量高,也赋予学生模型自我完善的机会。总的来说,用推理模型生成的数据进行训练已被证明是提升推理能力的有效途径 [15] [34]。相对于仅用非推理模型数据(缺少中间监督),这种方式令模型真正掌握了解题过程,因而在遇到新问题时也能靠推理解决而非仅仅模式匹配。展望未来,随着推理模型变得愈发强大,它们完全可以自动生成各种领域的大量高质量解题过程,以训练新模型或提升自己,使得人工标注的需求逐步降低。这将加速推理模型的改进迭代,形成正反馈的进化过程。
综上所述,非推理模型与推理模型在定义、本质和能力上存在显著区别。非推理模型擅长快速模式匹配式的回答,缺乏显式的中间推理过程;推理模型则集成了链式思考等机制,能够通过逐步演绎解决复杂问题 [3] [1]。这种“会思考”的特性并非简单开关,而是依赖模型规模、架构设计和训练范式的综合作用 [4] [9]。在训练上,推理模型往往需要特殊的数据和方法来教授中间过程,包括利用大模型示范、小模型模仿、自举式生成等策略 [15] [34]。性能评估表明,推理模型在数学、逻辑推理等复杂任务上远超传统模型,但在某些直觉判断任务上需谨防使用推理,以免性能下降 [27] [26]。一个强大的非推理基础模型是打造推理模型的基石,结合高质量的推理过程数据训练,能使模型具备卓越的逻辑推理能力 [25] [12]。近年来的顶尖研究与基准(如MMLU、GSM8K等)清晰地展现了这一演进:从依赖提示才能偶然“思考”的大模型,到专门为“会思考”而优化的新模型,AI正逐步迈向更接近人类推理的智能形态 [3] [35]。展望未来,通过在训练中进一步融合推理机制、引入更高级的自我反思和元推理能力,模型或许能在更广泛的领域实现超越,人类也将在这一过程中对“让机器学会思考”有更加深刻的理解。
参考文献:
Jason Wei et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022 [2] [21].
Takeshi Kojima et al. Large Language Models are Zero-Shot Reasoners. NeurIPS 2022 [5].
TechTarget: OpenAI o3 explained: Everything you need to know [4] [9].
Ryan Liu et al. Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans Worse. arXiv 2024 [27] [10].
Leonardo Ranaldi, André Freitas. Aligning Large and Small Language Models via Chain-of-Thought Reasoning. EACL 2024 [15] [16].
Eric Zelikman et al. STaR: Bootstrapping Reasoning With Reasoning. arXiv 2022 [34].
OpenAI. GPT-4 Technical Report. 2023 [23].
Google Research Blog: Minerva: Solving Quantitative Reasoning Problems with Language Models. 2022 [25] [12].
Zhong-Zhi Li et al. From System 1 to System 2: A Survey of Reasoning Large Language Models. arXiv 2025 [3].
Xuezhi Wang, Denny Zhou. Chain-of-Thought Reasoning Without Prompting. NeurIPS 2024 [6].
引用:
[1] [2502.17419] From System 1 to System 2: A Survey of Reasoning Large Language Models: https://ar5iv.org/pdf/2502.17419#:~:text=Foundational%20Large%20Language%20Models%20,like%20cognitive%20abilities
[2] Chain-of-Thought Prompting Elicits Reasoning in Large Language Models: https://proceedings.neurips.cc/paper_files/paper/2022/hash/9d5609613524ecf4f15af0f7b31abca4-Abstract-Conference.html#:~:text=We%20explore%20how%20generating%20a,parameter%20language%20model%20with%20just
[3] [2502.17419] From System 1 to System 2: A Survey of Reasoning Large Language Models: https://ar5iv.org/pdf/2502.17419#:~:text=reasoning,like%20cognitive%20abilities
[4] OpenAI o3 explained: Everything you need to know: https://www.techtarget.com/whatis/feature/OpenAI-o3-explained-Everything-you-need-to-know#:~:text=The%20o3%20model%20uses%20a,conclusions%20based%20on%20those%20patterns
[5] [2205.11916] Large Language Models are Zero-Shot Reasoners: https://arxiv.org/abs/2205.11916#:~:text=reasoners%20by%20simply%20adding%20,of%20improvements%20with%20another%20off
[6] NeurIPS Poster Chain-of-Thought Reasoning Without Prompting: https://neurips.cc/virtual/2024/poster/96654#:~:text=Our%20findings%20reveal%20that%2C%20intriguingly%2C,This
[7] : https://aclanthology.org/2024.eacl-long.109.pdf#:~:text=billions%20of%20parameters%2C%20which%20represent,for%20align%02ing%20and%20transferring%20reasoning
[8] : https://aclanthology.org/2024.eacl-long.109.pdf#:~:text=1%20Introduction%20Chain,step%2C%20controlled
[9] OpenAI o3 explained: Everything you need to know: https://www.techtarget.com/whatis/feature/OpenAI-o3-explained-Everything-you-need-to-know#:~:text=The%20o3,time%20to%20generate%20an%20output
[10] Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans Worse: https://arxiv.org/html/2410.21333v1#:~:text=match%20at%20L394%20o1,shot
[11] [2203.14465] STaR: Bootstrapping Reasoning With Reasoning: https://arxiv.org/abs/2203.14465#:~:text=iteratively%20leverage%20a%20small%20number,Thus%2C%20STaR
[12] Minerva: Solving Quantitative Reasoning Problems with Language Models: https://research.google/blog/minerva-solving-quantitative-reasoning-problems-with-language-models/#:~:text=Model%20,or%20other%20mathematical%20typesetting%20formats
[13] OpenAI o3 explained: Everything you need to know: https://www.techtarget.com/whatis/feature/OpenAI-o3-explained-Everything-you-need-to-know#:~:text=What%20are%20the%20new%20safety,techniques%20in%20o3
[14] : https://openreview.net/pdf?id=_VjQlMeSB_J#:~:text=made%20by%20PaLM%2062B%20and,natural%20question%20of%20whether%20the
[15] : https://aclanthology.org/2024.eacl-long.109.pdf#:~:text=In%20this%20paper%2C%20we%20propose,same%20family%20or%20not%2C%20evaluating
[16] : https://aclanthology.org/2024.eacl-long.109.pdf#:~:text=Results%20obtained%20on%20question,task%20towards%20a%20sequence%20of
[17] : https://aclanthology.org/2024.eacl-long.109.pdf#:~:text=we%20instruct%20a%20smaller%20Language,domain%20scenarios
[18] : https://aclanthology.org/2024.eacl-long.109.pdf#:~:text=Results%20obtained%20on%20question,domain%20scenarios
[19] [2203.14465] STaR: Bootstrapping Reasoning With Reasoning: https://arxiv.org/abs/2203.14465#:~:text=rationale%20examples%3B%20if%20the%20generated,from%20its%20own%20generated%20reasoning
[20] Chain-of-Thought Prompting Elicits Reasoning in Large Language Models: https://proceedings.neurips.cc/paper_files/paper/2022/hash/9d5609613524ecf4f15af0f7b31abca4-Abstract-Conference.html#:~:text=are%20provided%20as%20exemplars%20in,3%20with%20a%20verifier
[21] : https://openreview.net/pdf?id=_VjQlMeSB_J#:~:text=improves%20performance%20on%20a%20range,The%20answer%20is%209
[22] : https://openreview.net/pdf?id=_VjQlMeSB_J#:~:text=reasoning%20tasks,They%20used
[23] open-llm-leaderboard/open_llm_leaderboard · Scores of GPT3.5 and GPT4 for comparison: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard/discussions/30#:~:text=%22MMLU%20%285,gpt35_values%20%3D
[24] open-llm-leaderboard/open_llm_leaderboard · Scores of GPT3.5 and GPT4 for comparison: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard/discussions/30#:~:text=%22MMLU%20%285,shot%29%20%E2%AC%86%EF%B8%8F%22%3A%2047.0%2C
[25] Minerva: Solving Quantitative Reasoning Problems with Language Models: https://research.google/blog/minerva-solving-quantitative-reasoning-problems-with-language-models/#:~:text=difficult%20quantitative%20reasoning%20tasks,with%20our%20interactive%20sample%20explorer
[26] Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans Worse: https://arxiv.org/html/2410.21333v1#:~:text=governing%20human%20performance%20generalize%20to,Overall%2C%20our%20results
[27] Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans Worse: https://arxiv.org/html/2410.21333v1#:~:text=drop,thinking%20reduces%20human%20performance%20in
[28] Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans Worse: https://arxiv.org/html/2410.21333v1#:~:text=o1,shot
[29] On the Impact of Fine-Tuning on Chain-of-Thought Reasoning: https://arxiv.org/html/2411.15382v1#:~:text=Faithfulness%2C%20in%20this%20context%2C%20refers,reasoning%20contributes%20to%20the%20final
[30] On the Impact of Fine-Tuning on Chain-of-Thought Reasoning: https://arxiv.org/html/2411.15382v1#:~:text=research%20suggests%20that%2C%20despite%20generating,reasoning%20contributes%20to%20the%20final
[31] OpenAI o3 explained: Everything you need to know: https://www.techtarget.com/whatis/feature/OpenAI-o3-explained-Everything-you-need-to-know#:~:text=Originally%20developed%20under%20the%20code,5%2C%202024
[32] OpenAI o3 explained: Everything you need to know: https://www.techtarget.com/whatis/feature/OpenAI-o3-explained-Everything-you-need-to-know#:~:text=What%20is%20OpenAI%20o3%3F
[33] Minerva: Solving Quantitative Reasoning Problems with Language Models: https://research.google/blog/minerva-solving-quantitative-reasoning-problems-with-language-models/#:~:text=A%20Model%20Built%20for%20Multi,Quantitative%20Reasoning
[34] [2203.14465] STaR: Bootstrapping Reasoning With Reasoning: https://arxiv.org/abs/2203.14465#:~:text=complex%20reasoning,from%20its%20own%20generated%20reasoning
[35] [2502.17419v2] From System 1 to System 2: A Survey of Reasoning Large Language Models: https://ar5iv.org/html/2502.17419v2#:~:text=LLMs%20like%20OpenAI%27s%20o1%2Fo3%20and,the%20progress%20in%20foundational%20LLMs