李宏毅:一堂课搞懂 AI Agent 的原理|2025.03.09

2.5万
29
2025-03-09 18:46:36
595
166
2282
386
https://www.youtube.com/watch?v=M2Yg1kwPpts 李宏毅刚刚发布了《一堂课搞懂 AI Agent 的原理》,非常深入浅出,强烈推荐。 从 LLM 的角度来看,它做 AI Agent 任务仍然是在做文字接龙。AI Agent 并不是语言模型的新技术,它比较像语言模型的一个应用。 主要内容: 一、AI Agent 的基本运作原理 核心循环:目标 (Goal) -> 观察 (Observation) -> 行动 (Action)。 Action 影响环境,产生新的 Observation。 循环往复,直至达成目标。 举例:AlphaGo - 目标:赢棋。 - Observation:棋盘上的棋子位置。 - Action:在棋盘上落子。 与强化学习 (RL) 的关系: - 传统上,AI Agent的打造依赖 RL 算法。 - RL 的局限性:需要为每个任务单独训练模型。 - 新的思路:能否直接用 LLM 作为 AI Agent? 二、LLM 作为 AI Agent 目标 (文字描述) -> 环境 (转为文字或直接使用图像) -> 行动 (文字描述,需转译为可执行指令)。 LLM 的核心是文字接龙,AI Agent 是 LLM 的一种应用。 本课程没有新的模型被训练,是基于现有LLM通用能力的应用。 历史回顾:2023 年春季出现过一波 AI Agent 热潮 (AutoGPT),但后来降温,因为实际效果不如预期。 LLM 驱动 AI Agent 的优势: - 行动可能性近乎无限,不再局限于预设行为。 - 无需像 RL 那样定义 Reward,可直接提供错误日志等丰富信息。 三、AI Agent 实例 AI 村民:斯坦福小镇 AI 使用电脑:Cloud Computer Use、ChatGPT Operator。 AI 训练 AI 模型:Google 的 co-scientist 等 四、更即时的互动 需要能够根据环境的实时变化,立刻调整行动。 应用场景:语音对话 五、AI Agent 的关键能力剖析 (一)根据经验调整行为 传统方法:调整模型参数 (本课程不涉及)。 LLM 的能力:直接提供错误信息,无需调整参数即可改变行为。 关键问题:如何管理和利用过去的经验? 解决方案:Memory 机制,类似于人类的长期记忆。 - Read 模块:从 Memory 中选择与当前问题相关的经验。类似于 RAG 技术。 - Write 模块:决定什么信息应该被记录下来。 - Reflection 模块:对记忆中的信息做抽象、整理,建立经验之间的联系 (Knowledge Graph)。类似于 GraphRAG、HippoRAG。 (二)使用工具 工具定义:只需知道如何使用,无需了解内部运作。 常用工具:搜索引擎、程序 (LLM 自己编写)、其他 AI 模型。 使用工具 = 调用函数 (Function Calling)。 需要开发者搭建桥梁,将 Tool 指令转化为实际的函数调用。 具体工具: - 搜索引擎 (RAG) -自己打造工具:LLM 自己编写程序,作为工具使用。 - 其他 AI 作为工具: 文字模型调用语音识别、情绪识别等工具处理语音。 大模型和小模型协同工作。 过度相信工具的风险:LLM 有一定程度的判断力,但有时仍会出错。 使用工具会遇到的问题:内部知识 vs. 外部知识冲突 - LLM 会在内部知识 (信念) 和外部知识 (工具结果) 之间进行权衡。 - 外部知识与 LLM 信念差距越大,LLM 越不容易相信。 - LLM 对自己信念的信心也会影响其是否被外部信息动摇。 另外,使用工具不一定总是更有效率,取决于 LLM 本身的能力。 (三)做计划 当前传统 LLM 的规划能力:介于有和没有之间。 进一步强化规划能力:与环境互动探索 (Tree Search),去除没希望的路径。 Tree Search 缺点:有些动作不可逆。 解决方案:让尝试发生在脑内模拟 (World Model),模拟环境变化。 用脑内小剧场进行规划:思考、验证可能性,模拟世界变化。 DeepSeek-R1 等思考模型确实有类似效果 。 但也存在过度思考的风险:LLM 可能会想太多,停滞不前,甚至直接放弃。
AI 技术、资讯分享
人工智能、LLM
(17/42)
自动连播
10.3万播放
简介
【中英】大型语言模型原理简化版 by 3Blue1Brown|2024.11.20
08:48
Anthropic 提示词改进工具讲解 by Alex Albert|2024.11.15
09:17
OpenAI o1 团队采访的完整版【2024.09.20】
22:14
超强多模态能力,谷歌 Gemini 2.0 演示一句话就能实现完美 P 图|2024.12.11
03:52
Gemini 2.0 空间理解能力演示
03:10
谷歌 Gemini 2.0 原生音频输出能力演示,支持多语言|2024.12.11
03:44
Gemini 2.0 原生工具使用能力演示|20241211
02:39
谷歌 Gemini 2.0 多模态实时交互能力演示|20241211
02:30
谷歌 Gemini 2.0 甚至可以做你的游戏搭子
02:07
Ilya 最新演讲:预训练将终结
24:37
用 Gemini 2.0 Flash 实现动嘴控制 Blender 建模
15:33
Anthropic 首席执行官采访 by WSJ|2025.01.22
35:33
Anthropic:构建 AI agents 的建议|2025.02.13
18:20
训大模型不如让模型思考20秒,OpenAI 研究科学家 Noam Brown TED 演讲|2024.10.22
12:10
OpenAI 首席研究官 Mark Chen 采访:GPT 4.5、Scaling Laws 以及模型情商|2025.02.28
24:05
OpenAI构建Agent的4个经验教训|20250305
08:08
李宏毅:一堂课搞懂 AI Agent 的原理|2025.03.09
01:42:00
MCP作者分享如何使用MCP构建Agent|2025.03.02
01:44:12
Windsurf构建AI Agent的三个原则|20250312
20:32
3月20日
05:31
Anthropic:构建有效Agent的三个核心思想|2025.03.07
13:43
谷歌是如何做 DeepResearch 的|2025.03.27
14:39
YC 拆解 Manus:AI Agents 的下一个突破已经到来|2025.04.08
08:30
RAG作者:部署企业RAG系统的10个经验教训|2025.04.11
16:19
李宏毅新课:大语言模型的推理过程不用太长、够用就好
24:23
李宏毅新课:谈谈有关大语言模型评估的几件事|2025.05.04
24:03
OpenAI 是如何打造 Deep Research 的?by Isa Fulford|2025.05.09
08:50
OpenAI 研究科学家 Dan Roberts 谈论强化学习 | 2025.05.09
10:04
OpenAI 如何打造协同创作的 agents|2025.04.30
23:46
Anthropic 首席产品官 Mike Krieger:从下至上构建 AI 产品|2025.05.09
21:49
不同大模型在粒子章鱼动画上的测试
00:31
Anthropic 内部关于 MCP 的访谈|20250616
19:35
Andrej Karpathy 最新演讲:Software 3.0、Agent|20250619
39:32
12-Factor Agents:可靠 LLM 应用的模式|20250704
16:36
Claude Code 官方最佳实践|演讲时间:2025.5.22
25:53
Anthropic:如何在生产环境中 vibe coding|演讲时间:2025.5.22
16:27
Anthropic:系统提示词入门
24:21
Anthropic:Prompting for Agents|演讲时间:2025.5.22
29:25
李宏毅讲 Context Engineering
01:50:08
Richard Sutton 访谈|20250927
01:07:09
用 Codex 复刻前两天最火的 3D 生物学网站
03:26
实测 DeepSeek Harness:一切皆插件,玩明白了很上头
05:49
客服
顶部
赛事库 课堂 2021拜年纪