李沐关于星星的低语项目讲座总结
真夏的硬币
2026年01月29日 20:36

——介于好多人懒得听讲座就对着招聘图乱想,这里补充一下讲座的总结,文本使用生成式ai不是全部人工制作。

🎮 项目背景

游戏设定:玩家通过语音与主角 Stella(一名来自2000年后的天体物理系大学生)互动,帮助她在坠毁的外星星球上生存并逃离。 核心挑战:构建一个开放世界、多分支、高沉浸感的AI驱动叙事系统,要求AI既扮演游戏设计师(推动合理剧情),又扮演角色演员(符合人设、情感真实)。整个交互采用严格的回合制对话模式(AI输出一轮 → 玩家输入一轮 → AI再输出下一轮),模拟真实对话节奏,而非预设脚本或批量生成。


🧠 技术与设计挑战

角色一致性 vs 开放性 Stella有详尽的世界观和人设(约20页文档),AI必须严格遵守未来科幻设定(如不能提及当代电影、技术术语需符合公元4026年背景)。然而当前语言模型训练数据以当代语料为主,极易“穿越”,需额外机制约束输出。

玩家行为不可预测 玩家可能拒绝帮助、故意挑衅(如说“你就死吧”)或长时间沉默。AI需在不破坏人设的前提下主动引导剧情——例如表达恐惧、恳求,甚至在多次无响应后自行采取行动,避免故事卡死。

剧情僵局处理 若玩家连续多次不配合(如三次未选择食物),系统需自动推进剧情(如Stella冒险尝试某种植物),确保叙事持续流动,同时维持角色动机合理。

长期对话质量衰减 当前模型在15轮以上对话后质量明显下降,50轮后几乎无法维持可信的世界状态(如忘记已损坏的设备、混淆地点),严重限制长线剧情体验。

多角色与扩展性瓶颈

  • 在涉及多个NPC的场景中,现有模型表现急剧恶化:通常只能稳定处理2–3个角色的身份、关系与状态;

  • 一旦引入第四个角色,极易出现身份混淆、关系错乱或记忆丢失,导致叙事崩塌;

  • 当前方案高度依赖人工设计(prompt engineering + 专业标注),难以快速复制到新角色或新游戏。


⚙️ 技术演进路径

初期方案(2年前) 因GPT-4推理成本过高,团队自研训练了一个 30B参数模型,使用约5万亿token的虚构/游戏相关语料进行预训练。在角色扮演任务上优于Llama 2,但通用能力不足,训练周期长、性价比低。

中期优化:强化学习 + 人工标注

  • 自建数据中心显著降低算力成本;

  • 组建20人专业标注团队(需具备游戏设计思维),构建高质量回合级剧情响应排序数据集;

  • 通过后训练(post-training),在特定场景下实现超越GPT-4的交互体验。

后期反思:通用能力是基础 发现:领域表现上限受限于通用能力。若模型在通用任务上得分低于85(满分90),则无法支撑高质量剧情交互。 提出:先确保模型具备强通用语言理解能力,再叠加领域奖励模型(Reward Model)进行微调,实现“通才+专精”结合。

未来方向:架构创新 认识到仅靠扩大模型规模无法解决根本问题——尤其是回合制长程交互中的状态漂移与多角色追踪失效。 正探索新型对话架构(如三组件结构:显式记忆模块 + 推理引擎 + 受控生成器),目标是让AI真正具备跨轮次的世界建模能力,突破“角色一多就乱、轮次一长就崩”的现状。


💡 核心经验总结

  • “智能源于预训练,但体验成于对齐”:大规模预训练提供基础能力,但高质量游戏体验依赖精细的领域对齐(reward modeling + human-in-the-loop)。

  • 不要过早放弃通用能力:专用模型若通用能力弱,反而拖累整体表现。

  • AI叙事 ≠ 聊天机器人:需兼顾故事节奏、角色弧光、玩家自由度,是系统工程而非单纯语言生成。

  • 成本与效果平衡:自建算力 + 高效训练策略是商业落地关键。

这场合作揭示了下一代AI娱乐的核心命题:真正的沉浸感,不在于模型有多大,而在于它能否像一个“活在故事里的人”那样思考、记忆、回应与成长。