Qwen真是怪胎,奖励错了,模型反而更强,强化学习得推翻重来?

6.9万
2
2025-06-04 19:40:42
1209
60
1210
207
来自华盛顿大学、艾伦人工智能实验室、伯克利的研究团队发布一篇论文,引爆了 AI 界,他们发现使用虚假奖励也能让大语言模型的推理能力提升。难道强化学习必须奖励精准的传统认知要被打破了吗?
机器之心:专业的人工智能服务平台 合作邮箱:liyazhou@jiqizhixin.com
客服
顶部
赛事库 课堂 2021拜年纪