MiniMind-O来了!动手训练0.1B主干「能看能听能说」的多模态Omni模型

7.8万
58
2026-05-06 14:03:30
3034
1510
5688
1152
MiniMind 系列第三站是:MiniMind-O! 从 0 训练一个仅约 0.1B 参数的开源 Omni 模型,支持文本、语音、图像输入,并能输出文本与流式语音。项目完整开源代码、权重、mini / full 两套训练数据,其中 mini 数据集可在单张 RTX 3090 上约 2 小时跑通完整训练链路。并有minimind-3o系列模型的配套技术报告论文! MiniMind-O 支持语音对话、图像理解、流式语音生成、实时打断、近似双工交互、音色克隆和电话模式 WebUI。目标很简单:真正从代码和数据开始,自己训练、理解和改动一个完整 Omni 模型。 🔗 GitHub:https://github.com/jingyaogong/minimind-o 🔗 Technical Report:http://arxiv.org/abs/2605.03937 欢迎关注、欢迎一键三连! 如果项目有帮助,也欢迎在 GitHub 给一个 Star!
真理之风永远吹拂
客服
顶部
赛事库 课堂 2021拜年纪