MiniMind 系列第三站是:MiniMind-O!
从 0 训练一个仅约 0.1B 参数的开源 Omni 模型,支持文本、语音、图像输入,并能输出文本与流式语音。项目完整开源代码、权重、mini / full 两套训练数据,其中 mini 数据集可在单张 RTX 3090 上约 2 小时跑通完整训练链路。并有minimind-3o系列模型的配套技术报告论文!
MiniMind-O 支持语音对话、图像理解、流式语音生成、实时打断、近似双工交互、音色克隆和电话模式 WebUI。目标很简单:真正从代码和数据开始,自己训练、理解和改动一个完整 Omni 模型。
🔗 GitHub:https://github.com/jingyaogong/minimind-o
🔗 Technical Report:http://arxiv.org/abs/2605.03937
欢迎关注、欢迎一键三连!
如果项目有帮助,也欢迎在 GitHub 给一个 Star!