字节跳动开源 Lance:3B参数搞定图像视频理解、生成、编辑!
AI-GitHub
2026年05月21日 15:51
收录于文集
共416篇

Lance 是由字节跳动 Intelligent Creation Lab(智能创作实验室)重磅开源的一款原生统一多模态模型

该模型最大的特点是仅拥有 3B(30亿)激活参数,却在单一框架内原生支持了图像与视频的理解、生成、编辑全链路任务。

与以往依赖扩大模型容量(如 7B、20B+)或仅聚焦图文的主导设计不同,Lance 探索了通过多任务协同训练实现高效统一建模的实用范式。整个模型(Transformer 主干)完全从零开始训练,且在仅 128 张 A100 GPU 的预算下完成,遵循 Apache-2.0 协议开源,支持商业应用。

主要功能

Lance 打破了单一模型只能专精某一任务的局限,在一个 3B 规模的模型中实现了六大核心能力的统一:

图像理解

支持语义解析、视觉问答(VQA)、OCR 及文档解析,能准确识别物体、场景与空间关系。

图像生成

根据文本提示生成照片级写实或风格化图像,在属性绑定(颜色、数量、位置)和复杂构图控制上表现优异。

图像编辑

支持指令级编辑,如背景替换、物体增删、风格迁移、局部重绘,并能保持主体身份一致性。

视频理解

支持时序动作识别、视频问答及细粒度动态场景分析。

视频生成

可生成具备自然运动、稳定时序一致性和清晰细节的视频(支持最高 121 帧,480p)。

视频编辑

支持基于文本指令的对象替换、背景变换、风格迁移,且支持多轮连续编辑(保持跨帧/跨轮次的一致性)

性能表现

在权威基准测试中,Lance 展现了“以小博大”的实力:

图像生成:GenEval 得分 0.90(与 7B 模型 TUNA 并列第一,超越 GPT-Image-1 和 20B 的 Qwen-Image);DPG-Bench 得分 84.67,在关系建模上表现突出。

视频生成:VBench 总分 85.11,在统一模型中领先,甚至超过了部分 14B 规模的专用视频生成模型(如 Wan2.1-T2V)。

视频理解:MVBench 得分 62.0,在统一多模态模型中排名第一,较同类模型有显著提升。

图像编辑:GEdit-Bench 得分 7.30,在统一模型中表现最佳。

Lance 证明了通过多任务协同架构解耦,可以在极小参数量下构建出兼顾图像/视频理解与生成/编辑的高性能统一模型,为多模态 AI 的高效落地提供了新的可能性。

项目官网:https://lance-project.github.io/

GitHub:https://github.com/bytedance/Lance

#字节开源#​#AI模型#​#多模态模型#​#AI图像生成#​#AI视频理解#​#AI视频生成#​