尽管现在的有许多的图像编辑的评价指标和模型,但是这些方法更多关注的是指令是否跟随,在未编辑的区域并没有非常专业的评价。StableI2I因此弥补这个空白,我们主要从语义、纹理和质量三个大的方面出发评价内容的一致性。

🌐 Project Page: https://henry-lee-real.github.io/StableI2I_Page/
💻 Code: https://github.com/Henry-Lee-real/StableI2I
📝 Paper: https://arxiv.org/pdf/2605.04453
📊 Checkpoint & Benchmark: https://huggingface.co/collections/lijiayangCS/stablei2i
🤗 HuggingFace Paper: https://huggingface.co/papers/2605.04453

如图是一个图像编辑的结果,传统的图像评估指标大多关注的是质量,美学等维度。这些指标都是NR的指标,并不能很好的参考输入的图像。此外一些编辑类的评价指标如ImgEdit-Judge,更多关注的是编辑指令的一致性。而其中的一致性维度判断能力也较弱,并不能很好的发现像素级的内容变化。
就如本图所示,可能GPT-Image-1的美学质量很高,但是它发生了内容的错误和重绘,StableI2I就能很好的判断这些内容。
由于现在没有专业的评测数据,我们构建了StableI2I-Data和Bench。评估模型是否能合理的完成保真度评估任务。
1. 核心评估维度
Semantic-level:是否出现语义信息上的内容错误。
Structure Level:是否出现像素级别的内容重绘或者是纹理结构错位。
Low-level Appearance:处理后的图像相对于原图是否发生了质量上的退化。
2. 数据构建流水线
我们主要从图像编辑和图像恢复两个任务来构建数据集。
图像恢复:我们设计错误放大的数据生成流程。具体而言,我们先对自然图像施加随机退化,再利用 GPT-5 提取原图内容描述并引入受控语义扰动,构造错误文本条件,以引导恢复模型产生语义漂移或内容错误样本。对于合成数据,我们基于已知错误语义使用 GPT-5 API 进行初步标注,并由人工筛选修正;真实恢复数据则采用完全人工标注。
图像编辑:由于编辑错误难以通过确定性规则构造,我们使用多种编辑指令和多个生成模型生成多样化编辑结果,以覆盖不同场景下的潜在保真度问题。所有编辑数据均由人工标注,主要关注非目标区域中的语义变化、结构错位、内容重绘以及低层外观退化。

人工标注流程:
人工标注流程主要包括标注团队筛选、标注员培训、正式标注和质量验收四个阶段。首先,我们通过公开招标选择标注团队,并为三家候选公司分别提供每个任务 100 个样本及详细标注指南进行试标。根据试标准确率,我们选择表现最好的公司进行正式标注。正式标注前,所有标注员均接受视频培训,并在标注过程中通过共享文档实时记录和解答问题。
正式标注采用交叉标注流程,包括一轮初始标注和后续审核。对于图像恢复数据,标注员主要判断 GPT-5 粗标结果是否正确,并使用三点尺度标注退化程度;对于图像编辑数据,标注员需要标注错误类型,必要时使用 bounding box 定位问题区域,并同样使用三点尺度标注退化程度。最终,我们获得了 6,722 条人工标注的图像恢复样本和 4,839 条图像编辑样本,验收阶段整体标注通过准确率达到 94%。
1. 训练数据类型
StableI2I-Train 主要包含四类训练数据:Free-form Descriptive、Binary & Type QA、Multiple-choice QA 和 Open-ended QA。

Free-form Descriptive:用于保持模型基础的视觉感知和描述能力。该类数据要求模型对图像内容进行自由形式的自然语言描述,主要来源于 ShareGPT4V 和 CapRL 等通用视觉问答数据,覆盖自然图像、AIGC 图像、表格以及多种 QA 风格。
Binary & Type QA:用于训练模型进行标准化的错误判断。该类数据要求模型判断输出图像相较于输入图像是否存在保真度问题,并进一步给出错误类型,例如 Semantic Level、Structure Level 或 Low-level Appearance。其输出格式较为固定,便于后续训练和自动化评估。
Multiple-choice QA:用于提升模型细粒度内容理解和错误辨别能力。该类数据将人工标注的开放式错误描述转化为选择题形式,使模型在多个候选区域或错误类型中选择正确答案,从而增强模型对具体错误位置和错误内容的识别能力。
Open-ended QA:用于训练模型生成详细的错误分析。该类数据要求模型不仅判断是否存在问题,还需要以自然语言描述具体错误,并给出结构化的分析结果,例如指出哪些区域发生了语义变化、结构错位、内容重绘或低层外观退化。
2. 模型训练策略

StableI2I 采用多阶段训练策略。首先,我们基于 Qwen3VL-8B-Instruct 进行监督微调(SFT),训练数据包括 Free-form Descriptive、Multiple-choice QA 和 Binary & Type QA,使模型具备基础的视觉感知能力、图像描述能力以及保真度错误判断能力。 随后,我们在 SFT 模型基础上引入强化学习训练,使用 GRPO 优化模型的泛化能力。对于 Multiple-choice QA,奖励主要根据模型是否选择正确选项来计算;对于 Binary & Type QA,奖励同时考虑模型的 Yes/No 判断是否正确,以及预测的问题类型是否与标注一致。通过这一阶段,模型能够更稳定地判断不同类型的保真度错误。
接着,我们使用强化学习后的模型对大规模未标注 I2I 数据进行自动标注,并借助 GPT-5 对明显错误样本进行过滤,同时将部分 Binary & Type QA 数据进一步转化为 Open-ended QA 数据,生成包含 think 和 problem 字段的开放式错误分析样本。
最后,我们将原始标注数据与新构建的数据合并,对 Qwen3VL-8B-Instruct 进行最终全量微调,得到 StableI2I。该训练流程同时提升了模型的感知理解能力、错误判断能力和开放式分析能力。
1. 与现有MLLM对于保真度任务上的性能比较

我们在 StableI2I-Bench 上对比了多个主流开源和闭源多模态大模型,包括 Qwen3VL、InternVL、Claude、Gemini、GPT-4o 和 GPT-5 等。实验结果表明,现有通用多模态模型虽然具备一定的图像理解能力,但在 I2I 保真度评估任务上仍然存在明显不足,尤其是在结构错位、内容重绘以及细粒度低层外观变化的判断上表现不稳定。
相比之下,StableI2I 经过专门的 I2I 保真度数据训练后,在整体性能上显著优于其他模型。具体来看,StableI2I 在 Binary Accuracy 上达到 89.10%,高于 GPT-5 的 80.57% 和 Gemini-3-pro 的 82.28%;在更加严格、同时要求判断正确错误类型的 Strict Accuracy 上,StableI2I 达到 83.00%,明显高于 Gemini-3-pro 的 67.15%、Claude-Sonnet-4.5 的 63.37% 和 GPT-5 的 55.27%。这说明 StableI2I 不仅更擅长判断图像转换后是否存在问题,也更能准确识别问题属于语义、结构还是低层外观错误。
总体而言,通用多模态模型更偏向高层语义理解,对于语义错误和明显低层退化有一定判断能力,但对 I2I 任务中特有的结构一致性、内容重绘和局部保真度问题仍然不够敏感。StableI2I 通过专门的数据构建和训练策略,显著提升了这类保真度错误的检测能力。
2. 现有生成模型的性能比较

我们进一步使用 StableI2I 评估了多个主流图像编辑和图像恢复模型在实际 I2I 任务中的表现。评估对象包括开源模型,如 LuminaDiMOO、Flux.1-dev、OmniGen2、Bagel、Qwen-Image-Edit 系列,以及闭源模型,如 GPT-Image-1 和 Nano-Banana。评估任务覆盖图像编辑数据集 ImgEdit-Bench、GEdit-Bench,以及去噪、去模糊、去雨、去雾和曝光校正等图像恢复任务。
具体评估方式是:对于每个样本,StableI2I 分别从语义、结构和低层外观三个维度判断输出图像是否存在保真度问题。如果 StableI2I 回答 “Yes”,表示该维度没有检测到明显问题;最终得分即为回答 “Yes” 的样本比例。
实验结果表明,Bagel 和 Qwen-Image-Edit 系列整体保真度较好。大多数模型在语义层面表现尚可,说明它们通常能够保持主要物体和高层语义内容;但在结构层面表现明显较差,说明当前模型仍然容易破坏输入图像的布局、几何结构或细节对应关系。
尤其是 Flux.1-dev 和 GPT-Image-1,在真实评估中容易出现严重的内容重绘,即虽然生成图像看起来合理,但原图的结构布局被大幅重新生成,导致结构保真度得分很低。


总体来看,当前 I2I 生成模型的主要问题并不是完全不理解编辑或恢复任务,而是容易在完成任务的同时修改本应保持不变的区域。其中,内容重绘和结构不一致是最突出的保真度问题。
StableI2I 首次系统地从语义和像素级两个角度评估 I2I 任务中的保真度,判断生成结果是否正确保留了原图中应当保持的信息。
同时,StableI2I-Bench 为多模态大模型提供了一个多图一致性评测基准,能够检验模型超越单图理解的细粒度感知能力。
整体来看,StableI2I 可以作为评价指标、benchmark 或 reward model,帮助提升图像编辑和图像恢复模型的保真度,使生成结果更加真实、一致和可靠。

入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向