【SD1.5】反向使用复印/差异炼丹法提取人物+画风lora(上)
小达今天吃什么
编辑于 2023年10月01日 22:25

作者注:

由于设备和时间限制,(上)中讨论的方法和进行的测试将主要基于使用一图流复印炼丹法生成的Lora。使用差异炼丹法扩大泛用性的测试也在进行。会在文末放一些细节控制不严谨但有参考价值的由12张图构成训练集的Lora出图。在泛化能力方面,10张左右图片构成的训练集对比一图流有显著的提升。


关于复印炼丹和差异炼丹

最近作者在青龙大佬的视频中接触到了复印炼丹和差异炼丹的方法。

就复印炼丹而言,根据作者浅薄的理解:

正向使用的话,能够利用极少的素材,通过相减的方式,提取出我们想要的某些抽象化的效果,并排除底图中不必要元素的影响。

具体来说,假设想要提取一个类似于让图片黑白化的滤镜Lora,那么:

让大模型a(简称CPa)跑任意跑一张图1(P1)。

对P1,用PS等方式处理,得到黑白版的图2(P2)。

将P1制作成只包含P1的训练集1(T1)。

让T1在CPa中跑至充分过拟合,得到Lora1(L1)。

将Lora1融入大模型CPa中,得到CPb。

将P2制作成只包含P2的训练集2(T2)。

让T2在CPb中跑至充分过拟合,得到Lora2(L2)。

通过上述过程,在T2训练L2的过程中,原有图片中相同的元素会被相减,而黑白化的效果会被保留。进而实现我们想要的只提取一个类似滤镜的Lora的效果。


关于反向使用实现一次性提取人物+画风的构思

既然从概念上来说,复印炼丹实质上就是对两张图中的相同元素进行相减

那么如果我们将目标定为提取这张图片中人物特征(例如:发型/脸型/五官/服装/等等)以及画风特征(例如:勾线/填色/笔触/等等),在理论上来说或许也是同样可行的。

而我们需要排除的则可能有单一的图片中的:

角色固有动作/固有表情/背景等等再泛化性中并非必要的内容

当然,根据泛化性的需求不同,角色固有的服装/发型等也可能是我们不需要的内容。但是,为了控制变量,本文中,我们依然会把角色的服装和发型尽可能作为需要保留的因素来考虑。这也是受制于作者的显卡性能,没有办法在有限的时间内实现尽可能多的图片处理和Lora生成。

这里需要注意的是反向的概念。对于正常的复印炼丹而言,大模型生成一张P1,而以P1衍生出的P2作为生成最终Lora的底图。

而如果希望去提取指定图片中的风格。很显然,我们需要反向操作。让大模型来生成具有我们期望效果的P1’,而P2’则是我们已经拥有的真人或AI绘制出来的成图。


关于实现提取的方法构思

这里作者必须解决的问题是:

如何让大模型生成一张既体现我们希望相减消除特征(也就是P1和P2应当共同具有的特征),又体现出我们希望在目标L2中保留的特征(也就是P1和P2中不同的特征)。

根据我们对泛化需求的定义,具体而言,我们希望两张图中的

相同点:

角色固有动作/固有表情/背景等等

不同点:

人物特征(例如:发型/脸型/五官/服装/等等)以及画风特征(例如:勾线/填色/笔触/等等)

在观察上述相同点和不同点时,作者就立刻联想到了CONTROLNET(CN)的功能。

当我们利用已有的P2并开启CN中例如lineart或者seg类型的控制效果,并适当拉低CN生成的步数。CPa就会生成通常看来质量很低的图片。

因为这些图片乍看之下,动作和构图与原图相似。但是仔细一看大部分细节都受到了CPa自身的影响,变的与原图相去十万八千里。

但这显然就是我们需要的,因为我们希望保留的元素正是这些P1与P2相差的部分。

因此,作者将这种思路作为方法一。

方法一 模糊化法:

利用P1’+CN生成一张低画质且与原图相差较大的P2’。

重复差异炼丹步骤,但需要注意的是,P2’充当了正向过程中的P1。

而P1’(即原图)则作为我们炼制目标L2的P2。


关于方法一的改良

方法一的优点在于我们能够很轻易的获得一张我们想要的P1。但其缺点也是较为明显的:

首先,如果我们将CN的参数拉的过低,P1会与P2生成过多的差异。这会污染我们的提取范围。如果我们将CN的参数拉的过高,P1会与P2过于类似,这会导致我们的提取效果被削弱,许多细节因为相似性在相减过程中被消去了。

换言之,如何找到一个适合每一张素材图的参数,是我们根据人眼较难进行确定的内容。因为这涉及到每一张图片不同的结构特性,以及我们希望使用的CPa自身对画面补全的特性。泛用性显然是收到较大限制的。

其次,人物结构以外的背景因素对画面的影响可能较大。具体来说,即使我们对人物细节差异进行了较好的控制,但以SD1.5的CN处理能力,想要在人物适当模糊的情况下,又保障背景里面的结构或物品与原图相似显然是不可能的。这也就意味着我们的目标Lora里面或多或少都会残留有原图背景对画面的影响。

那么大家可能觉得,如果我们对原图进行抠图,只保留人物结构部分。那么背景因素不就被排除了吗?

但既然我们的目标同时包含提取画风和人物特征,也就意味这我们希望,在使用L2是,除了人物之外的部分也同样能够或多或少的保留原有图片的上色风格但又不会对画面造成污染。

这也就意味着:

在相同的学习步数下,对于同一张图片的不同结构,我们希望提取细节的范围和力度是不同的。

换言之,作者希望同一张图片上,人物的部分动作/轮廓等细节保留较多,而其他目标提取细节保留越少越好,而背景内容的则除了填色之外的其他细节都得到保留。

希望细致的保留细节,我们就立刻会想到CN中的depth相关的处理方式。Depth在调高参数之后,能够显示细腻的景深,自然也包括了我们要求的轮廓。

而人物方面,我们则可以利用PS将Depth生成的P1中人物扣除,在人物轮廓中填入纯黑。当然,如果人物有手持的东西,例如手机,伞等与固有特征无关的东西。我们在抠图时则不应将这些内容扣除。应当抱持他们在P1中原本的样子。这也是为了避免我们将这些内容除了填色之外的要素被提取。

这也就是本文希望阐述的方法二。

方法二 蒙版法:

利用CN中的Depth高参数生成一张细致的黑白景深预览图。这张预览图不会放入CPa中跑,而是直接作为P1的预产物P0。

通过PS等操作。生成只有人物部分被填入纯黑,而其他部分与P0保持一致的P1。

接下来就是正常的复印炼丹操作生成L2。


关于方法二的改良

方法二的缺点是作者在测试充分过拟合的L1时发现的。因为此时的P1完全与CPa无关,且我们的提示词中必定包含于人物有关的内容。因此,在拟合的过程中,CPa总会试图给L1纯黑的人物部分加上一些细节。这也就意味着,使用这样的L1与P2相减时,人物部分的特征会损失。

同时,由于我们完全保留了原有人物姿态的轮廓,CPa擅自加入的细节因素很可能与原有人物的相似度很高,这可能会进一步放大细节损失带来的影响。

作为补充,由完全与CPa无关的P1生成的L1,在不锁种子不加提示词词的情况下,无论再怎么过拟合,其生成的图片都与喂如的P1会产生较大的区别。区别依然是CPa的固有画风带来的。换言之,用此种方法形成的CPb可能是不稳定的。

因此,为了避免CPa对L1擅自加入细节,我们需要使得P1本身就是CPa自行生成的。

作者采用的方法是,利用处理完的P1进行img2img,在此过程中重绘幅度调到0.2,且开启CN的DEPTH组合,再次以P1为控制参考,生成P1_1。

这样做的好处是,P1_1是大模型自己生成的,且种子是可控的。同时,P1_1与P1在肉眼看来是几乎100%相似的。

通过测试发现,这样过拟合后的L1,即便不锁种子不加提示词,自动跑出的图片与P1也并无区别。能够最大程度避免细节损失。

因此,这种改良方法可被视作为方法三。

方法三 大模型蒙版法:

参照方法二生成P1。

采用img2img生成P1_1。

而后重复复印炼丹法的操作。

以上部分就是作者构思的三种方法,下面开始进入实际测试部分。


训练集

P2部分

为了验证前文提到的三种方法的可行性和可重复性,本文采用了两组测试集。并尽可能进行变量控制(但仍有部分变量,如提示词方面,控制的不尽如人意。)

T2_1由一张来自P站大佬しろは的青雀图片构成

T2_2由一张来自fkey大佬的药指图片构成

通过观察可以直观的发现。两者的画风均有特点。

对于青雀组而言,其服装当中的纹饰更多,且画面中仅给到了人物的上半身,

且人物表情较为详细。

对于药指组而言,其背景结构更为复杂且人物手持了旗杆。

在接下来的讨论中,T2所采用的提示词和种子将与T1中保持一致。药指组每组T1中的提示词可能会存在细微的差异但总体结构仍然保持一致。所有提示词均只包含正面提示词。


P1部分

P1同样分为两组,青雀组和药指组。而每组当中则根据上述的三种方法分别处理出一张底图。

青雀组

模糊法

P1_1_1是遵循方法一 模糊法所制作的底图

这张图片构成了训练集T1_1_1

提示词:

正面:QQ NO2, 1girl, closed_mouth, food, holding, letterboxed, multicolored_hair, one_eye_closed, phone_screen, pillarboxed, simple_background, solo, white_background, cowboy_shot, hands_up,

蒙版法

P1_1_2是遵循方法二蒙版法所制作的底图

这张图片构成了训练集T1_1_2

提示词:

正面:QQ NO2, 1girl, closed_mouth, food, holding, letterboxed, multicolored_hair, one_eye_closed, phone_screen, pillarboxed, simple_background, solo, white_background, cowboy_shot, hands_up,

大模型蒙版法

P1_1_3是遵循方法三大模型蒙版法所制作的底图

这张图片构成了训练集T1_1_3

提示词:

正面:QQ NO2, 1girl, closed_mouth, food, holding, letterboxed, multicolored_hair, one_eye_closed, phone_screen, pillarboxed, simple_background, solo, white_background, cowboy_shot, hands_up,

作者注:

从底图上来看,方法二和方法三好像并不差异。但可以对比一下L1_1_2和L1_1_3过拟合之后的表现。(保持关键词和训练所用种子不变)

L1_1_2

L1_1_3

如果仔细观察可以发现在青雀人物的轮廓线内出现了大模型自行添加的一些浅色的内容。


药指组

模糊法

P1_2_1是遵循方法一模糊法所制作的底图

这张图片构成了训练集T1_2_1

提示词:

正面:1girl, bangs, black_border, black_dress, border, bow, breasts, brown_hair, closed_mouth, dress, earrings, grey_border, hair_ribbon, holding, holding_weapon, jewelry, letterboxed, long_hair, long_sleeves, looking_at_viewer, medium_breasts, outside_border, pillarboxed, ribbon, solo, standing, sword, weapon, white_legwear, white_ribbon, smile, blue_eyes, simple_background, socks, arm_up, two_side_up, grey_eyes, kneehighs, feet_out_of_frame, chinese_clothes, white_socks, china_dress, side_slit, flag, yin_yang, holding_flag

蒙版法

提示词:

正面:1girl,  black_dress,  bow,  brown_hair, closed_mouth,  earrings, hair_ribbon, holding, holding_weapon, jewelry, letterboxed, long_hair,looking_at_viewer, outside_border, pillarboxed, solo, standing, sword, weapon, white_legwear, white_ribbon, smile, blue_eyes, simple_background,  arm_up, grey_eyes,  feet_out_of_frame, chinese_clothes, china_dress, side_slit, flag, yin_yang, holding_flag

大模型蒙版法

P1_2_3是遵循方法二蒙版法所制作的底图

这张图片构成了训练集T1_2_3

提示词:

正面:1girl,  black_dress,  bow,  brown_hair, closed_mouth,  earrings, hair_ribbon, holding, holding_weapon, jewelry, letterboxed, long_hair,looking_at_viewer, outside_border, pillarboxed, solo, standing, sword, weapon, white_legwear, white_ribbon, smile, blue_eyes, simple_background,  arm_up, grey_eyes,  feet_out_of_frame, chinese_clothes, china_dress, side_slit, flag, yin_yang, holding_flag

至此为了训练L1和目标L2的训练集已经制作完成了。


训练过程

为了确保控制变量的一致。

CPa均采用animefull-latest

在CPa中生成图片均采用DDIM 35步。(578,768)。提示词控制性11。

训练过程均只训练U-net,训练L1时关闭shuffle训练L2时开启,学习率采用1e-4 2e-4,rep定为500,epoch定为6,adamW8bit优化器,未开启噪声设置。


出图测试

对于青雀组和药指组均进行4轮测试。

每轮出图的顺序是:模糊法/蒙版法/大模型蒙版法

每轮当中均采用XYZ插件跑图。批次设定为2,单批次出图为1。

每轮当中分别测试L2的控制权重为0.8,0.9,1的情况。

尺寸均采用576,768

均开启高清修复,放大倍数2,放大算法RESRGAN 4x+ Anime6B,重绘幅度均设置为0.5。

采用的出图模型为BLAZZINGDRIVE V09i + anything_84000 VAE

均采用DDIM 35步。

注释:青雀组我将需要提取的人物固有特征的提示词全部集合到了自定义的提示词的QQ NO2。而药指组则几乎没有对根据原图


青雀组 第一轮测试 模糊法

人物相关: 1girl + 质量词

提示词

正面:

best quality,masterpiece,HDR,UHD,8K,Highly detailed,

1girl,

full body, cowboy shot,

负面:

nsfw,logo,text,badhandv4,EasyNegative,ng_deepnegative_v1_75t,rev2-badprompt,verybadimagenegative_v1.3,negative_hand-neg,mutated hands and fingers,poorly drawn face,extra limb,missing limb,disconnected limbs,malformed hands,ugly,

分析:

首先,在不加入QQ NO2(青雀组人物固有特征提示词)的情况下,明显可以看出模糊法的对衣着细节的保留能力弱于蒙版类方法。

但是模糊法对full_body提示词的服从性以及对臂膀动作的过拟合可能更低。

同时可以注意到两者对于人物发型方面的保留能力可能均较差。

作者注:但总体来说,在对衣服的整体细节进行保留的基础上仍然能够拥有一定的泛化能力。仍然让我觉得有点惊艳。

放大部分图片可能会看的更加清晰

原图


药指组 第一轮测试

人物相关: 1girl + 质量词

提示词

正面:

best quality,masterpiece,HDR,UHD,8K,Highly detailed,

1girl,

full body, cowboy shot,

负面:

nsfw,logo,text,badhandv4,EasyNegative,ng_deepnegative_v1_75t,rev2-badprompt,verybadimagenegative_v1.3,negative_hand-neg,mutated hands and fingers,poorly drawn face,extra limb,missing limb,disconnected limbs,malformed hands,ugly,

分析:

药指的固有特征提示词比较分散。因此在不加入相关提示词的情况下人物的特征可能更加符合大模型自带特征。这里也可以发现,帽子在这个CP中权重可能较高。在青雀和药指的图片中角色都或多或少出现了帽子。

但值得关注是,模糊化法对于图片画风的提取能力。因为青雀组原图画风并不十分明显所以观察起来并不容易。但是在药指组模糊化法Lora的高权重下,人物着装特征明显趋向于原图。蒙版类方法也有类似表现但明显程度稍弱。

放大部分图片可能会看的更加清晰

原图


青雀组 第二轮测试

人物相关: 1girl/与受训人物相关提示词/手臂动作限制提示词 + 场景提示词 + 质量词

提示词

正面:

best quality,masterpiece,HDR,UHD,8K,Highly detailed,

1girl,QQ NO2, own hands together, park, outdoors,

full body, cowboy shot, 

负面:

nsfw,logo,text,badhandv4,EasyNegative,ng_deepnegative_v1_75t,rev2-badprompt,verybadimagenegative_v1.3,negative_hand-neg,mutated hands and fingers,poorly drawn face,extra limb,missing limb,disconnected limbs,malformed hands,ugly,

分析:

可以发现,即便加入了青雀固有特征相关提示词,模糊化法的服装细节保留能力仍然较弱,且对于加入的手臂动作的服从性较差。但是比较来看,模糊化法对于青雀固有发型的保留程度可能更高。

同时,值得注意的是,当镜头拉远之后,蒙版类方法给青雀的服装大都增添了一个长拖尾。观察原图可以发现,青雀服装的拖尾有一个缺失。这可能是导致服装过度推理的原因。作者认为这是可以通过少量增加样本素材来解决的。

但从总体上来,蒙版类方法对于复杂服装细节的保留能力仍然较强,且对于服装细节的保留能力仍然更强。同时,在相同权重的情况,蒙版法和大模型蒙版法的保留侧重则显现出了不同。

放大部分图片可能会看的更加清晰

原图


药指组 第二轮测试

人物相关: 1girl/与受训人物相关提示词 + 场景提示词 + 质量词

提示词

正面:

best quality,masterpiece,HDR,UHD,8K,Highly detailed,

1girl, black_dress,  bow,  brown_hair, earrings, hair_ribbon,  jewelry, long_hair, solo, white_legwear, white_ribbon, blue_eyes, chinese_clothes, china_dress, side_slit,

full body, cowboy shot,  

负面:

nsfw,logo,text,badhandv4,EasyNegative,ng_deepnegative_v1_75t,rev2-badprompt,verybadimagenegative_v1.3,negative_hand-neg,mutated hands and fingers,poorly drawn face,extra limb,missing limb,disconnected limbs,malformed hands,ugly,

分析:

与青雀组相反,加入人物固有特征之后,模糊化法在服装颜色的保留防范更加优于蒙版类方法的表现。这可能是由于模糊化法对于较为简单的服装线条的认知更为有效。而同样有可能的是,例如bow等词汇,在原有模型中的权重对特征控制更加宽松的蒙版类模型造成了影响。

可以观察到的是,在画风保留方面模糊化法仍然优于蒙版类方法。但正如前文提到的,背景干扰和原本图片的固有动作对模糊化法的干扰较大。

放大部分图片可能会看的更加清晰

原图


青雀组 第三轮

 人物相关: 1girl/与受训人物相关提示词/手臂动作限制提示词/面部装饰提示词/腿部动作提示词 + 场景提示词 + 质量词

提示词

正面:

best quality,masterpiece,HDR,UHD,8K,Highly detailed,

1girl,QQ NO2, own hands together, sitting,glasses,white socks,park, outdoors, twin braids,

full body, cowboy shot,  

负面:

nsfw,logo,text,badhandv4,EasyNegative,ng_deepnegative_v1_75t,rev2-badprompt,verybadimagenegative_v1.3,negative_hand-neg,mutated hands and fingers,poorly drawn face,extra limb,missing limb,disconnected limbs,malformed hands,ugly,

分析:

坐下后可能是镜头角度与原图角度相似,三种方法均在不同程度上对青雀头部的麻花盘发进行了还原。从手部情况可以看出模糊法的手部细节在相同种子的情况下更优秀。而对于纹饰较为复杂的服装,蒙版类的还原程度依然较好。同时值得注意的是,大模型蒙版法的头发部分出现了猫耳。作者在进行单独测试时也出现了类似情况。可能是人物轮廓边缘勾线被相减,导致对边缘的控制能力较弱。

放大部分图片可能会看的更加清晰

原图


药指组 第三轮

 

人物相关: 1girl/与受训人物相关提示词/手臂动作限制提示词/面部装饰提示词/腿部动作提示词 + 场景提示词 + 质量词

提示词

正面:

best quality,masterpiece,HDR,UHD,8K,Highly detailed,

1girl, black_dress,  bow,  brown_hair, earrings, hair_ribbon,  jewelry, long_hair, solo, white_legwear, white_ribbon, blue_eyes, chinese_clothes, china_dress, side_slit,own hands together, sitting,glasses,white socks,park, outdoors, twin braids, 

full body, cowboy shot, 

负面:

nsfw,logo,text,badhandv4,EasyNegative,ng_deepnegative_v1_75t,rev2-badprompt,verybadimagenegative_v1.3,negative_hand-neg,mutated hands and fingers,poorly drawn face,extra limb,missing limb,disconnected limbs,malformed hands,ugly,

分析:

对比药指和青雀图片可以发现,药指图片对own hands together的控制能力明显较弱。原因可能是青雀原图中的手部动作与双手置于一处的要求比较相似。但就腿部动作而言,药指模型依然较好的完成了。

但是蒙版类,出现大量的腿部问题可能与药指原图中体现了部分腿部,与前文中青雀的裙摆类似,对画面产生了污染。同时采用大模型蒙版法也可以发现药指的头饰也出现了过度体现的状况,可能与青雀的猫耳类似。

关于长发与双麻花并存的情况,可能与提示词中的long hair和twin_braids被同时体现有关。

但就画风而言,模糊法仍然有不错的表现。

放大部分图片可能会看的更加清晰

原图


青雀组 第四轮

人物相关: 1girl/与受训人物相关提示词/更复杂的手臂动作限制提示词/面部装饰提示词/更复杂的腿部动作提示词 + 场景提示词 + 质量词

提示词

正面:

best quality,masterpiece,HDR,UHD,8K,Highly detailed,

1girl,QQ NO2, glasses,white socks,running,looking at viewer,city,night, outstretched arms,  

full body, cowboy shot, 

负面:

nsfw,logo,text,badhandv4,EasyNegative,ng_deepnegative_v1_75t,rev2-badprompt,verybadimagenegative_v1.3,negative_hand-neg,mutated hands and fingers,poorly drawn face,extra limb,missing limb,disconnected limbs,malformed hands,ugly,

分析:

在增加动作的复杂度之后,可以观察到对服装的还原度有较为明显的下降。但是蒙版类方法一番保留了部分的要素。作者推测这可以通过少量增加素材来使得对服装不同角度的学习,从而被解决。

放大部分图片可能会看的更加清晰

原图


药指组 第四轮

人物相关: 1girl/与受训人物相关提示词/更复杂的手臂动作限制提示词/面部装饰提示词/更复杂的腿部动作提示词 + 场景提示词 + 质量词

提示词

正面:

best quality,masterpiece,HDR,UHD,8K,Highly detailed,

1girl, black dress,  bow,  brown hair, earrings, hair ribbon,  jewelry, long hair, solo, white legwear, white ribbon, blue eyes, chinese clothes, china dress, 

running,outstretched arms,  glasses, twin braids, 

 

full body, cowboy shot, 

负面:

nsfw,logo,text,badhandv4,EasyNegative,ng_deepnegative_v1_75t,rev2-badprompt,verybadimagenegative_v1.3,negative_hand-neg,mutated hands and fingers,poorly drawn face,extra limb,missing limb,disconnected limbs,malformed hands,ugly,

分析:

对于药指组而言,由于衣服的结构较为简单,即便有细节损失,对比青雀图片而言,给人的感受也相对没有那么强烈。动作表现上也相对好一些。可能与药指图片本身自带的动作类似有关。

放大部分图片可能会看的更加清晰


总 结

(上)这篇内容进行测试的核心主旨是:

探索在训练集仅有一张图的情况下,通过制造差异,利用复印炼丹法,是否能够在提取画风和人物固有特征的同时确保生成Lora的泛用性。

单纯从结果来看,一图流虽然的确能够提取某些特征,但效果仍然是较为局限的。

但作者认为应当从两个方面来看待这种局限性。

一方面是单张图片提供情报的有限性。例如,青雀图片只提供了正面衣着情报,因此不能期望在泛化过程中模型能够给予高质量的背身图。发型、动作等方面也同样或多或少的受此局限。

第二方面则是制造差异的方法。作者基于让大模型来生成用于制造差异的图片这一基本思路,提供了模糊法和蒙版类方法两种大的处理框架。但从一图流的表现而言,这两种方法都是缺陷频出的。因此,即便是将训练集从1张扩展到12张看似能出一些更具多样性也更美观的图,作为底层逻辑的差异制造工艺仍然可能是存在缺陷,需要进一步完善的。从结果来看,作为蒙版法改良思路的大模型蒙版法,由于在img2img的过程中可能存在重绘导致边缘细节丢失的问题,反而成为了一种负优化的手段。而蒙版类方法与我们最初的构思不同,在药指的训练集,反而表现出对画风的保留能力较弱。

作者认为,如果希望进一步挖掘反向复印炼丹的潜力,则需要一种更具有泛用性的差异制造模板,就类似于CN的功能一样,能够为每张图提供一个制造合适差异的套路。仍然以蒙版法做比喻的话,就可以看做,自动给发型部分上多厚的蒙版,给脸部、衣着等上多厚的蒙版,能够保证这些细节在同一张图片中被以适当的程度提取。

如果能够继续挖掘这一方法的潜力,对于素材十分有限的图片而言,或许能够解决不恰当的过拟合对画面造成的影响。


最后来一点药指的12张图训练集采用模糊法和蒙版类方法训练出的测试Lora在不同大模型上的跑图展示吧。由于设备性能和时间有限,这些图均没有经过高清修复。

作者注:最后一张图是蒙版法Lora与水叔画风Lora的叠用,在蒙版法Lora控制权重为MIDD之后,融合效果出奇的好。


写在最后

如果各位对原版的复印炼丹法感兴趣,可以在b站搜索青龙大佬的Lora进阶训练视频合集。其中不仅包含了差异炼丹,也有许多其他十分有趣的Lora训练技巧。