这几年汉服特别流行,但是古代真实的生活现在只能通过古代的绘画来了解。那如果有一台照相机穿越回唐朝,它能带来些什么?我们可以通过AIGC来实现这一切,今天的教程是通过AIGC来试图复原著名的《唐宫仕女图》。
这几年AI绘画已经有了很多玩法,我们可以通过它来实现平面插画转真实摄影,除了复原古画,还可以让二次元动漫人物真人化,除了让平面作品真人化之外,还可以让有景深的照片呈现不同的质感,最近很流行的照片转黏土风也是通过类似的方法来实现的。
本次案例会通过使用WHEE的画面参考来制作,深入浅出的带大家理解这个功能。
我这里选择的是《唐宫仕女图》的一个角色,然后用提示词来描述这张图的画面。这里可以直接自己描述你看到的内容,也可以通过GPT4的多模态来描述,GPT4的提示词是:
请描述这张画的内容。
然后它就会根据你上传的图来生成对应的文字描述,不过因为你上传的是古画,所以需要自己从描述里把跟画有关的内容修改掉。
选好参考模型之后,我们来详细讲解它的功能区。画面参考主要有五个部分功能区。
第一个区域是用来设置多重参考的,也就是你可以通过使用多重的参考模式来更加细节的生成图像。这里的多个参考对象的数目是最多三个。因为每个参考类型的侧重点不一样,所以单独使用一个可能不一定可以达到自己的预期,这个时候就需要叠加多重参考类型进行生成。常见的叠加玩法是
深度扫描 + 查找边缘/边缘检测/姿态检测
。
因为深度扫描里面包含空间位置信息可以给其它三个只有平面参考的参考类型提供更加准确的画面控制。比如在其它参考类型无法正确识别人物的手臂是在前还是在后的时候,通过叠加深度扫描就可以更加准确的识别。
比如下面这个案例,即使吧参考程度开到最大,因为原图裙子吧人物手臂和腿部遮住了,所以最后生成的图像只有头部和躯干的姿势是一致的。手部的姿势还是会有偏差。
但是如果再叠加上一层深度扫描,那么人物的姿势就会变得非常的准确。下图可以注意到启动状态的
参考1
和
参考2
的前面都有一个蓝色的圆点。
就是我们最开始提到的一共
7种
参考模式。本次主要使用的是
边缘检测-柔化,深度扫描,姿态检测这三个
参考类型。下面是
7种
参考模型的大概介绍。
如果我们只是想要重绘一张图片的内容,并且希望这个内容尽可能的一致,细节丰富,就可以选择查找边缘或者边缘检测。如果我们只有一个黑白草图想根据草图生成完稿,可以选择
涂鸦生图
这个模型。
如果我们并不需要参考这张图的细节,只是想要参考里面的人物姿势,就可以选择
姿态检测
,生成的图像就会根据参考图的人物姿势生成一个类似的人物。
融合控制
是可以将一个特定的logo或者文字通过控制生成图片内容和光影来让它无痕融入进去。这个玩法在去年曾经火遍全网。
二维码生成
是指可以上传一个二维码的图片,然后就根据提示词来生成一个可以扫描的二维码画面。
这里大家可以自行上传你需要参考的图片。这里的参考图和图生图里的参考图不一样,图生图的参考图相当于是用图片作为最开始影响画面的种子,但是后面通过扩散模型的生成,画面里的内容和元素可能都会有很大程度的变化。但是画面参考可以严格限定参考图的参考内容,对于生成画面的控制能力更加的细节和严格。
下图是我在同样提示词和其他参数的前提下,只对
图生图
和
画面参考
进行对比,可以发现
图生图
被参考图的配色影响较大,但是结构和人物细节都有很大变化。
画面参考
在结构上可以保持一致,但是在衣服的颜色上有较大差异,如果我们追求画面的高度一致性,可以同时结合图生图和画面参考。但是直接用
画面参考
的图像因为发挥的空间较大可以生成更加逼真自然的图像。
这里的参考程度指的是生成画面跟原图参考部分的一致性,这个数值越高生成的结果越像原图,最高值是2,一般我们会取
0.6~1
这个范围。下面分别对比了参考程度是
0.3,0.6,1.5
这三个数值,可以看到当数值过大
(1.5)
的时候就跟参考图几乎没差别了,而当数值过小
(0.3)
又不能很好提取原图的结构,所以默认值
0.6
附近即可以让画面有参考图的结构,又可以让模型和提示词对画面有一定的影响。
这里调整的是控制在生成的过程中介入画面的参考的时间段。比如我们可以在最开始正常的文生图,但是在生成进行
30%
的时候进行介入,在画面生成的
100%
的时候停止。也就是参考时段设置为
0.3 和1.0。
画面参考介入的越晚,参考对于画面的控制力越弱。
下面分别测试了在不同时段介入参考画面对于生成图的影响。可以看到当我们一开始不参考,而在生成进度已经进行到
30%
的时候介入,生成的图片已经几乎看不到参考图的影子了,而在生成进度在
10%
的时候介入一直到最后,那么也会有一些奇怪的图像生成,初始随机种子和参考图会同时影响画面。
而当我们让参考图在最开始的时候就介入,但是提前结束参考,比如只对生成的前面
30%
进行参考,那么仍然可以看到参考图对生成结果会造成很大的影响。
我们可以通过提前结束参考来让生成结果的多样性更加的丰富。
比如下图中参考时段为
(0~0.5)
就比参考时段
(0~0.3)
更加的接近原图,而参考时段
(0~0.3)
的人物姿势和表情已经改变。
这里模型我选择了摄影风格的lora,模型可以自己用多个lora叠加也可以使用单个模型,我还测试了盲盒这种3D模型也是可行的,出来的效果会更简洁一些。当我们改变lora就可以改变画面的风格,比如可以改成目前最流行的黏土风,和像素插画风。虽然风格不同,但是仍然可以制作同样人物结构内容的插画。下面是同一个参考图,不同lora模型生成的六种不同风格的图。