ComfyUI初探
游戏美术是一大难题,最理想的办法还是能交给 AI。ComfyUI 并不陌生,不过一直没有尝试,借着这次机会尝试一下。
安装
ComfyUI 安装很简单,直接官网下载即可。
使用
ComfyUI 的初步使用其实很简单。我的目标只是基础文生图,最初找到的是官方文档里的例子。要做的事情其实文档里已经说的很清楚了,下载三份参数,放到对应的目录下,然后将工作流 json 拖到 ComfyUI 里就能使用。

通过此方式生成的单图其实理论上还是可以的,不过用于游戏不太行,游戏对图片有较高的连续性和一致性要求。
结合 ControlNet
很快便找到通过 ControlNet 来对生成的图片进行适度控制。还是官方的例子。不过这里需要的是, ControlNet 是需要和文生图的模型相匹配的,所以这个文档已经有点老旧了。在基本使用中,用到的文生图模型是 z-image-turbo,所以 controlNet 也必须要使用对应的。
所以 controlNet 需要使用这个。然后对于
z-image-turbo 来说,这个 controlNet 是作为 patch 的方式加入的。所以这个
controlNet 需要放到 /ComfyUI-Shared/models/model_patches
目录下。
而工作流实际使用的是这个

实际使用还是发现有不少问题的,这些问题直接导致不太可能用这个工作流来生产游戏背景。下面是使用 comfyUI 的一些实际体感。
优点:
- 纯本地部署,没有成本压力
- 速度其实也可以接受,用最新版的 macbook pro 跑一个 1000x1000 左右的图片是 1 分钟
- controlNet 确实可以控制一下画面构造,画一些简笔线条就能表达出控制
缺点:
- 无法精准控制颜色和元素
这个已经是最大的缺点了。如果希望做一张无缝大地图,那使用 comfyUI 工作流生成的图来拼,将会非常吃力,可以说基本拼不起来。经过这些探究我才慢慢意识到,为什么要选择像素风,为什么要做房间而不是连续大地图。
小结
其实我感觉继续探究应该能有更好的一些效果,但感觉目前此部分的 AI 能力还比较弱,所以暂时先不继续了。目前 AI 视频泛滥,AI 视频的质量可以说已经是有点令人惊艳了,而这些视频甚至还是用 comfyUI 的工作流生产的,对比起自己探究文生图的效果,不禁令我觉得这个反差有点大。但其实也很好理解,视频是分镜的,不需要这种连续性和精确性,只要控制每个镜头的长度,那整体质量可控,但游戏不同,连续背景就需要两张图完美衔接,这就是最大的区别。