Flux模型+Krea风格+深度图ControlNet:AI图像生成全流程实战指南

最近在尝试将 AI 生成图像融入工作流时,发现市面上新模型和工具层出不穷,但资料零散,尤其是 Flux 系列模型和 Krea 这类风格库的搭配使用,以及如何利用深度图进行精准的图像控制,往往需要东拼西凑。本文将为你整合一套从模型获取、风格应用,到深度图控制的全流程实战方案,包含完整的本地部署步骤、可复用的提示词库和关键的避坑指南。无论你是想尝鲜 Flux 3 的强大能力,还是希望用 Krea 2 的丰富风格快速出图,或是通过深度图实现构图控制,都能在这篇攻略中找到答案。

1. 背景与核心概念:为什么是 Flux、Krea 和深度图?

在深入实操之前,我们有必要理清这几个核心工具各自扮演的角色以及它们组合使用的价值。这能帮助你在后续步骤中理解每一步操作的目的,而非机械地复制命令。

1.1 Flux 模型:下一代文生图基石

Flux 是由 Black Forest Labs 推出的扩散模型系列,它并非 Stable Diffusion 的简单迭代,而是在架构上进行了革新。Flux 采用了“一致性模型”等先进训练方法,旨在以更少的采样步骤生成更高质量、细节更丰富的图像。其特点包括:

  • 图像质量高:在色彩、光影、纹理和细节表现上,普遍被认为优于同期的 SDXL 等模型。
  • 对提示词理解更精准:能更好地捕捉复杂、细致的文本描述。
  • 采样步数需求低:通常 4-8 步就能获得不错的效果,生成速度相对更快。
  • 官方模型变体多:除了基础的文生图模型,还有flux-dev(开发者版)、flux-schnell(快速版)以及用于修复、超分等任务的专项模型。

Flux 3是该系列的最新版本(本文撰写时处于抢先体验阶段),在画质、分辨率和提示词遵循度上可能有进一步提升。对于追求顶尖出图质量的创作者和开发者来说,掌握 Flux 是紧跟技术前沿的必修课。

1.2 Krea 风格库:快速统一视觉风格的利器

Krea 是一个专注于 AI 图像生成的在线平台和社区,其核心价值之一在于构建了庞大的“风格(Style)”库。Krea 2 风格库包含了由社区和官方精心调校的数百种视觉风格预设。

  • 作用:每个风格预设本质上是一组精心设计的“提示词模板”或“LoRA/Embedding 的触发词组合”。应用一个风格,相当于为你的基础提示词套上了一层强大的视觉滤镜,能快速生成具有特定艺术流派(如赛博朋克、水墨风)、特定艺术家风格或特定质感(黏土、胶片)的图像。
  • 价值:它极大地降低了用户调试复杂风格提示词的门槛。你无需记忆“masterpiece, best quality, cinematic lighting”等一大堆质量标签,只需选择“Cinematic Portrait”风格,就能获得电影感人像的基底。

1.3 深度图与 ControlNet:实现精准构图控制

深度图(Depth Map)是一种表示图像中物体距离信息的灰度图,越近的物体越亮,越远的物体越暗。

  • 在 AI 绘图中:我们可以利用深度图来控制生成图像的构图和空间关系。例如,你可以提供一张风景照片的深度图,让 AI 按照同样的前景、中景、远景布局来生成一幅全新的画作。
  • ControlNet:这是一个强大的神经网络控制框架,能够让扩散模型(如 Stable Diffusion, Flux)在生成图像时,接受额外的条件输入(如边缘图、姿态图、深度图等)作为引导。control_v11f1p_sd15_depth或更新版本的深度图 ControlNet 模型,就是专门用于处理深度图条件的。

三者结合的工作流Flux提供高质量的图像生成引擎,Krea 风格提供快速定调的视觉风格,深度图 ControlNet提供精确的构图控制。三者结合,你就能实现“按照我提供的场景布局(深度图),生成一幅具有特定艺术风格(Krea风格)的高质量画作(Flux)”。

2. 环境准备与工具部署

本攻略主要基于ComfyUI这一节点式可视化工作流工具进行演示。ComfyUI 以其极高的灵活性和对最新模型、节点的快速支持而受到高级用户青睐。当然,Stable Diffusion WebUI (AUTOMATIC1111) 也支持类似功能,但节点式操作在构建复杂、可复用工作流上更具优势。

2.1 基础环境搭建

  1. 安装 Python:确保系统已安装 Python 3.10 或 3.11。推荐使用 Miniconda 或 PyCharm 管理虚拟环境。
  2. 安装 Git:用于克隆仓库和更新。
  3. 准备显卡:需要 NVIDIA GPU 且显存建议 8GB 以上。Flux 模型对显存有一定要求。

2.2 部署 ComfyUI

这是我们的主战场。部署过程相对简单。

# 1. 克隆 ComfyUI 仓库 git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI # 2. 创建并激活虚拟环境(以 conda 为例) conda create -n comfyui python=3.11 conda activate comfyui # 3. 安装依赖 pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121 # 根据你的 CUDA 版本调整 pip install -r requirements.txt # 4. 启动 ComfyUI python main.py

启动后,在浏览器中打开http://127.0.0.1:8188即可看到界面。

2.3 获取并放置模型文件

ComfyUI 的模型文件通常放在ComfyUI/models/目录下的对应子文件夹中。

  1. Flux 模型

    • 从 Hugging Face 或 Civitai 等平台下载 Flux 系列模型(如flux1-devflux1-schnell, 以及未来的flux3)。文件格式通常为.safetensors
    • 将其放入ComfyUI/models/checkpoints/目录。
    • 重要:Flux 模型可能需要特定的 VAE 文件(如ae.sft.vae)。请根据模型发布页的说明,将对应的 VAE 文件放入ComfyUI/models/vae/目录。
  2. ControlNet 模型

    • 下载深度图 ControlNet 模型,例如control_v11f1p_sd15_depth.pth或更新的.safetensors版本。
    • 将其放入ComfyUI/models/controlnet/目录。
  3. (可选)Krea 风格提示词文件

    • Krea 风格库的 397 种提示词通常以文本文件(如.txt)或 JSON 格式提供。你可以将其保存在任意方便的位置,在 ComfyUI 中通过 “CLIP Text Encode (Prompt)” 节点读取,或手动输入。

2.4 安装必要自定义节点

为了更便捷地使用 Flux 和深度图功能,我们可能需要安装一些社区节点。

  1. 在 ComfyUI 界面,点击右下角的 “Manager” 按钮(如果已安装 ComfyUI Manager)。
  2. 在 “Install Custom Nodes” 标签页,搜索并安装以下节点(非必须,但推荐):
    • ComfyUI-Flux:可能提供对 Flux 模型的专用加载器和节点。
    • efficiency-nodes-comfyui:提供一系列提升效率的节点,如通配符处理、提示词调度等,方便管理 Krea 风格提示词。
    • ComfyUI-Impact-Pack:包含许多实用节点,有时也包含深度图处理工具。 安装后,重启 ComfyUI。

3. 核心工作流构建与节点解析

接下来,我们将在 ComfyUI 中搭建一个融合了 Flux 模型、Krea 风格和深度图控制的核心工作流。我们将分模块讲解关键节点。

3.1 加载模型与设置采样器

这是工作流的起点。

  1. Checkpoint Loader:选择你下载的 Flux 模型(如flux1-dev.safetensors)。这个节点会输出MODELCLIPVAE
  2. CLIP Text Encode (Prompt):连接上一步的CLIP输出。在text输入框中,我们将填入结合了 Krea 风格的核心提示词。例如:“Cinematic portrait of a warrior, (Krea Style: Cinematic Portrait), intricate armor, dramatic lighting”。这里(Krea Style: Cinematic Portrait)可以替换成你从风格库中选中的任何风格提示词。
  3. CLIP Text Encode (Negative):同样连接CLIP,用于输入负面提示词,如“blurry, ugly, deformed, text, watermark”
  4. KSampler / KSampler Advanced:这是调度采样过程的核心。
    • model: 连接 Checkpoint Loader 的MODEL
    • positive: 连接正面提示词编码节点的CONDITIONING
    • negative: 连接负面提示词编码节点的CONDITIONING
    • latent_image: 连接一个Empty Latent Image节点,用于定义生成图像的宽高和批次大小。对于 Flux,可以尝试 1024x1024 或更高。
    • samplerscheduler:Flux 推荐使用eulerdpmpp_2m采样器,normalkarras调度器。采样步数(steps)可以设置得较低,如 4-8 步,这是 Flux 的优势之一。

3.2 集成深度图 ControlNet

这是实现构图控制的关键。

  1. Load Image:节点用于加载你事先准备好的参考深度图。你可以使用 MIDAS 等算法从普通图片生成深度图,或使用 3D 软件渲染深度图。
  2. ControlNet Apply:这是一个关键组合节点。你需要先有一个ControlNet Loader节点来加载深度图 ControlNet 模型,然后将其CONTROL_NET输出连接到 ControlNet Apply 节点。
    • 在 ControlNet Apply 节点中:
    • conditioning: 连接KSamplerpositive输入线(实际上需要连接到 conditioning 区域之前,通常通过Conditioning (Combine)节点与文本条件合并)。
    • image: 连接Load Image节点的IMAGE输出。
    • strength: 控制深度图的影响强度,通常 0.8-1.0 效果较强。
    • start_percent/end_percent: 控制深度图在采样过程中的开始和结束时机,用于精细控制。
  3. Conditioning (Combine):将来自 CLIP Text Encode 的文本条件和来自 ControlNet Apply 的图像条件合并,然后一起输入给 KSampler 的positive端口。

3.3 集成 Krea 风格提示词库

Krea 风格库的集成更偏向于“提示词工程”。有两种主要方式:

  1. 手动应用:最简单的方式。将风格库文件用文本编辑器打开,找到你想要的风格(如 “Oil Painting”),将其对应的提示词片段(可能是一串特定的质量标签和风格描述词)复制出来,粘贴到你的主提示词中。例如,你的提示词可能变为:“portrait of a cat, (masterpiece, oil painting texture, thick brushstrokes, classic art), detailed eyes”,其中括号内就来自 Krea 风格库。
  2. 使用通配符节点(高级):如果你安装了efficiency-nodes-comfyui,可以使用WildcardProcessor节点。
    • 将 Krea 风格库整理成一个文本文件,每行一个风格,或使用 JSON 格式。
    • WildcardProcessor节点中,设置通配符(如__krea_style__),并指向你的风格库文件。
    • 在你的主提示词中使用这个通配符,如“portrait of a cat, __krea_style__, detailed eyes”
    • 运行前,可以在节点中随机选择一种风格,或指定某一种,实现批量化、风格随机的生成。

3.4 VAE 解码与图像保存

采样完成后,需要将潜空间变量解码为最终图像。

  1. VAE Decode:连接 KSampler 的LATENT输出和 Checkpoint Loader 的VAE输出。
  2. Save Image:连接 VAE Decode 的IMAGE输出,设置好输出路径和文件名前缀,即可保存最终生成的图片。

4. 完整实战案例:生成一幅受深度图控制的赛博朋克风格城市景观

让我们将上述所有节点组合起来,完成一个端到端的案例。

4.1 准备工作

  1. 准备深度图:找一张城市天际线的图片,使用在线工具或本地软件(如MiDaSviacv2)生成其深度图,保存为city_depth.png。确保深度图是黑白(灰度)的。
  2. 选择风格:从 Krea 2 风格库中,找到 “Cyberpunk Neon” 或类似赛博朋克风格的提示词片段。假设我们得到的片段是:“neon lights, cyberpunk aesthetic, rainy night, futuristic city, cinematic, blade runner style”
  3. 构思提示词:结合风格和主题,我们的正面提示词定为:“A breathtaking view of a sprawling futuristic metropolis, (neon lights, cyberpunk aesthetic, rainy night, futuristic city, cinematic, blade runner style), towering skyscrapers, flying cars, holographic advertisements, ultra detailed, 8k”。负面提示词用通用的即可。

4.2 在 ComfyUI 中搭建工作流

你可以手动拖拽节点连接,也可以使用以下的大致节点连接逻辑作为指导:

Checkpoint Loader (选择 flux1-dev) -> MODEL -> KSampler -> VAE Decode -> Save Image -> CLIP -> CLIP Text Encode (Prompt) [输入正面提示词] -> Conditioning (Combine) -> CLIP -> CLIP Text Encode (Negative)[输入负面提示词] -> Conditioning (Combine) -> VAE -> VAE Decode Load Image (加载 city_depth.png) -> ControlNet Apply ControlNet Loader (加载 depth controlnet) -> ControlNet Apply ControlNet Apply -> Conditioning (Combine) Empty Latent Image (width: 1024, height: 768) -> KSampler

(注:这是一个文字描述的逻辑图,实际在 ComfyUI 中需用节点连线)

4.3 关键参数设置

  • Checkpoint Loader: 选择flux1-dev.safetensors
  • KSampler:
    • steps: 6 (利用 Flux 快速采样的特性)
    • cfg: 7.5
    • sampler:euler
    • scheduler:normal
  • ControlNet Apply:
    • strength: 0.9
    • start_percent: 0.0
    • end_percent: 1.0
  • Empty Latent Image:
    • width: 1024
    • height: 768 (与你深度图的宽高比大致匹配效果更好)

4.4 运行与输出

点击 “Queue Prompt” 按钮开始生成。等待片刻后,你将在ComfyUI/output目录下找到生成的图像。最终图像应该具有赛博朋克的视觉风格(霓虹灯、雨夜、未来感),同时城市建筑的前后空间布局会与你提供的city_depth.png深度图高度相似。

5. 常见问题与排查思路

在实际操作中,你可能会遇到以下问题:

问题现象可能原因解决思路
加载 Flux 模型后出图全黑或全灰1. 缺少对应的 VAE 文件。
2. 采样步数过低或过高。
3. CFG Scale 值异常。
1. 检查模型发布页,下载并放置正确的 VAE 文件(如ae.sft.vae.pt)到vae文件夹,并在 Checkpoint Loader 中确认 VAE 已正确加载(有时需手动选择)。
2. 调整采样步数,尝试 4, 6, 8, 12 步。
3. 将 CFG Scale 调整到 5-9 之间常见范围。
深度图控制效果不明显或图像扭曲1. ControlNet 强度 (strength) 过低。
2. 深度图本身质量差或对比度低。
3. 提示词与深度图内容冲突。
1. 将strength提高到 0.8 以上。
2. 使用更专业的深度估计算法(如MiDaS)生成质量更高的深度图,确保前景背景区分明显。
3. 确保你的文本描述(如“一个女孩”)与深度图场景(如“城市景观”)大致匹配。
应用 Krea 风格后风格不明显1. 风格提示词权重不够。
2. 风格提示词与主提示词冲突。
3. 模型本身不擅长该风格。
1. 使用(style words: 1.2)语法增加风格词权重,或将风格词放在提示词靠前位置。
2. 简化主提示词,突出风格主题。例如,先测试“(cyberpunk style), a city”
3. 尝试不同的基础模型,有些模型对特定风格泛化能力更强。
ComfyUI 报错 “找不到模块” 或节点1. 自定义节点未正确安装。
2. Python 依赖缺失。
1. 通过 ComfyUI Manager 重新安装对应节点,并重启 ComfyUI。
2. 在 ComfyUI 根目录下,尝试pip install -r requirements.txt更新基础依赖。对于特定节点,查看其 GitHub 页面安装额外依赖。
生成速度非常慢1. 显存不足。
2. 分辨率设置过高。
3. 使用了未优化的采样器。
1. 尝试降低Empty Latent Image的分辨率(如从 1024x1024 降至 768x768)。启用--lowvram参数启动 ComfyUI。
2. Flux 模型本身在较高分辨率下需要更多资源,酌情调整。
3. 对于 Flux,坚持使用推荐采样器如euler,步数可先尝试 4 步。

6. 最佳实践与工程建议

掌握基础操作后,遵循以下建议能让你的工作流更高效、出图更稳定。

6.1 模型与版本管理

  • 建立模型库目录:在ComfyUI/models/下清晰分类checkpoints,loras,controlnet,vae等,便于管理。
  • 记录模型组合:某些 Flux 变体需要搭配特定的 VAE。建议建立一个简单的文本笔记,记录有效的模型-VAE-参数组合,避免混淆。
  • 关注社区更新:Flux 和 ControlNet 生态更新快,关注 GitHub、Civitai 和 Hugging Face,及时获取新模型和优化节点。

6.2 提示词工程优化

  • 分层构建提示词:将提示词分为“主题描述”、“质量标签”、“风格标签”、“负面提示”四部分。Krea 风格库主要提供“风格标签”和部分“质量标签”。
    主题:A majestic eagle soaring over mountain peaks. 质量:(masterpiece, best quality, ultra detailed, 8k, HDR) 风格:(Krea: Epic Fantasy Landscape) // 此处替换为具体风格 负面:blurry, ugly, deformed, text, watermark, lowres, bad anatomy
  • 善用权重和交替语法:使用()增加权重,[]降低权重,|进行提示词交替。例如(sunset:1.3)(blue|red) sky可以在单次生成中探索不同可能性。
  • 制作个人风格预设:将你调试成功的、常用的“Krea风格+自定义微调”组合保存成 ComfyUI 的工作流文件 (.json) 或节点模板,实现一键复用。

6.3 深度图使用技巧

  • 深度图预处理:在导入 ComfyUI 前,可用图像软件(如 Photoshop)或 OpenCV 脚本调整深度图的对比度和亮度,强化前景与背景的差异,使 ControlNet 的控制信号更清晰。
  • 强度与时机控制:不要总是将strength设为 1.0。对于希望 AI 有更多自由发挥的场景,可以降低到 0.6-0.8。start_percentend_percent可用于“先构图,后细化”,例如让深度图只在采样前期 (0.0-0.4) 起作用,锁定大体布局后让模型自由发挥细节。
  • 多 ControlNet 结合:可以同时使用深度图 ControlNet 和边缘检测(Canny)或姿态(OpenPose)ControlNet,实现构图、形状、姿态的多重控制。在 ComfyUI 中,使用多个Conditioning (Combine)节点来合并这些条件。

6.4 工作流优化与备份

  • 模块化设计:将“风格选择”、“深度图控制”、“高清修复(Hi-Res Fix)”等功能拆分成独立的节点组。在 ComfyUI 中,你可以框选多个节点,右键选择 “Group”,将其折叠成一个整洁的模块,方便管理和复用。
  • 定期备份工作流:复杂的、调试好的工作流是你的宝贵资产。定期通过 ComfyUI 的 “Save” 功能导出.json文件,并做好版本备注。
  • 性能监控:在生成时,关注任务管理器中 GPU 的显存占用和利用率。如果发现显存溢出(OOM),首要降低批次大小(batch size)和图像分辨率。

通过本文的梳理,你应该已经掌握了 Flux 3(及 Flux 系列)模型的基础应用、Krea 2 风格库的融合方法,以及利用深度图 ControlNet 进行精准构图控制的全套流程。这套组合拳将极大提升你从“创意文字”到“可控高质量图像”的生产力。技术的核心在于实践,接下来最好的方式就是按照步骤搭建起你的 ComfyUI 环境,从一个简单的提示词开始,逐步加入风格和深度图控制,观察每一步带来的变化。过程中遇到的任何问题,都可以回到第 5 部分的排查思路寻找答案。