news 2026/10/2 5:04:14

【AI学习-comfyUI学习-三十二节-FLXU原生态反推+controlnet depth(UNion)工作流-各个部分学习】

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【AI学习-comfyUI学习-三十二节-FLXU原生态反推+controlnet depth(UNion)工作流-各个部分学习】

@[TOC](AI学习-comfyUI学习-三十二节-FLXU原生态反推+controlnet depth(UNion)工作流-各个部分学习)

1,前言

最近,学习comfyUI,这也是AI的一部分,想将相关学习到的东西尽可能记录下来。

2,说明

1,第三十二节-FLXU原生态反推工作流

输入图片 → JoyCaption 自动反推描述 → 送入 FLUX 双 CLIP 条件 → KSampler 生成 → VAE 解码 → 保存

【模型加载】 UNet + 双CLIP + VAE ↓ 【输入图像】 ↓ 【VAE 编码 → Latent】 ↓ 【JoyCaption 自动生成 prompt】 ↓ 【CLIP 文本编码(正 / 负)】 ↓ 【KSampler(FLUX)】 ↓ 【VAE 解码 → Image】 ↓ 【保存】

这是一个:自动理解图片 → 自动写 prompt → 再用 FLUX 高质量重绘的 pipeline

2,第三十二节2-FLUX controlnet depth(UNion)模型工作流

原图 → DepthAnything 抽几何 → ControlNet Union(depth) 锁结构
→ JoyCaption 生成语义 → CLIP 控制风格
→ FLUX 低 CFG 采样 → 高一致性重绘

3,流程

1-第三十二节-FLXU原生态反推工作流

(1)调用模块

(2)输出 提示词

输出得提示词,自动生成

1girls, blue_eyes, weapon, full body, sky, boobs, looking at viewer, black pants,partedlips, white hair, bangs, white gloves, black gloves, holding, black footwear, snow, long hair, black jacket, long sleeve, photoshop(medium), thigh boots, holding weapon, long gloves, black_blouse, holding sword, solo, parted_bangs, cleavage, black leotard, sfw, leotard, bare shoulder, holding gun, ponytail, jacket, weapon over shoulder, bare arms, large_breasts, armpit, hair ornament, white blouse, thighhighs, long ponytail, original, blue sky, hair between eyes, gun, black hair, gloves, white hairband, black hairband, armour, swords, snowing, white hairband, 1other, long hair tied low, blue hairband, hairband, snowing hairband, blush, weapon on shoulder, black gloves, weapon on head, hair accessory, thigh strap, tits apart, hair between breasts, weapon on headwear, white_gloves, holding weapon over shoulder, weapon over head, snowing hair, hair between fingers, pants, hair intakes, blue eyes, armour on shoulders, white hairband, hair between legs, holding weapon over head, hair between thighs, armour_between_breasts, holding weapon between legs, hair between, hair between elbows, armour on forearms, armour_between

(3)生成图片

(1)原图片

(2)生成图片

(4)模型选择

2-第三十二节2-FLUX controlnet depth(UNion)模型工作流

(1)调用模块

(2)输出 提示词

Chinese style high quality character render, cinematic fantasy artwork, dynamic action pose, strong sense of motion, sharp focus, high contrast lighting, detailed fabric texture, realistic skin detail, professional concept art quality, clean lighting, no illustration texture, dramatic lighting,cleardepth separation painterly, illustration, sketch, watercolor, flat lighting, dull colors, gray tone, paper texture, canvas texture, low contrast, blurry, low detail

(3)生成图片

(1)原图片-参考图

(2)生成图

(4)使用模型

4,模块部分说明

1 JoyCaption 自动反推(核心亮点)

🔹 Joy Caption Two Load
  • 使用模型:unsloth/Meta-Llama-3.1-8B-bnb-4bit
  • 管道:JoyTwoPipeline

这是:

LLM + Vision Encoder 的图像描述模型


🔹 JoyCaption Two(参数)
参数含义
caption_typeDescriptive
caption_lengthlong
low_vramfalse

👉 输出的是长、完整、偏自然语言的描述

📌这一步 = 自动写 prompt


🔹 输出去向
  • 输出STRING
  • 直接送入下面的CLIP 文本编码器

2 CLIP 文本编码(FLUX 专用)

你这里有两个一模一样的节点:

🔹 CLIP 文本编码(Flux)×2
  • 上:正向 prompt
  • 下:负向 prompt

参数:

权重:3.5

3DownloadAndLoadDepthAnythingV2Model

看到的参数

model: depth_anything_v2_vitl_fp32.safetensors precision: auto

作用一句话:

加载 Depth Anything V2 的深度预测模型(本体),供后续节点使用。


🔍 关键点逐条解释

🔹 model:depth_anything_v2_vitl_fp32

  • Depth Anything V2

    • 当前最强、最稳定的通用深度估计模型之一
  • vitl

    • Vision Transformer Large

    • 比 base / small:

      • 边缘更准
      • 人体轮廓更干净
      • 前后层次更稳定
  • fp32

    • 精度最高
    • 深度连续性最好(适合 ControlNet)

📌 结论:

这是“质量优先”的正确选择
代价只是显存和速度。


🔹 precision:auto

含义:

  • 如果显存够 → fp32
  • 显存紧 → 自动降精度

👉 对深度图质量几乎没负面影响
✔️ 推荐保持auto


它只:

  • 加载模型
  • 输出一个da_model(深度模型句柄)

5,细节部分

1-图片识别能力

有时候调试很久,一直要不到感觉质量好的图,可能使用得图片就太难了

6,工作流链接

(1)第三十二节-FLXU原生态反推工作流
https://download.csdn.net/download/qq_22146161/92554564
(2)第三十二节2-FLUX controlnet depth(UNion)模型工作流
https://download.csdn.net/download/qq_22146161/92554566

7,总结

不断学习摸索中。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/30 9:04:01

一键智能抠图实践|基于CV-UNet大模型镜像快速部署批量处理方案

一键智能抠图实践|基于CV-UNet大模型镜像快速部署批量处理方案 在电商产品图处理、AI图像生成、数字内容创作等场景中,高质量的图像抠图能力已成为基础刚需。传统手动抠图效率低,而市面上多数在线工具存在隐私泄露、成本高、无法批量处理等问…

作者头像 李华
网站建设 2026/9/26 23:33:31

一键批量抠图实践|基于CV-UNet大模型镜像高效实现

一键批量抠图实践|基于CV-UNet大模型镜像高效实现 1. 引言:智能抠图的工程化落地需求 在电商、广告设计、影视后期等场景中,图像背景移除(即“抠图”)是一项高频且关键的任务。传统手动抠图效率低、成本高&#xff0…

作者头像 李华
网站建设 2026/9/27 5:25:40

UNet抠图实战升级版|科哥大模型镜像助力高效分割

UNet抠图实战升级版|科哥大模型镜像助力高效分割 随着AI图像处理技术的快速发展,智能抠图已成为电商、设计、影视等多个领域的刚需。传统手动抠图耗时费力,而基于深度学习的语义分割方案如UNet,则为自动化高质量抠图提供了强大支…

作者头像 李华
网站建设 2026/9/30 0:52:00

如何高效搭建中文语音识别?用科哥开发的FunASR镜像一键实现

如何高效搭建中文语音识别?用科哥开发的FunASR镜像一键实现 随着AI技术的发展,语音识别在智能客服、会议记录、字幕生成等场景中发挥着越来越重要的作用。然而,对于大多数开发者而言,从零部署一个高精度、易用性强的中文语音识别…

作者头像 李华
网站建设 2026/9/26 22:46:07

无需GPU!用GTE CPU版镜像快速构建中文文本相似度系统

无需GPU!用GTE CPU版镜像快速构建中文文本相似度系统 在没有GPU资源的环境下,如何高效实现中文语义相似度计算?传统方案往往依赖高性能显卡进行向量推理,导致部署成本高、门槛大。本文介绍一款基于 GTE 中文语义相似度服务 的轻量…

作者头像 李华
网站建设 2026/9/26 21:13:44

零代码抠图工具部署|基于CV-UNet大模型镜像快速落地

零代码抠图工具部署|基于CV-UNet大模型镜像快速落地 1. 背景与价值:为什么需要零代码智能抠图? 在电商、广告设计、内容创作等领域,图像背景移除(抠图) 是一项高频且关键的任务。传统方式依赖 Photoshop …

作者头像 李华