现在做 AI 创作的人,普遍面临一个很现实的困境:出图在 ComfyUI、写文案在另一个对话窗口、图片分层要在设计软件里重新做,最后还要手动拼接出一个完整产物。工具链越高级,流程反而越碎。如果你是刚接触 ComfyUI、Skills、MCP、Agent 这些概念的开发者,想找一套“把 AI 创作链路串起来”的完整方案,那这篇文章值得你花 10 分钟看完。
本文将以最近社区关注度比较高的 DX-OS 为线索,拆解一个内置无限画布、图片分层、ComfyUI、Skills、MCP、Agent、AI 漫剧等多功能的新一代 AI 工作台应该具备哪些模块,并给出从环境准备到跑通一个 AI 漫剧工作流的完整实操思路。文章会尽量贴近工程落地的角度,帮助你理解每个功能模块为什么存在、彼此之间如何协作、实际配置时容易踩哪些坑。
文章适合以下读者:
- 刚接触 ComfyUI、Agent、MCP,想梳理技术脉络的新手。
- 已经用 ComfyUI 出图,想往工作流自动化方向进阶的开发者。
- 正在做 AI 创作平台、AI 内容工具的产品经理和开发同学。
1. DX-OS 是什么:一个把创作链路装进同一块画布的工作台
1.1 为什么叫“AI 操作系统”
传统意义上的操作系统,负责管理计算机的 CPU、内存、文件和外部设备,为上层的应用软件提供统一运行环境。而 DX-OS 这里的“操作系统”并不是要替代 Windows 或 macOS,它更像一个面向 AI 工作流的“创作操作系统”,把各种生成模型、绘图引擎、外部工具和自动化代理统一管理起来。
你可以把它理解成一层“胶水层”加上一个“可视化调度层”:
- 底层是各种能力引擎,例如 ComfyUI、本地大模型、MCP Server。
- 中间是 Skills,也就是可复用的技能包。
- 上层是 Agent,负责理解用户的创作目标,并调度这些技能和工具去执行。
- 整个界面则通过无限画布的方式呈现,让每个节点、每步产物都像一张卡片一样铺在画布上。
这样的设计思路,本质上是在解决一个核心矛盾:AI 工具的能力越来越强,但工具之间的协作成本也越来越高。
1.2 DX-OS 解决的核心问题
以前用一个 AI 漫剧类项目,常常需要五六个软件来回切换:
- 用文本模型写故事大纲和分镜脚本。
- 把分镜描述复制到 ComfyUI 中生成图片。
- 把图片导入设计软件做分层、调整构图。
- 再通过脚本把图片按顺序组装起来。
- 最后还要记录每一步的用到的参数和模型,方便后续调整。
每一步都可以跑通,但每一步之间的衔接都需要人工完成。DX-OS 这类产品试图把上面这个过程完整地“编排”起来:
- 无限画布用来组织流程节点,让每个步骤的输入输出都可视化。
- 图片分层把 ComfyUI 生成的结果转成可继续编辑的工程文件。
- Skills 封装确定性行为,比如“把故事大纲转成镜头列表”。
- MCP 让 Agent 可以安全地访问文件系统、数据库、外部 API。
- Agent 负责把上述能力组合起来,按目标自动执行。
这样一套组合,使得“从一句话到一组分镜图”成为可能,并且每一步之间不再是断裂的。
1.3 适合谁用
从实际使用场景来看,DX-OS 更适合以下几类人:
- AI 绘画进阶用户:已经用 ComfyUI 出图,但觉得每次手动改工作流很麻烦,希望把流程模板化。
- 内容创作者:需要批量生成漫画、漫剧、宣传图,对效率和一致性有要求。
- 前端/客户端开发者:关注 AI 原生应用的交互设计,例如无限画布、节点编辑器这类 UI。
- 后端开发者:想了解 Agent、Skill、MCP 如何在实际产品中协同工作。
如果你是第一次接触这些概念,也不要紧。下面先从核心功能模块逐个拆解。
2. 核心功能全景:从画布到漫剧的模块拆解
2.1 无限画布:降低 AI 创作流程的组织成本
无限画布是 DX-OS 交互层的核心。传统的线性页面只适合展示单一内容,但 AI 创作流程往往是非线性的:一个分镜为了生成多张候选图,需要跑多个工作流;一张图可能要经过多轮迭代;一条漫剧又由几十个分镜组成。这些内容放在线性列表里会非常混乱,放到无限画布上则清晰得多。
无限画布带来三个直接好处:
- 流程可视化。每个节点代表一个工作流、一段文本或一张图片,节点之间的连线代表数据流向,用户一眼就能看出整个项目推进到了哪一步。
- 多方案并行。同一个分镜可以并排挂多组参数,方便对比。
- 素材组织。素材、提示词、模型信息都可以以卡片形式组织在画布中,减少在文件夹里翻来找去的时间。
对开发者来说,无限画布的启发是:不要把 AI 工作流设计成一串函数调用的黑盒,而是把它设计成“可观察、可干预、可回退”的节点网络。
2.2 图片分层:把生成结果当成可继续编辑的工程文件
普通 AI 绘画工具输出的是一张平面 PNG 或 JPG。这张图虽然好看,但后期调整空间很小。比如背景要换、前景人物要移动、某个元素要单独调整,平面图片都很麻烦。
DX-OS 内置的图片分层能力,解决的是“生成结果可编辑”的问题。它会把生成结果拆成多个图层,每个图层对应画面中的一类元素,例如:
- 背景层。
- 人物层。
- 前景装饰层。
- 特效层。
这种做法类似于 PSD 文件里的图层概念。有一点需要注意:AI 模型原生输出并不一定带分层信息,所以实际产品通常是靠“图层分割模型”或“分层渲染工作流”来得到分层结果。也就是说,它更像一个后处理管线,而不是生成模型本身就输出 PSD。
对用户来说,图片分层意味着生成结果并不是终点,而是编辑的起点。在漫剧这样的项目中,分层能力尤其重要,因为同一个背景可以在多个分镜中复用,只需更换人物层即可。
2.3 AI 漫剧:一个典型的多模态流水线
AI 漫剧是 DX-OS 中一个相对完整的多模态场景。它不是一个单一功能,而是一条流水线,通常包含以下步骤:
- 故事大纲:先用文本模型生成完整的故事框架。
- 分镜脚本:把故事拆成镜头级描述,包含景别、运镜、画面内容、台词。
- 角色一致性设定:为每个角色生成稳定的外貌描述,方便后续出图保持一致。
- 场景生成:使用 ComfyUI 生成每个镜头的画面。
- 图片分层与后期:对生成图片进行分层,调整构图,导出为可继续编辑的工程文件。
- 组装:按顺序组装分镜,如果需要,还可以接入配音和时间轴工具。
这条流水线涉及文本模型、图像生成模型、图片编辑工具、自动化编排,正好可以展示 DX-OS 各个模块是如何协作的。
2.4 模块之间的关系
用一张简单的描述来概括:
- 无限画布是“界面”。
- ComfyUI 是“图像生成引擎”。
- 图片分层是“后期处理管线”。
- Skills 是“技能库”。
- MCP 是“外部连接器”。
- Agent 是“调度大脑”。
后续章节会围绕这些模块逐一展开,并给出可落地的配置思路。
3. ComfyUI 集成与工作流
3.1 ComfyUI 是什么,为什么 DX-OS 会内置它
ComfyUI 是一个基于节点式工作流的 Stable Diffusion 图像生成工具。用户把不同的功能节点,比如“加载模型”“输入提示词”“采样器”“保存图片”,用连线搭成流程图,然后一键运行。它的优势非常明显:
- 灵活度高,几乎每个环节都能控制。
- 工作流可以导出为 JSON 文件,方便分享和复用。
- 支持批量和 API 方式调用,适合二次开发。
DX-OS 选择内置 ComfyUI,原因也很直接:它已经拥有庞大的工作流生态和用户基础。内置 ComfyUI 可以避免开发一套新的生成引擎,同时又能利用社区沉淀的大量优秀工作流。
如果你之前在找 ComfyUI 一键整合包、ComfyUI 安装教程,那么可以把 DX-OS 理解成一种“更上一层”的封装:它帮你把 ComfyUI 的模型、工作流和外部工具统一管理起来,让你把注意力放在项目本身。
3.2 解析一个最小工作流
在 ComfyUI 中,一个最基础的生成流程至少包含四类节点:
- CheckpointLoader:加载基础模型。
- CLIPTextEncode:编码正向提示词和反向提示词。
- KSampler:执行采样生成潜空间图像。
- VAEDecode 和 SaveImage:解码并保存图片。
这些节点组合成一个 JSON 工作流文件。DX-OS 中导入这种工作流的方式通常是:
- 把工作流 JSON 文件拖入画布。
- 或者通过“导入工作流”按钮选择文件。
一个值得新手注意的点:ComfyUI 工作流 JSON 里可能包含 UI 布局信息,不同版本之间可能不兼容。如果你导入报错,优先检查 ComfyUI 核心版本和自定义节点版本是否匹配。
3.3 模型管理思路
ComfyUI 使用起来最麻烦的部分之一就是模型管理。常见的模型有:
- Checkpoint 大模型,例如 SD1.5、SDXL、社区微调模型。
- LoRA 模型,用于调整风格或人物特征。
- VAE 模型,影响画面色彩和细节。
- ControlNet 模型,用于控制构图、姿势、线稿等。
DX-OS 集成 ComfyUI 后,通常会在设置中提供一个模型目录配置。需要你把模型文件放到指定目录,并在界面上刷新。如果你发现某个工作流模型加载失败,优先检查:
- 模型文件是否已经下载到正确目录。
- 模型文件名是否包含空格或中文字符。
- 工作流里配置的模型名称是否与本地模型名称完全一致。
4. Skills 与 MCP:给 AI 扩展能力的两种方式
Skills 和 MCP 是 DX-OS 这类 AI 工作台里最容易混淆的两个概念。下面把这两个概念拆开讲清楚。
4.1 Skills:定义“会做什么”
Skills 可以理解成一组结构化的“技能包”,它告诉 Agent:“当你遇到某类任务时,可以按这个流程执行。”
一个 Skill 通常包含:
- 描述文件:说明这个技能的名称、适用场景、输入输出。
- 指令内容:详细描述执行步骤,让 Agent 知道怎么一步步完成任务。
- 可选资源:例如脚本、模板、参考示例。
简单来说,Skills 是给 AI 的“SOP 手册”。你希望 AI 稳定地完成某项任务,光靠提示词可能不够,因为大模型每次输出都有随机性。而 Skills 通过固定的步骤约束,让输出结果更稳定、更可预期。
举个例子,一个“AI 漫剧分镜脚本生成”技能可以这样描述:
--- name: comic-script-writer description: 根据故事大纲生成 AI 漫剧分镜脚本,输出 JSON 格式的镜头列表。 --- 你是一个 AI 漫剧编剧。用户会输入故事大纲,请按以下步骤完成: 1. 将故事拆解为若干镜头,每个镜头包含一个明确的画面事件。 2. 为每个镜头输出以下字段: - scene_id: 镜头序号 - camera: 景别(远景/全景/中景/近景/特写) - prompt: 英文正向提示词,描述画面主体、环境、光线、风格 - negative_prompt: 反向提示词 - duration: 建议时长(秒) 3. 确保人物外貌描述在多个镜头中保持一致。 4. 最终输出 JSON 数组,不要附加大段解释。把这段内容保存为 SKILL.md 文件,放到 skills 目录下,DX-OS 中的 Agent 就能识别并调用这个技能。
从热词里可以看到,最近“find skills”“skills 推荐”这类搜索很多,也出现了像 superpower skills、mattpocock skills 这类社区技能包。当你在使用社区 Skills 时,一定要注意:
- 先检查技能内容是否包含危险命令。
- 再确认技能使用的模型能力是否达标。
- 最后在小规模任务上验证,再用于正式项目。
4.2 MCP:定义“能连什么”
MCP 全称是 Model Context Protocol,模型上下文协议。它解决的是 AI 应用如何与外部系统交互的问题。
如果说 Skills 是“会做什么”,那 MCP 就是“能连什么”。通过 MCP Server,Agent 可以连接文件系统、数据库、浏览器、设计工具、API 服务等外部系统,并且以统一的协议进行通信。
在当前生态里,MCP Server 的种类非常多,常见的有:
- 文件系统 MCP:让 Agent 读写本地文件。
- 数据库 MCP:让 Agent 执行 SQL 查询。
- 浏览器 MCP:让 Agent 控制浏览器进行页面操作。
- 设计工具 MCP:例如 Figma MCP、蓝湖 MCP,让 Agent 读取设计稿信息。
在 DX-OS 中配置 MCP Server,通常是在配置文件里声明服务器地址和权限。下面是一个典型的 MCP 配置片段,仅用于演示配置结构:
{ "mcpServers": { "filesystem": { "command": "npx", "args": [ "-y", "@modelcontextprotocol/server-filesystem", "/data/workspace" ] }, "fetch": { "command": "npx", "args": [ "-y", "@modelcontextprotocol/server-fetch" ] } } }需要特别注意的是,具体 MCP Server 包的名称和参数会随版本迭代变化。实际使用前应查阅官方文档,不要照抄上面这个示例就当生产配置。
4.3 Agent Skill 和 MCP 有什么区别
很多人在搜索“agent skill 和 mcp 有什么区别”,这里用一个例子来区分:
假设你要让 AI 帮你做一份漫剧分镜 PPT:
- Agent 是那个“项目经理”,它理解你的目标,并制定执行计划。
- Skill 是“工作手册”,它规定写分镜的步骤和格式,不涉及外部工具。
- MCP 是“连接器”,它让 Agent 能读取你的图片素材文件夹、写入 PPT 文件。
所以:
- Skill 解决的是“任务怎么做”。
- MCP 解决的是“数据从哪里来、结果写到哪里去”。
- Agent 解决的是“先做什么、后做什么、遇到问题怎么处理”。
5. Agent 编排:从单个技能到完整流程
5.1 什么是 Agent
Agent 在这里指的是“智能体”,它能够理解用户目标、拆解任务、调用工具、观察结果并根据结果决定下一步动作。
一个简单的 Agent 工作流可以描述为:
- 接收用户输入的目标。
- 将目标拆解为多个子任务。
- 为每个子任务选择合适的 Skill 或 MCP 工具。
- 执行并检查结果。
- 如果结果不符合预期,自动调整参数后重试。
在 DX-OS 中,Agent 通常以“流程编排”的形式存在。你可以把多个 Skills 串联起来,中间用 MCP 连接外部数据,最终得到一个可复用的自动化流水线。
5.2 DX-OS 里的 Agent 常见工作模式
从使用角度看,DX-OS 的 Agent 大致有三种工作模式:
- 单轮任务型:用户只提一次目标,Agent 完成后返回结果,适合“帮我根据这个大纲生成 5 张分镜图”这类任务。
- 多轮迭代型:Agent 执行一步、展示结果、等待用户确认再继续,适合对质量要求较高的场景。
- 批量流水线型:Agent 按预置流程批量处理,例如“把整本小说chapter 1 到 chapter 10 全部分镜并出图”。
如果你刚开始接触 Agent 开发,建议从“单轮任务型”开始,把单一流程跑通后再叠加复杂度。
5.3 Agent 项目的边界注意事项
在“agent项目”和“agent开发”相关讨论中,经常出现的问题是:Agent 到底能自动到哪一步?
现实中的 Agent 并没有那么“无所不能”,常见的坑有:
- Agent 执行时间过长,超过模型或服务的响应限制,出现类似 “the agent execution provider did not respond in time” 的报错。
- Agent 在工具调用时,因为参数格式问题反复重试。
- Agent 的中间结果不稳定,需要手动干预。
解决思路也很明确:
- 把大任务拆成小步骤,每步设置超时机制。
- 在关键节点给 Agent 提供明确的判断标准,告诉它什么结果算通过。
- 尽量减少不必要的工具调用,能一次算完的不要分三次。
6. 环境准备与基础配置
6.1 运行环境检查
DX-OS 这类大型工作台对硬件要求较高,尤其是内置 ComfyUI 后,生成图片依赖 GPU 计算。在开始之前,需要确认以下环境:
- 操作系统:Windows 10/11、macOS、Linux 均可,但显卡驱动和 CUDA 环境需要提前装好。
- GPU:推荐 NVIDIA 显卡,显存建议至少 8GB,显存越大,越能流畅运行 SDXL 等大模型。
- Python 环境:很多 AI 组件依赖 Python,建议安装 3.10 或 3.11 版本。
- Node.js 环境:部分 MCP Server 依赖 npx 运行,建议安装 Node.js 18 以上版本。
- 磁盘空间:模型文件通常很大,建议预留 30GB 以上空间。
这里不写死具体版本号,是因为不同版本迭代太快,实际应以官方文档为准。核心思路是:GPU 驱动、Python、Node.js 这三样先保证可用。
6.2 安装与初始化
由于 DX-OS 的具体安装方式会随版本更新,本文不给出具体安装包路径。但从常规 AI 工作台的使用逻辑来看,安装后通常需要经历以下步骤:
- 安装主程序并启动。
- 指定数据目录,用于保存画布项目、模型文件、工作流和生成结果。
- 在设置中配置 ComfyUI 的模型路径。
- 创建或导入一个项目。
- 从模板或空白画布开始。
完成这些步骤后,你会得到一个可以自由拖拽节点的无限画布界面。
6.3 配置用户目录与模型路径
为了让 ComfyUI 能够找到模型,需要在设置中指定模型目录。模型目录常见结构如下:
models/ checkpoints/ loras/ vae/ controlnet/如果你之前使用过秋叶整合包或手动安装过 ComfyUI,可以把之前的模型目录直接挂载过来,省去重新下载。不过要注意,不同版本对模型目录的读取方式可能不同,挂载后需要刷新模型列表并确认工作流中的模型名称能匹配上。
7. 实战:在 DX-OS 中跑通一个 AI 漫剧工作流
这一节我们从零开始,搭建一个最小可用的 AI 漫剧分镜工作流。目标很简单:输入一个故事大纲,输出 3 张连续的分镜画面。
7.1 明确输入输出
输入:
- 一段中文故事大纲,例如:“一个少年在雨夜发现了一座发光的古老钟楼,他走进去后进入了另一个世界。”
输出:
- 3 个分镜脚本,每个分镜包含场景描述、正向提示词、反向提示词。
- 3 张生成的图片,保存在指定输出目录。
7.2 把流程拆成 5 个阶段
为了降低复杂度,我们把整个流程拆成 5 个阶段:
- 编写分镜脚本:使用文本模型把大纲拆成镜头。
- 生成画面提示词:将中文镜头描述翻译成适合图像模型的英文提示词。
- 调用 ComfyUI 出图:把提示词作为工作流参数输入。
- 基础检查:判断图片是否生成成功。
- 汇总结果:生成一个包含图片路径和分镜说明的汇总文件。
7.3 配置 Skills
首先创建一个分镜脚本技能,文件路径建议放在skills/comic-script-writer/SKILL.md:
--- name: comic-script-writer description: 根据故事大纲生成 AI 漫剧分镜脚本,输出 JSON 格式的镜头列表。 --- 你是一个专业的 AI 漫剧分镜师。用户会输入一个故事大纲,你需要完成以下任务: 1. 判断故事的关键转折点,将故事拆成 3 个镜头。 2. 对每个镜头,输出以下 JSON 字段: - scene_id: 镜头编号 - location: 场景地点 - action: 画面中的主要动作 - style: 画面风格 - prompt: 英文正向提示词,用于图像生成 - negative_prompt: 英文反向提示词 3. 三个镜头之间应存在因果连续性,人物外观保持一致。 输出格式要求:只输出 JSON 数组,不要输出其他文字。再创建一个提示词优化技能,路径为skills/prompt-refiner/SKILL.md:
--- name: prompt-refiner description: 将中文分镜描述转换为高质量英文图像提示词。 --- 你是一个提示词工程专家。用户会输入一个分镜描述,请将其转换为结构化的英文提示词。 规则: 1. 提示词结构依次为:主体、环境、光线、风格、画质关键词。 2. 使用英文输出,关键词之间用逗号分隔。 3. 反向提示词包含常见画质问题,如 lowres, bad anatomy, blurry 等。 4. 不改变用户原始创意。 输出格式:JSON 对象,包含 prompt 和 negative_prompt 两个字段。在实际使用时,你只需要通过界面“加载技能”或把技能目录交给 Agent 即可。
7.4 接入 MCP Server
为了让 Agent 能把最终结果保存到指定目录,我们需要接入一个文件系统 MCP Server。假设工作区目录是/data/workspace,配置如下:
{ "mcpServers": { "filesystem": { "command": "npx", "args": [ "-y", "@modelcontextprotocol/server-filesystem", "/data/workspace" ] } } }注意:如果你运行在 Windows 系统,路径写法可能不同,例如D:/workspace。同时,不要给 MCP Server 暴露整个磁盘的权限,只给需要访问的工作区目录即可,这样可以降低安全风险。
7.5 编排 Agent 流程
接下来,把上述 Skills 和 MCP Server 组合成一个 Agent 流程。这类流程在 DX-OS 中通常以项目配置的形式保存。下面是一个用于演示思路的 YAML 配置:
agent: name: ai-comic-producer description: 从故事大纲到 AI 漫剧分镜图的最小工作流 steps: - skill: comic-script-writer input: story_outline output: scene_script - skill: prompt-refiner input: scene_script output: refined_prompts - comfyui: workflow: workflows/static_scene.json input_mapping: prompt: refined_prompts[*].prompt negative_prompt: refined_prompts[*].negative_prompt output_dir: /data/workspace/output/images - verify: check: image_files_exist retry: 2 - mcp: filesystem action: write_summary args: output: /data/workspace/output/summary.json这份配置表达的核心逻辑是:
- 先用 comic-script-writer 生成分镜脚本。
- 再用 prompt-refiner 优化提示词。
- 然后调用 ComfyUI 工作流批量出图。
- 接着检查图片是否生成成功,失败则重试。
- 最后通过 filesystem MCP 写入汇总文件。
不同版本的 DX-OS 配置格式可能不同,这里的重点是理解编排思路,而不是死记字段。
7.6 执行与结果检查
配置完成后,运行 Agent。理想情况下,你会看到:
- 分镜脚本 JSON 生成。
- 提示词优化完成。
- ComfyUI 日志显示 3 张图片生成成功。
- output 目录中出现 3 张图片和 1 个 summary.json。
建议执行后检查以下几个点:
- 图片是否真的存在于指定目录。
- 分镜之间的人物是否保持一致。
- 提示词是否完整、没有被截断。
- 反向提示词是否生效,画面是否出现明显瑕疵。
如果某个环节失败,按照下一节的排查思路逐个定位。
8. 常见问题与排查思路
这里汇总了几个高频问题,按实际经验整理成表格:
| 问题现象 | 常见原因 | 解决思路 |
|---|---|---|
| ComfyUI 模型加载失败 | 模型路径未配置、模型名称不匹配 | 检查设置中的模型目录,刷新模型列表,核对模型名称 |
| Skills 不生效 | 目录结构错误、SKILL.md 格式不规范 | 确认放在 skills 目录下,检查 frontmatter 中的 name 和 description |
| MCP Server 连不上 | 端口被占用、鉴权失败、依赖未安装 | 查看 MCP 日志,单独运行命令测试,确认服务器地址和 token |
| Agent 执行超时 | 单个任务步骤太多、模型响应慢 | 将任务拆小,增加超时配置,减少重试次数 |
| 生成的图片分层丢失 | 工作流中没有分层导出节点 | 检查是否使用支持分层输出的后处理工作流 |
| Agent 输出的 JSON 格式错误 | 提示词约束不足、模型能力不够 | 在提示词中显式指定字段和格式,增加示例 |
如果你遇到 Agent 报错 “the agent execution provider did not respond in time”,这个问题通常表示 Agent 在执行某个工具或模型调用时超时。排查顺序如下:
- 先确认是哪个步骤超时,查看日志中的步骤名称。
- 如果是 ComfyUI 出图慢,检查 GPU 负载和队列是否堆积。
- 如果是外部 API 调用超时,检查网络连接和接口响应时间。
- 适当调大超时时间,或者把任务拆成更小的步骤。
另外,如果你在配置 Figma MCP 时发现工具注册不上,例如社区里有人提到 “figma mcp 在 codex 中总是工具注册不上”,通用的排查方向是:
- 确认 MCP Server 是否能独立启动。
- 检查配置中的参数是否完整,例如 API Token。
- 检查客户端工具名是否和 MCP Server 注册的工具名一致。
- 查看客户端日志,看是否有工具注册失败的错误信息。
9. 最佳实践与工程建议
9.1 工作流命名与模块化
无论是 ComfyUI 工作流、Skill 还是 Agent 流程,命名都要清晰。建议采用“类型_场景_版本”的结构,例如:
comfyui_动漫场景_v1.json skill_分镜脚本_v2 agent_漫剧生产_测试版同时尽量做到模块化。把“出图”和“后处理”拆成独立工作流,方便复用。一个项目里不要把所有逻辑堆到一个巨大的流程里。
9.2 素材与模型路径统一管理
项目中的素材、模型、输出结果,建议使用固定的目录结构:
项目根目录/ inputs/ # 输入素材 outputs/ # 生成结果 workflows/ # ComfyUI 工作流 skills/ # 技能包 logs/ # 运行日志统一路径管理的好处是:Agent 在调用 MCP 读写文件时,不容易越界;出了问题也容易定位。
9.3 Skills 的权限边界
在配置 Skills 时,一定要控制权限范围。尤其是社区下载的 Skills,可能包含你并不了解的指令。使用前做到“三查”:
- 查描述文件是否包含下载、执行脚本、修改系统配置等敏感操作。
- 查技能中引用的脚本是否来自可信来源。
- 查技能执行是否会读写到非预期目录。
建议把所有 Skills 默认放在沙箱目录中运行,不要赋予系统级权限。
9.4 MCP Server 最小权限
MCP Server 的设计初衷是让 Agent 可以连接外部世界,但连接范围越大,风险也越大。生产环境中建议遵循最小权限原则:
- 文件系统 MCP 只开放项目工作区目录。
- 数据库 MCP 只授权只读账号,除非业务明确需要写入。
- 不要长期保留高权限 Token,用完即撤销。
如果项目涉及敏感数据,还要在 MCP Server 层做访问审计,记录每次工具调用的时间、调用方、参数摘要。
9.5 Agent 执行加审计日志
Agent 自动执行时,输出结果固然重要,但运行过程也不能忽略。建议为 Agent 增加结构化日志,至少包含:
- 步骤名称。
- 开始时间和结束时间。
- 输入参数摘要。
- 输出结果摘要。
- 错误信息。
- 耗时。
有了这些日志,排查问题时就不再是“黑盒猜谜”。
9.6 备份与版本管理
在做 AI 工作流开发时,版本管理同样重要。推荐做法:
- 把 ComfyUI 工作流、Skills 配置文件、Agent 流程配置都纳入 Git 管理。
- 每次调整参数前,记录旧版本的效果。
- 对生成结果定期备份,尤其是还在调优阶段的项目。
这样即使某一版本迭代出了问题,也可以快速回滚到可用状态。
10. 总结与下一步学习路线
这篇文章围绕 DX-OS 的定位和核心模块展开,重点拆解了无限画布、图片分层、ComfyUI、Skills、MCP、Agent、AI 漫剧这几个概念之间的关系,并通过一个 AI 漫剧工作流的例子,演示了从分镜脚本到出图、再到结果汇总的完整思路。
如果你之前对 ComfyUI 只停留在“下载模型、导入工作流出图”的阶段,那么下一步可以尝试:
- 理解 ComfyUI 工作流中的关键节点,学会读写 API 方式的工作流。
- 自己编写一个简单的 Skill,先跑通“输入大纲、输出分镜 JSON”这个小闭环。
- 接入一个本地文件系统 MCP Server,让 Agent 能自动保存结果。
- 最后再把 ComfyUI 出图接入流程,串成完整链路。
在实际项目中,优先关注三件事:模型的路径和版本一致性、Skills 的权限边界、Agent 的超时和日志。这三件事做好了,整个工作台的稳定性会明显提升。
如果你正在使用或准备使用 DX-OS,建议先从一个最小工作流开始,不要一上来就想做完整漫剧。先把“一个镜头从文本到图片”跑通,再逐步扩展成多个镜头、多个角色、批量处理。AI 系统再强大,也需要一个可维护、可观测的工程化底座。