AI 软件工厂还处在探索阶段,远谈不上成熟,却被许多人看作软件开发的下一个方向。Cole Medin 在这条路上钻研已久,他的 Archon 工作流已渐渐成形,只是要用它,仍得从零搭建环境。最近他再进一步,把这些积累收进一个开箱即用的软件工厂,装好就能让 AI 把需求变成成品。它究竟能走到哪一步,他自己也坦言,目前还在 alpha。GitHub 项目已经放在文末。
什么是 AI 软件工厂
先说概念。AI 软件工厂是一条几乎全自动的 AI 编码流水线,Cole Medin 常把它叫作 dark factory。往里投一份PRD(产品需求文档),系统自己拆任务、派 coding agent 写代码,再自动审 PR、合并分支、部署上线。
从需求到上线,没有一个人审阅过代码。
Cole 一开始就料到读者会怀疑。这类系统不是纸上谈兵,已有公司把它接进一部分开发流程,他还亲手帮几家企业搭过这样的工厂。
现阶段,软件工厂最合算的用途,是快速做出原型、低成本验证想法,Cole 称之为 spike。将想法交给工厂,用产出的原型检验需求,试错成本比以往低一个量级。这也是他押注的重心。他已经宣布,未来会把大量精力投入一个开源软件工厂,让任何公司下载即用。
为什么恰好是现在
软件工厂能跑起来,不是靠某一项突破,而是三样东西正好凑到了能用的节点:
- coding agent 已经能独立写代码
不再只会补几句提示。
- 大模型也比从前更强
能接住更长、更乱的需求。
- harness 成熟了
也就是把 agent 框进固定流程的那套外围装置。
单看任何一样都不够,可一旦串成流水线,从需求进到代码出,才从设想变成真能落地的事。
Cole 特意澄清一句,免得被当成疯子。他不认为 AI 会在一年内取代所有工程师。软件工厂会在未来几年成为多数公司工具箱里的常规工具,能在这个阶段先摸清自动化边界的人,会占到先机。
自治度分五级,开到 L5 就没了方向盘
软件工厂这套说法的源头,是 Dan Shapiro 年初发的一篇博客。他用开车来类比 AI 编码的自治度,把 coding agent 放手的程度分成五级。这个坐标系是理解后文的钥匙,值得看仔细:
- L1
代码基本由人写,AI 只做少量辅助。
- L2
AI 帮的更多,主导权仍在人手里。
- L3
agent 写全部代码,人深度介入每个任务的规划与验收。Cole 教学的主推档位是这一级,因为它把可靠性放到最高。
- L4
介于 L3 与 L5 之间,人只保留监督。
- L5
车里还剩一个控制台,人给出高层方向,方向盘已经拆掉。规划文档进,成品代码出。
Cole 反复引用这套类比,还自嘲说,旁人又可以拿他再次搬出 Dan Shapiro 的博客来下酒了。他真正看重的,是接近 L5 的状态,所有小决策都交给 agent,人只保留大方向。对多数人而言,这近乎理想状态,前提是它足够可靠。
L3 与 L5 的差别值得多说一句。L3 把可靠性托付给人逐条验收,L5 把可靠性全部押在系统外围的 harness 上。Cole 也承认,他平时教的主要是 L3,而软件工厂的目标,是把可靠性做到 L5 也能成立。
第一个成品:一行代码都没写的 Dynachat
问题落到实地只有一句,dark factory 到底可不可靠?Cole 今年亲手做了一次验证。他把搭建全程公开记录,建起一套完整的 dark factory,再用它做了一个 AI 导师应用,叫Dynachat。
Dynachat 是一个 agentic chat 应用,能力可以拆成两条:
读取 Cole 公开发布的视频内容,回答只以这些公开资料为依据
Dyna 社群的读者,还能让它检索课程与工作坊的专属材料
整个应用从零到上线,Cole 没有写、也没有看过一行代码,目前仍在生产环境运行,可以当场试用。
Cole 对这次实验的结论很克制。他成功了,但还没触到 dark factory 可靠性的上限。Dynachat 本身不复杂,简单应用探不出工厂的极限。他把整套搭建方法打包成一个 build a dark factory 的 skill,放进自己的主 skills 仓库,供人照着从零复刻。
授人以渔多年,这次也发一条鱼
Cole 把这次选择称为一次哲学上的变脆弱。做频道多年,他的信条一直是教人自己造出东西,如同教人钓鱼,而不只是递上一条鱼。这个信条他仍然保留,只是再补一类内容,直接交付开箱即用的工具。
转变的诱因,是 Cole 一直想做出一个能病毒式传播的开源项目。他拿几个数字当参照。OpenClaw 接近 40 万星,Hermes agent 24 万星,另有一个高星开源 agent 项目据说到 20.9 万星。
Cole 自认最接近的是 Archon,一个他至今仍在投入的工具。但 Archon 再强,也到不了几十万星。原因他说得很直接。此前的工具都要用户从零搭自己的流程,装好后也看不到现成成果,第一印象不够惊艳,很难传播开来。于是他换了一条路,做一个开箱即能出成果的软件工厂。
这条新路线与旧信条并行。软件工厂把 Cole 在多家公司实施这类系统时与公开实验中积累的教训,一并收编进去。它自带一套明确主张,底层直接内置 Archon 工作流,装好即可使用,把规划文档一路变成部署上线的代码;想按自己的习惯调整,后面还留着旋钮。
还在 alpha,但已经可以试
Cole 反复强调,这不是安装教程。软件工厂还很新,处于 alpha,但已经可以试,装起来只有三步:
把 README 顶部那段 prompt 发给 coding agent
回答几个问题,系统就自动装好
此后扔进任意 PRD,工厂端到端产出成品
他这次公开亮出产品,更多是预告和邀请。展示正在做的东西,也邀请大家一起来把这套系统推到更可靠。Cole 也坦言,自己对工厂能造任何东西持保留态度。这条路接下来要做的,就是一起找出可靠性的边界。
可靠性这件事,Cole 心里有一杆秤。需要高可靠的关键任务,人还是要多留在环内,另一些任务则可以放心交给软件工厂。判断交给工厂还是留在手上,看的是 harness 做到多硬。他已反复从零建厂来迭代主仓库,耗费大量 token,只为把 harness 这套外围打磨得更可靠。
用什么压测上限:视频游戏
Cole 除了交付软件工厂这个主仓库,还需要真实的复杂应用来检验它的成色。Dynachat 这类 web 应用做起来太轻松,功能稍多便显冗余,难以再考验工厂的上限。想继续加压,就得换更复杂的载体。他的答案听来有些孩子气,却极为认真,那便是做视频游戏。
游戏没有做完的一天。关卡能一直增加,玩法能持续变复杂,永远留有空间去考验系统处理大型、多模块构建的能力。Cole 自幼酷爱游戏,把爱好与技术验证结合在一起,恰好成了继续推进这条路的动力。
后续连载,是否值得跟进
Cole 计划以连载的形式持续做下去。不断打磨软件工厂,展示用它完成的项目,也分享搭建 harness 过程中积累的教训与最佳实践,尤其是如何用 Archon 及其工作流驱动一切。他特别强调,这些经验有更大的价值,所有让软件工厂变可靠的做法,都是在训练人更好地使用 coding agent。即便始终停留在 L3、坚持人在环内,从极限自治中总结出的可靠性方法,同样适用。
若想验证软件工厂是否可信,不妨挑一件不重要的、即使写坏也无妨的小工具,交给它完整处理一遍,观察它如何拆解任务、如何自我纠错。读完全文,把术语与五级标尺收藏起来,日后与人讨论 AI 编程时可直接派上用场。
最后用一句话收束,软件工厂离真正可用还有多远,取决于 harness 能加固到什么程度,也取决于它敢拿多复杂的项目来检验自己。
素材来源说明
本文基于 Cole Medin 的视频《AI Software Factories Are the Next Big Thing(And I'm Building You One)》。觉得有用,建议先收藏备用。
相关资源
资源 | 是什么 | 链接 |
|---|---|---|
AI Software Factory | 文章主角,README 顶部有一段即装 prompt | github.com/coleam00/ai-software-factory |
Dynachat | dark factory 建出、仍在线上维护的 App | chat.dynamous.ai |
The Five Levels | Dan Shapiro 的博客,五级自治说法的出处 | danshapiro.com/blog/2026/01/the-five-levels |
Archon | 工厂底层的 agent 工作流引擎 | github.com/coleam00/archon |
build a dark factory skill | 从零搭出整套工厂的 skill | github.com/coleam00/skills |
dark factory experiment | Cole 最初的实验仓库 | github.com/coleam00/dark-factory-experiment |
这些链接值得一起收藏,挑一个项目先试一遍。
#AI软件工厂 #CodingAgents #开源 #AI编程 #软件工程 #AI自动化 #PRD #代码生成 #智能体 #开发效率