news 2026/9/6 5:22:32

开源、开箱即用,这套 AI 软件工厂装好就能把需求变成产品

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
开源、开箱即用,这套 AI 软件工厂装好就能把需求变成产品

AI 软件工厂还处在探索阶段,远谈不上成熟,却被许多人看作软件开发的下一个方向。Cole Medin 在这条路上钻研已久,他的 Archon 工作流已渐渐成形,只是要用它,仍得从零搭建环境。最近他再进一步,把这些积累收进一个开箱即用的软件工厂,装好就能让 AI 把需求变成成品。它究竟能走到哪一步,他自己也坦言,目前还在 alpha。GitHub 项目已经放在文末。

什么是 AI 软件工厂

先说概念。AI 软件工厂是一条几乎全自动的 AI 编码流水线,Cole Medin 常把它叫作 dark factory。往里投一份PRD(产品需求文档),系统自己拆任务、派 coding agent 写代码,再自动审 PR、合并分支、部署上线。

从需求到上线,没有一个人审阅过代码

Cole 一开始就料到读者会怀疑。这类系统不是纸上谈兵,已有公司把它接进一部分开发流程,他还亲手帮几家企业搭过这样的工厂。

现阶段,软件工厂最合算的用途,是快速做出原型、低成本验证想法,Cole 称之为 spike。将想法交给工厂,用产出的原型检验需求,试错成本比以往低一个量级。这也是他押注的重心。他已经宣布,未来会把大量精力投入一个开源软件工厂,让任何公司下载即用。

为什么恰好是现在

软件工厂能跑起来,不是靠某一项突破,而是三样东西正好凑到了能用的节点:

  1. coding agent 已经能独立写代码

    不再只会补几句提示。

  2. 大模型也比从前更强

    能接住更长、更乱的需求。

  3. harness 成熟了

    也就是把 agent 框进固定流程的那套外围装置。

单看任何一样都不够,可一旦串成流水线,从需求进到代码出,才从设想变成真能落地的事。

Cole 特意澄清一句,免得被当成疯子。他不认为 AI 会在一年内取代所有工程师。软件工厂会在未来几年成为多数公司工具箱里的常规工具,能在这个阶段先摸清自动化边界的人,会占到先机。

自治度分五级,开到 L5 就没了方向盘

软件工厂这套说法的源头,是 Dan Shapiro 年初发的一篇博客。他用开车来类比 AI 编码的自治度,把 coding agent 放手的程度分成五级。这个坐标系是理解后文的钥匙,值得看仔细:

  1. L1

    代码基本由人写,AI 只做少量辅助。

  2. L2

    AI 帮的更多,主导权仍在人手里。

  3. L3

    agent 写全部代码,人深度介入每个任务的规划与验收。Cole 教学的主推档位是这一级,因为它把可靠性放到最高。

  4. L4

    介于 L3 与 L5 之间,人只保留监督。

  5. L5

    车里还剩一个控制台,人给出高层方向,方向盘已经拆掉。规划文档进,成品代码出。

Cole 反复引用这套类比,还自嘲说,旁人又可以拿他再次搬出 Dan Shapiro 的博客来下酒了。他真正看重的,是接近 L5 的状态,所有小决策都交给 agent,人只保留大方向。对多数人而言,这近乎理想状态,前提是它足够可靠。

L3 与 L5 的差别值得多说一句。L3 把可靠性托付给人逐条验收,L5 把可靠性全部押在系统外围的 harness 上。Cole 也承认,他平时教的主要是 L3,而软件工厂的目标,是把可靠性做到 L5 也能成立

第一个成品:一行代码都没写的 Dynachat

问题落到实地只有一句,dark factory 到底可不可靠?Cole 今年亲手做了一次验证。他把搭建全程公开记录,建起一套完整的 dark factory,再用它做了一个 AI 导师应用,叫Dynachat

Dynachat 是一个 agentic chat 应用,能力可以拆成两条:

  • 读取 Cole 公开发布的视频内容,回答只以这些公开资料为依据

  • Dyna 社群的读者,还能让它检索课程与工作坊的专属材料

整个应用从零到上线,Cole 没有写、也没有看过一行代码,目前仍在生产环境运行,可以当场试用。

Cole 对这次实验的结论很克制。他成功了,但还没触到 dark factory 可靠性的上限。Dynachat 本身不复杂,简单应用探不出工厂的极限。他把整套搭建方法打包成一个 build a dark factory 的 skill,放进自己的主 skills 仓库,供人照着从零复刻。

授人以渔多年,这次也发一条鱼

Cole 把这次选择称为一次哲学上的变脆弱。做频道多年,他的信条一直是教人自己造出东西,如同教人钓鱼,而不只是递上一条鱼。这个信条他仍然保留,只是再补一类内容,直接交付开箱即用的工具。

转变的诱因,是 Cole 一直想做出一个能病毒式传播的开源项目。他拿几个数字当参照。OpenClaw 接近 40 万星,Hermes agent 24 万星,另有一个高星开源 agent 项目据说到 20.9 万星。

Cole 自认最接近的是 Archon,一个他至今仍在投入的工具。但 Archon 再强,也到不了几十万星。原因他说得很直接。此前的工具都要用户从零搭自己的流程,装好后也看不到现成成果,第一印象不够惊艳,很难传播开来。于是他换了一条路,做一个开箱即能出成果的软件工厂。

这条新路线与旧信条并行。软件工厂把 Cole 在多家公司实施这类系统时与公开实验中积累的教训,一并收编进去。它自带一套明确主张,底层直接内置 Archon 工作流,装好即可使用,把规划文档一路变成部署上线的代码;想按自己的习惯调整,后面还留着旋钮。

还在 alpha,但已经可以试

Cole 反复强调,这不是安装教程。软件工厂还很新,处于 alpha,但已经可以试,装起来只有三步:

  1. 把 README 顶部那段 prompt 发给 coding agent

  2. 回答几个问题,系统就自动装好

  3. 此后扔进任意 PRD,工厂端到端产出成品

他这次公开亮出产品,更多是预告和邀请。展示正在做的东西,也邀请大家一起来把这套系统推到更可靠。Cole 也坦言,自己对工厂能造任何东西持保留态度。这条路接下来要做的,就是一起找出可靠性的边界。

可靠性这件事,Cole 心里有一杆秤。需要高可靠的关键任务,人还是要多留在环内,另一些任务则可以放心交给软件工厂。判断交给工厂还是留在手上,看的是 harness 做到多硬。他已反复从零建厂来迭代主仓库,耗费大量 token,只为把 harness 这套外围打磨得更可靠。

用什么压测上限:视频游戏

Cole 除了交付软件工厂这个主仓库,还需要真实的复杂应用来检验它的成色。Dynachat 这类 web 应用做起来太轻松,功能稍多便显冗余,难以再考验工厂的上限。想继续加压,就得换更复杂的载体。他的答案听来有些孩子气,却极为认真,那便是做视频游戏。

游戏没有做完的一天。关卡能一直增加,玩法能持续变复杂,永远留有空间去考验系统处理大型、多模块构建的能力。Cole 自幼酷爱游戏,把爱好与技术验证结合在一起,恰好成了继续推进这条路的动力。

后续连载,是否值得跟进

Cole 计划以连载的形式持续做下去。不断打磨软件工厂,展示用它完成的项目,也分享搭建 harness 过程中积累的教训与最佳实践,尤其是如何用 Archon 及其工作流驱动一切。他特别强调,这些经验有更大的价值,所有让软件工厂变可靠的做法,都是在训练人更好地使用 coding agent。即便始终停留在 L3、坚持人在环内,从极限自治中总结出的可靠性方法,同样适用。

若想验证软件工厂是否可信,不妨挑一件不重要的、即使写坏也无妨的小工具,交给它完整处理一遍,观察它如何拆解任务、如何自我纠错。读完全文,把术语与五级标尺收藏起来,日后与人讨论 AI 编程时可直接派上用场。

最后用一句话收束,软件工厂离真正可用还有多远,取决于 harness 能加固到什么程度,也取决于它敢拿多复杂的项目来检验自己。


素材来源说明

本文基于 Cole Medin 的视频《AI Software Factories Are the Next Big Thing(And I'm Building You One)》。觉得有用,建议先收藏备用。

相关资源

资源

是什么

链接

AI Software Factory

文章主角,README 顶部有一段即装 prompt

github.com/coleam00/ai-software-factory

Dynachat

dark factory 建出、仍在线上维护的 App

chat.dynamous.ai

The Five Levels

Dan Shapiro 的博客,五级自治说法的出处

danshapiro.com/blog/2026/01/the-five-levels

Archon

工厂底层的 agent 工作流引擎

github.com/coleam00/archon

build a dark factory skill

从零搭出整套工厂的 skill

github.com/coleam00/skills

dark factory experiment

Cole 最初的实验仓库

github.com/coleam00/dark-factory-experiment

这些链接值得一起收藏,挑一个项目先试一遍。

#AI软件工厂 #CodingAgents #开源 #AI编程 #软件工程 #AI自动化 #PRD #代码生成 #智能体 #开发效率

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 5:18:27

量子计算威胁区块链密码学,后量子迁移实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/6 5:18:01

x64游戏FPS变换矩阵内存分析与定位技术详解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/6 5:17:47

1700行代码浓缩了LangGraph和ADK的设计精华

prodagent 是一个教学型、同时保留必要生产能力的 Agent 框架。它用尽量少、尽量 正交的抽象,把“一台 Agent 执行引擎由哪几块构成、为什么非它们不可”讲清楚,你可以 读完内核,并照着自己手写一遍;再用上层配方拼出 ReAct、先规…

作者头像 李华
网站建设 2026/9/6 5:17:30

QEMU CPU执行源码分析

摘要:本文从源码层面剖析 QEMU 的 CPU 执行流程,围绕主循环调度、基本块缓存、TCG 动态翻译与主机代码执行四条主线展开。文章先介绍 TCG、CPUState、CPUClass 等核心概念,再依次分析 vCPU 线程入口、cpu_exec 主循环、基本块查找与翻译、TCG…

作者头像 李华
网站建设 2026/9/6 5:17:05

Zemax光学设计入门:从指标定义到公差分析的完整验证流程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/6 5:13:06

企业内部流程管理系统部署与实战:72-Skill技术部审批流程详解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华