一、单模型的瓶颈
用了大半年 AI 写代码,我发现一个反复出现的问题:
单个模型写的代码,我不敢直接用。
不是代码不能用,而是——没有第二个人帮我看一眼。人类团队里,写完代码要 review,review 完要测试,上线前还要再过一遍。但用 AI 的时候,大多数人是「让它写 → 复制粘贴 → 跑一下 → 报错就改」,全程一个人盯。
那能不能让 AI 自己 review 自己?
问题又来了:同一个模型 review 自己写的代码,就像自己检查自己的作业,天然有盲区。GPT-4 是这样,DeepSeek 也是这样。
所以我想了一个办法:**别让一个模型包揽所有事,让三个模型各司其职。
二、架构:三模型流水线
用户输入需求
↓
DeepSeek(首席工程师)→ 写代码
↓
Kimi(代码审查员) → 审代码,找 bug
↓
Qwen(文档官) → 读代码和审查意见,写 README
↓
Kimi(二次审查) → 最终确认:能不能交付?
↓
输出:代码 + README + 审查报告
每个模型只做一件事,在自己的「岗位」上深度发挥。三个专才的组合,超过一个通才。
三、为什么选这三个
| 模型 | 我让它干什么 | 为什么选它 |
|------|------------|-----------|
| DeepSeek | 写代码 | 代码生成强,中文理解好,100万上下文 |
| Kimi | 审代码 | 逻辑严密,审查风格像严格的 Code Review |
| Qwen | 写文档 | 结构化输出稳定,文档风格干净 |
三个都是国产模型,都兼容 OpenAI API 格式,一个 `openai` 库全部搞定。
四、核心代码
骨架不到 100 行。关键就三步:
python
1. 给每个模型配一个角色(system prompt)
ROLES = {
"deepseek": {
"model": "deepseek-chat",
"system": "你是资深 Python 工程师。只输出可运行代码,不要废话。",
},
"kimi": {
"model": "moonshot-v1-8k",
"system": "你是严格的代码审查员。指出 bug、安全问题、改进建议。",
},
"qwen": {
"model": "qwen-plus",
"system": "你是技术文档撰写者。根据代码和审查意见写 README。",
},
}
2. 流水线调用
code = call_model("deepseek", "写一个 Flask 网页,访问 /time 返回北京时间")
review = call_model("kimi", f"请审查这段代码:{code}")
doc = call_model("qwen", f"代码:{code}\n审查意见:{review}\n写 README.")
final = call_model("kimi", f"最终审查:{code}\n{doc}\n可以交付吗?")
就这么简单。没有复杂的 Agent 框架,没有 LangChain,就是 plain Python + OpenAI SDK + 精心设计的 system prompt。
完整代码已开源:https://github.com/wh-henry/ai-agent-team
五、实际效果
用它生成了一个命令行待办事项工具:
- DeepSeek 输出了 80 行完整代码,包括添加、删除、列出功能
- Kimi 发现了 2 个问题:空输入没做校验、退出条件不明确
- Qwen 自动生成了一份 README,包含安装方法、使用示例
- Kimi 二次审查:「代码和文档都没问题,可以交付」
整个流程跑完大概 15 秒。成本?4 分钱。
六、不止于写代码
这套流水线框架改一下 system prompt,可以做任何事:
写文章团队:DeepSeek 写初稿 → Kimi 润色 → Qwen 取标题
炒股研究团队:DeepSeek 读财报 → Kimi 分析行业 → Qwen 出策略
英语学习团队:DeepSeek 出口语范文 → Kimi 查语法 → Qwen 润色地道表达
本质上,你在用 AI 复刻人类团队的协作模式。
七、我又做了一个
顺着这个思路,上周又搞了个 **AI 周报生成器**:
你输入「修了 3 个 bug,上线了用户系统」,或者让它自动读 git 提交记录。DeepSeek 整理成结构化草稿,Kimi 润色成正式周报,Qwen 提取本周亮点和下周重点。
同样是三模型流水线,同样开源了:https://github.com/wh-henry/weekly-report-ai
八、写在最后
自己闲暇时间做的,没有什么高深的技术,就是把「分工协作」这个人类团队的常识套到了 AI 上。
但我觉得这个方向是对的:**与其等下一个更强的模型,不如让现有的模型学会合作。**
三个国产模型的免费额度加起来,够你日常用几个月。不需要翻墙,不需要 ChatGPT Plus,不需要等 GPT-5。
代码都在 GitHub 上,觉得有用就给个 Star。
> 作者:wh
> GitHub: https://github.com/wh-henry