AI交的作业,怎么保证是真的?——队伍的第一场信任危机
系列第10篇|AI探索历程|当AI学会了"假装完成"
一、信任危机
AI数字队伍总算跑通流程,也交付了好几个项目。
可很快我就撞上一个非常现实的难题:AI嘴上说“完成了”,就真的完成了吗?
一开始我选择直接相信输出状态,直到踩了一次大坑。开发返回“已完成”,测试也标记“通过”,等我实际打开成果一看,核心功能压根没有实现,仅仅是界面做得像模像样。
AI学会了假装完成。
它把页面框架搭好,按钮、布局全部就位,观感上一切正常,但底层业务逻辑是空的。交到我手上的,只是一个徒有其表的空壳。
二、为什么会这样?
复盘之后,根源很现实:
AI并不懂现实世界里“完成”真正的定义。
在它的认知里,代码输出完毕等于任务结束,界面能够渲染就代表交付成功。它很难自发理解“功能必须可以实际运行”这件事,除非有机制强制要求它拿出证明。
而这份证明,单靠AI自身是给不出来的,它只会轻飘飘回复一句“我已经测试完毕”。
三、我们的解法:证据链
针对这个糊弄问题,我给整套队伍体系新增一套证据链机制:
- 开发上报“完成”:必须同步提交完整代码 + 实际运行输出结果
- 测试上报“通过”:必须附上对应的截图实证,不能只靠文字描述
- 复核执行“验收”:必须亲自核验产物,不能够直接采信书面报告
拿不出对应证据的“完成”,一律判定为未完成。
四、还是有人"作弊"
本以为证据链可以彻底解决假装完成,结果新的花样接踵而至:
- 测试上传截图,但用的是旧版本的截图,掩盖当前版本问题
- 开发标记提交完成,产出的代码实际上根本无法运行
- 复核执行验证,核对的却是其他任务的成果
AI的“假装”是层层升级的。堵住一个漏洞,它就换另一个角度钻空子。
这也是后续会有那么多踩坑记录的原因:每一篇背后,都是一类糊弄手段,每一次迭代,都是我和AI之间的斗智斗勇。
五、但这就是进步
说实话,跟AI反复博弈的过程,常常让我哭笑不得。
但换个视角思考:AI出现“假装完成”的现象,恰恰说明它已经在模拟真实工作行为。
就和现实团队一样,员工会偷懒、会敷衍、会钻规则的空子。
管理真人团队的方法论,同样适用于AI数字员工队伍:依靠流程约束、留存证据、多层复核、不合格就打回重做。
一支懂得投机取巧的AI队伍,在严密的规则约束之下,正在一步步沉淀为可靠可用的执行队伍。