加示例反而更差?LifeOS Science 技能把科学方法变成可执行的排障与实验循环
【免费下载链接】LifeOS⛰️ LifeOS — The universal AI Harness designed to move you from Current to Ideal state in both life and work.项目地址: https://gitcode.com/GitHub_Trending/pe/LifeOS
你大概率干过这种事:提示词输出忽好忽坏,你心想"加两个示例总不会错",改完一看——分数反而比不加低。LifeOS 仓库里的 Science 技能里就有这么一组真实数据:6 个提示词变体里,"组合约束"以 88% 跑赢"加 few-shot 示例"的 85%。直觉这次输了,而且输得很体面。这就是 Science 技能想解决的问题:把"凭感觉改两下"换成一条目标-假设-实验循环,让从 5 分钟排障到 2 周 A/B 实验都能走同一套动作。
先画一张图:目标-假设-实验循环长什么样
整个技能就一圈循环,SKILL.md 里原样印着:
GOAL 成功长什么样?(写下来,不许脑补) ↓ OBSERVE 现在是什么状态? ↓ HYPOTHESIZE 什么可能管用?★ 铁律:最少 3 条,单条假设=自我印证 ↓ EXPERIMENT 设计一个"能失败"的测试,跑掉它 ↓ MEASURE 记下数字(没有基线的数据不算数) ↓ ANALYZE 和 GOAL 对比,不是和你的希望对比 ↓ ITERATE 回到 HYPOTHESIZE,再来一圈注意 ★ 的位置:假设必须复数。这一条贯穿后面所有尺度,也是整个循环里最容易偷懒、也最容易被偷懒毁掉的一步。
三条铁律:目标先行、假设复数、诚实测量
| 铁律 | 反面教材 | 正面做法 |
|---|---|---|
| 🎯 目标先行 | "让它更快一点"——快一点没有验收标准 | "加载时间从 3s 压到 1s"——写下来再碰键盘 |
| 🧪 假设必须复数 | 只验证你心里那条路,测完宣布"验证成功" | 先列 3 条以上,每条标注"什么证据能证伪它" |
| 📏 诚实测量 | "感觉比之前顺了"——感觉不产生结论 | 基线 40% → 结果 36%,变化 +4pp,p=0.0003 |
反面教材的共同点是:你省掉的那一步,会在后面以翻倍的工时代价还回来。
按尺度选工作流:分钟级、小时级、周级各走几步
分钟级问题:先列 3 条假设再动手
什么时候用:明显修复试过没效;你正准备"随便试几把";嘴里冒出"应该是 XX 吧"但没有证据;问题耗时超出预期。
什么时候别用(反触发):修复显而易见、5 分钟内能完;这模式你已解决过 50 次以上;你还在创造性头脑风暴——这些场景走流程纯属仪式。
拿"登录接口 500"走一遍。目标一句话:"用户能登录,不再 500。" 60 秒列假设:H1 数据库连接、H2 昨晚发版、H3 认证服务挂了、H4 限流触发。按"验证成本 × 命中概率"排序,先跑最便宜的:
$ psql -c "SELECT 1" # 连接超时 $ docker ps | grep postgres # 空的——容器停了docker-compose up -d postgres,curl -I /api/login返回 200,收工。前后 5 分钟,对照"重启→换浏览器→翻文档"的随机试探,那套通常是 30 分钟起步。
TDD 的红绿重构是同一个循环穿了编码的马甲,Protocol.md 给了逐字段映射:
goal: 测试断言先定义预期行为 observe: 跑一次测试,看它失败 hypothesize: 列出实现方案(示例:正则 / 引库 / 手写解析,3 选 1) experiment: 写最少代码让它变绿 measure: 再跑测试 + 看覆盖率 iterate: 全绿→重构或下一个特性示例里isValidEmail走简单正则,6 个测试全过、覆盖率 100%,正则方案确认够用。关键点:RED(先写失败测试)逼你把目标钉死在动手之前,"边写边想、写出来就算对"从机制上就被堵死了。
小时到天:A/B 实验与提示词评测都靠对照组
购物车弃购率 40%,要压到 25% 以下,还附加两条不许变差:转化率不回退、投诉不增加——这就是"预注册":标准写在跑实验之前。四条假设按测试成本排序,成本最高的"砍结账步骤"排最后:
| 假设 | 改动 | 测试成本 |
|---|---|---|
| H1 | 加安全徽章 | 低 |
| H4 | 显眼的优惠券框 | 低 |
| H3 | 移动端优化 | 中 |
| H2 | 结账 4 步砍到 2 步 | 高 |
第一轮只动 H1,对照组 vs 实验组,每组 5,000 人跑 7 天:
| 组别 | 弃购率 | 显著性 |
|---|---|---|
| 对照组(现有流程) | 40.0% | — |
| 实验组(+安全徽章) | 36.0% | p=0.0003 |
然后 H1 → H4 → H3 逐轮叠加,每轮只改一个变量,每一分改善都能归因:
| 阶段 | 基线 → 结果 |
|---|---|
| 起点(基线) | 40% |
| +安全徽章 | 40% → 36% |
| +优惠券框 | 36% → 32% |
| +移动端优化 | 32% → 24% |
24% < 25%,达成。别学一次性把四个改动全上线——那时你分不清功劳是谁的。
提示词评测是 Meso 尺度的另一副面孔,Workflows/ 之外它直接委托给 Evals 技能:
| 变体 | 综合得分 |
|---|---|
| 对照组(基线) | 62% |
| 长度约束 | 68% |
| 格式约束 | 72% |
| 要点指引 | 78% |
| 组合约束 | 88% ← 胜出 |
| Few-shot 示例 | 85% |
基线 62% 起步,最后靠加执行约束拉到 93%。注意那条反直觉结论——"组合约束 88% > few-shot 85%"——正是对照实验给你的,而不是"加示例肯定更稳"的脑补给你的。Protocol.md 对此只有一句:"提示词实验直接走 Evals,句号。" 临时搭的评测撑不过第三轮就开始骗你。
周级:MVP 验证靠文档化撑住周期成本
产品级验证跨周,口头目标会被两周的噪音冲掉。做法是把目标、假设、实验标准全部落成文档、做全局登记,PMF 指标提前承诺。宏尺度慢,所以每一步都要留痕。
尺度×协议总览:什么时候显式、什么时候隐式
| 尺度 | 周期 | 适用场景 | 协议显式度 | 配套模板 |
|---|---|---|---|---|
| Micro | 秒~分钟 | 快速 Debug、TDD 红绿重构 | 隐式,脑内过一遍,不落状态 | 假设快速版(Templates.md) |
| Meso | 小时~天 | 功能 A/B、提示词评测 | 显式,卡住才落文档,状态放.science/ | 实验模板(PRE-COMMITTED 成功/失败/不确定三态) |
| Macro | 周~月 | 产品 MVP 验证 | 正式文档化 + 全局登记 | 目标模板(含 Minimum/Target/Stretch 三层阈值) |
原则就一句:别给 5 分钟的问题上两周的仪式。四类模板(目标/假设/实验/结果)都在 Templates.md,每类带一个"快速版",抄下来改三个字就能用。
收工与升级:什么算解决,什么信号该上更重的手段
算解决:预写的成功标准逐条打勾(不是"差不多"),且数字能复述——基线多少、结果多少、变化多少。只够到 Minimum 阈值?也收工:上线,让生产环境教下一课。"无限实验"本身就是反模式。
升级触发器清单:
- 🕒 QuickDiagnosis 满 15 分钟没结论 → 升 StructuredInvestigation
- 🔀 问题横跨多系统,或两人对根因说法不一 → 同上
- 📄 跨天/跨周、要给干系人审阅、结论要对外发布、需要统计严谨 → 升 FullCycle(功率分析、执行审计、敏感性分析都在这层补上)
- 🤖 碰提示词 → 直接 Evals,不自己手搓
- 📉 评测连续 3 轮无改进 → 触发范式检查:先怀疑用例定义和测量对象,再怀疑提示词
写在最后
方法不神秘:知道要什么、现在在哪、哪条路可能通、试最便宜的那条、看数字、对照目标、再来一轮。从 5 分钟的 500 排障到 2 周的功能实验,规模在变,循环没变。要写正式一点的时候,翻 Templates.md 把四类模板抄出来,再对照 Workflows/QuickDiagnosis.md 把触发和反触发条件贴在屏幕边上。
【免费下载链接】LifeOS⛰️ LifeOS — The universal AI Harness designed to move you from Current to Ideal state in both life and work.项目地址: https://gitcode.com/GitHub_Trending/pe/LifeOS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考