- 人工智能
- AI 技能/插件
- 深度研究
- 知识图谱
- MCP 服务
【免费下载链接】AutoSci
Karpathy's LLM-Wiki vision, fully realized — wiki-centric full-lifecycle AI research platform powered by Claude Code
AutoSci是一个以 wiki 为中心的全生命周期 AI 科研平台,其中的/exp-run实验自动化技能可以一键完成实验代码生成、本地/远程 GPU 部署、运行监控与结果收集。本教程带你快速掌握它的三种运行模式(deploy / --collect / --full),几分钟就能把实验丢上远程 GPU 服务器并自动盯盘。
/exp-run是什么:一条龙的实验执行流水线
在 AutoSci 中,实验设计由/exp-design生成到wiki/experiments/目录后,/exp-run就接手执行环节。它把原本需要手工操作的 4 个步骤全部自动化:
| 阶段 | 做什么 | 自动化细节 |
|---|---|---|
| Phase 1 准备 | 生成实验代码 | 读取实验页配置,写出train.py、config.yaml、run.sh,并做小规模 sanity check |
| Phase 2 部署 | 启动实验 | 本地用 screen 后台运行;远程则 SSH 同步代码、选空闲 GPU、启动 session |
| Phase 3 监控 | 检查状态 | 检测 NaN、OOM、Traceback 等异常,还能自动降学习率/减 batch size 修复一次 |
| Phase 4 收集 | 汇总结果 | 拉回results/{slug}/seed_*.json,计算 mean±std,对比 baseline,更新实验页 |
完整流程定义见 i18n/zh/skills/exp-run/SKILL.md,远程 GPU 操作的实现集中在 tools/remote.py。
三种运行模式速览:怎么选?
/exp-run用三个参数切换工作模式,适配不同时间尺度的实验:
| 模式 | 命令 | 覆盖阶段 | 适合场景 |
|---|---|---|---|
| 默认(deploy) | /exp-run <slug> | Phase 1-2 | 要跑几小时甚至几天的长实验,部署后立即返回 |
| 收集(collect) | /exp-run <slug> --collect | Phase 3-4 | 实验已在跑,检查是否完成、完成则收结果 |
| 完整(full) | /exp-run <slug> --full | Phase 1-4 | 几分钟就出结果的本地快速实验 |
💡 官方推荐流程:
/exp-run <slug>部署 →/exp-status监控 →/exp-run <slug> --collect收集。
模式一:deploy 默认模式,自动部署到远程 GPU
这是最常用的模式。假设wiki/experiments/里有一个status: planned的实验exp-demo,执行:
/exp-run exp-demo --env remoteAgent 会依次完成:
- 读取实验配置:从实验页提取模型、数据集、硬件、指标与 baseline,并加载关联 idea 的方法草图和参考论文细节;
- 生成代码:统一写入
experiments/code/exp-demo/,模块化组织(训练入口 + utils + 超参配置 + 启动脚本),结果按seed_N.json保存,天然支持多 seed; - Sanity check:用小规模数据先跑一遍,验证不 crash、GPU 可用、loss 能下降;
- 用户确认关卡🚪:这是刻意保留的人工检查点——代码和配置(数据集路径、API 配置等)交给你确认后才真正部署,避免浪费 GPU 资源;
- 远程部署:调用
tools/remote.py依次执行status(连通性)→gpu-status(找空闲 GPU)→sync-code(rsync 代码)→setup-env(装依赖)→launch --gpu N(在远程 screen session 中启动); - 写回 wiki:状态改为
running,记录 session 名、启动时间,并根据硬件/数据规模估算 ETA。
完成后终端会输出一份DEPLOY_REPORT:session 信息、日志路径、预计完成时间,以及"用/exp-status监控、用--collect收集"的下一步指引。
远程 GPU 只需一份 server.yaml
远程模式唯一的额外准备工作是复制 config/server.yaml.example 为config/server.yaml,填好四要素:
host/user/port:SSH 连接信息;work_dir:远程工作目录(代码同步到这里、实验也在这里跑);conda或env_setup:环境激活方式;- 可选的
identity_file、proxy_jump(跳板机)与同步 include/exclude 规则。
tools/remote.py会把 9 个远程操作(status、gpu-status、sync-code、setup-env、launch、check、tail-log、pull-results)全部封装成子命令,/exp-run全程无需你手写任何 SSH 命令。
模式二:--collect,检查是否跑完并自动收结果
几小时后(或第二天),执行:
/exp-run exp-demo --collect它会分两种情况处理:
- 实验还在跑:只输出进度报告(当前 step/epoch、最新指标、异常检测、剩余时间估算),不修改任何 wiki 文件;如果检测到 NaN 或 OOM,会自动尝试一次修复(从 checkpoint 恢复并降学习率,或减小 batch size 重启)。
- 实验已完成:自动拉回远程结果与日志,解析各 seed 的 JSON,计算 mean ± std 并与 baseline 对比,把实验页状态推进到
completed,填入 outcome(succeeded / failed / inconclusive)、一句话核心发现,并输出RUN_REPORT,末尾还会建议"接下来运行/exp-eval更新关联 idea 的状态"。
模式三:--full,快速实验一口气跑完
对于 CPU 或本地 GPU 上几分钟就能跑完的实验(sanity check、toy 数据集验证),加--full即可让 Phase 1→4 一口气执行完:生成代码 → 部署 → 轮询等待 screen session 结束 → 收集结果,中间不会返回打断你。如果 session 超过预计时间的 2 倍还没结束,它会警告你但不会强制终止,防止误杀长实验。
用 /exp-status 批量监控所有实验
多实验并行时,/exp-status是统一监控入口(定义见 i18n/zh/skills/exp-status/SKILL.md)。它会扫描所有running实验,逐一检查 screen session / SSH 状态,输出四栏状态表:
- 🔄Running:耗时、最新指标、环境;
- ⚠️Anomaly:NaN / OOM / Traceback 异常及建议动作;
- ✅Completed — Pending Collect:session 已消失、等待收集;
- 📦Already Collected:已收集及结果。
再配合两个高级参数:
--collect-ready:对所有"已跑完待收集"的实验自动批量执行--collect;--pipeline <slug> --auto-advance:在/research流水线中,当所有实验完成时自动推进到 Stage 4(判定与迭代),实现从实验到论文的无人值守衔接。
常见问答
Q:deploy 模式提示"已在运行中"?说明该实验 status 已是running,直接用/exp-run <slug> --collect检查进度即可。
Q:没有本地 GPU 怎么办?配置好config/server.yaml后加--env remote,Agent 会自动查找远程空闲 GPU(显存占用低于阈值即视为空闲)并部署。
Q:实验代码会被 Review LLM 审查吗?可选。deploy / full 模式加--review参数,会调用独立的 Review LLM 以资深 ML 工程师视角审查训练循环正确性、数据泄漏、公平对比等常见坑,并根据反馈修正代码。
Q:结果保存在哪?所有实验结果以 JSON 格式保存在results/{slug}/seed_{N}.json,多 seed 报告取 mean ± std,不报告单次运行,保证结论可复现。
总结:三步搞定实验自动化
| 步骤 | 命令 | 说明 |
|---|---|---|
| 1️⃣ 部署 | /exp-run <slug> [--env remote] | 生成代码 + 部署到本地/远程 GPU,立即返回 |
| 2️⃣ 监控 | /exp-status | 批量查看进度与异常,--collect-ready可批量收集 |
| 3️⃣ 收集 | /exp-run <slug> --collect | 拉回结果、对比 baseline、更新实验页 |
配合/exp-eval完成结果判定后,AutoSci 的实验循环就闭环了——记忆沉淀在 wiki,下一个实验会自动参考这次的经验。想深入了解各技能的完整参数与错误处理策略,可以从 i18n/zh/skills/ 目录下的中文技能文档开始读起。
- 人工智能
- AI 技能/插件
- 深度研究
- 知识图谱
- MCP 服务
【免费下载链接】AutoSci
Karpathy's LLM-Wiki vision, fully realized — wiki-centric full-lifecycle AI research platform powered by Claude Code
相关推荐
ARIS GPU 实验环境配置实战:在 CLAUDE.md 中声明远程、本地与 Vast.ai 三种模式,让自动审稿循环替你跑实验
ARIS GPU 实验环境配置实战:在 CLAUDE.md 中声明远程、本地与 Vast.ai 三种模式,让自动审稿循环替你跑实验 本文围绕 ARIS(Auto
AI 技能/插件AI 评测科研人工智能MCP 服务dsh-pluginOdoo MLOps实践指南:企业智能模型的部署与监控自动化流程
Odoo MLOps实践指南:企业智能模型的部署与监控自动化流程 Odoo作为全球领先的开源企业资源规划系统,正在通过MLOps实践将人工智能和机器学习能力深度
企业应用后端电商ngxtop自动化部署监控:监控部署过程与结果
ngxtop自动化部署监控:监控部署过程与结果 你是否还在为Nginx服务器的部署监控烦恼?手动检查日志、分析指标耗时费力,还容易遗漏关键问题。本文将带你通过n
运维可观测性CLI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考