news 2026/10/11 4:29:52

AutoSci实验自动化教程:/exp-run三种模式如何自动部署并监控远程GPU实验

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AutoSci实验自动化教程:/exp-run三种模式如何自动部署并监控远程GPU实验
  • 人工智能
  • AI 技能/插件
  • 深度研究
  • 知识图谱
  • MCP 服务

【免费下载链接】AutoSci

Karpathy's LLM-Wiki vision, fully realized — wiki-centric full-lifecycle AI research platform powered by Claude Code

项目地址:https://gitcode.com/gh_mirrors/om/AutoSci
点击查看免费下载

AutoSci是一个以 wiki 为中心的全生命周期 AI 科研平台,其中的/exp-run实验自动化技能可以一键完成实验代码生成、本地/远程 GPU 部署、运行监控与结果收集。本教程带你快速掌握它的三种运行模式(deploy / --collect / --full),几分钟就能把实验丢上远程 GPU 服务器并自动盯盘。

/exp-run是什么:一条龙的实验执行流水线

在 AutoSci 中,实验设计由/exp-design生成到wiki/experiments/目录后,/exp-run就接手执行环节。它把原本需要手工操作的 4 个步骤全部自动化:

阶段做什么自动化细节
Phase 1 准备生成实验代码读取实验页配置,写出train.py、config.yaml、run.sh,并做小规模 sanity check
Phase 2 部署启动实验本地用 screen 后台运行;远程则 SSH 同步代码、选空闲 GPU、启动 session
Phase 3 监控检查状态检测 NaN、OOM、Traceback 等异常,还能自动降学习率/减 batch size 修复一次
Phase 4 收集汇总结果拉回results/{slug}/seed_*.json,计算 mean±std,对比 baseline,更新实验页

完整流程定义见 i18n/zh/skills/exp-run/SKILL.md,远程 GPU 操作的实现集中在 tools/remote.py。

三种运行模式速览:怎么选?

/exp-run用三个参数切换工作模式,适配不同时间尺度的实验:

模式命令覆盖阶段适合场景
默认(deploy)/exp-run <slug>Phase 1-2要跑几小时甚至几天的长实验,部署后立即返回
收集(collect)/exp-run <slug> --collectPhase 3-4实验已在跑,检查是否完成、完成则收结果
完整(full)/exp-run <slug> --fullPhase 1-4几分钟就出结果的本地快速实验

💡 官方推荐流程:/exp-run <slug>部署 →/exp-status监控 →/exp-run <slug> --collect收集。

模式一:deploy 默认模式,自动部署到远程 GPU

这是最常用的模式。假设wiki/experiments/里有一个status: planned的实验exp-demo,执行:

/exp-run exp-demo --env remote

Agent 会依次完成:

  1. 读取实验配置:从实验页提取模型、数据集、硬件、指标与 baseline,并加载关联 idea 的方法草图和参考论文细节;
  2. 生成代码:统一写入experiments/code/exp-demo/,模块化组织(训练入口 + utils + 超参配置 + 启动脚本),结果按seed_N.json保存,天然支持多 seed;
  3. Sanity check:用小规模数据先跑一遍,验证不 crash、GPU 可用、loss 能下降;
  4. 用户确认关卡🚪:这是刻意保留的人工检查点——代码和配置(数据集路径、API 配置等)交给你确认后才真正部署,避免浪费 GPU 资源;
  5. 远程部署:调用tools/remote.py依次执行status(连通性)→gpu-status(找空闲 GPU)→sync-code(rsync 代码)→setup-env(装依赖)→launch --gpu N(在远程 screen session 中启动);
  6. 写回 wiki:状态改为running,记录 session 名、启动时间,并根据硬件/数据规模估算 ETA。

完成后终端会输出一份DEPLOY_REPORT:session 信息、日志路径、预计完成时间,以及"用/exp-status监控、用--collect收集"的下一步指引。

远程 GPU 只需一份 server.yaml

远程模式唯一的额外准备工作是复制 config/server.yaml.example 为config/server.yaml,填好四要素:

  • host/user/port:SSH 连接信息;
  • work_dir:远程工作目录(代码同步到这里、实验也在这里跑);
  • conda或env_setup:环境激活方式;
  • 可选的identity_file、proxy_jump(跳板机)与同步 include/exclude 规则。

tools/remote.py会把 9 个远程操作(status、gpu-status、sync-code、setup-env、launch、check、tail-log、pull-results)全部封装成子命令,/exp-run全程无需你手写任何 SSH 命令。

模式二:--collect,检查是否跑完并自动收结果

几小时后(或第二天),执行:

/exp-run exp-demo --collect

它会分两种情况处理:

  • 实验还在跑:只输出进度报告(当前 step/epoch、最新指标、异常检测、剩余时间估算),不修改任何 wiki 文件;如果检测到 NaN 或 OOM,会自动尝试一次修复(从 checkpoint 恢复并降学习率,或减小 batch size 重启)。
  • 实验已完成:自动拉回远程结果与日志,解析各 seed 的 JSON,计算 mean ± std 并与 baseline 对比,把实验页状态推进到completed,填入 outcome(succeeded / failed / inconclusive)、一句话核心发现,并输出RUN_REPORT,末尾还会建议"接下来运行/exp-eval更新关联 idea 的状态"。

模式三:--full,快速实验一口气跑完

对于 CPU 或本地 GPU 上几分钟就能跑完的实验(sanity check、toy 数据集验证),加--full即可让 Phase 1→4 一口气执行完:生成代码 → 部署 → 轮询等待 screen session 结束 → 收集结果,中间不会返回打断你。如果 session 超过预计时间的 2 倍还没结束,它会警告你但不会强制终止,防止误杀长实验。

用 /exp-status 批量监控所有实验

多实验并行时,/exp-status是统一监控入口(定义见 i18n/zh/skills/exp-status/SKILL.md)。它会扫描所有running实验,逐一检查 screen session / SSH 状态,输出四栏状态表:

  • 🔄Running:耗时、最新指标、环境;
  • ⚠️Anomaly:NaN / OOM / Traceback 异常及建议动作;
  • ✅Completed — Pending Collect:session 已消失、等待收集;
  • 📦Already Collected:已收集及结果。

再配合两个高级参数:

  • --collect-ready:对所有"已跑完待收集"的实验自动批量执行--collect;
  • --pipeline <slug> --auto-advance:在/research流水线中,当所有实验完成时自动推进到 Stage 4(判定与迭代),实现从实验到论文的无人值守衔接。

常见问答

Q:deploy 模式提示"已在运行中"?说明该实验 status 已是running,直接用/exp-run <slug> --collect检查进度即可。

Q:没有本地 GPU 怎么办?配置好config/server.yaml后加--env remote,Agent 会自动查找远程空闲 GPU(显存占用低于阈值即视为空闲)并部署。

Q:实验代码会被 Review LLM 审查吗?可选。deploy / full 模式加--review参数,会调用独立的 Review LLM 以资深 ML 工程师视角审查训练循环正确性、数据泄漏、公平对比等常见坑,并根据反馈修正代码。

Q:结果保存在哪?所有实验结果以 JSON 格式保存在results/{slug}/seed_{N}.json,多 seed 报告取 mean ± std,不报告单次运行,保证结论可复现。

总结:三步搞定实验自动化

步骤命令说明
1️⃣ 部署/exp-run <slug> [--env remote]生成代码 + 部署到本地/远程 GPU,立即返回
2️⃣ 监控/exp-status批量查看进度与异常,--collect-ready可批量收集
3️⃣ 收集/exp-run <slug> --collect拉回结果、对比 baseline、更新实验页

配合/exp-eval完成结果判定后,AutoSci 的实验循环就闭环了——记忆沉淀在 wiki,下一个实验会自动参考这次的经验。想深入了解各技能的完整参数与错误处理策略,可以从 i18n/zh/skills/ 目录下的中文技能文档开始读起。

  • 人工智能
  • AI 技能/插件
  • 深度研究
  • 知识图谱
  • MCP 服务

【免费下载链接】AutoSci

Karpathy's LLM-Wiki vision, fully realized — wiki-centric full-lifecycle AI research platform powered by Claude Code

项目地址:https://gitcode.com/gh_mirrors/om/AutoSci
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/11 4:29:19

BK7238(XH-WB3S)新手入门指南(AT指令篇:常用指令)!

三、常用指令篇 源码和BIN文件资料参考&#xff1a;https://github.com/Sparkleiot/bk7238-at-esp32c3-compat 3.1 AT 常用 1、读取 IO 状态 ATCIOREAD26 26 为 GPIO26&#xff0c;返回值 0:LOW&#xff08;低电平&#xff09; OK 2、设置 IO 口状态 ATCIOWRITE26,1 …

作者头像 李华
网站建设 2026/10/11 4:27:26

Visio2013安装全指南:从RAR校验到避坑部署

简介&#xff1a;这是一款Visio2013完整安装包资源&#xff0c;为需要在Windows平台绘制流程图、组织架构图、工程图表及机房拓扑图的用户提供离线安装方案。压缩包内共包含226个文件&#xff0c;以cab压缩组件、msi安装模块、dll运行库及xml配置文件为主&#xff0c;同时带有c…

作者头像 李华
网站建设 2026/10/11 4:27:15

Nginx安全加固实战:配置、限流与HTTPS防护

部署一台Nginx很容易&#xff0c;但把一台Nginx配置到"安全"状态&#xff0c;很多人其实没认真想过。我接触过不少项目&#xff0c;应用代码写得不错&#xff0c;结果Nginx层漏成了筛子——目录列表开着、管理后台裸奔、错误信息把内部IP打得到处都是、4核机器被一个…

作者头像 李华
网站建设 2026/10/11 4:26:31

启动Flink报错:[ERROR] Could not get JVM parameters properly.

报错&#xff1a;Starting cluster. Starting standalonesession daemon on host master.localdomain. [ERROR] Could not get JVM parameters properly. [ERROR] Could not get JVM parameters properly. [ERROR] Could not get JVM parameters properly.解决方法&#xff1a;…

作者头像 李华
网站建设 2026/10/11 4:24:26

vc_redist.x64.exe 下载安装与排错完全指南

简介&#xff1a;微软C运行库64位安装程序&#xff08;vc_redist.x64.exe&#xff09;打包下载&#xff0c;面向需要在64位操作系统上运行依赖C库的软件开发者与普通用户。当程序提示找不到某个动态链接库&#xff08;如msvcrXX.dll&#xff09;或缺少运行库组件时&#xff0c;…

作者头像 李华