- AI 技能
- 人工智能
- 大模型
- 深度学习
【免费下载链接】AI-Research-SKILLs
Comprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.
本文系统梳理 AI-Research-SKILLs 开源仓库
demos/目录下的演示案例集合。该集合是「技能库如何驱动真实 AI 科研任务」的活教材:既有 NeMo Evaluator 的 GPQA 基准评测、llama.cpp/GGUF 分层量化、FAISS 跨语言对齐分析等单技能实战,也有以 autoresearch 双循环架构为核心的端到端自主科研 Demo(负结果翻盘、RL 算法「脑部扫描」),以及把 academic-plotting 双工作流落地成论文级图表的完整示例。读完本文,你将理解每个 Demo 的仓库结构、核心技术链路、关键数据结论,以及如何把现有技能库组合出可复现、可发表的 AI 科研流水线。
一、Demo Gallery 是什么:技能库的「实战样板间」
demos/README.md 是 AI-Research-SKILLs 仓库的Demo Gallery 索引页。它的定位很明确——每个 demo 都是一个独立仓库,用来展示「如何用本技能库中的某个(或某组)技能完成真实 AI 科研任务」,并且每个 demo 都包含完整代码、结果、分析与文档,而非玩具示例。
demo-name/ ├── README.md # 概览、结果摘要、如何运行 ├── configs/ # 配置文件 ├── results/ # 原始输出与数据 ├── analysis/ # 脚本与可视化 ├── .env.example # 必需的环境变量 └── requirements.txt # Python 依赖(如适用)这个统一结构背后是四条设计原则(原文明确列出):
- Self-contained(自包含):克隆即可运行,除 API Key 外不依赖外部资源;
- Reproducible(可复现):提供清晰的复现步骤;
- Educational(教育性):解释「为什么」而不只是「怎么做」;
- Real results(真实结果):展示的是实际输出,不是 mock 数据。
在仓库中,有三个 demo 是直接内嵌于本仓库的(而非外部链接),它们是本文的讲解重点:
| Demo | 仓库内路径 | 涉及技能 |
|---|---|---|
| Embedding Norm Heterogeneity 论文 | demos/autoresearch-norm-heterogeneity/ | autoresearch、ML Paper Writing、Research Ideation |
| RL Algorithm Brain Scan 论文 | demos/autoresearch-rl-brain-scan/ | autoresearch、GRPO、TRL、SAELens、TransformerLens、ML Paper Writing |
| Scientific Plotting 演示 | demos/scientific-plotting-demo/ | academic-plotting |
其余 demo(NeMo Evaluator、LoRA Without Regret、分层量化、跨语言对齐)以外部仓库 + 摘要的形式索引在 Gallery 中,同样值得逐一拆解。
二、Demo 1:NeMo Evaluator 跑 GPQA Diamond 基准
技能:NeMo Evaluator(仓库内对应 11-evaluation/nemo-evaluator/)
任务:用 NVIDIA NeMo Evaluator 在GPQA Diamond基准(198 道研究生级别科学题)上横向对比 Llama 三个规模档次的模型,验证「端到端评测工作流」。
关键结果(原文表格,完整保留):
| Model | Accuracy | Notes |
|---|---|---|
| Llama-3.1-8B-Instruct | 27.3% | 20.7% extraction failures |
| Llama-3.3-70B-Instruct | 48.0% | Clean extraction |
| Llama-3.1-405B-Instruct | 53.0% | Best performance |
这组数据本身就很有信息量:8B 模型的 27.3% 准确率里有20.7% 是答案提取失败——即模型答对了但输出格式无法被解析,这说明在评测小模型时,「答案抽取/解析」环节的稳定性会显著影响最终分数,而 70B 与 405B 模型则能干净输出。这是一个评测工程层面的重要洞察。
你将学会:
- 用 NVIDIA Build API 配置 NeMo Evaluator;
- 为不同模型编写评测 YAML 配置;
- 跨模型规模分析评测结果;
- 制作准确率对比图、Venn 图与失败分类(failure taxonomy)可视化。
仓库结构(原文列出):configs/(每个模型的 YAML 配置)、results/(原始评测输出)、analysis/(分析脚本与model_accuracy.png、failure_taxonomy_plot.png、venn_diagrams.png可视化)、README.md。
三、Demo 2:用 AI Agent 复现「LoRA Without Regret」
技能:GRPO RL Training、TRL Fine-Tuning
任务:完全通过提示词驱动一个 AI Agent,复现 Thinking Machines Lab 论文《LoRA Without Regret》的核心发现。Agent 自主完成了:
- 编写 SFT 与 GRPO 强化学习的训练代码;
- 申请 H100 GPU 并通宵运行实验;
- 执行 LoRA rank 消融实验(rank 1 到 256 全范围扫描);
- 生成可直接投稿的分析与可视化。
看点:研究者只需向 Agent 描述「想复现哪篇论文」,Agent 就全权接管——从理解方法论、执行多天 GPU 实验到分析结果,全程无需手工写码。
你将学会:
- 如何为 AI Agent 撰写自主科研复现的提示词;
- 端到端 SFT + GRPO 训练流水线;
- LoRA 与全参数微调的实验设计对比;
- 自动化分析与报告生成。
仓库中与该 Demo 强相关的技能实现:GRPO RL Training 的说明明确指出,GRPO 适用于「需要多种输出格式约束、可验证任务(数学/代码/事实核查)、无偏好数据但有多目标奖励」的场景,其核心机制是对每个 prompt 生成一组(4–16 条)补全,在组内按奖励函数相互比较来更新策略,与 PPO 的关键差异是不需要独立奖励模型、更省样本、更易调试——这正是 Agent 能在夜间自主跑通 LoRA rank 消融的算法基础。
四、Demo 3:逐层量化实验(Layer-Wise Quantization)
技能:llama.cpp、GGUF
任务:研究量化 LLM 时各层精度的最优分配。核心发现是:早期层用 Q8 精度即可实现 1.9× 压缩,且困惑度(perplexity)只损失 1.3%——这证明「并非所有层在量化面前都生而平等」。
你将学会:
- LLM 的逐层(layer-wise)量化策略;
- 测量每层不同精度对困惑度的影响;
- 用 llama.cpp 与 GGUF 执行量化实验;
- 识别哪些层对精度降低最敏感。
这个 Demo 的启发意义在于:它把「量化」从「对整模型做统一精度取舍」升级为「按层敏感度差异化分配精度」,是典型的科研式探索路径——先建立测量(per-layer perplexity),再做消融(不同精度组合),最后得出可操作的结论。
五、Demo 4:跨语言语义对齐分析
技能:FAISS
任务:用 FAISS 相似度检索,定量衡量多语言 embedding 在 8 种语言之间对齐语义概念的能力,揭示跨语言表示的结构以及对齐在何处失效。
你将学会:
- 构建并查询多语言 embedding 的 FAISS 索引;
- 测量跨语言语义对齐质量;
- 分析不同语言间的 embedding 空间结构;
- 用相似度检索评估多语言模型。
该 Demo 展示了 RAG/检索链路中 FAISS 索引类型选择的实际研究用途:它不只是服务于「向量数据库」生产场景,也能作为分析工具探测表示空间的几何结构。
六、Demo 5:Autoresearch 实战——负结果翻盘为更强的论文
仓库内位置:demos/autoresearch-norm-heterogeneity/(论文 PDF:norm-heterogeneity-lora-brittleness.pdf)
技能:Autoresearch、ML Paper Writing、Research Ideation
6.1 完整剧情:从假设、负结果到翻盘
这是「AI Agent 跑完整 autoresearch 工作流」的标杆案例。起始假设是「ETF 结晶化(ETF crystallization)驱动了过训练模型的 LoRA 微调脆弱性」,Agent 的完整行动链是:
- 文献调研:连接两篇近期工作——NeurIPS 2025 Best Paper Runner-Up(关于 superposition/ETF 结构)与 ICML 2025(关于灾难性过训练);
- 内循环实验:在 Pythia-410M 与 Pythia-1.4B 多个 checkpoint 上计算 ETF overlap 指标与范数统计量,随后应用 LoRA 微调;
- 发现负结果:ETF overlap 几何不能预测微调难度(r=0.14),起始假设被证伪;
- 翻盘(Pivot):识别出** embedding 范数异质性(norm heterogeneity,即变异系数 CV)**才是真正的因果预测因子(410M 上 r=-0.84,1.4B 上 r=-0.99);
- 因果深化:在 LoRA 之前先均衡范数,可将微调可塑性提升最多79%;
- 写论文:调用 ml-paper-writing 技能完成论文写作。
6.2 关键发现(原文完整保留)
- ETF overlap 指标与 LoRA 微调难度无相关性——一个清晰的负结果;
- LM head 行的范数 CV 与去混淆后的微调可塑性强相关(r=-0.99 @ 1.4B);
- LoRA 前均衡范数可将相对微调可塑性提升最多 79%;
- 该效应与 rank 无关——增大 LoRA rank 无法缓解;
- 机理解释:范数编码了语义特异性,与 LoRA 统一低秩更新的「阻抗不匹配」(impedance mismatch)是脆弱性根源。
6.3 为什么这个 Demo 重要
它直接印证了 0-autoresearch-skill/SKILL.md 中定义的两循环架构设计意图:
- 内循环(Inner Loop):运行受约束的实验(checkpoint 分析、LoRA 微调、指标计算),目标是快速、可量化;
- 外循环(Outer Loop):把「负结果」综合成一次翻盘决策,产出比原假设更有价值的发现;
- Agent 自主完成了从「ETF 预测脆弱性」到「不,是范数异质性」的真实科研转向,最终论文的发现比最初的计划更强。
正如 SKILL.md 中所强调的:「一致的负结果是有效贡献」("X does NOT work because Y"只要推理严谨就可发表),以及外循环中findings.md是项目的记忆中枢——本 Demo 正是这一理念的实装验证。
七、Demo 6:Autoresearch 实战——RL 算法的「脑部扫描」
仓库内位置:demos/autoresearch-rl-brain-scan/(论文 PDF:rl_algorithm_brain_scan.pdf)
技能:Autoresearch、GRPO RL Training、TRL、SAELens、TransformerLens、ML Paper Writing
7.1 任务与执行链
Agent 自主研究了「RL 对齐算法到底对模型内部做了什么」——此前没有工作在同一基座模型上系统性对比 RLOO、GRPO、DPO 在权重与特征层面的差异:
- 文献调研:梳理 RLOO/GRPO/DPO,识别研究空白——无人对比过三种算法在同一基座模型上的权重/特征级影响;
- 内循环实验:用 RLOO、GRPO、DPO 在 GPT-2 Small 上分别做情感(sentiment)与毒性(toxicity)任务训练,随后用SVD 分析权重增量、用SAELens 分析特征变化;
- 外循环综合出三大发现(见下);
- 因果验证:用 SVD 消融实验提供因果(而非仅相关)证据;
- 写论文:按 ICML 格式用 ml-paper-writing 技能成稿。
7.2 三大关键发现(原文完整保留)
- DPO 是 rank-1 对齐(rank-1 alignment):每个权重矩阵的单个 SVD 方向即可恢复 DPO 行为效应的95.6%;而 GRPO 需要 50+ 个方向才能达到等效恢复。
- 在线 RL 保留结构:RLOO/GRPO 维持更高的有效秩(200 vs 119),并更好地保留基座模型的 SAE 特征结构(Jaccard0.83 vs 0.69)。
- DPO 的「集中扰动级联」:尽管秩更低,DPO 在深层扰动了2 倍多的 SAE 特征(1619 vs 527–870),扰动在网络中逐层放大。
- 结论在情感与毒性两个任务上都成立,且具备统计显著性(n=3 个种子,置信区间不重叠)。
7.3 为什么这个 Demo 重要
它展示了 autoresearch同时编排多个领域技能的能力:
- 后训练技能(TRL、GRPO)负责训练 RL 模型;
- 可解释性技能(SAELens、TransformerLens)负责分析「改变发生在哪里」;
- 论文写作技能负责产出 ICML 投稿。
更关键的是外循环的综合价值:「DPO 是 rank-1 扰动」是一个概念性洞见,而不只是某个指标的最优值——这正是两循环架构中「外循环产生新颖性」的设计初衷(见 0-autoresearch-skill/SKILL.md 中「OUTER LOOP: …this is where novelty comes from」)。
八、Demo 7:Scientific Plotting——论文级图表生产流水线
仓库内位置:demos/scientific-plotting-demo/(子文档:README.md)
技能:Academic Plotting
8.1 目标与结果
该 Demo 用 academic-plotting 技能的两条工作流,为 Andes 论文(Andes: Defining and Enhancing Quality-of-Experience in LLM-Based Text Streaming Services, Liu et al., 2024)生成了全部关键图表。论文核心结论(原文保留):
| Metric | Result |
|---|---|
| QoE improvement over vLLM | 4.7x |
| GPU resource savings | 61% |
| Peak queue length reduction | 85% |
| Gemini text accuracy | 100%(所有标签拼写正确) |
| Figures generated | 6(1 张 AI 架构图 + 5 张数据图表) |
8.2 Workflow 1:Gemini 生成架构图
系统架构图(Figure 1)用gemini-3-pro-image-preview生成,遵循 academic-plotting 技能的6 段式提示词结构(Framing / Visual Style / Colors / Layout / Connections / Constraints)、Style B "Modern Minimal"与Nord 色板:
- Framing(定位)——设定整体基调:「ultra-clean, modern, authoritative, like Apple docs meets Nature paper」;
- Visual Style(视觉风格)——完整的 Modern Minimal 样式块:浮动盒子 + 阴影、无边框、细灰色箭头;
- Color Palette(配色)——Nord 色板,为每个元素指定精确 hex 值(如 Andes 组件用 Aurora Yellow
#EBCB8B,执行引擎用 Frost Blue#5E81AC); - Layout(布局)——每个盒子都有名称与空间位置,含嵌套子组件(如 Token-Level Scheduler 内含 Priority Scheduler 与 Overhead Refiner 两个子盒);
- Connections(连接)——每条箭头单独指定:源、目标、样式、颜色、标签与布线(8 条编号箭头 + 红色虚线 preempt 路径 + 绿色 token 交付流);
- Constraints(约束)——明确「不要什么」:零装饰、无图标、无渐变、CRITICAL TEXT ACCURACY(每个标签必须精确拼写)。
关键做法:生成 3 次非确定性尝试,人工/自动评估后选优(best-of-3)。仓库中保留了全部 3 次尝试(attempt1、attempt2、attempt3),且 3 次尝试的文字准确率均为 100%(Token Pacer、Overhead Refiner、KV Cache 等全部拼写正确)——相比上一代生成器「所有尝试都有拼写错误」是重大改进。
完整的生成脚本可直接复现:gen_fig_andes_architecture_gemini.py,它演示了从.env加载GEMINI_API_KEY、循环 3 次调用client.models.generate_content(model="gemini-3-pro-image-preview", response_modalities=["IMAGE","TEXT"])并落盘fig_andes_architecture_attempt{n}.png的完整流程。
8.3 Workflow 2:matplotlib 数据图表
实验图表用 matplotlib 生成,采用出版级默认参数(serif 字体、色盲安全色板、300 DPI 导出、符合投稿 venue 的尺寸),同时导出 PDF(矢量,供 LaTeX)与 PNG(栅格)。仓库内生成脚本 gen_fig_experiment_results.py 展示了 4 类图表的具体实现:
| 图表 | 内容 | 实现要点 |
|---|---|---|
| fig_qoe_definition.png | QoE 定义四案例图示(理想体验 / 首 token 延迟 / 慢速流式 / 中途停顿) | 4 子图线图,红色阴影标出 S_delay 退化面积 |
| fig_cdf_comparison.png | QoE / TTFT / TDS 三面板 CDF 对比 | 三面板共享样式,QoE=0.95 参考线,Andes(橙)97% 请求 QoE≥0.95 vs vLLM(蓝)75%,TTFT 从 10.5s 降到 1.8s |
| fig_burst_intensity.png | 突发强度下 4 模型 × 3 数据集平均 QoE | 4×3 多面板网格,共享坐标轴与统一图例,Andes 在最高突发强度下达到 4.7x 提升 |
| fig_summary_improvements.png | 关键改进汇总 | 三面板柱状图:平均 QoE 0.99 vs 0.88、各架构 3.2x–4.7x 提升、61% GPU 节省 / 85% 队列降低 / 2.6x 并发 |
8.4 与技能库的对应关系
该 Demo 完整落实了 academic-plotting/SKILL.md 的两条核心规则:「有数值坐标轴的图用 matplotlib,有盒子和箭头的图用 Gemini」;以及 Workflow 1 的「永远 3 次尝试」「样式块必填」「绝不硬编码 API Key」「保存生成脚本以保证可复现」。同时对应技能中「Nord 色板(用于 Modern Minimal 风格)」与「Okabe-Ito 色盲安全色板(数据图必选)」的选色规范。
九、Coming Soon 与参与方式
9.1 规划中的 Demo
ML Paper Writing: From Repo to Publication(技能:ML Paper Writing):计划将「一个带实验结果的科研仓库」转化为可投稿 NeurIPS/ICML/ICLR 的论文。状态:开发中。这与 ml-paper-writing/SKILL.md 中「从科研仓库出发,主动交付完整初稿」的核心理念一脉相承。
9.2 如何贡献一个 Demo
Gallery 欢迎社区贡献,要求如下(原文完整保留):
- 使用本技能库中的一个或多个技能;
- 产出有意义且可复现的结果;
- 包含清晰的文档;
- 有可视化输出(图表、表格、报告)。
贡献流程:创建自己的 demo 仓库 → 遵循上述统一目录结构 → 开 issue 或 PR 将其加入本索引。
十、总结:从「索引页」到「可执行技能组合」
demos/ 目录虽然以「索引」形式呈现,但它承载了三种不同粒度的价值:
- 单技能实战模板(Demo 1–4):NeMo Evaluator 的评测配置、llama.cpp/GGUF 的逐层量化方法、FAISS 的检索分析方法论,都可直接迁移到自己的评测或分析任务;
- 多技能编排示范(Demo 5–6):autoresearch 两循环架构让 Agent 能自主完成「文献调研 → 内循环实验 → 外循环综合 → 翻盘 → 论文写作」的完整闭环,两个内嵌 Demo 分别展示了「负结果翻盘」与「跨领域技能编排」两种高级形态;
- 图表生产流水线(Demo 7):从 6 段式 Gemini 提示词到出版级 matplotlib 样式,仓库内的生成脚本与结果图可直接作为 academic-plotting 技能的「参考答案」。
如果你要复现或扩展其中任意 Demo,可以直接从对应子目录的README.md与figures/gen_*.py脚本入手;如果要贡献新 Demo,则遵循 Gallery 的统一结构与四条设计原则即可。这套「技能库 + Demo 样板间」的组合,让 AI 科研 Agent 的每一次能力升级都有据可依、有例可循。
- AI 技能
- 人工智能
- 大模型
- 深度学习
【免费下载链接】AI-Research-SKILLs
Comprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.
相关推荐
AI-Research-SKILLs 的 Autoresearch 技能:用双循环架构驱动全自主 AI 科研编排
AI Research SKILLs 的 Autoresearch 技能:用双循环架构驱动全自主 AI 科研编排 本篇技术指南围绕 AI Research SK
AI 技能人工智能大模型深度学习AI-Research-SKILLs 研究日志模板实战:用 research-log.md 记录自主研究的决策时间线
AI Research SKILLs 研究日志模板实战:用 research log.md 记录自主研究的决策时间线 导读 本指南以 AI Research S
AI 技能人工智能大模型深度学习autoskill 实战:在 scientific-agent-skills 中根据真实科研工作流自动生成与补全 Agent Skills
autoskill 实战:在 scientific agent skills 中根据真实科研工作流自动生成与补全 Agent Skills autoskill
AI 技能科研生物信息学数据科学
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考