- 人工智能
- AI 技能/插件
- 深度研究
- 知识图谱
- MCP 服务
【免费下载链接】AutoSci
Karpathy's LLM-Wiki vision, fully realized — wiki-centric full-lifecycle AI research platform powered by Claude Code
AutoSci 是一个 wiki 优先(wiki-centric)的 AI 研究平台,用 Claude Code 驱动科研全流程。它的核心能力,是把散落在硬盘里的论文 PDF、笔记和网页,变成一份带双向交叉引用、可持续生长的知识图谱——也就是结构化研究记忆。其中,/init负责从零搭建整份 wiki 并批量消化论文,/ingest负责把单篇论文折叠进知识库并自动建立所有交叉引用。本文面向新手,完整拆解这两个命令如何一步步工作、产出什么样的图谱,以及建库之后还能怎么用。
快速开始:3 步装好 AutoSci 知识图谱
先准备好三个前置依赖,然后克隆仓库并完成初始化:
git clone https://gitcode.com/gh_mirrors/om/AutoSci cd AutoSci ./setup.sh --lang zh # 生成虚拟环境与本地配置(Windows 用 setup.ps1) claude login # 登录 Claude Code- Python 3.9+:驱动
tools/下的 wiki 引擎与检索工具 - Node.js 18+:驱动交互式 Web 界面
- Claude Code:登录方式见 README.md
接下来,把论文 PDF 放进raw/papers/,把想法笔记放进raw/notes/(目录说明见 docs/runtime-directory-structure.zh.md),然后打开 Claude Code,输入:
/init 大语言模型的推理加速剩下的工作——扫描素材、补充发现相关论文、并行消化、合并重建——全部由 AutoSci 自动完成。
AutoSci 知识图谱到底长什么样
在动手之前,先看一张全景图:
AutoSci 的记忆中枢叫SciMem(Evolving Research Brain),由两部分组成:
- 长期记忆:一张知识图谱,节点是论文(Papers)、概念(Concepts)、方法(Methods)、主题(Topics)、研究者(People)、基础(Foundations)等实体
- 活跃记忆:想法(Ideas)、实验(Experiments)、稿件(Manuscripts)、评审(Reviews)在研究时间线上的生命周期流转
/init与/ingest正是把外部资源"Aggregate"进长期记忆的两个入口:
落到磁盘上,一份建好的 wiki 是这样的目录结构(完整树形图见 docs/runtime-directory-structure.zh.md):
wiki/ ├── index.md ← 内容目录 ├── log.md ← 时序日志(append-only) ├── papers/ ← 论文结构化摘要 ├── concepts/ ← 技术概念综述 ├── topics/ ← 研究方向地图 ├── people/ ← 研究者追踪 ├── ideas/ ← 研究想法(带生命周期状态) ├── experiments/ ← 实验记录 ├── methods/ ← 跨论文可复用的方法实体 ├── Summary/ ← 领域全景综述 └── graph/ ← 自动生成的知识图谱(勿手动编辑) ├── edges.jsonl ← 语义边 └── citations.jsonl ← 论文引用也就是说:你丢进去的是文件,长出来的是一个实体库 + 一张图。后面所有技能(提问、找灵感、做实验、写论文)都站在这份记忆之上。
/init 一键建库:从 20 篇论文到研究记忆
/init是整个流程里最重的命令。假设你的raw/papers/里有 20 篇相关论文、几页笔记,它的完整工作流(定义见 i18n/zh/skills/init/SKILL.md)可以拆成 6 步:
| 步骤 | 做什么 | 你感知到的结果 |
|---|---|---|
| 1. 初始化骨架 | 创建wiki/标准目录、graph/、index.md、log.md | 空的 wiki 骨架就绪 |
| 2. 素材预处理 | 把本地 PDF 规范化到raw/tmp/(恢复标题、抓 arXiv 源码转.tex,失败才回退 PDF) | 论文变成"可精读"的文本来源 |
| 3. 发现与裁剪 | 结合 Semantic Scholar 与 DeepXiv 生成候选清单,按相关性、新鲜度、连通性裁剪出最终论文集 | 自动补上你漏掉的"应该读的那几篇" |
| 4. 搭脚手架 | 建Summary/、topics/,从你的笔记中种下 provisional 的 ideas/concepts | wiki 在论文消化前就有"研究方向地图" |
| 5. 并行消化 | 每篇论文派一个子代理,在 git worktree 隔离中各跑一遍/ingest | 20 篇论文并行处理,互不冲突 |
| 6. 合并重建 | 顺序合并各 worktree,去重边与引用,回填 citation,重建索引,重新生成可视化 | 一份完整、自洽的知识图谱 |
几个新手容易忽略的要点:
- 并行但不打架:每篇论文的
/ingest跑在独立 git worktree 里,互不污染;合并时由/init统一处理概念/方法的冲突,避免近重复页面泛滥 - 外部论文只进
raw/discovered/:/init自动发现的论文绝不写进你自有的raw/papers/,你的素材永远是只读的 - 全程可恢复:
.checkpoints/init-*.json记录每一步状态,中途中断也能接着跑 - 降级不失败:Semantic Scholar / DeepXiv 不可用、单篇下载失败、单篇 ingest 失败,都会记录 warning 后继续,而不是让整个建库流程崩掉
/init 与 /ingest 的分工:一张表看懂
/init | /ingest | |
|---|---|---|
| 适用场景 | 从零建库 / 批量消化 | 持续给库里"喂"新论文 |
| 输入 | raw/papers/、raw/notes/、raw/web/+ 可选 topic | 单篇:本地.tex/.pdf/ arXiv URL |
| 论文数量 | 8–20+ 篇,批量 | 1 篇 |
| 是否自动发现相关论文 | 是(可裁剪、可控) | 否(可选--discover附推荐清单) |
| 并行策略 | git worktree + 子代理 fan-out / fan-in | 单进程顺序执行 |
| 典型耗时 | 较长(分钟到小时级,视论文数与 API 限速) | 分钟级 |
一句话记忆:/init是"批量建库",/ingest是"持续喂养"。两者共享同一套实体与边规则,所以第 21 篇、第 100 篇论文进来,图谱依然自洽。
/ingest 单篇论文消化:7 步把 PDF 变成互联页面
/ingest的职责是把一篇论文转化成一组正确链接的 wiki 页面(规则定义见 i18n/zh/skills/ingest/SKILL.md)。以一篇新论文为例:
1. 解析来源。支持四种输入:arXiv URL、本地.tex、本地.pdf、或/init交接的规范化路径。PDF 会先走预处理管线(i18n/zh/skills/ingest/references/pdf-preprocessing.md):恢复 arXiv ID → 抓取 LaTeX 源码 → 失败才回退 PDF 解析。优先级始终是.tex>.pdf。
2. 身份与元数据回填。通过 Semantic Scholar 查询 venue、年份、引用数,并评估importance(1–5)。这个分数很关键:importance 低于 4 的论文,最多新建 1 个新概念 + 1 个新方法;高于 4 的才允许更丰富的实体产出——从源头防止知识库"通货膨胀"。
3. 概念与方法去重。每个 concept 候选先调用find-similar-concept查库里有没有同物异名(如"少样本微调" vs "Few-shot fine-tuning"),默认合并而非新建。这是整份知识图谱越用越干净、而不是越用越乱的核心机制。
4. 双向链接与语义边。每条正向链接必须同步写入反向链接(规则见 runtime/schema/xref.yaml);语义关系写入graph/edges.jsonl并标注置信度:
{ "from": "papers/llama-adapter", "to": "concepts/low-rank-adaptation", "type": "introduces_concept", "confidence": "high" }引用关系则进入graph/citations.jsonl。
5. 归类与索引。论文按 tags 归入已有 topic,更新wiki/index.md与wiki/log.md,最后在终端输出一行摘要:
Wiki: +1 paper, +2 concepts, +1 method, +5 edges6. 可选延伸。--discover会附一份"接下来可能想 ingest 的相关论文"清单(只推荐、不自动入库);--visualize会即时重生成 Canvas 可视化。
7. 边界清晰。/ingest只对自己写出的内容做形状检查;反向链接对称性、悬空节点等语义审计留给/check——职责分离让每一步都可预期。
建好之后:让 AutoSci 知识图谱"看得见"
图谱建好后,有三种方式探索:
- 交互式网页 Graph 视图:
/visualize会自动后台启动python3 tools/serve.py,浏览器打开http://127.0.0.1:8765/#/graph——点击节点用 BFS 高亮邻域,按实体类型 / 边类别过滤,双击直接打开完整页面 - Obsidian:
/visualize --obsidian生成按 9 类实体着色的图谱配置;/visualize --canvas生成带边类型标签的 Canvas 知识地图 - 直接读 wiki:
wiki/下全是 Markdown,用任何编辑器或 Obsidian 都能打开,[[wikilink]]双向跳转
节点大小也编码了信息:论文节点按 importance 缩放(1→0.7× 到 5→1.5×),一眼看出库里的"重量级论文"。
建库之后的常用命令
建库只是起点。AutoSci 的 30+ 技能都构建在这份记忆之上,新手最常用的是这几个:
| 命令 | 干什么 |
|---|---|
/ask <问题> | 基于 wiki 综合回答并附引用,--crystallize可把回答沉淀回库 |
/discover | 按主题 / 会议 / anchor 论文生成候选论文清单(不自动 ingest) |
/check | 全库健康扫描,生成分级修复建议报告 |
/reset | 按范围(wiki / raw / log / all)重置状态 |
完整技能清单见 README.md 的 Skills 一节。
总结与延伸阅读
回顾整条路径:素材放raw/→/init一键建库 →/ingest持续喂养 → 图谱随时可查。这就是"结构化研究记忆"的全部含义——知识被编译一次、长期维护,而不是每次提问重新翻一遍 PDF。
想深入细节,可以按这份快速参考:
/init技能定义:i18n/zh/skills/init/SKILL.md/ingest技能定义:i18n/zh/skills/ingest/SKILL.md- 实体字段契约:runtime/schema/entities.yaml
- 边类型定义:runtime/schema/edges.yaml
- 双向链接规则:runtime/schema/xref.yaml
- 可视化配置示例:config/visualize.json
- 目录结构文档:docs/runtime-directory-structure.zh.md
- Wiki 引擎源码:tools/research_wiki.py
下一篇,可以继续了解/ask如何让这份知识图谱变成会回答问题的研究伙伴。
- 人工智能
- AI 技能/插件
- 深度研究
- 知识图谱
- MCP 服务
【免费下载链接】AutoSci
Karpathy's LLM-Wiki vision, fully realized — wiki-centric full-lifecycle AI research platform powered by Claude Code
相关推荐
openinterpreter 记忆写入管线解剖:Stage-One 输入消息模板如何把 Rollout 变成结构化原始记忆
openinterpreter 记忆写入管线解剖:Stage One 输入消息模板如何把 Rollout 变成结构化原始记忆 本篇以 stage_one_inp
人工智能大模型AI Agent代码智能体AI 应用CLIBiomni知识图谱构建:如何从文献中提取结构化知识
Biomni知识图谱构建:如何从文献中提取结构化知识 在生物医学研究领域,每天都有大量新的研究论文发表,如何从这些海量文献中自动提取结构化知识并构建专业的知识图
graphify 入门与实践:把代码、文档与 PDF 变成可查询的本地知识图谱
graphify 入门与实践:把代码、文档与 PDF 变成可查询的本地知识图谱 graphify 是一个面向 AI 编程助手(Claude Code、Codex
人工智能知识图谱RAGAI 技能开发工具MCP 服务
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考