news 2026/10/11 11:52:52

AutoSci知识图谱入门:/init与/ingest如何把20篇论文变成结构化研究记忆

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AutoSci知识图谱入门:/init与/ingest如何把20篇论文变成结构化研究记忆
  • 人工智能
  • AI 技能/插件
  • 深度研究
  • 知识图谱
  • MCP 服务

【免费下载链接】AutoSci

Karpathy's LLM-Wiki vision, fully realized — wiki-centric full-lifecycle AI research platform powered by Claude Code

项目地址:https://gitcode.com/gh_mirrors/om/AutoSci
点击查看免费下载

AutoSci 是一个 wiki 优先(wiki-centric)的 AI 研究平台,用 Claude Code 驱动科研全流程。它的核心能力,是把散落在硬盘里的论文 PDF、笔记和网页,变成一份带双向交叉引用、可持续生长的知识图谱——也就是结构化研究记忆。其中,/init负责从零搭建整份 wiki 并批量消化论文,/ingest负责把单篇论文折叠进知识库并自动建立所有交叉引用。本文面向新手,完整拆解这两个命令如何一步步工作、产出什么样的图谱,以及建库之后还能怎么用。

快速开始:3 步装好 AutoSci 知识图谱

先准备好三个前置依赖,然后克隆仓库并完成初始化:

git clone https://gitcode.com/gh_mirrors/om/AutoSci cd AutoSci ./setup.sh --lang zh # 生成虚拟环境与本地配置(Windows 用 setup.ps1) claude login # 登录 Claude Code
  • Python 3.9+:驱动tools/下的 wiki 引擎与检索工具
  • Node.js 18+:驱动交互式 Web 界面
  • Claude Code:登录方式见 README.md

接下来,把论文 PDF 放进raw/papers/,把想法笔记放进raw/notes/(目录说明见 docs/runtime-directory-structure.zh.md),然后打开 Claude Code,输入:

/init 大语言模型的推理加速

剩下的工作——扫描素材、补充发现相关论文、并行消化、合并重建——全部由 AutoSci 自动完成。

AutoSci 知识图谱到底长什么样

在动手之前,先看一张全景图:

AutoSci 的记忆中枢叫SciMem(Evolving Research Brain),由两部分组成:

  • 长期记忆:一张知识图谱,节点是论文(Papers)、概念(Concepts)、方法(Methods)、主题(Topics)、研究者(People)、基础(Foundations)等实体
  • 活跃记忆:想法(Ideas)、实验(Experiments)、稿件(Manuscripts)、评审(Reviews)在研究时间线上的生命周期流转

/init与/ingest正是把外部资源"Aggregate"进长期记忆的两个入口:

落到磁盘上,一份建好的 wiki 是这样的目录结构(完整树形图见 docs/runtime-directory-structure.zh.md):

wiki/ ├── index.md ← 内容目录 ├── log.md ← 时序日志(append-only) ├── papers/ ← 论文结构化摘要 ├── concepts/ ← 技术概念综述 ├── topics/ ← 研究方向地图 ├── people/ ← 研究者追踪 ├── ideas/ ← 研究想法(带生命周期状态) ├── experiments/ ← 实验记录 ├── methods/ ← 跨论文可复用的方法实体 ├── Summary/ ← 领域全景综述 └── graph/ ← 自动生成的知识图谱(勿手动编辑) ├── edges.jsonl ← 语义边 └── citations.jsonl ← 论文引用

也就是说:你丢进去的是文件,长出来的是一个实体库 + 一张图。后面所有技能(提问、找灵感、做实验、写论文)都站在这份记忆之上。

/init 一键建库:从 20 篇论文到研究记忆

/init是整个流程里最重的命令。假设你的raw/papers/里有 20 篇相关论文、几页笔记,它的完整工作流(定义见 i18n/zh/skills/init/SKILL.md)可以拆成 6 步:

步骤做什么你感知到的结果
1. 初始化骨架创建wiki/标准目录、graph/、index.md、log.md空的 wiki 骨架就绪
2. 素材预处理把本地 PDF 规范化到raw/tmp/(恢复标题、抓 arXiv 源码转.tex,失败才回退 PDF)论文变成"可精读"的文本来源
3. 发现与裁剪结合 Semantic Scholar 与 DeepXiv 生成候选清单,按相关性、新鲜度、连通性裁剪出最终论文集自动补上你漏掉的"应该读的那几篇"
4. 搭脚手架建Summary/、topics/,从你的笔记中种下 provisional 的 ideas/conceptswiki 在论文消化前就有"研究方向地图"
5. 并行消化每篇论文派一个子代理,在 git worktree 隔离中各跑一遍/ingest20 篇论文并行处理,互不冲突
6. 合并重建顺序合并各 worktree,去重边与引用,回填 citation,重建索引,重新生成可视化一份完整、自洽的知识图谱

几个新手容易忽略的要点:

  • 并行但不打架:每篇论文的/ingest跑在独立 git worktree 里,互不污染;合并时由/init统一处理概念/方法的冲突,避免近重复页面泛滥
  • 外部论文只进raw/discovered/:/init自动发现的论文绝不写进你自有的raw/papers/,你的素材永远是只读的
  • 全程可恢复:.checkpoints/init-*.json记录每一步状态,中途中断也能接着跑
  • 降级不失败:Semantic Scholar / DeepXiv 不可用、单篇下载失败、单篇 ingest 失败,都会记录 warning 后继续,而不是让整个建库流程崩掉

/init 与 /ingest 的分工:一张表看懂

/init/ingest
适用场景从零建库 / 批量消化持续给库里"喂"新论文
输入raw/papers/、raw/notes/、raw/web/+ 可选 topic单篇:本地.tex/.pdf/ arXiv URL
论文数量8–20+ 篇,批量1 篇
是否自动发现相关论文是(可裁剪、可控)否(可选--discover附推荐清单)
并行策略git worktree + 子代理 fan-out / fan-in单进程顺序执行
典型耗时较长(分钟到小时级,视论文数与 API 限速)分钟级

一句话记忆:/init是"批量建库",/ingest是"持续喂养"。两者共享同一套实体与边规则,所以第 21 篇、第 100 篇论文进来,图谱依然自洽。

/ingest 单篇论文消化:7 步把 PDF 变成互联页面

/ingest的职责是把一篇论文转化成一组正确链接的 wiki 页面(规则定义见 i18n/zh/skills/ingest/SKILL.md)。以一篇新论文为例:

1. 解析来源。支持四种输入:arXiv URL、本地.tex、本地.pdf、或/init交接的规范化路径。PDF 会先走预处理管线(i18n/zh/skills/ingest/references/pdf-preprocessing.md):恢复 arXiv ID → 抓取 LaTeX 源码 → 失败才回退 PDF 解析。优先级始终是.tex>.pdf。

2. 身份与元数据回填。通过 Semantic Scholar 查询 venue、年份、引用数,并评估importance(1–5)。这个分数很关键:importance 低于 4 的论文,最多新建 1 个新概念 + 1 个新方法;高于 4 的才允许更丰富的实体产出——从源头防止知识库"通货膨胀"。

3. 概念与方法去重。每个 concept 候选先调用find-similar-concept查库里有没有同物异名(如"少样本微调" vs "Few-shot fine-tuning"),默认合并而非新建。这是整份知识图谱越用越干净、而不是越用越乱的核心机制。

4. 双向链接与语义边。每条正向链接必须同步写入反向链接(规则见 runtime/schema/xref.yaml);语义关系写入graph/edges.jsonl并标注置信度:

{ "from": "papers/llama-adapter", "to": "concepts/low-rank-adaptation", "type": "introduces_concept", "confidence": "high" }

引用关系则进入graph/citations.jsonl。

5. 归类与索引。论文按 tags 归入已有 topic,更新wiki/index.md与wiki/log.md,最后在终端输出一行摘要:

Wiki: +1 paper, +2 concepts, +1 method, +5 edges

6. 可选延伸。--discover会附一份"接下来可能想 ingest 的相关论文"清单(只推荐、不自动入库);--visualize会即时重生成 Canvas 可视化。

7. 边界清晰。/ingest只对自己写出的内容做形状检查;反向链接对称性、悬空节点等语义审计留给/check——职责分离让每一步都可预期。

建好之后:让 AutoSci 知识图谱"看得见"

图谱建好后,有三种方式探索:

  • 交互式网页 Graph 视图:/visualize会自动后台启动python3 tools/serve.py,浏览器打开http://127.0.0.1:8765/#/graph——点击节点用 BFS 高亮邻域,按实体类型 / 边类别过滤,双击直接打开完整页面
  • Obsidian:/visualize --obsidian生成按 9 类实体着色的图谱配置;/visualize --canvas生成带边类型标签的 Canvas 知识地图
  • 直接读 wiki:wiki/下全是 Markdown,用任何编辑器或 Obsidian 都能打开,[[wikilink]]双向跳转

节点大小也编码了信息:论文节点按 importance 缩放(1→0.7× 到 5→1.5×),一眼看出库里的"重量级论文"。

建库之后的常用命令

建库只是起点。AutoSci 的 30+ 技能都构建在这份记忆之上,新手最常用的是这几个:

命令干什么
/ask <问题>基于 wiki 综合回答并附引用,--crystallize可把回答沉淀回库
/discover按主题 / 会议 / anchor 论文生成候选论文清单(不自动 ingest)
/check全库健康扫描,生成分级修复建议报告
/reset按范围(wiki / raw / log / all)重置状态

完整技能清单见 README.md 的 Skills 一节。

总结与延伸阅读

回顾整条路径:素材放raw/→/init一键建库 →/ingest持续喂养 → 图谱随时可查。这就是"结构化研究记忆"的全部含义——知识被编译一次、长期维护,而不是每次提问重新翻一遍 PDF。

想深入细节,可以按这份快速参考:

  • /init技能定义:i18n/zh/skills/init/SKILL.md
  • /ingest技能定义:i18n/zh/skills/ingest/SKILL.md
  • 实体字段契约:runtime/schema/entities.yaml
  • 边类型定义:runtime/schema/edges.yaml
  • 双向链接规则:runtime/schema/xref.yaml
  • 可视化配置示例:config/visualize.json
  • 目录结构文档:docs/runtime-directory-structure.zh.md
  • Wiki 引擎源码:tools/research_wiki.py

下一篇,可以继续了解/ask如何让这份知识图谱变成会回答问题的研究伙伴。

  • 人工智能
  • AI 技能/插件
  • 深度研究
  • 知识图谱
  • MCP 服务

【免费下载链接】AutoSci

Karpathy's LLM-Wiki vision, fully realized — wiki-centric full-lifecycle AI research platform powered by Claude Code

项目地址:https://gitcode.com/gh_mirrors/om/AutoSci
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/11 11:51:18

北京理工大学 l 金属激光增材制造在线监测技术研究进展

金属激光增材制造技术具备实现复杂构件高效精密成形的核心能力&#xff0c;目前已经在航空航天、国防、医疗等重要工业领域得到了成功应用。然而&#xff0c;由于涉及极端非平衡的快速熔凝过程&#xff0c;难以避免地会产生较多的孔隙、裂纹、表面几何缺陷及分层等制造缺陷。这…

作者头像 李华
网站建设 2026/10/11 11:50:56

什么是长效代理?适合哪些使用情况

长效代理指的是在较长时间内保持同一代理IP持续可用的一种方式。那么问题来了&#xff1a;为什么有些代理需要频繁更换&#xff0c;而长效代理可以持续使用&#xff1f;它的优势具体体现在哪&#xff1f;又适合在什么情况下使用&#xff1f;本文将从概念、优势和应用场景三个角…

作者头像 李华
网站建设 2026/10/11 11:50:15

多Agent协作系统Skill管理实战:集中管理与差异化覆盖方案

1. 多 Agent 环境下的 Skill 管理困局1.1 一个让我头疼了两周的真实场景事情是这样的。我手头维护着一套多 agent 协作系统&#xff0c;三个 agent 各司其职&#xff1a;一个负责代码生成&#xff0c;一个负责代码审查&#xff0c;还有一个负责文档撰写。它们共享同一套 skill …

作者头像 李华
网站建设 2026/10/11 11:47:41

scikit-learn 学习资源全景指南:MOOC、官方视频与领域教程导览

人工智能机器学习数据科学 【免费下载链接】scikit-learn scikit-learn: machine learning in Python 项目地址&#xff1a; https://gitcode.com/gh_mirrors/sc/scikit-learn 点击查看 免费下载 scikit-learn 官方在用户指南的末尾专门开辟了一章"External Resources, V…

作者头像 李华
网站建设 2026/10/11 11:46:20

Java课程设计图片管理系统:从选型到避坑的完整实战指南

简介&#xff1a;在Java桌面应用开发中&#xff0c;如何高效管理图片资源是常见的技术挑战。本文从图片存储方案谈起&#xff0c;对比数据库BLOB与本地路径存储的性能差异&#xff0c;并深入讲解基于Swing构建图形界面的原理与MySQL元数据管理方法。通过缩略图生成、动态SQL检索…

作者头像 李华