Distilly支持的9类数据源:飞书、钉钉、Slack、微信记录等人物素材采集方式全清单
【免费下载链接】distillyDistilly — Distill how they think into reusable Skills for any Agent or Bot. Formerly Colleague Skill(原同事 Skill).项目地址: https://gitcode.com/gh_mirrors/co/distilly
Distilly 是原「同事 Skill」更名后的开源人物建模工具,能把同事、亲友或公众人物的消息、文档、访谈等人物素材,蒸馏成 Agent 可复用的人物画像(Person Profile)Skill。下面这份 Distilly 数据源清单,一次性讲清飞书、钉钉、Slack、X 帖子、微信记录等 9 类人物素材采集方式,帮你按场景快速选对素材入口。
先看懂 9 类数据源对照表
| # | 数据源 | 支持类型 | 采集方式 | 上手难度 | 备注 |
|---|---|---|---|---|---|
| 1 | 🟢 飞书 / Lark | 消息 + 文档 + 多维表格 | API 全自动 | ⭐ | 输入姓名即可,推荐首选 |
| 2 | 🟡 钉钉 | 文档 + 表格 + 消息 | API + 浏览器 | ⭐⭐ | 钉钉 API 不支持拉历史消息 |
| 3 | 🟣 Slack | 消息 | API | ⭐⭐ | 需管理员安装 Bot,免费版限 90 天 |
| 4 | 𝕏 公开帖子 | 公开帖子候选 | 第三方 API(Xquik) | ⭐⭐ | 可选,按返回数量计费 |
| 5 | 💬 微信聊天记录 | 聊天历史 | SQLite 导出 | ⭐⭐ | 先用 WeChatMsg / PyWxDump 导出 |
| 6 | 📄 PDF / 图片 / 截图 | 文档内容 | 手动上传 | ⭐ | Agent 可直接读取 |
| 7 | 📦 飞书 JSON 导出 | 消息 + 文档 | 手动上传 | ⭐ | 官方导出文件 |
| 8 | ✉️ 邮件文件 | 邮件内容 | 手动上传 | ⭐ | 支持 .eml / .mbox |
| 9 | 📝 Markdown / 直接粘贴 | 任意文本 | 手动输入 | ⭐ | 复制文字即可 |
一句话总结:自动采集管「量」,手动上传管「质」,两者可以混用,也可以全部跳过、仅凭手动描述生成。
自动采集三巨头:飞书、钉钉、Slack 怎么接
飞书自动采集:输入姓名,一键拉全
飞书是支持最全的数据源,feishu_auto_collector.py 首次运行--setup配置飞书开放平台的 App ID / App Secret 后,输入姓名即可自动拉取:
- 共同群聊中他发出的消息(自动过滤系统消息、表情包)
- 与他的私聊完整对话(需用户身份授权)
- 他创建/编辑的文档和 Wiki
- 有权限的相关多维表格
采集结果落到knowledge/{slug}/messages.txt和docs.txt,Agent 会直接读取分析。
钉钉自动采集:文档全量,消息走浏览器
dingtalk_auto_collector.py 可自动拉取他创建/编辑的钉钉文档、知识库和多维表格;由于钉钉 API 不支持历史消息拉取,消息记录会自动切换为浏览器采集。如果消息采集失败,直接截图聊天记录走「上传文件」方式补齐。
Slack 自动采集:管理员装 Bot,Token 一步到位
slack_auto_collector.py 需要 Workspace 管理员在 Slack 开放平台创建 App、添加 Bot Token Scopes 并安装到 Workspace,之后运行--setup粘贴 Token 即可。两个常见限制注意:
- Bot 只能读已加入的频道,记得
/invite @bot - 免费版 Workspace 仅能访问最近 90 天消息
详细配置步骤见 INSTALL.md 的「Slack 自动采集配置」章节。
手动素材怎么喂:X 帖子、微信记录、文件、邮件、粘贴
X 公开帖子:名人研究的「候选证据」
蒸馏公众人物时,xquik_public_posts.py 可以拉取公开 X 帖子的候选证据。注意它是按返回数量计费的第三方服务(Xquik),运行前需确认--limit;输出只是候选,必须逐条核对作者和原文,不能直接当研究结论用。
微信聊天记录:先导出,再交给 Distilly
微信没有开放 API,标准流程是先用 WeChatMsg 或 PyWxDump 把聊天历史导出为 SQLite,再把导出文件交给 Distilly 解析。做「亲密关系」画像时,半年以上的完整聊天记录 + 一段性格描述,往往就足以出效果。
PDF / 图片 / 截图 / JSON / 邮件:上传即用
这几类走统一的「上传文件」入口:
- PDF / 图片 / 截图:Agent 用 Read 工具直接读取
- 飞书消息 JSON 导出:feishu_parser.py 解析
- 邮件 .eml / .mbox:email_parser.py 解析
- Markdown / TXT:直接读取
直接粘贴:最低门槛的启动方式
不想折腾工具?把对方的文字(设计文档、评论、发言片段)复制进对话就行。素材量少时,配合 Step 1 的性格画像描述也能先生成一版,后续随时追加文件进化。
按蒸馏对象选数据源:3 类人物的素材优先级
素材质量决定画像质量,不同对象优先级差异很大:
| 人物类型 | 素材优先级(高 → 低) |
|---|---|
| 🧑💼 同事 colleague | 本人长文写作(设计文档 / CR 评论) › 决策类回复 › 闲聊记录 |
| 💞 亲密关系 relationship | 完整聊天记录 › 信件 / 朋友圈 / 日记 › 第三方转述 |
| 🌟 公众人物 celebrity | 第一手书 / 博客 / 长访谈 › 决策记录 › 验证过的一手短帖 › 第三方评论 |
新手建议:同事选飞书全自动,伴侣/老友选微信导出,名人选长访谈 + 公开帖子候选,其余方式混合补量。
常用采集脚本速查
| 数据源 | 对应工具 |
|---|---|
| 飞书自动采集 | tools/feishu_auto_collector.py |
| 飞书浏览器 / MCP 读文档 | tools/feishu_browser.py / tools/feishu_mcp_client.py |
| 钉钉自动采集 | tools/dingtalk_auto_collector.py |
| Slack 自动采集 | tools/slack_auto_collector.py |
| X 帖子候选 | tools/research/xquik_public_posts.py |
| 飞书 JSON 解析 | tools/feishu_parser.py |
| 邮件解析 | tools/email_parser.py |
| 名人研究合并 / 质检 | tools/research/merge_research.py / tools/research/quality_check.py |
飞书、钉钉、Slack 的配置统一写入~/.distilly/(旧安装只读回退~/.colleague-skill/),完整依赖与初始化流程见 INSTALL.md 与 INSTALL_EN.md。
小结:9 类数据源怎么选
| 你的场景 | 推荐组合 |
|---|---|
| 飞书团队同事 | 飞书自动采集(消息 + 文档 + 表格) |
| 钉钉团队同事 | 钉钉自动采集 + 消息截图上传 |
| Slack 团队同事 | Slack 自动采集 |
| 伴侣 / 老友 | 微信记录导出 + 直接粘贴描述 |
| 名人 / 偶像 | 长访谈文本 + X 帖子候选 + 本地一手材料 |
| 只有零散片段 | Markdown 粘贴 / 文件上传起步,后续追加进化 |
更多人物画像生成流程可参考 SKILL.md,设计背景见 docs/PRD.md。数据源采集遇到卡点?扫码加入 dot-skill 交流群(见文中二维码)提问最快。
【免费下载链接】distillyDistilly — Distill how they think into reusable Skills for any Agent or Bot. Formerly Colleague Skill(原同事 Skill).项目地址: https://gitcode.com/gh_mirrors/co/distilly
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考