SurfSense完全指南:5分钟自建你的开源私人AI研究助手
【免费下载链接】SurfSenseOpen-source NotebookLM alternative. Research the open web with live data(Reddit, YT, IG, TikTok, Indeed, Google Search, Maps etc) through one platform, API or MCP server. Join our Discord: https://discord.gg/ejRNvftDp9项目地址: https://gitcode.com/GitHub_Trending/su/SurfSense
还在为"这个产品现在口碑到底怎么样"翻遍 Reddit、YouTube 和 Google 地图,手动复制粘贴、逐条整理吗?SurfSense 是一个开源的 NotebookLM 替代品:一个把私有知识库和全网实时数据连在一起的 AI 研究平台。它的最大卖点是一句话:本地文档问答、带引用的搜索、报告与播客生成,加上 Reddit、YouTube、Instagram、TikTok、Google 搜索等 10+ 个实时数据连接器,全部可以 Docker 一键自托管,数据留在你自己的机器上。
🚀 快速上手:Docker 部署 SurfSense
前置条件只有一个:Docker Desktop 已安装并在运行。最短启动路径如下:
git clone https://gitcode.com/GitHub_Trending/su/SurfSense cd SurfSense cp .env.example .env # 首次使用按提示填入必要变量 docker compose -f docker/docker-compose.yml up -d启动完成后的访问入口(端口见 docker/scripts/install.ps1 的输出定义):
- 前端界面:
http://localhost:3929 - 后端 API 与接口文档:
http://localhost:8929,文档页http://localhost:8929/docs - 数据库(PostgreSQL + pgvector)、Redis 缓存由 Compose 自动拉起,无需单独部署
📦 能力盘点:SurfSense 支持的数据源与格式
实时数据接入(连接器):每个连接器都是一个返回结构化 JSON 的 REST 端点,同时通过内置 MCP 服务器暴露给 Claude、Cursor 等 Agent 当工具调用:
- 社交平台:Reddit 帖子与评论、YouTube 视频/字幕/评论、Instagram 公开资料、TikTok 视频与话题
- 本地生活与搜索:Google Maps 商户评价、Google Search 实时搜索结果
- 电商与招聘:Amazon 与 Walmart 商品价格/评分/评论,Indeed 公开职位
- 办公协同:Google Drive、OneDrive、Dropbox 同步,Slack、Notion、Jira、Linear 等(连接器源码)
格式与平台支持:
- 支持 50+ 文件格式:PDF、Word、Excel、PowerPoint 等文档,JPG/PNG 等图像,MP3/MP4 等音视频,以及各类代码文件
- 支持通过 REST API、MCP 服务器、Web 界面、浏览器插件(surfsense_browser_extension/)和桌面端(surfsense_desktop/)接入
核心功能:
- 混合检索问答:语义 + 全文双路召回,答案带来源引用
- AI 报告生成:导出 PDF、DOCX、HTML、LaTeX、EPUB 等格式
- 双主持播客:任意文档或文件夹生成,支持多家 TTS
- 自动化:按计划或事件触发 Agent 任务,结果写回 Notion、Slack、Linear
- 团队协作:实时共享聊天、评论 @、Owner/Admin/Editor/Viewer 四级权限
🔍 进阶亮点:混合检索与多模型接入
混合检索。文档上传后经过分块(ETL 管道见 etl_pipeline/)生成向量嵌入,查询时语义向量搜索与全文搜索并行执行,再用 Reciprocal Rank Fusion (RRF) 融合排序,命中既有"概念相近"的段落,也不漏"关键词精确"的句子——这是答案带引用的基础。
多模型、无锁定。通过 OpenAI 规范 + LiteLLM 接入 100+ 个 LLM 和 6000+ 嵌入模型,也支持 vLLM、Ollama 本地模型。国内用户可直接配置 DeepSeek、通义千问、Kimi、智谱 GLM、MiniMax,官方给了逐字段配置表,见 国产 LLM 配置指南。
技术栈一句话带过:后端 FastAPI + PostgreSQL/pgvector + Celery(surfsense_backend/),前端 Next.js + Tailwind(surfsense_web/)。
🎯 适用场景:谁会用得上 SurfSense
- 独立研究者 / 学生:把论文、讲义 PDF 导入知识库,问答时逐条带引用,省去手动做文献笔记
- 市场 / 竞品分析师:用 Reddit、YouTube、Google Maps 连接器定期抓取口碑与评价,配合计划任务自动生成监测简报
- 内容创作者 / 团队:把素材库丢进去生成播客和演示文稿,团队在共享工作区里实时评论协作
💡 上手建议:先做什么、后做什么
- 先配模型再喂数据:启动后第一件事在 Settings → LLM Configurations 里填好至少一个 LLM 的 API Key(含对应的嵌入模型),否则上传文档后无法生成索引和问答
- 分批导入文档:先用几十个核心文档跑通上传→索引→问答链路,确认引用正常,再批量导入;文件解析依赖 Unstructured/Docling,大文件解析会占用较多资源
- 按需选 GPU 变体:本地跑嵌入或大文档解析压力高时,部署脚本支持
--variant=cuda参数切换 GPU 镜像(见 docker/scripts/install.sh),CPU 环境则默认即可 - 自托管计费关闭:自托管安装默认不开计费,连接器与 Agent 调用的上限只取决于你的硬件和模型 Key
✅ 下一步行动
- 按上面的命令克隆仓库并启动 Docker Compose,打开
http://localhost:3929注册第一个工作区 - 按 国产 LLM 配置指南 或 后端目录说明 接入你的模型 Key
- 阅读 CONTRIBUTING.md 了解贡献流程,提交 Issue 或参与开发
【免费下载链接】SurfSenseOpen-source NotebookLM alternative. Research the open web with live data(Reddit, YT, IG, TikTok, Indeed, Google Search, Maps etc) through one platform, API or MCP server. Join our Discord: https://discord.gg/ejRNvftDp9项目地址: https://gitcode.com/GitHub_Trending/su/SurfSense
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考