3分钟给浏览器装一个离线AI助手:Page Assist实操手册
【免费下载链接】page-assistUse your locally running AI models to assist you in your web browsing项目地址: https://gitcode.com/GitHub_Trending/pa/page-assist
你正在读一篇很长的英文论文,想快速要一份中文要点,但不想把内容贴去某个云端网页排队。Page Assist 是一个本地AI浏览器助手:把跑在你机器上的模型直接接到浏览器侧边栏,任何网页里都能对话,数据全程留在本机。
它到底解决了什么问题
说白了,这个本地AI浏览器助手就解决三件事:
- 想问当前网页内容,又不想切窗口、不想把数据交给云端 → 侧边栏开“Chat With Website”,模型直接读当前页面
- 想本地跑AI、不建服务端、不注册账号 → Ollama、Chrome AI(Gemini Nano)、任意 OpenAI 兼容端点(如 LM Studio)都能接
- 想跟自己的文档对话 → 知识库支持 PDF、Word、CSV、Markdown 问答
源码结构也直白:UI 组件在 src/components/,模型接入在 src/models/,基于 React + TypeScript + WXT 构建,想读就读。
从零跑通:最快上手路径
离线AI侧边栏从源码装出来一共 5 步,前置条件先摆好:
- Bun运行时(下文命令均可用 npm 替代)
- Ollama已启动,并拉取过一个对话模型(无显卡就选 8B 左右的小模型)
- Chrome / Edge / Brave 或 Firefox
第 1 步,克隆仓库:
git clone https://gitcode.com/GitHub_Trending/pa/page-assist cd page-assist提示:克隆完成后,后面所有命令都在这个目录里执行。
第 2 步,安装依赖:
bun install提示:Bun 报错时换成
npm install即可,效果等价。
第 3 步,拉一个本地模型:
ollama pull llama3.1:8b提示:想用知识库功能,记得再拉一个
nomic-embed-text当嵌入模型。
第 4 步,构建扩展:
bun run build提示:这条命令会一次构建 Chrome、Edge、Firefox 三个版本,产物在
build/目录下。
第 5 步,加载未打包的扩展:
chrome://extensions提示:打开“开发者模式”,点“加载已解压的扩展程序”,选
build/目录;Firefox 走about:addons,选其中的manifest.json。
核心能力速览
离线AI侧边栏只是它的入口之一,常用能力一张表收拢:
| 能力 | 触发方式 | 适用场景 | 对应源码路径 |
|---|---|---|---|
| 网页对话 | 侧边栏开关,或 Ctrl+E 切换 | 总结、翻译、提问当前页面 | src/chain/ |
| Web UI | 扩展图标或 Ctrl+Shift+L | 完整 ChatGPT 式界面、知识库问答 | src/routes/ |
| 知识库 | 设置→Manage Knowledge,输入框选择 | 与 PDF / Word / CSV / MD 对话 | src/db/ |
| 联网搜索 | 设置中选搜索引擎 | 对话时查最新信息 | src/web/ |
| Page Action(仅 Chromium) | 侧边栏光标图标开关 | 让模型替你点击、填表、导航 | extensions/page-action/ |
它和网页版 AI 聊天的差别,就是“本地”和“当前页面”两件事:模型跑在你机器上,页面内容不出浏览器。Page Action 拆成独立小扩展也很克制——敏感的 debugger 权限单独放,想让模型动手操作页面的人才需要装。
把配置调到位
这个本地AI浏览器助手的设置项不少,真正值得动的就三块:
快捷键冲突排查
Ctrl+Shift+Y(侧边栏)、Ctrl+Shift+L(Web UI)属于浏览器级快捷键,要在扩展管理页的“键盘快捷键”里改- 应用内:
Ctrl+Shift+O新对话、Ctrl+E切换普通对话/网页对话、Shift+Esc聚焦输入框 - 浏览器级两个若与其他软件冲突,优先改它们,应用内的不受影响
模型连接三步法
- Ollama(本地):跑在
localhost:11434时零配置自动发现;放在别的机器上就设OLLAMA_HOST环境变量指向它 - OpenAI 兼容端点:LM Studio、llamafile、自建 vLLM,在设置里填 API 地址即可
- Chrome AI(Gemini Nano):Chromium 内置,开箱即用,什么都不用装
搜索与嵌入数据源
- 联网搜索支持 Google、DuckDuckGo、SearXNG、Brave、Tavily、Exa、Kagi、Perplexity 等,自托管选 SearXNG
- 知识库和网页对话依赖嵌入模型,推荐
nomic-embed-text - 不想走向量检索时,可在网页对话设置里关掉 RAG 模式,把页面内容直送模型
进阶玩法与效率技巧
本地AI浏览器助手装好之后,下面 4 个技巧可以直接用:
- Ctrl+E 一键读页:读到长文按它切到网页对话模式,直接说“用 300 字总结”,不用复制粘贴。
- @tab 多标签对照(实验特性):输入框里用
@tab引用已打开的标签页,例如:@tab1 和 @tab2 两个文档,限流策略有什么区别。 - 知识库吃领域文档:上传 API 文档或合同,再问“这份文档里分页是怎么做的”,答案基于你的文档,而不是模型的记忆。
- 给 Page Action 上审批锁:设置→Page Action 保持“每次操作前要求审批”,模型能操作页面,但每次点击都经你确认,前几次使用建议开着。
常见问题快查
排查之前,先看看是不是本地AI浏览器助手这几个高频问题:
模型不出现 / 对话没反应:确认 Ollama 在运行(ollama list能看到模型),且已拉取模型;默认端口 11434 无需任何配置。
快捷键没反应:Ctrl+Shift+Y和Ctrl+Shift+L注册在浏览器层,要去扩展管理页的“键盘快捷键”里看是否被改或没分配。
知识库索引很慢:嵌入计算和向量存储都在浏览器本地完成,没有服务端缓存;大文档建议分批上传,别拿对话模型当嵌入模型用。
Firefox 支持全吗:侧边栏、Web UI、网页对话都支持;Page Action 和 YouTube 摘要按钮仅限 Chromium 系。
会不会把数据传到云端:不会。聊天记录和知识库存在浏览器本地存储,唯一涉及服务器的是分享功能,且可在设置中关闭。
第一件值得试的事:打开任意长文网页,按Ctrl+E切到网页对话,让模型把要点讲一遍;第二件:进设置连上 Ollama,上传一份文档体验知识库。更多细节可以看 docs/features/,安装或使用时踩了坑,欢迎去 issue 区交流。
【免费下载链接】page-assistUse your locally running AI models to assist you in your web browsing项目地址: https://gitcode.com/GitHub_Trending/pa/page-assist
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考