news 2026/8/17 17:21:34

小说下载器使用指南:三步把小说网站存成TXT和EPUB

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
小说下载器使用指南:三步把小说网站存成TXT和EPUB

小说下载器使用指南:三步把小说网站存成TXT和EPUB

【免费下载链接】novel-downloader一个可扩展的通用型小说下载器。项目地址: https://gitcode.com/gh_mirrors/no/novel-downloader

追了三年的连载,某天早上打开书页,迎接你的却是刺眼的"404"——这种经历,老书虫多少都遇过一两次。网站改版、章节被锁、整站关停,网络小说消失的速度,常常比更新还快。小说下载器(novel-downloader)就是为这个时刻准备的浏览器脚本:它支持两百多个小说网站,能把目录页一键打包成 TXT 和 EPUB,让看过的故事真正留在你的硬盘里。

一句话总结它的定位:一个可扩展的通用型小说下载器,装进浏览器脚本管理器就能用。它和普通下载脚本最大的区别有两处——一是按"站"适配,两百多个站点各有一份独立解析规则,某个站挂了不影响其他站;二是对反爬有完整对策,连"把文字换成图片"这种招数,它都有对应的解码方案。

每个网站一份规则,这就是它"通用"的秘密

打开项目源码,src/rules/目录按网站形态分门别类:

  • onePage/:一页展示全部章节的站点
  • twoPage/:目录与正文分页的站点
  • special/:起点、晋江、番茄这类需要特殊处理的站点
  • biquge/mbtxt/:笔趣阁系等常见转载站

每个站点对应一个规则文件,继承统一基类,实现"解析目录"和"解析正文"两个方法就够了。这意味着新增一个网站的支持,往往只是一份几十行的规则文件,主流程完全不用动。对普通读者来说,这个设计带来的好处很实在:那些小众冷门的站点,很可能早有人贡献过规则,打开就能用。

最硬核的地方:给"图片文字"解码

有些站点(比如西瓜书屋)为了防抓取,把正文里的汉字替换成一张张图片,普通下载器到这里就卡壳了。小说下载器的解法是三层递进:

  1. 文件名映射:图片文件名直接对应文字,命中率最高、速度最快;
  2. 哈希映射:文件名对不上,就下载图片算哈希值,再去映射表里匹配;
  3. OCR 识别:前两招都失效时,调用 PaddleOCR 模型直接读图,最准但也最慢。

前两层够快够准,OCR 只是兜底。首次触发 OCR 时会自动下载识别模型并缓存到本地,之后无需重复加载。

下载运行时,控制台会实时打印每一章的抓取日志,进度一目了然。

从零到第一本书:只需要三步

第一步,装脚本管理器。Tampermonkey、Violentmonkey 任选其一,在浏览器扩展商店搜名字安装即可。

第二步,添加脚本。从脚本发布页把小说下载器装进管理器。首次运行会询问是否同意把当前书页存档到互联网档案馆——这是项目所属"404小说文库"的附加功能,不同意也不影响下载。

第三步,打开目录页,点图标。访问任意一个支持的小说网站目录页,比如番茄、七猫或某个笔趣阁系站点,等右上角出现下载图标,点下去,剩下的交给脚本:

  • 下载期间会播放无声音频,这是为了不让浏览器后台休眠,属正常现象;
  • 右下角有实时进度条,也可以按 F12 看详细状态;
  • 完成后自动存下 TXT 和 EPUB 两份文件,外加一个打包了 HTML 章节的压缩包,方便日后对照。

在目录页点一下右上角的下载图标,接下来只需等待。

下载完成的正文干净整齐,TXT 和 EPUB 都能直接开读。

进阶玩法:只下载你真正需要的那部分

整本上千章,很多时候你只要其中一部分。按下 F12,在控制台里定义这样一个函数,下载时就会自动过滤:

// 只下载前 100 章 function chapterFilter(chapter) { return chapter.chapterNumber <= 100; } window.chapterFilter = chapterFilter;

想按卷下载,把条件换成chapter.sectionNumber === 1;想按关键词筛选,就判断chapter.chapterName.includes("武器")。另一个变量saveOptions则能自定义章节标题格式、段落缩进、清除 EPUB 空行,甚至把章节倒序保存。这些能力在官方文档里都有完整示例,属于"需要时再查"的类型,不影响日常使用。

配合自定义保存参数,导出的文本可以完全按你的排版习惯生成。

老用户踩过的坑,帮你提前避一避

  • 付费章节不是免费午餐。下载 VIP 章节前,请先在对应网站登录并确认已购买,未购买的付费章节会被直接跳过。
  • 长佩文学会限速。它反爬严格,大约每分钟只能下 6 章,别同时开多个页面下多本书。
  • 图片型站点首次下载偏慢。触发 OCR 时要先下载识别模型,第一次请多给点耐心。
  • 下载卡住先开调试模式。在设置里启用调试后,生成的压缩包会附带debug.log,连同复现步骤一起反馈,维护者才能定位问题。
  • 晋江字体乱码可以修。下载文本若出现异常字符,按日志提示更新字体匹配表即可。

写在最后

小说下载器最难得的地方,是把"保存"这件事做得体面——TXT、EPUB、HTML 三份备份,图片型反爬也有三层解码兜底。它脱胎于"404小说文库"项目,初衷就是保存那些质量上乘、却可能悄然消失的作品。想深入研究的读者,也可以把仓库克隆到本地(git clone https://gitcode.com/gh_mirrors/no/novel-downloader),照着文档跑一次构建,甚至为自己常看的站点贡献一份规则。

当然,也请记住一条朴素的原则:工具负责保存,我们负责尊重版权。只下载已购或公开的内容,别给目标站点造成访问压力。

你的书架上,总该有几本"跑不掉"的小说。

【免费下载链接】novel-downloader一个可扩展的通用型小说下载器。项目地址: https://gitcode.com/gh_mirrors/no/novel-downloader

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/17 17:20:48

暗黑2存档修改完整教程:用免费D2R存档编辑器d2s-editor一键毕业

暗黑2存档修改完整教程&#xff1a;用免费D2R存档编辑器d2s-editor一键毕业 【免费下载链接】d2s-editor 项目地址: https://gitcode.com/gh_mirrors/d2/d2s-editor 朋友凌晨发来一句&#xff1a;"明天开荒&#xff0c;帮我整一个能直接下地狱的号。"说实话&…

作者头像 李华
网站建设 2026/8/17 17:19:56

Ubuntu中文输入法配置指南:IBus与Fcitx5对比与实战

1. 从“打不出字”到“行云流水”&#xff1a;Ubuntu中文输入法入门刚装好Ubuntu&#xff0c;桌面清爽&#xff0c;命令行强大&#xff0c;一切都那么美好&#xff0c;直到你需要写一封中文邮件、在浏览器里搜索中文资料&#xff0c;或者给代码写个中文注释——然后发现&#x…

作者头像 李华
网站建设 2026/8/17 17:17:30

2048 AI助手上手实测:从命令行自动代打到算法原理一次讲透

2048 AI助手上手实测&#xff1a;从命令行自动代打到算法原理一次讲透 【免费下载链接】2048-ai AI for the 2048 game 项目地址: https://gitcode.com/gh_mirrors/20/2048-ai 你可能已经玩腻了 2048&#xff0c;但你未必试过让一台机器替你把它打穿。今天要聊的开源项目…

作者头像 李华
网站建设 2026/8/17 17:15:32

工程实践:如何为开发工作流集成稳定可靠的LLM替代服务

在实际开发和学习过程中&#xff0c;我们经常需要借助大型语言模型&#xff08;LLM&#xff09;来辅助代码编写、问题排查、技术方案设计或学习新概念。然而&#xff0c;直接访问某些官方服务可能会遇到网络延迟、服务不稳定或访问限制等问题。因此&#xff0c;寻找稳定、快速且…

作者头像 李华
网站建设 2026/8/17 17:08:33

Python基础6 - 字符串:(2)字符串常用操作

目录 一. 拼接 二. 计算字符串长度 三. 截取字符串 &#xff08;一&#xff09;普通截取 &#xff08;二&#xff09;反向输出字符串 四. 分割、合并字符串 &#xff08;一&#xff09;分割字符串 &#xff08;二&#xff09;合并字符串 五. 检索字符串 &#xff08;一…

作者头像 李华