GetQzonehistory:一键备份QQ空间全部历史说说,导出Excel和图片
【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory
GetQzonehistory 是一款开源的QQ空间数据备份工具:扫码登录后,它会自动抓取你QQ空间的所有历史说说,包括文字、图片链接、评论和发布时间,导出成多个Excel文件和一张本地图片文件夹,还会生成一个浏览器里直接打开就能看的网页版。
你发出去多年的说说,正在悄悄过期
先问一句:你有多久没翻过自己QQ空间的最后一页了?
三个真实场景:换新设备重新登录后想找老动态,想把几年前的文字整理成个人博客,想捞回某年某月的照片却发现图片链接早就失效。手动一条条复制粘贴几千条说说根本不现实,QQ空间网页版也没有导出按钮。GetQzonehistory 要做的,就是让你坐着扫一次码,把这件事全交给程序。
GetQzonehistory 能做这 5 件事
- 扫码登录后自动分页抓取你的全部历史说说,可见未删除的内容都覆盖,包含 2014 年的老内容
- 一次性导出 6 类 Excel 文件:全部列表、说说列表、转发列表、留言列表、好友列表、其他列表
- 把说说里的图片逐张下载到本地
pic/文件夹,并自动把缩略图升级成高清原图 - 解析每条说说的完整评论:谁说的、什么时候说、说了什么
- 生成「说说网页版」HTML,浏览器打开就是你的时间线
- 中途按 Ctrl+C 中断时,自动保存已抓取的数据,不用从头再来
5 步拿到你的QQ空间数据
环境要求
| 项目 | 要求 |
|---|---|
| Python | 3.8 及以上(3.12 已验证) |
| 关键依赖 | pandas、beautifulsoup4、requests、qrcode、pyzbar |
| 系统库 | Linux 需安装 zbar(自动识别扫码用) |
安装步骤
git clone https://gitcode.com/GitHub_Trending/ge/GetQzonehistory cd GetQzonehistory python -m venv myenv pip install -r requirements.txt- 激活虚拟环境:Windows 执行
.\myenv\Scripts\activate,macOS/Linux 执行source myenv/bin/activate - 运行主程序:
python main.py- 用 QQ 扫描终端里弹出的二维码完成登录
- 等进度条走完,结果文件会出现在
resource/result/你的QQ号/目录下
主入口是main.py,登录逻辑在util/LoginUtil.py:它生成二维码并在你扫完的瞬间自动完成识别,全程不需要输密码。
它是怎么把说说抓全的
整个流程分 4 步,设计思路是"慢而稳":
- 登录拿凭证:扫码后程序获得 cookies(可以理解成 QQ 空间发的"临时门禁卡"),由
util/LoginUtil.py完成。 - 抓历史消息列表:程序按每页 10 条翻 QQ 空间的历史消息列表,每翻一页休息 3 秒,这里覆盖了你这些年被互动过的说说主体,请求逻辑在
util/RequestUtil.py。 - 抓未删除说说:再调 QQ 空间的说说接口,按每页 30 条拉取所有可见未删除的说说,含图片和评论,这一步在
util/GetAllMomentsUtil.py。 - 去重、分类、导出:把两份来源合并去重,按说说、转发、留言、其他分类后写入 Excel,同时下载图片、渲染网页版。
每页之间强制歇几秒是刻意为之:既减轻服务器压力,也降低触发风控的概率。几千条的账号跑完全程通常要十几到几十分钟,属于正常水平。
导出后你会得到哪些文件
所有结果都放在resource/result/你的QQ号/下:
- 6 个 Excel 文件:
全部列表、说说列表、转发列表、留言列表、好友列表、其他列表 说说网页版.html:可直接用浏览器打开的时间线页面pic/文件夹:本地化保存的说说图片
Excel 的核心字段(每行一条记录):
| 字段 | 说明 | 示例 |
|---|---|---|
| 时间 | 发布时间,精确到分秒 | 2023年01月15日 10:30:59 |
| 内容 | 「昵称:正文」,QQ 表情以标记形式保留 | 阿明:今天天气真好~ |
| 图片链接 | 原图地址,多张用逗号分隔 | http://...xxx.jpg |
| 评论 | 评论人、时间、内容的列表 | [[时间, 内容, 昵称, QQ], ...] |
好友列表还多一列空间主页链接,想顺路串门很省事。
这份数据能拿来做什么
个人存档:换平台、换手机之前跑一遍,几年的说说、图片和评论就都进了本地硬盘。哪怕哪天图片链接大规模失效,你手里还有完整一份。
内容再创作:在 Excel 里按年份筛选出你写过的旧文和拍过的旧图,二次创作的素材库十分钟就建好了;配合网页版 HTML 还能回看当年的排版和发布节奏。
行为研究:「时间」和「评论」两列可以直接算出发布频率、活跃时段、互动水平,相当于一个人十年的行为数据集,结构规整到可以直接喂给 pandas 跑分析。
常见问题
Q:仅自己可见的说说能拿到吗?不能。程序走的是你自己的QQ空间可见范围,设置成仅自己可见或仅特定好友可见的内容接口不会返回,导出里自然没有。
Q:需要输密码吗,安不安全?全程不经过密码,登录走官方扫码,cookies 只在本地会话里用于请求鉴权,所有抓取和解析都在你自己电脑上完成,不往第三方服务器传数据。
Q:几千条说说要跑多久?消息列表每 10 条歇 3 秒,说说的图片还要逐张下载,一千条左右通常十几到几十分钟,主要看图片数量和网速。
Q:跑到一半断了怎么办?不亏。程序内置了信号处理,按 Ctrl+C 会立刻把已抓到的数据导出成文件,之后重跑补上剩下的部分即可。
项目信息
仓库名 GetQzonehistory,采用 GPL v3 开源协议,克隆命令见上面「快速上手」一节。代码模块化程度较高,util/目录下每个文件只负责一件事(登录、请求、抓取、配置、工具),读起来不费劲,也方便按需改造。项目欢迎提 issue 和贡献代码,后续方向主要在三点:抓取中断后的增量续抓、更多导出格式(如 JSON/CSV)、跨平台兼容性的补齐。
QQ 空间是记忆的容器,而这份归档才真正属于你。把仓库克隆下来扫个码,把十年的说说交给程序去搬一次吧。
【免费下载链接】GetQzonehistory获取QQ空间发布的历史说说项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考