MediaCrawler 多平台爬虫教程:5 分钟跑通小红书、抖音等 7 个站点
【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler
MediaCrawler 是一款开源多平台自媒体数据采集工具,覆盖小红书、抖音、快手、B站、微博、贴吧、知乎 7 个主流平台,能抓取笔记、视频和评论数据,靠浏览器登录态代替复杂的 JS 逆向,新手也能直接上手。
🚀 最短路径上手:五分钟跑通第一次采集
先备好 Python(建议 3.11)和 Node.js 16 以上,Node 是抖音、知乎的签名脚本用的。默认 CDP 模式直接复用你本地的 Chrome,不用额外装浏览器驱动。
三步跑起来:
git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler && uv sync uv run main.py --platform xhs --lt qrcode --type search最后一条命令会打开 Chrome 让你扫码登录小红书,然后开始按关键词抓取。登录态会缓存,下次运行免扫码。不喜欢命令行的话,也可以启动 WebUI 可视化界面,在浏览器里改参数、看实时日志:
🎯 核心玩法:三种模式覆盖所有取数任务
不管你要做什么,都能落到下面三种模式里。参数可以先写进配置文件,再靠命令行参数覆盖。
按关键词搜索:输词拿内容加评论
最常用的模式。指定--type search和关键词(多个用英文逗号分隔),会自动抓笔记或视频的正文、互动数据,以及一级评论:
uv run main.py --platform dy --lt qrcode --type search --keywords "咖啡,探店"用--max_comments_count_singlenotes限制单条内容的评论抓取量,大热评论容易拖慢整体速度,所以先控量再放量。
按内容ID批量抓取怎么做
手里有具体链接时,用--type detail加--specified_id,支持完整 URL,多个 ID 逗号分隔:
uv run main.py --platform bili --type detail --specified_id "BV1xx411c7mD,BV1xx411c7mE"适合批量分析几条明确的竞品内容或历史爆款,不会有搜索带来的偏差。
盯住某个主页:跟踪一个账号
用--type creator传入创作者主页 URL 或 ID,即可抓取该账号发布的内容和互动数据:
uv run main.py --platform xhs --type creator --creator_id "你的创作者ID"适合盯目标账号,定期跑一遍就能观察更新频率和热度变化。
💾 数据落盘:一句话选存储格式
默认存 JSONL 到 data 目录,一行一条记录,方便脚本后续读取。习惯 Excel 就加--save_data_option excel,直接出报表。数据量大、要反复跑就选 sqlite 或 mongodb,内置去重,二次运行不会产生重复记录。
📊 场景实战:把数据变成真实工作
场景一:竞品营销监控背景:想看竞品账号最近在做什么。做法:--type search模式输入竞品品牌名,开启评论抓取,每周跑一次。拿到什么:新发内容清单、互动数据,以及用户评论里的真实反馈。
场景二:产品口碑词云背景:想知道用户对某产品说了什么。做法:按产品名搜索抓评论,配置文件里把ENABLE_GET_COMMENTS和ENABLE_GET_WORDCLOUD都设为 True(数据需存为 json 或 jsonl)。拿到什么:用户反馈的高频词分布图,停用词可在 hit_stopwords.txt 里过滤。
🛡️ 避坑指南:三个最常卡住的地方
坑一:小红书登录滑块一直过不了现象:扫码成功但卡在滑块验证。原因:小红书风控严格,新开的浏览器容易被识别。解法:保持默认 CDP 模式连接自己的真实 Chrome,并删除项目根目录下 brower_data 目录后重新登录。
坑二:抖音、知乎报 "SyntaxError: 缺少 ';'"现象:命令行弹出 execjs 相关报错。原因:没装 Node.js 环境。解法:安装 Node.js 16 以上再重跑,这是缺 Node 最直接的信号。
坑三:开始能爬,过一段时间就失效现象:没报错但拿不到新数据。原因:账号登录态被平台风控失效。解法:先降低抓取频率和数量,删除 brower_data 换账号重新登录;高频需求再上代理池。项目支持多种代理服务商并自动轮换 IP,整体流程如下:
代理IP拉取入池与轮换的完整流程图
服务商控制台里的代理账号密码,就是需要配置进环境变量的凭据:
代码里通过环境变量读取密钥,避免把账号密码硬编码进文件:
📌 最后说两句
三种模式加一条命令,就能开始采集任意平台的内容与评论。更多运行问题先看项目里的 docs/常见问题.md,所有参数都能在 config/base_config.py 里改。
【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考