MediaCrawler 多平台爬虫教程:5 分钟跑通小红书、抖音、B 站数据采集
【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler
想批量拿到小红书、抖音、B 站上的笔记、视频和评论,手动复制根本做不完?MediaCrawler 就是干这个的——一个开源的多平台数据采集工具,覆盖小红书、抖音、快手、B 站、微博、百度贴吧、知乎七个平台,内容和评论一次采集全落盘。
中断能续爬,Windows、Linux 都能跑
采集到一半断了?它会从断点接着抓,已采过的不重复跑。有多个账号时可以轮流切换,分散压力。新版还把对浏览器自动化组件的依赖去掉了,体积更轻,Linux 上和 Windows 一样好使。
5 分钟完成首次运行
克隆仓库、装依赖,两步就好:
git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler && pip install -r requirements.txt然后改一处配置,默认项都集中在 config/base_config.py:把PLATFORM改成目标平台(比如 xhs),KEYWORDS填上你的关键词,CRAWLER_TYPE保持 search。回到终端敲python main.py,首次会弹浏览器,手机扫码登录后就开始自动采集了。
两种最高频的用法
按关键词采集——最常用的场景。KEYWORDS支持英文逗号分隔多个词,工具会逐个搜索,把该关键词下的笔记、视频、评论全部落盘。
按用户主页采集——把CRAWLER_TYPE改成 creator,再给一个用户 ID,这个人的主页内容就一次性拿到;想抓单篇帖子及其评论区,就用 detail 模式贴一条链接。
快手、微博、贴吧、知乎都是同一套玩法,换个PLATFORM和对应的 config/ 文件就行。
排坑指南:被限流、数据找不到时怎么办
- 采集频繁中断、疑似被风控:上代理 IP。在基础配置里开启
ENABLE_IP_PROXY,再从 proxy/ 选一个提供商(快代理、豌豆 HTTP 或自己的静态代理)。原理不复杂:从代理商拉 IP、存入 Redis、组成 IP 池,每次请求从池里取一个用。

采完的数据不知道去哪 / 想直接分析:存储方式可切换——落盘文本文件、写入数据库(MySQL、MongoDB、SQLite 均可)、或直接导出 Excel,细节看 docs/data_storage_guide.md。
不确定程序是否在正常工作:终端会滚动打印日志,每行带平台、内容 ID 和标题,卡住就看最后一条报错。
扫码登录一直过不了:把
HEADLESS设为 False 弹出浏览器,手动过一遍滑块再试。其他报错:先翻 docs/常见问题.md,命中率高。
一句话:改一处配置,跑一行命令,多平台数据就到手了。CDP 模式、词云等进阶玩法,去 docs/ 目录里找。
【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考