MediaCrawler 多平台爬虫教程:5 分钟跑通小红书、抖音、B 站数据采集
2026/9/17 18:11:41 网站建设 项目流程

MediaCrawler 多平台爬虫教程:5 分钟跑通小红书、抖音、B 站数据采集

【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler

想批量拿到小红书、抖音、B 站上的笔记、视频和评论,手动复制根本做不完?MediaCrawler 就是干这个的——一个开源的多平台数据采集工具,覆盖小红书、抖音、快手、B 站、微博、百度贴吧、知乎七个平台,内容和评论一次采集全落盘。

中断能续爬,Windows、Linux 都能跑

采集到一半断了?它会从断点接着抓,已采过的不重复跑。有多个账号时可以轮流切换,分散压力。新版还把对浏览器自动化组件的依赖去掉了,体积更轻,Linux 上和 Windows 一样好使。

5 分钟完成首次运行

克隆仓库、装依赖,两步就好:

git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler && pip install -r requirements.txt

然后改一处配置,默认项都集中在 config/base_config.py:把PLATFORM改成目标平台(比如 xhs),KEYWORDS填上你的关键词,CRAWLER_TYPE保持 search。回到终端敲python main.py,首次会弹浏览器,手机扫码登录后就开始自动采集了。

两种最高频的用法

按关键词采集——最常用的场景。KEYWORDS支持英文逗号分隔多个词,工具会逐个搜索,把该关键词下的笔记、视频、评论全部落盘。

按用户主页采集——把CRAWLER_TYPE改成 creator,再给一个用户 ID,这个人的主页内容就一次性拿到;想抓单篇帖子及其评论区,就用 detail 模式贴一条链接。

快手、微博、贴吧、知乎都是同一套玩法,换个PLATFORM和对应的 config/ 文件就行。

排坑指南:被限流、数据找不到时怎么办

  • 采集频繁中断、疑似被风控:上代理 IP。在基础配置里开启ENABLE_IP_PROXY,再从 proxy/ 选一个提供商(快代理、豌豆 HTTP 或自己的静态代理)。原理不复杂:从代理商拉 IP、存入 Redis、组成 IP 池,每次请求从池里取一个用。

![代理IP池获取流程图:从提供商拉取、存入Redis后从池中取用](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler/raw/5665a271ef15e0ec82b1f48a951b66760e054db9/docs/static/images/代理IP 流程图.drawio.png?utm_source=gitcode_repo_files)

  • 采完的数据不知道去哪 / 想直接分析:存储方式可切换——落盘文本文件、写入数据库(MySQL、MongoDB、SQLite 均可)、或直接导出 Excel,细节看 docs/data_storage_guide.md。

  • 不确定程序是否在正常工作:终端会滚动打印日志,每行带平台、内容 ID 和标题,卡住就看最后一条报错。

  • 扫码登录一直过不了:把HEADLESS设为 False 弹出浏览器,手动过一遍滑块再试。

  • 其他报错:先翻 docs/常见问题.md,命中率高。

一句话:改一处配置,跑一行命令,多平台数据就到手了。CDP 模式、词云等进阶玩法,去 docs/ 目录里找。

【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询