四步玩转 MediaCrawler-new:一文搞定小红书、抖音、快手、B站、微博五大平台数据采集
2026/8/20 21:59:09 网站建设 项目流程

四步玩转 MediaCrawler-new:一文搞定小红书、抖音、快手、B站、微博五大平台数据采集

【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new

想批量拿到小红书、抖音、快手、B站、微博的笔记、视频、评论和互动数据?MediaCrawler-new 是一个基于 Playwright 的开源采集框架,用真实浏览器模拟真人操作来绕开平台反爬,专为运营、开发者和研究人员设计。你不需要懂逆向、不需要手写加密算法,跟着下面四步走,就能跑通一套属于自己的多平台采集管线。

第一幕|还在被这几件事折磨吗

先对号入座,看看下面有没有你的影子。

手工党的日常:运营同学需要分析竞品笔记,一页页复制标题、点赞数、评论内容到 Excel。一天下来,眼睛花了,表格还错了几行。

逆向党的深夜:开发者想写爬虫,结果发现平台接口的参数被加密包裹,光分析 Sign 签名就熬了几个通宵,代码没写几行,头发掉了一把。

老手也翻车:好不容易写通了脚本,跑了半小时就触发风控,IP 被拉黑,账号被限制,之前的工作全部作废。

MediaCrawler-new 正是冲着这三类痛点来的:它借用 Playwright 维持一个"活着的"浏览器上下文,通过执行 JS 拿到加密参数,绕开了逆向加密算法的地狱级难度;同时内置登录态缓存与代理 IP 池,把"被封号"的风险压到最低。

  • ✅ 一套框架覆盖五大平台:xhs、dy、ks、bili、wb
  • ✅ 三种登录方式自由切换:二维码、手机号、Cookie
  • ✅ 四种采集模式:关键词搜索、指定 ID、创作者主页、B 站视频下载
  • ✅ 三种存储出口:JSON、CSV、关系型数据库
  • ✅ 代理 IP 池 + 登录态缓存,长跑采集更稳

第二幕|三分钟,让第一个采集任务跑起来

上手路径很短,你只需做三件事。

第一步:搭好运行环境

打开终端,依次执行:

# 拉取项目代码 git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler-new cd MediaCrawler-new # 创建并激活虚拟环境 python -m venv venv source venv/bin/activate # 安装依赖库和浏览器内核 pip install -r requirements.txt playwright install

为什么这样做:虚拟环境把项目依赖和系统隔离,避免版本打架;playwright install会下载 Chromium 内核,它是后面"模拟真人浏览"的地基。如果中途报缺少 nodejs 环境,安装 Node.js v16.8.0 及以上版本即可。

第二步:改两行配置

打开config/base_config.py,核心就这几项:

PLATFORM = "xhs" # 目标平台:xhs | dy | ks | bili | wb KEYWORDS = "python,数据分析" # 要搜索的关键词 LOGIN_TYPE = "qrcode" # 登录方式:qrcode | phone | cookie CRAWLER_TYPE = "search" # 采集类型:search | detail | creator SAVE_DATA_OPTION = "json" # 保存方式:csv | db | json

为什么这样做:所有开关都收敛在一个文件里,改配置不用动代码,换平台、换关键词、换存储方式都是一行的事。

第三步:运行并扫码

python main.py --platform xhs --lt qrcode --type search

浏览器会自动弹出二维码,用手机小红书 App 扫码登录,程序随即开始按关键词采集。登录一次之后,登录态会被缓存下来,下次启动直接进入采集,不用再扫。

第三幕|把它的隐藏实力逐层拆开

跑通第一条命令只是开始,下面这些能力才是它真正值钱的地方。

登录三件套,总有一种适合你

  • 二维码登录:最省心,手机一扫完事,适合首次配置。
  • 手机号登录:配合短信转发工具,验证码自动回填进浏览器,适合长期无人值守的采集任务。
  • Cookie 登录:把已有的登录凭证直接填入COOKIES配置,秒级恢复会话。

三种方式背后都有SAVE_LOGIN_STATE登录态缓存兜底,中间断了也不怕,重跑一次就能接着采。

四种采集模式,覆盖九成需求

模式作用典型场景
search按关键词抓取帖子/视频分析某个话题的热度
detail按指定 ID 抓取单条内容精确获取某篇爆款的全维度数据
creator抓取创作者主页全部作品拆解头部账号的内容节奏
video_download批量下载视频(当前支持 B 站)本地留档与二次剪辑

config/base_config.py里填好XHS_SPECIFIED_ID_LISTDY_SPECIFIED_ID_LISTBILI_SPECIFIED_ID_LIST这类 ID 列表,就能批量定点采集指定内容。

存储自由选:文件、库都行

  • json:结构化输出,方便程序二次处理,落在data/目录。
  • csv:Excel 直接打开,给不会写代码的同事看刚刚好。
  • db:在config/db_config.py里把RELATION_DB_URL指向 MySQL、PostgreSQL 或 SQLite,数据量大时查询分析更顺手。

代理 IP 池:长跑采集的护身符

大规模采集最怕 IP 被封。开启ENABLE_IP_PROXY = True后,系统会从代理服务商拉取 IP,存入 Redis 维护有效期,动态构建代理池供爬虫轮换使用:

MediaCrawler-new代理IP池管理流程图

你只需要三步:在代理平台生成提取链接、把链接里的keycrypto写入环境变量、再把ENABLE_IP_PROXY置为 True。池子大小由IP_PROXY_POOL_COUNT控制,轻度使用 2~3 个就够,重度使用可以开到 10 个以上。

模块化架构:想加新平台不慌

项目目录按职责切分,结构一目了然:

MediaCrawler-new/ ├── base/ # 爬虫抽象基类,统一接口规范 ├── media_platform/ # 五大平台实现,各自独立 ├── proxy/ # 代理 IP 池管理 ├── store/ # 数据存储实现 ├── tools/ # 滑块、时间、工具函数 └── config/ # 全部开关集中在此

每个平台都在media_platform/下自成一体:客户端、核心逻辑、登录、字段定义各归其位。想接入新平台,照着现有模块的接口实现即可,扩展成本很低——这正是"一次配置,多端复用"的底气来源。

第四幕|它能帮谁,能帮到什么程度

场景一:电商运营做竞品拆解

你是美妆类目运营,想知道竞品在小红书的爆款逻辑。把KEYWORDS设为"粉底液,遮瑕膏,口红",开启评论采集ENABLE_GET_COMMENTS = True,跑一轮 search 模式。你会得到竞品的标题、互动数据和用户评论,照着这个清单就能反推选题方向与卖点话术。

场景二:创作者追踪头部账号

你是短视频作者,想学习同赛道的头部账号。把创作者 ID 填入XHS_CREATOR_ID_LIST,切到 creator 模式,就能批量拿到对方主页的作品列表,分析发布时间规律与内容风格,再结合 B 站的 video_download 模式把参考视频存到本地慢慢研究。

场景三:学生与分析师做舆情研究

你需要验证"某个社会话题的讨论热度"这类假设。用 search 模式按时间窗口抓取公开内容,以 JSON 落盘,再用 Pandas 做统计。全程公开数据、低频请求,适合学术场景的轻量研究。

常见问题速查

  • 报错execjs._exceptions.ProgramError: SyntaxError: 缺少 ';'——原因:缺少 nodejs 环境。解法:安装 Node.js v16.8.0 及以上版本。
  • 爬着爬着突然采不到数据了——原因:账号触发平台风控。解法:降低并发与频率,开启代理 IP 池,切勿大规模采集。
  • 想换一个登录账号——原因:浏览器缓存里存着旧登录态。解法:删除项目根目录下的browser_data/目录,重新扫码登录。

写在最后:把工具用好,也要用得对

MediaCrawler-new 的价值在于把"平台数据采集"这件事从逆向攻坚降级为"配置即用"。但请记住它的边界:它适合学习、研究与合规的市场分析,不适合对平台做大规模抓取或商用。请遵守各平台的使用条款,只采集公开数据,尊重用户隐私,控制请求频率——技术是杠杆,方向得你自己把握。

现在就可以动手:① clone 项目 ② 配好虚拟环境 ③ 改base_config.py里的平台与关键词 ④ 跑第一条命令扫码登录。十分钟后,你的第一份结构化数据就躺在data/目录里了。

【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询