xhs 小红书数据采集工具:拿笔记、评论、用户数据只要几行代码
2026/8/21 17:20:09 网站建设 项目流程

xhs 小红书数据采集工具:拿笔记、评论、用户数据只要几行代码

【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs

想在小红书里分析某个话题的笔记热度,只能打开网页逐条复制标题、点赞数、评论数,几百条下来半天就没了。这类重复的取数活儿,完全可以交给脚本干。小红书数据采集工具 xhs就是一个对小红书 Web 端请求做封装的 Python 库:登录网页版拿到 Cookie 后,几行代码就能取回笔记详情、评论、用户资料等公开数据。

一分钟看懂 xhs 能干什么

它同时覆盖小红书主站和创作服务页两条线,能力大致分四类:

  • 取数:按 ID 查笔记(标题、正文、点赞、收藏、评论数、图片/视频链接)、查用户资料、拉主页推荐流、按关键词搜索笔记
  • 批量取数:拉取某用户发布的笔记、收藏笔记、点赞笔记,还有自动翻页的"全量拉取"接口,一次跑完一个账号的全部内容
  • 交互操作:点赞、收藏、关注、发评论、删评论等写操作,不只是"读"
  • 账号与发布:二维码登录、手机验证码登录,以及发布图文/视频笔记、查看创作数据

适合谁:内容运营、电商选品、做竞品追踪的开发者,想快速把公开数据落到自己数据库里的人。不适合谁:期望零维护、或想拿平台未公开数据的人。它的接口跟随网页端变动,平台改版后需要跟着升级版本。

上手前先看明白:签名是怎么回事

小红书的每个网页请求都带一个叫 x-s 的签名,可以把它理解成平台的"笔迹验证":网页里的 JS 代码会为每次请求生成一段配套校验码,对不上就被拒。所以 xhs 的做法是让 playwright 驱动一个无头浏览器,加载真实网页、调用真实的 JS 函数来完成"验笔迹",顺便用一段隐身脚本绕开环境检测。这也解释了为什么装它比装普通库多几步。

三步跑通第一个采集任务

第一步,装依赖。Python 3.7 以上即可,执行:

pip install xhs pip install playwright playwright install

第二步,拿 Cookie。登录小红书网页版,从浏览器开发者工具复制 Cookie,其中a1、web_session、webId 三个字段缺一不可,相当于请求的通行证。

第三步,跑示例。打开 example 目录下的 basic_usage.py,把 cookie 换成自己的,运行后就会打印指定笔记的完整结构化数据,配合项目自带的辅助函数还能直接提取图片、视频链接。文档 docs/basic.rst 里写明了全部准备事项(包括下载一份 stealth.min.js),照着做即可。

跑通之后你会发现,拿到手的就是普通 Python 字典,存 JSON、进数据库都是常规操作。

三个真实用法场景

关键词搜索做选题调研。给谁用:新媒体编辑、内容创作者。解决什么:发什么内容全凭感觉。用了之后得到什么:用get_note_by_keyword()按热度或时间排序拉出该关键词下的头部笔记,批量比对就能摸出爆款标题和内容套路,选题从猜变成查。

竞品账号持续监控。给谁用:品牌运营、电商从业者。解决什么:每天手动刷竞品主页看更新。用了之后得到什么:get_user_all_notes()自动翻页拉完对方全部笔记,再逐篇补互动数据存库,更新节奏、内容规律一目了然。

评论口碑挖掘。给谁用:产品调研、舆情分析团队。解决什么:只看得到点赞数这种表面数字。用了之后得到什么:get_note_all_comments()递归拉取一级评论和子评论,完整还原一条笔记下的讨论现场,用户的真实反馈就是最便宜的用户调研。

四个最常见的坑,提前避掉

  • 签名偶发失败:属于正常现象,浏览器环境检测偶尔会"没通过"。示例代码已内置重试循环,直接重试即可;频繁失败就加大页面加载后的等待时间。
  • 多账号用统一签名服务时 a1 必须一致:把签名封装成独立服务(项目 xhs-api/ 目录提供 Docker 一键部署),多个账号共用时,各 Cookie 里的 a1 字段要和服务端保持一致,否则会持续报签名错误。
  • 控制请求频率:高频请求容易触发风控甚至封 IP,批量采集时保留合理间隔,细水长流更稳。
  • 只碰公开数据:项目定位是个人学习用途的开源作品,请遵守法律法规与平台规则,不要对目标站点施加压力。

让脚本替你的眼睛值班

xhs 的价值不在代码多精巧,而在于把签名、反爬这些最耗神的活儿包好了,你只管决定拿到数据之后做什么。现在就可以pip install xhs直接开跑,或从仓库 https://gitcode.com/gh_mirrors/xh/xhs clone 下来运行 example 目录里的示例。手动复制是抄写员,脚本是流水线——后者一次配置,天天出数。

【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询