小红书数据采集工具 xhs:一条命令装完,笔记评论数据 5 分钟到手
【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs
周报截止前夜,你为了 600 篇笔记手动誊写标题、点赞、收藏进 Excel,凌晨一点手指发麻,还把两个竞品的数据抄串了。这种纯体力活,真不该再用双手干——小红书数据采集工具 xhs 把小红书 Web 端的请求封装成了 Python 接口,几行代码就能批量拿到笔记、用户、评论等公开数据。
📋小红书数据采集:xhs 到底能拉哪些数据
- 笔记详情一次拿全:
get_note_by_id()返回标题、正文、点赞、收藏、评论数、图片链接等信息,直接输出结构化 JSON,灌进表格或数据库都能用 - 关键词搜索加排序:
get_note_by_keyword()按关键词找笔记,支持按热度、时间排序,一眼定位话题下的头部内容 - 用户侧数据成体系:
get_user_info()拿主页资料,get_user_notes()拿发布列表,收藏列表、点赞列表也都有对应接口 - 多级评论全覆盖:
get_note_comments()抓一级评论,get_note_sub_comments()深挖楼中楼回复,完整还原讨论现场 - 不止会"读":点赞、收藏、关注、发评论等交互操作也有,登录支持二维码和手机号两种方式
🧭小红书数据采集工具适合谁:三类人对号入座
- 内容创作者和新媒体小编:用关键词搜索加热度排序扫一遍话题下的爆款笔记,哪个方向互动多一目了然,选题从此有据可依
- 电商选品和品牌运营:定期用
get_user_notes()拉竞品账号的发布列表,再交叉核对每篇的互动数据,对方的更新节奏和内容规律全进你自己的数据库 - 产品运营和口碑研究团队:把一级评论和子评论连起来分析,评论区里用户的真实原话,就是成本最低的市场调研
🪜小红书笔记数据采集:三步走到出结果
第一步:装依赖。三条命令搞定:
pip install xhs pip install playwright playwright install之所以要 playwright:网站对每个请求都会出几道"安全题"(也就是 x-s 签名),这个工具靠模拟真实浏览器替你作答,所以浏览器内核得先装好。
第二步:备好 Cookie。在小红书网页版登录,从开发者工具里复制 Cookie 填进脚本。a1、web_session、webId三个字段必须有,缺一个就像门禁卡少刷一道,门不会开。
第三步:跑示例看输出。打开 示例脚本,把里面的 cookie 换成你自己的,运行。屏幕上打印出一篇笔记的完整 JSON——标题、正文、点赞、收藏、评论数、图片链接——就算跑通了,数据已经在你手里。
🚧小红书数据爬取避坑:签名、多账号与合规边界
- 签名偶尔"不配合"是常态:示例脚本已内置重试循环,多试几次一般就好;若频繁失败,把浏览器加载后的等待时间适当调长一点,相当于让模拟浏览器先热热身再答题,详见 docs/basic.rst
- 多账号共用签名服务要统一 a1:把签名封装成独立服务(参考 example/basic_sign_server.py 或 xhs-api/ 里的 Docker 签名服务)时,所有账号 Cookie 中的 a1 字段必须保持一致,不然签名错误会一直报
- 控制请求频率:请求之间留足间隔,火力全开容易触发风控甚至 IP 封禁,细一点、慢一点才用得久
- 只取公开数据:项目出自个人学习用途,请只抓取公开可访问的内容,遵守相关法律法规与平台规则,不给目标网站施加压力
说到底,xhs 把签名、解析这些最磨人的环节收进了底层,你只管调接口、收 JSON。现在就pip install xhs装上,照着示例脚本跑一遍,昨天还在手抄的表格,今天就该由脚本自己干——这周的数据,别再浪费手指头了。
【免费下载链接】xhs基于小红书 Web 端进行的请求封装。https://reajason.github.io/xhs/项目地址: https://gitcode.com/gh_mirrors/xh/xhs
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考