Back to skills
extension
Category: Data & AnalyticsNo API key required

小红书评论采集与分析

小红书帖子评论采集与分析工具。根据指定搜索关键词和筛选规则,自动浏览搜索结果、进入帖子详情页提取评论,并按条件筛选后输出结构化数据。适用于市场调研、用户痛点收集、竞品分析等场景。当用户提供小红书搜索URL或关键词、并说明需要采集评论时触发此技能。

personAuthor: user_c20d139ahubcommunity

小红书评论采集与分析工具 (Xiaohongshu Comment Collector)

根据用户提供的小红书搜索 URL(或搜索关键词),自动浏览搜索结果列表、进入各帖子详情页、提取评论区内容,并按用户定义的筛选规则过滤评论,最后整理输出结构化数据(Markdown 文件)。

前置依赖

此技能依赖浏览器自动化能力。执行前必须先加载 agent-browser 技能(通过 Skill 工具调用 agent-browser),获取浏览器操作工具(如 browser_navigatebrowser_snapshotbrowser_evaluatebrowser_click 等)。

使用方式

用户需要提供以下信息(至少提供第 1、2 项):

  1. 搜索 URL 或关键词 — 小红书搜索页面的完整 URL(如 https://www.xiaohongshu.com/search_result?keyword=XXX)或直接搜索关键词
  2. 筛选规则 — 明确说明需要筛选什么样的评论(例如:"评论描述的是律师办案过程中的痛点,且该痛点可以通过 AI 技术来解决")
  3. 帖子数量(可选,默认检查搜索结果页前 15 个帖子)— 用户可指定最多查看多少个帖子
  4. 输出格式(可选,默认输出 Markdown 文件)— 可指定 Markdown / 表格 / JSON / 报告

执行流程

Step 1: 打开搜索结果页面

  • 使用浏览器工具打开用户提供的小红书搜索 URL
  • 如果用户只提供了关键词,构造搜索 URL:https://www.xiaohongshu.com/search_result?keyword={URL编码后的关键词}
  • 等待页面加载完成(小红书可能需要登录,需提示用户确认已登录状态)
  • 捕获页面快照,确认搜索结果的帖子列表已正确显示

Step 2: 浏览搜索结果列表

  • 滚动页面并获取完整快照,记录所有可见帖子的标题和作者
  • 根据用户指定的帖子数量(默认前 15 个),确定需要查看的帖子列表
  • 注意:搜索结果页顶部可能有「点点 AI」AI 总结模块,不要错过其内容,如有则一并记录

Step 3: 逐个进入帖子查看评论

对每个需要查看的帖子:

  1. 将帖子滚动到可见区域,然后点击进入帖子详情页
  2. 等待页面完全加载
  3. 使用 browser_evaluate 提取页面完整文本内容(document.body.innerText
  4. 从文本中解析出:
    • 帖子标题与内容 — 发帖人的正文描述
    • 评论列表 — 每个评论的用户名和评论内容
  5. 根据用户定义的筛选规则,逐条判断每条评论是否满足条件
  6. 将符合条件的评论记录到汇总数据中
  7. 返回搜索结果页面(使用 browser_navigate 回到搜索 URL)

Step 4: 数据整理与输出

  • 将收集到的有效评论按帖子分组整理
  • 每条评论需要包含:
    • 来源帖子名称
    • 评论者用户名
    • 评论原文
    • 匹配的痛点描述
    • 对应的解决方案建议(可选分析)
  • 输出为 Markdown 文件,保存到用户的工作区
  • 输出模板参考 references/output_template.md

Step 5: 汇总分析(可选)

  • 如果数据量足够,在文件末尾增加汇总表格
  • 汇总维度按痛点的类别分类,展示每个类别下收集到的评论数量和典型示例

注意事项

  1. 登录状态:小红书页面需要用户已登录才能查看搜索内容和评论。在执行前应确认用户已在浏览器中登录小红书。
  2. 页面动态加载:搜索结果和评论可能是动态加载的,如第一次快照未显示完整列表,需要滚动或等待后再次获取快照。
  3. 反爬机制:频繁操作可能触发小红书的反爬机制。如遇到「当前笔记暂时无法浏览」或 404 页面,跳过该帖子继续处理下一个。
  4. 广告/无关结果:搜索结果中可能混入广告,根据帖子标题判断是否相关,不相关的跳过。
  5. AI 总结内容:小红书搜索页有时会显示「点点 AI」的 AI 总结(对搜索结果的主题归纳),这部分也包含有价值的行业洞察,建议一并记录。
  6. 评论数量限制:部分帖子评论较多(如 1000+),快照可能只显示部分热门评论,在输出中注明。
  7. 按条件过滤:严格按用户定义的筛选规则过滤评论,不满足条件的评论不应计入最终结果。
  8. 操作间隔:在帖子之间切换时适当等待(1-2 秒),避免触发反爬机制。
  9. 评论滚动加载:进入帖子详情页后,评论区可能需要向下滚动才能加载更多评论。建议至少滚动 2-3 次以获取更多评论数据。

示例输出结构

输出文件的完整模板见 references/output_template.md。核心结构如下:

  • 标题与元信息(搜索关键词、收集日期、筛选规则)
  • 按帖子分组的评论数据(表格形式)
  • 汇总:痛点分类 × 解决方向对应表