返回 Skill 列表
extension
分类: 数据与分析无需 API Key

comment_analyze

传播内容评论分析。当用户需要分析社交媒体(抖音/小红书/视频号)传播内容的评论区时使用——用 ego-lite 爬取评论并按固定表格输出,剔除无关评论后做主题概括(含条数)、高频词云图、情感倾向分析、特定主题传播效果分析,并输出负面评论清单供人工复核。触发词:评论分析、分析评论、评论词云、评论情感、评论主题、传播效果分析、负面评论复核。

person作者: user_cfd5a9f0hubcommunity

传播内容评论分析(comment-analysis)

把「爬评论 → 分析评论 → 负面复核」三步流程固化为一条流水线,产出可进传播复盘材料的结构化产物。2026-08-19 经腾讯会议录音笔战役 812 条评论实战验证。

流水线总览

| 步骤 | 动作 | 产物 | |------|------|------| | 1 爬取 | 调 ego-social-scraper skill 逐条爬评论 | 每条 *.json/.csv + 固定表格汇总 | | 2 分析 | 跑 scripts/comment_analyze.py | 主题分布/词云/情感/负面清单 | | 3 复核 | 负面清单预分类交用户人工复核 | 复核后真实负面率,回写报告 |

步骤 1:ego-lite 爬取评论

加载 ego-social-scraper skill 并严格按其流程执行(环境验证 → heredoc 跑模板 → 逐条落盘)。要点:

  • ego-browser 连不上 bootstrap 时,请用户在真实终端跑 ego-browser nodejs -e "console.log('hi')" 点 Allow 重建授权。
  • outDir 必须写绝对路径——process.cwd() 在 ego 沙箱解析成只读 //,写盘报 EROFS。
  • 小红书有反爬,逐条串行抓,勿并发;抖音互动量(赞/评/藏/转)网页端基本不可得(选择器失效+接口反爬),标「不可得」不补 0;评论正文正常抓。
  • 固定表格输出:全部爬完后汇总为一张表——# / 平台 / 笔记或视频ID / 点赞 / 评论 / 收藏 / 转发 / 抓取评论数 / 页面声明数 / 是否未抓全,另合并全部评论为单个 CSV(平台/链接/作者/评论内容/点赞/时间)。拿不到的量一律写「不可得」。

步骤 2:评论分析(清洗→主题→词云→情感)

运行主脚本(用预装依赖的 venv 解释器):

/Users/hanz/.workbuddy/binaries/python/envs/default/bin/python \
  /Users/hanz/.workbuddy/skills/comment-analysis/scripts/comment_analyze.py \
  --inputs <抓取产物1.json> <抓取产物2.json> ... \
  --outdir <输出目录> \
  --brand-words 品牌名,产品名,产品别名 \
  --title <项目名>
  • --brand-words 必传本 campaign 的品牌/产品词(如 腾讯,腾讯会议,录音笔,WorkBuddy),否则品牌层词云和"产品植入识别"主题不准。
  • 自定义主题词库:--theme-lib <json>,格式见 references/theme-keywords.md;归类覆盖率目标 ≥60%,「其他」过高时抽样未分类评论补词。
  • 脚本一次性产出:comments_classified.json(带主题+情感标签)、comments_negative.json(负面清单)、word_freq_top50.jsonword_freq_brand.json、三层词云(词云图_全量.png/词云图_职场品牌.png/词云图_品牌.png),stdout 打印全部统计 JSON。
  • 词云三层用途:全量=整体话题结构;职场品牌=复盘材料主图;品牌=品牌信息被记住程度。
  • 清洗口径:剔空评论、纯表情、≤1字极短、达人统一回复"谢谢"类——剔除数如实报告。
  • 词云字体用 /System/Library/Fonts/Hiragino Sans GB.ttc勿用 PingFang.ttc(wordcloud 报 OSError cannot open resource)。

随后按 references/report-framework.md 的骨架写分析报告 md(主题概括+条数 → 词云 → 情感 → 传播效果五段式 → 数据缺口),用 present_files 交付报告+词云图。

步骤 3:负面评论人工复核(必经环节,不得跳过)

算法情感分析在玩梗语境下会大量误判("不好啦,workbuddy把纪要发给曹老板了"=调侃好评被误判负面),必须:

  1. comments_negative.json 全部列出(编号+原文)。
  2. 预分「疑似误判(玩梗/调侃)」「疑似真实负面」两类,各附一句理由;校准模式见 references/sentiment-dict.md
  3. 交用户复核;拿到复核结论后回写报告情感章节,算法口径与人工口径并列呈现,真实负面率以人工复核为准。

数据真实性铁律

  • 互动量/播放量/声明数拿不到写「不可得」,绝不补 0、绝不编造;差额标 truncated。
  • 主题/情感占比注明"算法归类+人工校准"属性。
  • 对外口径内容先与用户对齐再落地。

相关文件

  • scripts/comment_analyze.py —— 分析主脚本(清洗/主题/词云/情感/落盘)
  • references/theme-keywords.md —— 主题词库与自定义方法
  • references/sentiment-dict.md —— 情感词典与玩梗误判校准模式
  • references/report-framework.md —— 分析报告骨架(五段式传播效果)
  • 依赖 skill:ego-social-scraper(评论爬取)