传播内容评论分析(comment-analysis)
把「爬评论 → 分析评论 → 负面复核」三步流程固化为一条流水线,产出可进传播复盘材料的结构化产物。2026-08-19 经腾讯会议录音笔战役 812 条评论实战验证。
流水线总览
| 步骤 | 动作 | 产物 |
|------|------|------|
| 1 爬取 | 调 ego-social-scraper skill 逐条爬评论 | 每条 *.json/.csv + 固定表格汇总 |
| 2 分析 | 跑 scripts/comment_analyze.py | 主题分布/词云/情感/负面清单 |
| 3 复核 | 负面清单预分类交用户人工复核 | 复核后真实负面率,回写报告 |
步骤 1:ego-lite 爬取评论
加载 ego-social-scraper skill 并严格按其流程执行(环境验证 → heredoc 跑模板 → 逐条落盘)。要点:
- ego-browser 连不上 bootstrap 时,请用户在真实终端跑
ego-browser nodejs -e "console.log('hi')"点 Allow 重建授权。 outDir必须写绝对路径——process.cwd()在 ego 沙箱解析成只读//,写盘报 EROFS。- 小红书有反爬,逐条串行抓,勿并发;抖音互动量(赞/评/藏/转)网页端基本不可得(选择器失效+接口反爬),标「不可得」不补 0;评论正文正常抓。
- 固定表格输出:全部爬完后汇总为一张表——
# / 平台 / 笔记或视频ID / 点赞 / 评论 / 收藏 / 转发 / 抓取评论数 / 页面声明数 / 是否未抓全,另合并全部评论为单个 CSV(平台/链接/作者/评论内容/点赞/时间)。拿不到的量一律写「不可得」。
步骤 2:评论分析(清洗→主题→词云→情感)
运行主脚本(用预装依赖的 venv 解释器):
/Users/hanz/.workbuddy/binaries/python/envs/default/bin/python \
/Users/hanz/.workbuddy/skills/comment-analysis/scripts/comment_analyze.py \
--inputs <抓取产物1.json> <抓取产物2.json> ... \
--outdir <输出目录> \
--brand-words 品牌名,产品名,产品别名 \
--title <项目名>
--brand-words必传本 campaign 的品牌/产品词(如腾讯,腾讯会议,录音笔,WorkBuddy),否则品牌层词云和"产品植入识别"主题不准。- 自定义主题词库:
--theme-lib <json>,格式见references/theme-keywords.md;归类覆盖率目标 ≥60%,「其他」过高时抽样未分类评论补词。 - 脚本一次性产出:
comments_classified.json(带主题+情感标签)、comments_negative.json(负面清单)、word_freq_top50.json、word_freq_brand.json、三层词云(词云图_全量.png/词云图_职场品牌.png/词云图_品牌.png),stdout 打印全部统计 JSON。 - 词云三层用途:全量=整体话题结构;职场品牌=复盘材料主图;品牌=品牌信息被记住程度。
- 清洗口径:剔空评论、纯表情、≤1字极短、达人统一回复"谢谢"类——剔除数如实报告。
- 词云字体用
/System/Library/Fonts/Hiragino Sans GB.ttc;勿用 PingFang.ttc(wordcloud 报 OSError cannot open resource)。
随后按 references/report-framework.md 的骨架写分析报告 md(主题概括+条数 → 词云 → 情感 → 传播效果五段式 → 数据缺口),用 present_files 交付报告+词云图。
步骤 3:负面评论人工复核(必经环节,不得跳过)
算法情感分析在玩梗语境下会大量误判("不好啦,workbuddy把纪要发给曹老板了"=调侃好评被误判负面),必须:
- 把
comments_negative.json全部列出(编号+原文)。 - 预分「疑似误判(玩梗/调侃)」「疑似真实负面」两类,各附一句理由;校准模式见
references/sentiment-dict.md。 - 交用户复核;拿到复核结论后回写报告情感章节,算法口径与人工口径并列呈现,真实负面率以人工复核为准。
数据真实性铁律
- 互动量/播放量/声明数拿不到写「不可得」,绝不补 0、绝不编造;差额标 truncated。
- 主题/情感占比注明"算法归类+人工校准"属性。
- 对外口径内容先与用户对齐再落地。
相关文件
scripts/comment_analyze.py—— 分析主脚本(清洗/主题/词云/情感/落盘)references/theme-keywords.md—— 主题词库与自定义方法references/sentiment-dict.md—— 情感词典与玩梗误判校准模式references/report-framework.md—— 分析报告骨架(五段式传播效果)- 依赖 skill:
ego-social-scraper(评论爬取)
微信扫一扫