电商评论分析(Shop Comment Analysis)
Overview
把一份原始电商评论数据,按固定六步流程,转化为「可筛选编辑的 Excel 母表 + 可视化 HTML 分析报告」。 全流程贯穿三条铁律:
- 先质检、后处理——第一步只做数据质量检查并给出排除规则,暂停等待用户确认后再动数据。
- 只信真实评论——所有分类、归因、结论必须来自评论原文,不臆测未明确表达的信息。
- 可继续编辑——分类母表带下拉校验,报告数据可被复核。
When to use
用户给出一份电商评论数据(Excel/CSV),并提出以下任一类意图时触发:
- 做评论/口碑/用户评价分析,不知道从何下手
- 要结构化分类、情感分析、人群/场景洞察
- 要找产品口碑来源与优化机会
- 要识别用户心里的竞品与差异化切入点
- 要产出可视化《用户评价分析报告》及可编辑母表
Resources(本 skill 自带)
scripts/quality_check.py— 第一步自动质检,输出《数据质量检查表》+quality_report.jsonscripts/build_master_table.py— 第二步把分类结果写成带下拉校验的 Excel 母表scripts/build_report.py— 第六步把全流程结论渲染为可视化 HTML 报告references/classification_schema.md— 第二~五步的字段口径、分类/情感标准、输出表结构references/report_spec.md— 第六步报告 JSON 结构与脚本调用方式
执行各步前,按需读取对应 references 以确保口径一致。
工作流程
第一步:数据准备 — 质量检查(先质检,等确认)
不要立即分析或处理用户上传的数据。先对原始数据做质量检查:
- 运行质检脚本(自动识别中文字段):
python scripts/quality_check.py <输入.xlsx|csv> --out <输出目录> - 脚本会输出《数据质量检查表》,覆盖:原始总行数、有效评论数、字段完整性、空评论/默认评价、疑似串品、时间/规格混字段检测,以及建议排除规则。
- 将检查表与建议排除规则呈现给用户,并明确说明「有效样本口径」。
- 暂停,等待用户确认排除规则后,再进入第二步。 用户可能调整排除范围(如保留某些默认评价)。
若质检脚本未能识别到关键字段(如 评论内容/时间/规格 缺失),先用 Grep/Read 确认表头,必要时请用户说明列含义,不要强行推断。
第二步:结构化分类 — 生成 Excel 母表
基于用户确认的有效样本,对每条评论做结构化分类(口径见 references/classification_schema.md):
- 为每条有效评论产出字段:评论内容|主分类|多标签分类|情感倾向|判断依据|评论时间|已购规格|评论人
- 主分类单选(质量/价格/包装/使用体验/售后服务/其他);多标签用分号分隔可多选;情感倾向按标准判定,无法判断归入「其他」。
- 把分类结果整理为 CSV 或 JSON(字段名见
references/classification_schema.md的别名表,中英文皆可)。 - 调用脚本生成可继续编辑的母表:
母表含「主分类/情感倾向」下拉校验、冻结首行、自动换行、筛选器。交付该 xlsx 给用户。python scripts/build_master_table.py <分类结果.csv|json> --out 评价分析母表.xlsx
第三步:人群与场景验证 — 谁在买、为什么买
基于母表,做买家身份与使用场景分析(口径见 references):
- 买家身份:从评论识别身份并归类统计,用饼图呈现数量与占比;无法判断归入「其他」。
- 使用场景:提炼主要场景,用条形图统计频次(一条评论可含多场景,总频次可大于评论数);无法明确归入「其他」。
- 图表须含清晰标题、数量与占比标注。
- 总结:最主要购买人群是谁?最高频使用场景是什么?
第四步:评论归因 — 口碑来源与优化机会
- 正面口碑来源:筛选「正面+混合」评论,统计最常提到的满意因素(满意因素|出现频次|占有效样本比例|代表性原话|说明的产品优势|可放大的品牌表达)。
- 负面问题归因:筛选「负面+混合」评论,提取高频负面关键词(负面关键词|出现频次|占问题评论比例|代表性原话|用户真实痛点|可优化机会点)。
- 可执行优化清单:核心口碑驱动;最需优先解决的负面问题(区分个别反馈 vs 高频趋势);最值得优化的三个方向。
- 每个关键结论尽量匹配代表性原话;不放大低频个别反馈,不过度推断。
第五步:参照物识别 — 用户拿谁跟你比
- 从评论识别参照物:明确竞品品牌、模糊竞品("别家/其他牌子")、替代产品、本产品旧版/旧规格、同店其他 SKU/价格档。
- 统计提及频次,列出 Top 竞品与代表原话;分析对比维度(价格/效果/口感/包装/体验/复购/服务…)与用户倾向(更认可谁、原因)。
- 输出表格:参照物类型|名称或描述|提及频次|对比维度|代表原话|用户倾向|差异化机会。
- 若未出现明确竞品品牌,直接写「未发现明确竞品品牌」,禁止编造品牌名。
第六步:生成可视化报告
- 汇总第二~五步结论为 JSON(结构见
references/report_spec.md)。 - 调用脚本渲染 HTML 报告:
python scripts/build_report.py analysis_result.json --out 用户评价分析报告.html - 报告含八节:执行摘要、分析口径、评论分类与情感分布、购买对象与使用场景、正面归因、负面归因、参照物分析、全局总结;所有图表标注样本量与占比。
- 同时交付第二步的 Excel 母表(可继续筛选编辑)。
注意事项
- 每一步的结论都需可追溯到真实评论原文;低频个别反馈不渲染为趋势。
- 第一步的暂停是硬性要求:未获用户确认前,不写任何处理后的数据文件。
- 图表中文显示依赖运行环境字体;HTML 报告使用 Chart.js CDN,离线打开时图表可能不渲染(数据表格仍可读)。
Scan to join WeChat group