公益行业调研数据规则
目的
对公益行业调研报告中的所有数据点执行系统性校验,确保每个数字有据可查、口径清晰、时效明确,报告内部无数据矛盾,逻辑推理严谨无误。
适用场景
收到包含以下触发词的请求时激活本技能:
- "公益数据校验" / "帮我执行数据校验" / "数据校验"
- "数据靠谱吗" / "数字有没有问题" / "帮我核查数据"
- "事实核查" / "数据验证" / "数据可信度" / "数据校准"
- "验证数据" / "多重校验" / "数据来源可靠吗"
仅适用于公益行业调研报告。若用户提交的是其他行业报告,提示"本技能专为公益行业设计,其他行业校验逻辑可能不同,是否继续?"
使用方式
方式一:直接粘贴报告内容 把报告全文或关键章节粘贴进对话,说"帮我做数据校验"。
方式二:提供文件路径 说"校验 output/xxx.md 里的数据",先读取文件再执行。
方式三:指定校验范围 说"只校验第三章的数据"或"重点校验项目规模数据",可缩小范围。
执行流程(七层校验逻辑)
收到校验任务时,按以下七层依次执行。每层详细方法论见 references/verification-methodology.md。
第一层:提取与分类
从报告文本中提取所有带数字的陈述句,按四类归档:
| 类型 | 特征 | 示例 | |------|------|------| | A. 宏观行业数据 | 政府/权威机构发布的全国性统计 | 全国基金会9867家、捐赠总额1324亿 | | B. 项目规模数据 | 机构自述的覆盖规模、受益人数 | 希望工程20195所、美丽中国3800人 | | C. 比例/估算数据 | 占比、增速、倍数等推算值 | 前5%掌握69%、同比下降12.3% | | D. 判断性数据 | 支撑分析判断的引用数据 | 留守儿童697万、抑郁率21.5% |
提取范围包括正文、表格、脚注、图表数值标注。图表提取规则详见方法论。
效率优化:对同一概念的多处出现进行预聚类,仅对组内首次出现执行完整搜索验证,其余位置继承验证状态。优先校验核心结论数据,辅助数据可延后。
输出:数据点清单,每行包含「原文句子 / 数据值 / 报告中标注的来源 / 数据类别(A/B/C/D)」
第二层:三源交叉验证
每个数据点至少找2个独立来源(来源A=报告原标注来源,来源B=搜索找到的独立来源,来源C=第三方佐证)。
关键规则:
- 独立性判断:检查两来源是否引用同一中间来源、发布时间先后、是否有转引标记、数据精确度是否异常一致、来源性质是否不同。≥2项非独立→⚠️单一来源;≥3项独立→✅
- 分档容忍:比例类≤5% / 大额绝对量≤2% / 小额绝对量≤3% / 整数±2% / 默认5%
- B类对冲:机构自述数据优先找第三方评估(FTI/民政部年检/独立审计),仅有机构自述→⚠️机构自述(未经独立核实)
- 来源失败预案:付费墙→搜新闻稿摘要;链接失效→搜镜像/快照;PDF下架→Wayback Machine;重定向→查ISBN编目
第三层:口径审查(核心)
数字本身对不代表引用对。必须核查五个维度:
- 统计口径:全行业还是子集?
- 时间口径:数据属于哪一年?
- 单位口径:人次还是人数?万元还是亿元?省还是地级市?
- 范围口径:覆盖范围与报告使用语境是否匹配?
- 采集方法口径:用什么量表?抽样方式?样本量?调查时间?定义边界?
统计效力评判(针对D类数据):样本量N≥384、概率抽样、覆盖≥3省份、加权处理——四项硬规则,不合格须降级标注。
第四层:可计算性验证
能从公开数据推算的,直接算一遍:
- 占比 = 分子 ÷ 分母
- 增速 = (新值 - 旧值) ÷ 旧值,核查起止时间节点
- 加总 = 各省/各机构累加,核查是否重复计算
通胀调整:跨年金额对比(≥2年跨度)须标注CPI影响,建议补充实际值。
第五层:时效性检查
每个数据点标注:数据来源年份、是否有更新版本、是否属于历史快照型数据。
链接有效性检查:同步检查引用链接状态(404/重定向/二手转载)。
第六层:跨章节内部一致性扫描
在第一层提取完成后即可执行,不依赖搜索:
- 概念聚类:将所有数据点按"同一概念"归类
- 组内比对:比对不同出现位置的数据值
- 矛盾分级:硬矛盾(差异>2%)/ 软矛盾(精度不一致)/ 口径矛盾(不同口径混用)
- 输出一致性扫描结果单
第七层:逻辑归因与表述严谨性校验
不依赖外部数据,仅针对报告内部推理链条:
- 7.1 归因谬误检测:扫描因果连接词,判断证据类型(仅时间先后→后此谬误 / 仅相关→混淆因果 / 有机制且排除混淆→✅ / 辛普森悖论→📝)
- 7.2 定性表述与数据匹配度:扫描"显著/大幅/爆发/稳步/小幅"等强程度定性词,检查附近是否有具体数字支撑。若使用强程度定性词但缺乏量化依据,标注⚠️缺乏量化依据;若有数字支撑,不做额外判断
交付物
1. 校验清单表
每行格式:
| # | 数据点(原文) | 类别 | 报告原值 | 验证值 | 验证来源 | 状态 | 备注(口径/修正说明) |
六态:
- ✅ 已确认:2个以上独立来源一致,口径明确
- 📝 需修正:数据有误或口径混用,备注列给出修正后表达
- ⚠️ 单一来源:仅1个来源,无法交叉验证
- ⚠️ 来源缺失:完全找不到来源,建议降级或删除
- ⚠️ 机构自述(未经独立核实):仅机构官网/年报自述,无第三方对冲来源
- ➖ 无需验证:纯序号/年份区间/无实质含义编号
2. 修正建议清单
针对所有📝条目,给出:
- 原表达(报告原文)
- 修正表达(含来源标注和口径说明)
- 修正操作建议(搜索词、操作路径)
3. 一致性扫描结果单
硬矛盾:X组 | 软矛盾:X组 | 口径矛盾:X组
详细列表:1. [概念名] — 硬矛盾 — 位置A值 vs 位置B值 — 建议统一为XX
4. 校验摘要
总数据点:X个
✅ 已确认:X个(X%) | 📝 需修正:X个 | ⚠️ 单一来源:X个 | ⚠️ 来源缺失:X个 | ⚠️ 机构自述:X个
报告内部一致性:硬矛盾 X组 | 软矛盾 X组 | 口径矛盾 X组
逻辑归因审查:归因谬误 X条 | 定性过当 X条 | 统计存疑 X条
Top 3-5 优先修正项(按严重度排序:核心结论 > 支撑数据 > 辅助说明)
输出示例(截选)
以下为对一份虚构公益行业调研报告执行七层校验后的输出示例,供首次使用者直观了解交付物格式。
校验清单表(截选前5条)
| # | 数据点(原文) | 类别 | 报告原值 | 验证值 | 验证来源 | 状态 | 备注 | |---|---------------|------|---------|--------|---------|------|------| | 1 | "截至2024年底,全国基金会9867家" | A | 9867家 | 9867家 | 民政部《2024年社会服务发展统计公报》 | ✅ | 口径一致,年份一致 | | 2 | "企业捐赠占捐赠总额的74.21%" | C | 74.21% | 73.8% | 《中国慈善捐赠2024年报》 | ✅ | 差异0.4个百分点,在容忍范围内 | | 3 | "美丽中国累计派出3800名支教老师" | B | 3800名 | 3800名(机构自述) | 美丽中国官网(无第三方对冲来源) | ⚠️ 机构自述 | 未找到FTI/民政部年检/独立审计等第三方核实 | | 4 | "乡村青少年抑郁检出率21.5%" | D | 21.5% | 21.5% | 张某某《乡村青少年心理健康调查》2023(PHQ-9≥10分,整群抽样5省12县N=3840加权) | ✅ | 采集方法完整,统计效力达标 | | 5 | "留守儿童约4000万" | D | ~4000万 | 697万(窄口径)/ 4000万(宽口径) | 民政部2024(窄)/ 联合国儿基会(宽) | 📝 需修正 | 宽窄口径混用,见口径陷阱四 |
一致性扫描结果单
硬矛盾:2组 | 软矛盾:1组 | 口径矛盾:1组
详细列表:
1. [全国基金会数量] — 软矛盾 — 第三章9867家 vs 第五章"约1万家" — 建议统一标注年份和精确值
2. [留守儿童数量] — 口径矛盾 — 第二章697万 vs 第六章"约4000万" — 须标注窄口径/宽口径来说明差异
3. [企业捐赠占比] — 硬矛盾 — 第二章74.21% vs 第四章70% — 来源不同(捐赠年报 vs 统计公报),需统一
4. [教育公益项目覆盖率] — 硬矛盾 — 第三章"覆盖65%县域" vs 第六章"覆盖58%县域" — 编辑残留,建议统一
校验摘要
总数据点:47个
✅ 已确认:31个(66%) | 📝 需修正:5个 | ⚠️ 单一来源:7个 | ⚠️ 来源缺失:2个 | ⚠️ 机构自述:2个
报告内部一致性:硬矛盾 2组 | 软矛盾 1组 | 口径矛盾 1组
逻辑归因审查:归因谬误 2条 | 定性过当 3条
Top 5 优先修正项(按严重度排序):
1. 【核心结论】留守儿童数量口径混用(697万 vs 4000万),两处均未标注口径差异
2. 【核心结论】基金会净资产集中度全行业口径用于教育议题,读者易误解为教育类基金会数据
3. 【支撑数据】两处基金会数量不一致(9867家 vs "约1万家"),建议统一标注
4. 【支撑数据】企业捐赠占比两处不同(74.21% vs 70%),来源不同建议统一
5. 【辅助说明】"捐赠额四年增长30%"未剔除CPI,实际购买力增长约18%
以上示例中的数据均为虚构,用于演示输出格式。
口径陷阱速查
公益行业调研报告中常见的十四类口径陷阱,执行第三层时需逐条对照。完整内容见 references/calibration-traps.md:
- 受益人次≠受益人数
- 全行业数据用于子行业
- 均值掩盖分布
- 窄口径vs宽口径混用
- 累计/年均/单年增速混用
- 数据快照缺乏时间标注
- 推算值当实测值呈现
- 来源链条断裂(二手引用)
- 采集方法盲区(量表/抽样/样本量)
- 跨章节数据不一致
- 机构自述数据的利益相关方偏差
- 样本量不足/非概率抽样(陷阱9深化场景)
- 把相关当因果(归因谬误)
- 跨期金额忽略通胀
权威数据源
校验时优先使用的权威数据源目录见 references/authoritative-sources.md,包含:
- 全国性统计(A类首选来源)
- 行业研究报告(A/C/D类补充来源)
- 头部公益机构官方数据(B类主要来源)
- B类数据对冲来源(第三方独立核实)
- 搜索建议词模板
Resources
references/verification-methodology.md
七层校验逻辑的设计原因、每层操作细则、搜索策略、分档容忍操作示例、来源独立性判断流程、统计效力评判详解、通胀调整示例、一致性扫描详解、归因谬误检测操作流程、定性表述匹配度操作流程。
references/calibration-traps.md
十四类高频口径陷阱的完整文档:每类含本质、识别方法、典型场景、修正模板。执行第三层口径审查时逐条对照。
references/authoritative-sources.md
权威数据源目录:全国性统计来源、行业研究报告、机构官方数据、B类对冲来源、搜索建议词。
微信扫一扫