Consumption Data Report (节假日消费数据报告)
Overview
This skill produces a four-deliverable package (四件套) for holiday consumption data reports, with data verification built in before the report is written -- never after:
- 消费数据集 -- structured dataset file (CSV) where every data point carries its source metadata
- 消费数据报告 -- single-file HTML report in Economist/FT newspaper style
- 数据真实性说明 -- single-file HTML provenance document, tracing every figure to its source with clickable URLs
- 首页 (index.html) -- single-file HTML landing page that serves as a portal, featuring report headline, provenance introduction, and CSV preview with links to all three deliverables; designed for EdgeOne deployment
Core methodology: data first, report last (先建数据集后出报告). Any data problem is caught before the report exists, so the report never needs rework for sourcing reasons.
Parameter Resolution (参数确认 · 必先于一切采集)
本技能在动手采集/写报告之前,必须确定三项参数:[年份] [节日] [地域(全国/城市)]。这三项驱动后续全部检索、口径与交付形态。
解析顺序
- 从用户对话中提取三项。若用户已明确给出(如"2026 五一 成都消费报告"),直接使用。
- 应用默认值(仅当用户未提供时):
- [年份] → 取当前系统日期的年份(如运行于 2026-08-20,则默认 2026)。
- [地域] → 默认
全国;若用户给出城市名(如"成都""上海""县域-某某县"),则 地域 = 该城市,进入城市模式。 - [节日] → 若用户明确给出节日名则采用;否则取当前系统日期所在节假日(依据
references/holiday-config.md各节假日日期范围判定,如 2026-08-20 不在任何假期窗口 → 无法默认)。
- 缺失处理(关键 · 必须提示):
- 若 [节日] 无法从对话获取,且当前日期不在任何节假日窗口内 → 必须主动提示用户补充 [年份][节日][地域],不得臆造节日。
- 使用
AskUserQuestion(或自然语言提问)向用户确认三项,并给出建议默认值:年份=今年、地域=全国、节日=当前节日或提供可选节日列表。 - 仅当三项全部明确(用户已给,或已用默认值且用户未反驳)后,才进入阶段一采集。
- 回显确认:进入采集前,向用户一句话回显解析结果,例如:"将为您生成 [2026][十一][全国] 消费数据报告(四件套)" 或 "-[2026][端午][成都] 城市视角报告(需先有/生成全国 SSOT 基准)",给用户一次纠正机会。
地域路由(决定走哪条流水线)
- 地域 = 全国 → 仅执行全国五阶段(阶段一至五)→ 产出四件套。
- 地域 = 具体城市 → 先确保存在/生成全国 SSOT 数据集(本次运行生成,或读取用户既有的全国数据集),再叠加城市层(30 字段 + 勾稽)→ 产出城市五件套(引用全国数据集,不重造全国数字)。详见下方「城市维度扩展」与
references/*-city.md。 - 地域 = 全国 + 城市(用户要两者)→ 先全国(四件套)后城市(五件套),共用同一 SSOT。
解析示例
| 用户原话 | 解析结果 | 模式 | | --- | --- | --- | | "做个五一消费报告" | 年份=2026(今年) · 节日=五一 · 地域=全国 | 全国四件套,直接执行 | | "成都端午怎么样" | 年份=2026 · 节日=端午 · 地域=成都 | 城市模式(需全国 SSOT) | | "消费报告"(运行于 2026-08-20,非假期) | 节日缺失且当前非假期 → 提示用户选年份/节日/地域 | 暂停,待补参数 | | "2025 春节 全国" | 年份=2025 · 节日=春节 · 地域=全国 | 全国四件套 |
默认值的目的是"少问多跑";但当任何一项(尤其节日)无法可靠默认时,宁可多问一次,不可臆造,以守住数据可信底线。
When to Use
Trigger when the user asks to produce a holiday consumption / travel spending data report for any year and any Chinese holiday, including:
| 节假日 | 典型时间范围 | 假期天数 | | --- | --- | --- | | 春节假期 | 除夕至初七 | 约 8 天 | | 端午假期 | 端午前后 | 3 天 | | 五一假期 | 5 月 1 日前后 | 5 天 | | 暑假 | 7-8 月 | 约 62 天 | | 中秋假期 | 中秋前后 | 3 天 | | 十一假期 | 10 月 1-7 日 | 7 天 |
Also use when the user asks to re-run the pipeline for a new year/holiday combination.
节假日配置详见 references/holiday-config.md.
Out of Scope / 不适用场景(边界,请勿越界)
本技能专为中国节假日消费数据报告设计。以下情形不适用,应明确告知用户并建议改用其他方案,而非强行套用本流程:
- 非中国节假日:如圣诞节、万圣节、感恩节、黑色星期五等境外节日。其消费结构与数据来源体系与中国节假日差异巨大,holiday-config 未覆盖,套用会产生错配。
- 无公开数据来源:目标节假日/年度过于冷门、或所涉消费领域几乎无联网公开数据。本流程的核心前提是"数据可溯源",无源则无法生成合规数据集与真实性说明。
- 实时/秒级数据需求:本流程产出的是周期性报告(节假日结束后或期间阶段性发布),不提供实时刷新、动态仪表盘或流数据监控。
- 非消费主题:如纯人口统计、气象灾害评估、医疗健康报告等与本主题无关的分析需求。
- 需原创调研/抽样调查:本流程依赖既有公开来源(政府公告、媒体、研报),不执行问卷、访谈、实地抽样等一手调研。
- 跨境/全球消费对比:聚焦中国节假日境内外消费,不做多国平行对比报告(除非作为单点引述)。
边界判定原则:凡涉及"数据必须可溯源 + 中国节假日 + 消费主题 + 周期性产出"四要素任一不满足,即属本技能不适用范围。
Deliverables (交付物 · 按地域分两套)
全国模式(地域 = 全国)→ 四件套(数据集为 L1+L2 双轨)
| # | 交付物 | 格式 | 用途 |
| --- | --- | --- | --- |
| 1 | 数据集(如 2026年暑假消费数据集.csv) | CSV(22 字段) | L1 结构化层:数据台账,每条数据含来源元数据,纵向可比 |
| 1b | 现象素材库(现象素材库.json + .md) | JSON + Markdown | L2 非结构化层:该节日时点特有现象/榜单/区间/定性/政策素材,含来源 URL(详见 references/data-architecture.md) |
| 2 | 数据报告(消费数据报告.html) | 单文件 HTML | 面向读者阅读,经济学人/FT 风格(L1 撑纵向, L2 撑本期现象) |
| 3 | 数据真实性说明(数据真实性说明.html) | 单文件 HTML | 逐条溯源与质量声明(含 L2 现象素材清单) |
| 4 | 首页(index.html) | 单文件 HTML | 门户入口,收录三件套精华,可发布到 EdgeOne |
双轨原则:L1 保延续性(22 字段口径治理),L2 保时点丰度(榜单/区间/定性/政策全保留,不因入不了 22 字段而被丢弃)。二者分栏呈现、不混同;L2 素材进入正文须标"现象级/定性素材"。详见
references/data-architecture.md。
可选第 6 交付物 · 跨年纵向趋势专题报告:当用户需要「从 2023 到 2026 看未来」类多年度趋势专题时,从 SSOT 数据集(多年份 CSV)聚合产出
节假日[主题]报告_从[起始年]到[终止年]看未来.html+ 同名.md(框架见references/templates.md第 7 节)。历史年份数据优先取自实时拉取的.baseline-cache/(上游 atomgit 仓库g_ww/holiday_data_reports),按references/historical-data-source.md做 17→22 适配与 canon 规范化后再聚合。
城市模式(地域 = 具体城市)→ 五件套
| # | 交付物 | 格式 | 用途 |
| --- | --- | --- | --- |
| 1 | 城市数据集([年度][节假日][城市]消费数据集.csv) | CSV(30 字段) | 城市台账,含城市 8 字段 + 勾稽元数据 |
| 2 | 城市消费数据报告(城市消费数据报告.html) | 单文件 HTML(图文) | 城市视角主报告,含勾稽总表与可视化 |
| 3 | 数据真实性说明(数据真实性说明.html) | 单文件 HTML | 逐条溯源 + 勾稽校验与覆盖率声明 |
| 4 | 首页(index.html) | 单文件 HTML | 门户入口,收录四件套精华,可发 EdgeOne |
| 5 | (勾稽基准)全国数据集 | CSV(22 字段) | 来自全国模式,城市层引用不重造 |
全国四件套由全国模式产出(或用户既有);城市模式在其之上叠加城市层。若用户仅要城市剖面,仍须先确认/生成或读取全国数据集作为勾稽基准(详见「城市维度扩展」)。城市模式同样产出 L2 现象素材库(城市视角榜单/现象,存
现象素材库-city.json/.md)。
可选第 6 交付物 · 跨年纵向趋势专题报告:当用户需要「从 2023 到 2026 看未来」类多年度趋势专题时,从 SSOT 数据集(多年份 CSV)聚合产出
节假日[主题]报告_从[起始年]到[终止年]看未来.html+ 同名.md(框架见templates.md第 7 节)。它消费既有四件套资产,不重复采集,是延续性方法论的进阶产出;历史年份数据优先取自实时拉取的.baseline-cache/(上游 atomgit 仓库),按references/historical-data-source.md适配与 canon 规范化后聚合。
Analysis Framework (分析主题框架)
方法论原则:提示词固化的是分析框架,不是分析结论。
固定分析维度 (8 项,采集前确定,构成报告栏目骨架)
下列维度为必采骨架;括注项为专家评估补全的系统性子维度,缺失须在报告中标注"本期暂无公开数据",不得留白或编凑。
- 游客画像:出游人次、客群结构(亲子/大学生/银发)、出行方式与时长变化
- 景区数据:门票政策、限流预约、热门景区接待量;必采子项:二消结构(餐饮/住宿/文创/游乐)拆解、承载率与限流方式、文博/演艺独立细分;出现"客流增速 vs 二消/门票收入增速"背离时须做悖论分析
- 目的地:国内热门城市与县域、出境目的地、入境客源国(边检口径,不同时段数据不聚合)
- 酒店:RevPAR/ADR/OCC 三件套(必填,缺失标"本期无权威来源")、各档次(奢华/高端/中端/经济)价格表现;必采子项:渠道结构(OTA/直营/会员 + 佣金率侵蚀)
- 旅行社:订单量、产品结构(跟团/小团/定制)
- 旅游行业平台:携程、去哪儿、同程、飞猪、途牛等(以数据可获取性为准,不强制全覆盖);C 级平台增速须标"该平台自身口径,非全市场"
- 交通出行:铁路、民航、公路、水路的客运量与同比;必采子项:公路"跨区域人员流动量"须与公共客运量分列标注(口径字典第三节)、城市交通(地铁/网约车/出租)、购票提前期等前瞻指标
- 政策与宏观:促消费政策、免签政策、社零与出行宏观数据;必采子项:消费分级维度(升级/平替/悦己/折扣/下沉)与品类颗粒度(餐饮/服饰/3C/文旅/生鲜);旅游总花费与商务部社零分列不可相加
探索性主题 (1 项,具体项目由数据决定)
热门新消费:不预设具体业态清单。入选标准(须同时满足,且须可被数据集机器校验):
- 量化显著性阈值(满足任一):
- 同比增速 ≥ 30%(A/B/C 级来源均须披露统计基数)
- 或绝对规模 ≥ 对应品类可观测量级(如平台 GMV ≥ 10 亿元、人次 ≥ 100 万)
- ≥2 个独立机构来源交叉印证:须是**≥2 个不同机构的 URL,且在数据集中同一主题项目互链**(同一"数据点/主题"行下出现 ≥2 条不同来源机构记录);仅 1 源或同源多 URL 一律不进报告主叙事,降级为"待核实"仅在真实性说明中单列。
- 平台 C 级约束:若来源为携程/同程/美团等平台,增速/规模须标注"该平台自身口径,非全市场",不得作为行业代表。
- 阶段二硬圈定:阶段二必须在数据集 CSV 中以独立行显式圈定入选项目(主题列标"新消费"或具体业态名),未圈定进数据集的项目,阶段四报告不得凭印象自建"新消费"章节(解决暑假散落问题)。
- 具备消费带动效应或社会关注度;数据不足的候选项目不得强行写入报告。
反模式警示:宣称"≥2 独立来源印证"但实际仅单源 C 级,属虚假交叉印证,违反零虚构原则——见反模式第 7 条。
Continuity Methodology (纵向延续性分析框架)
方法论原则:单期报告是「快照」,系列报告才是「资产」。节假日消费数据具有强延续性——去年同节、本年上期、上一周期预测,共同构成本期判断的坐标系。本技能把"延续性"作为与"口径治理"并列的核心方法论,而非可选装饰。
机制底座:所有预测须进预测台账(数据集
数据性质=预计+缺口标记=预判待回填+预测ID),下一报告期回填核验,形成"预测→实测→复盘→反哺"闭环(详见caliber-dictionary.md第六节与templates.md第 5/6 节)。
延续性四问(每期报告必答)
- 去年同期回顾(YoY):本节假日 vs 去年同节假日。核心指标(出游人次/总花费/人均)必须先归一为 per-day 或可比天数再比较——春节 7/8/8/9 天、十一 8/7/8/7 天的天数漂移,未折算的绝对量对比一律判为口径错误。判读须区分"增量来自天数/口径"还是"真实增长"。
- 本年上期回顾(同年内节奏):本节假日 vs 本年已发生的其他节假日(如十一 vs 五一/端午/暑假)。观察年内消费节奏、增速收敛斜率(报复性出游退潮后是否进入中低个位数稳态)。
- 上一周期预测复盘(忠实诚恳):读取上一报告期预测台账,逐条对比「预测值→实测值→偏差%→归因→判语」。偏差 > ±10% 必须标失准并区分三类归因(口径效应 / 外生变量 / 方法偏差),不美化、不选择性引用。若本期为首期,标注"暂无上期预测可比",不编造。
- 下一节假日前瞻 + 中长期趋势:基于可比序列与已确认的放假安排/免签/促消费政策,给出下一节假日预测(中心值+区间+置信度+口径效应提示,不得当实测);并给出未来 3–12 月及更久的中长期结构性判断,附拐点判据(可观测指标,提前 1–2 假期预警)与置信度分级(已验证 / 待核验 / 存疑)。
纵向数据来源
- 去年同期 / 本年上期:从 SSOT 数据集目录读取往年同节假日、本年已发生节假日的
消费数据集.csv,经audit_caliber.py口径校验后提取可比行(须 per-day 折算)。 - 历史纵向基线库(优先,实时):阶段一第 4c 步已实时拉取
.baseline-cache/(唯一路径,2023–2026 × 5 节假日,上游https://atomgit.com/g_ww/holiday_data_reports,clone/pull 实测约 9 秒;技能包不再内置快照);离线/拉取失败时纵向模块降级为首期基线标注,不编造历史。接入须按references/historical-data-source.md:17→22 字段适配(补 单位粒度/统计起止日/口径版本/指标口径类型/数据性质 5 派生字段)+ 数据点 canon 规范化(去年份/节假日名,如2023春节国内旅游出游人次→国内旅游出游人次)+ 枚举归一(复合值→复合、主题归并至字典 9 类)。 - MCP 实时检索层(v3.8 互补):调用
holiday-data-mcp的compare_across_years取去年同期/本年上期代表值,优先采用其自动 per-day 折算与口径/单位不一致告警(如2024 亿人次vs2025 万人次单位不一致、口径版本不同 → 提示不可直接相加比较);结果与.baseline-cache/取数交叉验证,共同喂给四元键可比判定。另get_data_point_detail可按id取回完整 22 字段溯源,补入真实性说明逐条溯源表。详见references/mcp-retrieval-layer.md。 - 上一周期预测:读取往年数据集
缺口标记=预判待回填的行(预测台账)。 - 跨年可比元组铁律:纵向比对键 =
(节假日, canon(数据点), 口径类型, 地域scope),四元一致且覆盖 ≥2 年才可做同比/环比;否则标「单年/不可比」,不得编造趋势线(实证:历史库仅 1 元组跨 ≥3 年可直接 join,不 canon 规范化几乎无法跨年)。 - 首期生成(无历史)时,上述对比优雅降级为"本期为首期基线",不编造历史数字。
City Dimension Extension (城市维度扩展 · 地域=城市时启用)
当
参数确认解析出 地域 = 具体城市(或用户显式要"城市视角")时,在全国 SSOT 数据集之上叠加城市层。城市数据是全国数据集的空间剖面,不是另一套数字——每条城市数据必须勾稽(reconcile)到某一全国指标键,城市加总在可比口径下与全国总量闭合。城市维度的全部细则在
references/*-city.md与assets/*-city.html/assets/chart-kit.html,本技能主流程沿用全国五阶段,仅在阶段一/二/三/四/五叠加【城市】增量步骤。
核心定位三句话
- 继承不重造:全国总量、口径字典、节假日配置、五阶段方法论继承自本技能全国模式;城市维度只增量定义城市字段、城市数据源、勾稽规则。
- 勾稽不脱钩:城市数据集每条数据
关联全国指标字段指向全国 SSOT 某一行;可加指标(旅游总花费/社零/酒店RevPAR等)用闭合勾稽(占比 ≤ 100% + 未披露残差),流量指标(出游人次/客运量等)用上限勾稽(呈现倍数 1.5–2.5× 为正常,> 3× 触发阻断)。 - 图文要可读:城市报告大量使用内联 SVG 可视化(排名条形 / 区域分布 / 占比环 / 热力矩阵 / 对比发散条),图表与数据表双轨。
城市模式五阶段增量(【城市】标记步骤)
- 阶段一·采集:读取
references/holiday-config.md全国矩阵 +references/holiday-config-city.md城市矩阵;9 大主题基础上追加城市组合检索词(城市总量/景区/酒店/交通/平台榜/县域);确定纳入城市集合(约 40 城基线 + 县域样本)与区域分组;平台城市榜标 C 级 + "该平台自身口径,非全市场"。 - 阶段二·整理:城市数据集强制 30 字段(22 全国 + 8 城市:城市/区域/城市层级/关联全国指标/占全国比重/勾稽状态/城市排名/修订状态);每条城市数据必须填
关联全国指标(R-CITY-3);勾稽计算(可加指标算占比+残差生成测算行,流量指标算倍数标流量非加和);勾稽校验 R-CITY-1~4。 - 阶段三·输出:真实性说明六部件 + 城市增量「勾稽校验与覆盖率声明」节(总表 + 未披露清单 + 口径差异说明)。
- 阶段四·报告:套用
assets/report-template-city.html(含图表容器),必含勾稽总表 + 排名图 + 区域图 + 对比图;图表片段见assets/chart-kit.html,规范见references/style-guide-viz.md;框架见references/templates-city.md(六部分:导语→城市总览与勾稽→分区域→县域下沉→纵向演化→口径声明)。 - 阶段五·交付:五件套齐备;首页套用
assets/landing-page-template-city.html(三卡片 + 连续性高亮条);三方勾稽校验:城市数据集 ↔ 全国 SSOT ↔ 真实性说明 数字闭合。
勾稽五铁律(城市 ⊂ 全国)
- 同口径才可比:城市与全国勾稽须「指标口径类型 + 口径版本 + 统计窗口 + 假期天数」四同,任一不同标
口径差异,不得相加。 - 占比规则分家族:可加指标合计 ≤ 100%+容差(> 100% 触发 R-CITY-1);流量指标占比可 > 100% 为正常(跨城重复),仅呈现倍数,> 3× 才阻断。
- 缺失不臆造:全国有数、城市无分城市披露时,仅以"其他/未披露"测算行(D 级、推算)兜底,不得编造具体城市值。
- 覆盖率声明(仅可加指标):给出「已披露城市占比合计」与「未披露残差」= 100%;覆盖率 < 40% 的排名标"局部样本,非全域排名";流量指标改报"披露城市倍数"。
- 排名仅在同口径城市间有效:跨指标/跨口径混排禁止;排名表须注明口径版本与可比城市集合。
城市模式反模式(增量,继承全国 11 条全部适用)
- C1 城市加总超全国:可加指标城市加总 > 全国总量(重复计算)或流量指标倍数 > 3×(错配 bug)→ 阻断整改。
- C2 幽灵城市:城市数据无
关联全国指标,自成"城市榜"不勾稽 → R-CITY-3 阻断。 - C3 臆造未披露残差:用虚构城市值填满"其他/未披露" → 违反零虚构,仅许测算占位行。
- C4 平台城市榜当全域排名:携程/同程榜直接称"全国城市排名"不标平台口径 → 标 C 级 + "该平台自身口径"。
- C5 低覆盖率假装全域:仅披露 < 40% 城市却称"城市格局" → 必须标"局部样本",显式列未披露残差。
城市模式 FAQ
- Q(城市):没有全国数据集怎么办? 先运行全国模式产出 SSOT,或以权威全国发布(文旅部等 A 级)建最小勾稽基准;无全国基准则城市数据无法勾稽,本模式不适用。
- Q(城市):城市披露很少? 诚实标"部分勾稽/局部样本",仅呈现已披露城市排名并声明覆盖率,不编造未披露城市。
- Q(城市):城市口径和全国不一致? 标
勾稽状态=口径差异,并列说明,禁止相加;占比填"不可比"。 - Q(城市):平台城市榜能用吗? 能,但 C 级 + "该平台自身口径,非全市场",作热度参考不与官方城市接待量加总。
- Q(城市):县域数据?
城市层级=县域,与地级市及以上分列;"奔县"新消费标县域口径,不混加。
城市模式 Resources(增量文件)
references/caliber-dictionary-city.md— 城市维度口径字典 v1.1:城市 8 增量字段、勾稽两类规则(可加闭合/流量上限)、勾稽状态枚举(含流量非加和)、R-CITY-1~4、修订状态与采集时点对齐references/templates-city.md— 城市 30 字段 schema、勾稽校验表、城市报告六部分框架、可视化组件清单(C1–C6)、城市预测台账references/holiday-config-city.md— 城市级数据源矩阵 v1.1:城市来源优先级、纳入城市集合(约 40 城)、区域分组、覆盖率预期、检索词references/style-guide-viz.md— 城市可视化规范 v1.1:图表选型、配色、口径标注、SVG 组件约定、图文配比references/development-prompt-city.md— 城市版五阶段操作细则assets/report-template-city.html— 城市版单文件 HTML 报告骨架(含图表容器与示例组件)assets/landing-page-template-city.html— 城市版首页门户骨架assets/chart-kit.html— 内联 SVG 图表片段库(C1 排名条 / C2 区域条 / C3 发散条 / C4 占比环 / C5 热力矩阵 / C6 折线)
Five-Stage Workflow (五阶段工作流程)
阶段一:数据采集 (Data Collection)
- 确定目标参数:【目标年度】与【节假日】,查阅
references/holiday-config.md获取该节假日的日期范围、检索关键词矩阵、主要数据源优先级。 - 围绕 9 大主题建立检索关键词矩阵,逐主题联网检索(不少于 8 轮)。
- 探索性主题采用开放式检索:检索词用"[节假日]新消费热点/[节假日]消费新业态/[节假日]新兴消费"等宽泛表述,禁止预置具体业态关键词——业态必须在检索结果中涌现,而非在检索词中预设。
- 每轮检索记录《采集日志》,字段:
检索关键词 | 检索时间 | 标题 | 来源机构 | 报告/资料名 | 发布时间 | URL | 内容摘要4b. 同源双录(v3.5 新增,L2 现象层入口):每轮检索除结构化数据点外,把榜单(TOP10 清单)、区间值(130%/60% 区间)、定性句("显著增长""翻倍")、政策事件(免签/消费券/放假安排)、平台热点等"现象级素材"一并记录(标题+URL+内容摘要即可),并尽力下载原文快照至素材快照/(命名=来源机构_标题摘要)。这些素材不因"入不了 22 字段口径"而被丢弃——它们是 L2 现象素材库的原料。 4c. 基线实时拉取(v3.6 新增,v3.7 纯实时,默认开启):纵向分析前先拉取最新历史基线——在报告输出目录.baseline-cache/执行git clone --depth 1 https://atomgit.com/g_ww/holiday_data_reports.git .baseline-cache/(首次)或git -C .baseline-cache pull --depth 1(后续增量,实测约 9 秒);技能包不内置快照,离线/拉取失败时纵向模块降级为首期基线标注(不得用任何过期数据冒充最新)。报告页脚须注明历史基线版本: live@<commit>(刷新时间)或未获取(离线/仓库不可达)(详见references/historical-data-source.md1.1 节)。 4d. MCP 实时检索层(v3.8 新增,可选互补):在 4c 拉取.baseline-cache/后,可调用已连接的holiday-data-mcp(已配置于~/.workbuddy/mcp.json,https://ai-x-ai.online/mcp,Bearer 鉴权)做结构化即时检索,作为 L1/L2 取数的交叉验证通道——list_holidays确认本年/本期数据集可用性;query_data_points(按 年份/节日/主题/关键词/最低可信度/数据性质 过滤)取 L1 结构化数据点初稿;query_phenomena取 L2 现象素材初稿。MCP 返回每行自带可信度等级/数据性质/口径类型/来源URL/采集日期,可直接映射进 22 字段口径治理。MCP 与 4c 基线、联网检索互为交叉验证,不替代其中任一;MCP 不可达时跳过本步,回退 4c+联网检索,页脚标MCP 未获取,不中断流程、不编造数据(详见references/mcp-retrieval-layer.md)。 - 来源优先级:A 级(政府公告/官方统计/权威通讯社通稿)> B 级(权威媒体转引机构数据)> C 级(企业自我披露/券商研报)> D 级(弱溯源)。
- 旧闻剔除:核对发布时间,凡非目标年度/节假日口径的数据一律不入库(但历史性背景素材可记入 L2 备注,不进 L1)。
- 口径冲突暂存:同一指标出现多个口径时全部记录,不急于取舍。
- 阶段产出:《数据采集日志》(含 L1 数据点 + L2 现象素材双轨记录)。
详细规则见 references/development-prompt.md 阶段一。
阶段门禁 Checklist(阶段一结束前核对):
- [ ] 【目标年度】与【节假日】已确认,
holiday-config.md已查阅 - [ ] 9 大主题检索 ≥8 轮,探索性主题采用开放式检索(无预设业态关键词)
- [ ] 采集日志字段齐全(含 URL、来源机构、发布时间)
- [ ] 旧闻已剔除(非目标年度/节假日口径不入库)
- [ ] 口径冲突已暂存,未急于取舍
- [ ] 同源双录已执行(v3.5):现象级素材(榜单/区间/定性/政策/热点)已随轮记录,未因入不了 L1 口径而被丢弃
- [ ] 基线实时拉取已执行(v3.6/v3.7):
.baseline-cache/已 clone/pull(或离线降级为首期基线标注),页脚标注基线来源与刷新时间 - [ ] MCP 实时检索层已调用(v3.8,可选):
holiday-data-mcp已用于 L1/L2 交叉验证(或离线标注MCP 未获取);返回数据已按 口径/可信度/数据性质 审查,未因便捷而绕过 4c/联网检索
阶段二:数据整理与质量评估 (Data Cleaning & QA)
- 数据质量快检:去重、缺失率、类型规范、数值单位统一。
- 逐条分级 + 口径字段填充:为每个数据点评估可信度等级 A/B/C/D,并强制填充新增 6 字段(单位粒度 / 统计起止日 / 口径版本 / 数据性质 / 是否测算 / 指标口径类型)。口径取值必须能在
references/caliber-dictionary.md中找到对应条目,否则退回重标。 - 口径冲突处理:官方口径优先;无法判定主次时并列说明(同指标多口径均保留)。
- 弱溯源处理:找不到直接出处的数据点降级为 D 级,标注"弱溯源",附最接近的佐证口径。
- 推算/派生值强制规则:凡
数据性质=推算或口径类型∈{测算,弱溯源}或数值类型≠水平值的数据点(含 per-day 人均、等效天数折算值、第三方推算),可信度强制 D 级,绝对禁止进入 B 级,且与实测数据分栏、不得混同;生成后须自动校验,消除跨年漂移(同性质数据今年标 D、明年不得标 B)。 - 人均口径规范:
人均消费唯一指 per-trip(单位粒度=人均trip,数据性质=实际);人均每日消费指 per-day(单位粒度=人均day,数据性质=推算且等级 D)。二者不得在同一报告混称"人均"。 - 跨年/调休天数折算:假期天数变动或合并拆分(春节 9 天 vs 八天、十一 8 天 vs 7 天)时,数据集须同时记录 per-day 等效值或等效天数口径;报告标题禁止用未折算的绝对增量做"创新高"主叙事(见口径字典第一节)。
- 探索性主题硬圈定:基于已分级数据集,按第三节量化标准筛选,在 CSV 中以独立行显式圈定入选项目(主题列标"新消费"或具体业态名);未圈定进数据集者,阶段四不得凭印象自建"新消费"章节。
- 纵向数据归集(延续性底座):从 SSOT 数据集目录读取(a)去年同节假日 CSV、(b)本年已发生节假日 CSV、(c)往年
缺口标记=预判待回填的预测台账行;经audit_caliber.py口径校验后提取可比行,统一 per-day 折算,为阶段四"纵向延续与前瞻"模块备料。历史补齐:SSOT 历史不全时,读取阶段一第 4c 步实时拉取的.baseline-cache/(上游 atomgit 仓库g_ww/holiday_data_reports)作去年同期/本年上期补数,按references/historical-data-source.md做 17→22 字段适配 + 数据点 canon 规范化 + 枚举归一(复合值→复合、主题归并至字典 9 类);归一动作记入缺口标记。首期无历史(含离线拉取失败)时优雅降级(见 Continuity Methodology)。 - 预测入账(闭环机制):阶段四若给出下一节假日前瞻/中长期点位预测,须在本数据集以独立行记录:
数据性质=预计、缺口标记=预判待回填、备注写预测ID=[年度][节假日]-F0X与「中心值/区间/置信度」;预测不得混入实测栏,且报告正文须用预测卡并标置信度。 - 阶段产出:《数据集》(CSV),强制 22 字段:
主题 | 数据点 | 数值 | 单位 | 单位粒度 | 统计起止日 | 统计窗口 | 口径版本 | 指标口径类型 | 口径类型 | 数据性质 | 基期 | 假期天数 | 数值类型 | 采集日期 | 缺口标记 | 来源机构 | 报告/资料名 | 发布时间 | 可信度等级 | URL | 备注 - L2 现象素材库整理(v3.5 新增):将采集日志中入不了 L1 22 字段的素材(榜单/区间/定性/政策/热点)整理进
现象素材库.json+现象素材库.md:贴现象标签、按 9 类字典归主题归属、记来源URL/采集日期/与L1指标键(可空)、HTML 快照入素材快照/。素材不因口径门槛被丢弃(唯一删除条件:无 URL 佐证的纯臆测)。同一现象标签连续 ≥2 期出现且可量化 → 记入备注"建议升 L1 跟踪",下期写入holiday-config.md检索词/指标清单。
阶段门禁 Checklist(阶段二结束前核对):
- [ ] 去重、单位、类型已统一,缺失率已知
- [ ] 每个数据点已标注 A/B/C/D,且
数据性质=推算/口径类型∈{测算,弱溯源}/数值类型≠水平值者全部为 D 级(无推算值混入 B) - [ ] 22 字段口径元数据已填充且可在
caliber-dictionary.md追溯(主题取自 9 类字典、指标口径类型取自指标字典、口径类型取自取值表) - [ ] 口径冲突已处理(官方优先 / 无法判定则并列说明)
- [ ] 弱溯源已降级 D 级并附最接近佐证口径
- [ ] 人均口径合规:per-trip 称"人均消费"、per-day 称"人均每日消费(推算, D 级)"
- [ ] 跨年天数变动已附 per-day 等效值,标题无未折算绝对增量
- [ ] 探索性主题(热门新消费)入选项目已在数据集 CSV 显式圈定(≥2 独立机构 URL 互链,否则降级"待核实")
- [ ] 纵向数据已归集:去年同期/本年上期可比行、上期预测台账行已读取(首期标注"无历史")
- [ ] 本期预测(若有)已入账:
数据性质=预计+缺口标记=预判待回填+预测ID,未混入实测 - [ ] 数据集 22 字段齐全,无空 URL 字段未加说明
- [ ] L2 现象素材库已产出(v3.5):榜单/区间/定性/政策/热点素材已入库(含 URL),无 URL 纯臆测已剔除;拟升 L1 的现象已在备注标记
阶段三:数据输出 (Data Output)
基于数据集生成《数据真实性说明》,包含六部件:
- 引言:采集与核实方法、数据局限(时点口径差异、转述性概括、推算标注)
- 可信度分级标准:A/B/C/D 定义与图例
- 台账差异与修正声明:与原稿/不同口径的差异逐条列出并更正
- 逐条溯源表:数据点 | 来源机构 | 发布时间 | 等级 | 可点击 URL
- 预测复盘与回填声明:若有上期预测台账,逐条列「预测值→实测值→偏差%→归因→判语」;偏差 > ±10% 诚实标"失准"并分三类归因(口径效应/外生变量/方法偏差),不美化、不选择性引用
- 全量来源机构清单
- L2 现象素材清单(v3.5 新增):列
现象素材库全部条目(现象标签 | 现象描述 | 来源机构 | 可点击 URL),并声明"以下为现象级/定性素材,非统计口径,仅供趋势与热点观察"。
无公开 URL 的(券商研报付费资料等)如实标注,并给出替代验证路径。
阶段门禁 Checklist(阶段三结束前核对):
- [ ] 六部件齐备:引言 / 分级标准 / 修正声明 / 逐条溯源表 / 预测复盘 / 来源清单
- [ ] 每条数据含可点击 URL 或可溯源声明(无 URL 项已如实标注+替代路径)
- [ ] 修正声明已列出口径差异与原稿更正
- [ ] 溯源表等级徽章与数据集 A/B/C/D 一一对应
- [ ] 预测复盘已诚实呈现(吻合/失准均写明,含三类归因)
- [ ] L2 现象素材清单已列(v3.5):全部素材条目含 URL,并声明"现象级素材,非统计口径"
阶段四:报告生成 (Report Generation)
- 仅从《数据集》取数:报告中每个数字(含纵向对比、预测点位)必须在数据集或预测台账有对应条目;本期现象/榜单/定性素材从 L2 现象素材库取数,引用时标"现象级/定性素材,非统计口径"(v3.5 双轨)。
- 报告整体框架(信息布局 v2,四部分)——全面梳理后的新布局,核心是把"延续性"前移到读者第一屏:
- 第一部分 · 导语与核心结论:标题 + standfirst + 首段正文(结论先行)+ 关键数字带(6 卡:出游人次/总花费/铁路/民航/酒店 RevPAR/出境游,均取自数据集)。
- 第二部分 · 纵向延续与前瞻(紧接导语,凸显数据延续性):按
templates.md第 6 节六子节搭建——2.1 口径裁决 → 2.2 去年同期回顾(per-day 折算后比)→ 2.3 本年上期回顾 → 2.4 上一周期预测复盘(忠实诚恳,失准须标)→ 2.5 下一节假日前瞻(预测卡+置信度,不得当实测)→ 2.6 中长期趋势预判(拐点判据+置信度分级)。 - 第三部分 · 分主题深度分析:8 固定维度 + 1 探索性(沿用现有骨架,栏目依阶段二圈定清单)。本期现象/热门新消费/目的地热点/政策速览等"丰度栏目"以 L2 现象素材库为素材,与 L1 统计叙事分栏呈现,不混同。
- 第四部分 · 口径与数据质量声明:摘要(详细见真实性说明)。
- 排版与风格:严格按
references/style-guide.md执行;可直接套用assets/report-template.html骨架(已含纵向模块与预测/偏差/拐点组件)。 - 技术约束:全部 CSS/JS 内联、无外链、无 emoji、简体中文、响应式。
- 测算/预计标注:数据集
数据性质=推算(含 per-day 人均)标"测算(D 级)";数据性质=预计的预测点位用预测卡并标置信度,不得混入实测数字栏;页脚注明来源机构与报告年份。涉及"创新高"等规模叙事且基期天数不同时,必须显式折算并标注口径版本,禁止未折算绝对增量。 - 阶段产出:
消费数据报告.html。
阶段门禁 Checklist(阶段四结束前核对):
- [ ] 报告每个数字均在数据集/预测台账有对应条目(无无源数字)
- [ ] 框架为 v2 四部分:导语 → 纵向延续与前瞻 → 分主题深度 → 口径声明
- [ ] 纵向延续与前瞻六子节齐备;去年同期/本年上期对比已 per-day 折算
- [ ] 上一周期预测复盘已诚实呈现(吻合/失准,失准标出且含三类归因)
- [ ] 下一节假日前瞻用预测卡标置信度,未当实测写入消费数字栏
- [ ] 规模叙事"创新高"已按口径字典折算(基期天数不同必有 per-day 等效值)
- [ ] 人均口径合规:仅 per-trip 称"人均消费",per-day 称"人均每日消费(测算, D 级)"
- [ ] 探索性主题栏目依阶段二圈定清单搭建,未凭印象自建章节
- [ ] 排版符合
style-guide.md(CSS/JS 内联、无外链、无 emoji、简体中文、响应式) - [ ] 探索性主题栏目依阶段二圈定清单搭建,未预固化业态、未凭印象自建章节
阶段五:成果交付 (Delivery)
- 交付物齐备:数据集(L1 CSV)+ 现象素材库(L2 JSON/MD, v3.5) + 数据报告 + 数据真实性说明 + 首页。
- 首页生成:
- 套用
assets/landing-page-template.html骨架 - 卡片一:摘录数据报告的头条部分(大标题 + standfirst + 首段正文),链接指向
消费数据报告.html - 卡片二:摘录数据真实性说明的引言部分(方法说明 + 数据局限声明),链接指向
数据真实性说明.html - 卡片三:数据集 CSV 前 5 行以表格形式预览,链接指向 CSV 文件下载
- 连续性高亮条(推荐):当存在跨年纵向报告或下一节假日前瞻时,在卡片上方加一条"纵向趋势 / 下一节假日前瞻"入口,链向跨年专题报告或报告第二部分
- 首页文件名固定为
index.html(EdgeOne 默认入口) - 技术约束同报告:全部 CSS/JS 内联、无外链、无 emoji、简体中文、响应式
- 套用
- 一致性校验:报告所有数字 <-> 数据集 <-> 真实性说明一一对应,首页链接全部可达,缺失即返工。跨年纵向专题报告(若产出)须与其引用的各年份数据集三方一致。
- 目录结构(分年分节持久化,v3.5):
data/{年份}/{节假日}/ # 每年每节独立目录,与历史基线库同构,持续沉淀 ├── index.html # 首页(EdgeOne 默认入口) ├── 消费数据报告.html # 完整报告(L1 纵向 + L2 本期现象) ├── 数据真实性说明.html # 真实性说明(含 L2 素材清单) ├── [年度][节假日]消费数据集.csv # L1 结构化数据集(22 字段) ├── 现象素材库.json / .md # L2 非结构化现象素材(v3.5) ├── 素材快照/ # L2 原文 HTML/PDF/图片快照(尽力而为) ├── 采集日志.csv # 阶段一检索记录 └── overview.md # 交付说明 + 沉淀登记(L1 行数/L2 条数/快照数)每期完成后将
数据集.csv+现象素材库.json同步至历史基线上游(atomgitg_ww/holiday_data_reports),实现跨期资产沉淀(见references/data-architecture.md第二节)。 - 交付说明:各文件用途、使用方法、数据等级分布概览(含 L1/L2 数量)。
- EdgeOne 发布说明(如用户需要):首页 index.html 为 EdgeOne 部署入口,部署后读者通过首页访问三件套全部资源。
阶段门禁 Checklist(阶段五结束前核对):
- [ ] 交付物齐备:数据集(L1) + 现象素材库(L2) + 数据报告 + 数据真实性说明 + 首页
index.html - [ ] 报告含 v2 框架:纵向延续与前瞻模块六子节齐备(首期无历史已优雅降级)
- [ ] 首页三卡片链接全部可达(报告/说明/CSV);连续性高亮条(若有)指向正确
- [ ] 三向对照校验通过:报告 ↔ 数据集 ↔ 真实性说明 数字一一对应
- [ ] 预测台账闭环:本期预测已入账(
数据性质=预计+缺口标记=预判待回填+预测ID),供下期回填 - [ ] 分年分节目录已落盘(v3.5):
data/{年份}/{节假日}/含 L1 CSV + L2 现象素材库,overview 登记 L1/L2/快照数量 - [ ] 目录结构与
overview.md交付说明已完成(含纵向/预测说明) - [ ] 任务未越过"不适用场景"边界(如非中国节假日、需实时数据等已排除)
Format & Delivery Rules (格式分工,硬性)
- 面向读者阅读的成果(首页、数据报告、数据真实性说明) -> 单文件 HTML
- 面向报告开发者的文档(开发提示词、说明文档) -> Markdown (.md),不产出 HTML 版
- 数据集 -> CSV(便于程序化消费与下载)
- 本技能所有阶段性规则文档均为 md,仅供执行者(AI/开发者)参考,不交付给读者。
Anti-Patterns / 反模式与修正(不可逾越,附后果与修正步骤)
下列条目即原"质量红线",以反模式 → 后果 → 修正步骤形式呈现,便于执行时自查与纠错。
1. 编造或杜撰数据
- 反模式:凭印象/记忆填充数字,或虚构来源机构与 URL。
- 后果:报告可信度崩塌,一旦被核验即全盘失信,真实性说明失效。
- 修正:无来源数据一律不入库;来源缺失时标注 D 级"弱溯源"并附最接近佐证口径,或剔除。
2. 公开数据不附可核验 URL
- 反模式:互联网公开数据只写"据某报道",不附链接,或给失效/模糊地址。
- 后果:读者无法核验,逐条溯源形同虚设。
- 修正:每条公开数据必须附可点击 URL;付费研报如实标注"无公开 URL"并给替代验证路径(如 STR 官网、券商新浪财经页)。
3. 推算值当实测值呈现
- 反模式:把测算/估算值混入实测数据,不标记"测算"。
- 后果:读者无法区分事实与推断,溯源表口径混淆。
- 修正:测算值单独标记"测算"并与实测数据分栏,不得混同。
4. 口径冲突擅自二选一
- 反模式:遇到多口径直接合并或凭偏好取舍。
- 后果:丢失信息,可能选错口径,读者无从判断差异。
- 修正:官方口径优先;无法判定主次时并列说明,注明差异与各自适用场景。
5. 交付前跳过全量对照校验
- 反模式:报告成稿后不逐条核对"数据 ↔ 来源"对应关系。
- 后果:报告数字与数据集/真实性说明脱节,出现无源数字。
- 修正:交付前强制完成三向对照校验(报告 ↔ 数据集 ↔ 真实性说明),缺失即返工。
6. 采集前固化探索性主题
- 反模式:在检索词中预设"音乐节/咖啡节"等具体业态清单。
- 后果:检索变"验证预设"引入确认偏误,冷门业态被强行写入,热门业态被遗漏。
- 修正:探索性主题仅给入选标准,具体项目由检索结果涌现、阶段二圈定;固维度可预置,结论由数据决定。
7. 违反口径字典 / 口径混用未折算
- 反模式:公路"人员流动量"与铁/民/水"客运量"直接加总;人均 per-trip 与 per-day 混称"人均";旅游总花费与社零相加;跨年天数不同仍用未折算绝对增量做"创新高"主标题;GMV/客流/播放量混为同一"消费"概念。
- 后果:量级与结论误导,读者无法识别口径差异,溯源表口径混淆。
- 修正:严格按
references/caliber-dictionary.md标注每条数据的「指标口径类型 / 单位粒度 / 口径版本」;跨家族指标分列不可相加;天数变动必附 per-day 等效值,标题禁用未折算绝对增量。
8. 虚假交叉印证(探索性主题)
- 反模式:报告宣称"≥2 独立来源印证",实际仅单源 C 级,或同源多 URL 充数;或凭印象自建"新消费"章节而数据集无对应圈定行。
- 后果:虚构探索性结论,违反零虚构原则,是真实性说明的致命漏洞。
- 修正:入选须满足 ≥2 个不同机构 URL 且在数据集同项目互链;不足则降级"待核实"仅列真实性说明;阶段四栏目必须源自阶段二 CSV 显式圈定行,禁止凭印象自建。
9. 预测无台账 / 无法复盘
- 反模式:报告给出下一节假日前瞻或中长期点位预测,但不记入数据集/预测台账(无
预测ID、无缺口标记=预判待回填);或下期报告对上期预测只字不提、选择性引用"说对的"。 - 后果:延续性断裂,预测永远无法被核验,「预测→复盘→反哺」闭环失效,读者无法判断预测可靠性。
- 修正:凡预测必入账(阶段二第 10 步);下期阶段二读取上期预测台账,在报告 2.4 与真实性说明逐条复盘,偏差 > ±10% 标"失准"并给三类归因,不美化。
10. 纵向比较不折算 / 直接比绝对量
- 反模式:去年同期/本年上期对比直接用未折算绝对量(如 2026 春节 9 天 5.96 亿 vs 2025 八天 5.01 亿,称"+18.9% 创新高"),忽略春节 7/8/8/9 天、十一 8/7/8/7 天的天数漂移。
- 后果:系统性高估增速,漂亮曲线掩盖口径陷阱,结论反转。
- 修正:任何跨年/跨节假日纵向对比,先归一为 per-day 或可比天数再谈增减(口径字典第一节、第二节);报告纵向模块标题禁用未折算绝对增量。
11. 预测当实测 / 前瞻混入消费数字栏
- 反模式:假期未至(如 2026 十一)却把前瞻预测值写入"消费数据"栏目,或预测卡不标置信度、不留"待回填"痕迹,读者误当已发生事实。
- 后果:无中生有,违背零虚构底线,一旦实测偏离即信用破产。
- 修正:假期未发生/数据未发布时,消费类栏目统一标"本期暂无数据(假期未发生)";预测仅置于 2.5 前瞻模块,用预测卡标置信度与口径效应提示,数据集
数据性质=预计单独成行,绝不与实测混栏。
12. 数据点内嵌年份 / 纵向无法 join
- 反模式:
数据点写成2023春节国内旅游出游人次(内嵌年份+节假日名),导致去年/今年同名无法跨年 join(实测:历史库按(节假日,数据点,口径类型)跨 ≥3 年的元组仅 1 个)。 - 后果:纵向延续章节无米下锅,强行"对比"只能靠编或靠猜。
- 修正:
数据点一律去年份/去节假日名(canon 键,如国内旅游出游人次);纵向比对前按references/historical-data-source.md第 3 节做 canon 规范化,四元键(节假日, canon, 口径类型, 地域scope)一致且 ≥2 年才可比。
13. 非数值误标水平值
- 反模式:
数值为三亚/厦门、近700、是、超四成、3-12月等列表/定性句,却标数值类型=水平值(实测:历史库 59 行此错误)。 - 后果:纵向聚合把定性文本当数字入趋势线,图表与结论失真。
- 修正:
数值非数值时必须标定性;含「/」的列表标复合;禁标水平值;水平值仅限可直接入趋势线的纯数字。
14. 历史数据不归一直接聚合
- 反模式:接入历史 CSV 时不归一枚举(
复合值未改复合、政策与宏观/新消费等主题别名未并回字典 9 类、口径类型与字典写法不一致),纵向聚合按别名分裂出多条同义曲线。 - 后果:跨年曲线断裂、主题分散,读者误判趋势。
- 修正:历史接入强制枚举归一(见
references/historical-data-source.md2.3 节归一表),归一动作记缺口标记,保证可追溯可回滚。
FAQ / 常见问题
Q1:单一弱来源的数据点怎么办? 标注 D 级"弱溯源",附最接近佐证口径;若无可交叉印证且为关键结论,降级为"待核实"或在报告中弱化呈现,不得作为硬数字引用。
Q2:假期跨年/调休导致统计区间怎么处理?
以国务院办公厅放假安排为准(如春节常跨农历年、部分节假日调休连休)。数据集每条数据须在「统计起止日」「口径版本」两列注明区间与天数口径(如 8天口径 9天口径);检索时覆盖跨年区间避免漏采。跨年天数变动时,报告主叙事须附 per-day 等效值,禁止用未折算绝对增量做"创新高"标题(详见口径字典第一节)。
Q3:两个口径都权威、相互冲突怎么办? 并列呈现,各自注明发布机构与时间,由读者自行判断;报告叙事可择主流口径,但不得掩盖差异,须在真实性说明修正声明中列明。
Q4:某个固定维度本期无公开数据? 该栏目可标注"本期暂无公开数据",不得编造填充以凑齐栏目;可保留栏目空位并说明原因。
Q5:用户只要四件套中的某几件? 可按需裁剪(如仅要报告+数据集),但报告取数仍须来自数据集,真实性说明与数据集保持对应;缺失交付物须在交付说明中注明。
Q6:数据集规模要多大? 无固定下限,但应覆盖 9 大主题主干;探索性主题入选项目须满足量化入选标准(增速≥30% 或绝对规模可观,且 ≥2 个不同机构 URL 在数据集同项目互链),宁缺毋滥,不足则降级"待核实"不进报告主叙事。
Q7:上一周期预测怎么复盘?
阶段二第 9 步读取 SSOT 目录中往年数据集 缺口标记=预判待回填 的行(预测台账);下期报告 2.4 节与真实性说明「预测复盘与回填声明」逐条对比:预测值→实测值→偏差%→归因(口径效应/外生变量/方法偏差)→判语(吻合/失准)。偏差 > ±10% 必须标"失准",不美化、不选择性引用。回填后改 缺口标记=已回填-偏差X%。
Q8:纵向对比数据从哪来?怎么保证可比?
数据源为 SSOT 数据集目录中往年同节假日、本年已发生节假日的 消费数据集.csv,经 audit_caliber.py 口径校验后提取可比行。可比铁律:跨年/跨节假日先 per-day 折算(春节 7/8/8/9 天、十一 8/7/8/7 天漂移必须归一),再谈增减。首期生成无历史时,2.2/2.4 标注"本期为首期基线,暂无去年同期/上期预测可比",不编造。
Q9:假期还没到,要做预测怎么办?
只做前瞻,不做消费数字。数据集仅收录已确认的放假安排/政策(A 级);预测置于报告 2.5 前瞻模块,用预测卡标中心值+区间+置信度+口径效应提示,数据性质=预计 单独成行并 缺口标记=预判待回填,待假期结束后回填核验。消费类栏目统一标"本期暂无数据(假期未发生)"。
Q10:历史纵向数据从哪拿?历史 CSV 和当年 22 字段对不上怎么办?
历史纵向基线默认实时拉取(v3.6 起):阶段一第 4c 步在 .baseline-cache/ 执行 git clone --depth 1 https://atomgit.com/g_ww/holiday_data_reports.git(首次)/ git -C .baseline-cache pull --depth 1(增量),保证用上游最新数据;技能包不内置快照,离线或拉取失败时纵向模块降级为首期基线标注(页脚 未获取),不编造历史。历史 CSV 为专家团 P0 的 17 字段版本,是 22 字段的严格子集,按 references/historical-data-source.md 接入:补 5 个派生字段(单位粒度/统计起止日/口径版本/指标口径类型/数据性质)→ 数据点 canon 规范化(去年份/节假日名)→ 枚举归一(复合值→复合、政策与宏观→消费宏观、热门新消费→新消费、目的地/跨境/出入境→景区目的地)。跨年可比四元键 (节假日, canon, 口径类型, 地域scope) 一致且 ≥2 年才可比,否则标"单年/不可比"。2026 各 CSV 多为进行中/前瞻数据(如 2026 十一仅 6 行全为放假安排),属预测台账输入,不得当实测。
Q11:会不会为了口径规范而丢掉该节日特有的现象信息?(双层数据模型)
会,这正是 v3.5 要解决的。实证:2026 暑假早版 78 行 vs 22 字段版 46 行,同名数据点仅 1 个,丢失的 77 条几乎全是榜单/区间/定性/政策等"现象层"素材。解法是数据双轨(references/data-architecture.md):统计性质强、可直接入趋势线的进 L1 结构化层(22 字段,保延续性);榜单/区间/定性句/政策事件等进 L2 非结构化现象层(现象素材库.json/.md + 原文快照,保时点丰度)。L2 不因入不了 22 字段而被丢弃(唯一删除条件:无 URL 佐证的纯臆测);进入报告正文须标"现象级/定性素材,非统计口径"。同一现象连续 ≥2 期出现且可量化 → 升级为 L1 跟踪指标,形成"现象→指标"正向循环。每期按 data/{年份}/{节假日}/ 分目录持久化,并与历史基线库(atomgit 仓库)同构沉淀,跨期资产持续积累。
Q12:历史基线是每次调用都实时下载吗?离线怎么办?
是的,v3.6 起默认每次调用实时拉取:阶段一第 4c 步在输出目录 .baseline-cache/ 执行 git clone --depth 1(首次,约 9 秒)或 git pull --depth 1(增量,秒级),保证使用上游 atomgit 仓库最新数据。技能包不内置快照(v3.7 已删除):离线/拉取失败时纵向模块降级为首期基线标注(页脚 未获取),不中断流程、不编造历史。镜像目录可写、不污染技能安装目录;可用参数 baseline_dir= 指定其他位置。若用户希望本次跳过拉取(如纯离线分析),可显式说明"不刷新基线",SKILL 将跳过 4c 步并以"无历史基线"处理。
Q13:怎么用 holiday-data-mcp 这个 MCP 做实时检索?它和 atomgit 基线什么关系?
holiday-data-mcp(已配置于 ~/.workbuddy/mcp.json,https://ai-x-ai.online/mcp,Bearer 鉴权)是节假日消费数据的结构化实时检索入口,查询后端与本技能历史基线同源(atomgit g_ww/holiday_data_reports 的衍生索引)。它不是 atomgit 的替代,而是其上的检索互补层:atomgit clone/pull(4c)继续作为原始 CSV 落盘与跨期沉淀源,MCP 提供无需 clone 的即时检索——list_holidays 看可用数据集、query_data_points/query_phenomena 取 L1/L2 初稿、compare_across_years 做跨年同比(自动口径/单位不一致告警)、get_data_point_detail 完整溯源。三者互为交叉验证,任一不可达都降级不中断(详见 references/mcp-retrieval-layer.md)。
Resources
references/development-prompt.md-- 完整开发提示词(v3.5):五阶段操作细则、角色定位、质量红线、口径规范、纵向延续性方法论、历史纵向基线库与实时刷新机制,可按年度/节假日替换参数后作为独立提示词提交references/holiday-config.md-- 节假日配置表(v1.2):六类节假日日期/关键词/全源 A-J 数据源矩阵/全源采集门禁/纵向与预测规则(含中秋独立/合并规则)references/caliber-dictionary.md-- 口径字典(v2.0,强制):统一 22 字段字典、统一主题字典(9类)、统一指标口径字典、口径类型取值表(L1-L4)、基期规范、数值类型规范、预测台账与缺口标记;公路人员流动量≠客运量、人均 per-trip/per-day、跨年天数折算、旅游花费 vs 社零不可相加、中秋合并规则references/templates.md-- 采集日志、数据集(22 字段 schema)、真实性说明(含预测复盘)、首页结构、预测台账模板、报告「纵向延续与前瞻」六子节模板、跨年纵向专题报告模板references/historical-data-source.md-- 历史纵向基线数据源 v1.2:atomgit 仓库(g_ww/holiday_data_reports)唯一权威源、调用时实时拉取机制(.baseline-cache/,clone/pull 实测可行;v1.2 起不内置快照,离线降级为首期基线)、历史 17 字段 → SKILL 22 字段对账适配器(5 派生字段 + 枚举归一表)、数据点 canon 规范化(跨年 join 铁律)、去年同期/本年上期取数流程、R13–R15 质量规则实证references/mcp-retrieval-layer.md-- MCP 实时检索层 v1.0(v3.8 新增):holiday-data-mcp的 6 工具与技能阶段映射、调用纪律(引用必附 URL+采集日期 / 实际-预计-推算分离 /reliability=?不引用 / 口径告警先对齐)、接入点(阶段一 4d 取数交叉验证、阶段二第 9 步纵向上游、阶段三溯源)、离线降级;作为 atomgit 基线的结构化检索互补层references/data-architecture.md-- 数据架构 v1.0(v3.5 新增):L1 结构化层(22字段,保延续性) + L2 非结构化现象层(榜单/区间/定性/政策素材库,保时点丰度)双层模型;分年分节持久化目录data/{年份}/{节假日}/;L2 素材库 JSON/MD schema;现象→指标升级通道;双轨质量红线references/style-guide.md-- 经济学人/FT 排版规范:CSS 变量、字体、颜色、组件清单(含首页组件、预测卡/偏差卡/拐点判据/置信度徽章)assets/report-template.html-- 经济学人/FT 风格单文件 HTML 报告骨架模板(v4 设计系统:明暗双主题 + 纵向延续与前瞻模块 + 预测卡/偏差卡/拐点判据/置信度徽章 + 可信组件[徽章/callout/预测块/来源披露] + Hero 卡/图表 + 页脚导航 + 可达性 + 响应式 + 全部内联 CSS;使用说明见文件末尾注释)assets/landing-page-template.html-- 经济学人/FT 风格单文件 HTML 首页门户骨架(v4 设计系统:明暗双主题、appbar/breadcrumb 骨架、三卡片入口 + 连续性高亮条 + footer-nav、全部内联 CSS/JS;使用说明见文件末尾注释)assets/icon.jpg-- 技能图标(1024x1024 JPG,体积<5MB),简洁大气:折叠报刊文档+递增柱形图+圆形核验徽章assets/icon.svg-- 上述图标的 256x256 SVG 矢量源文件,便于后续修改assets/-- 报告/首页模板、图表片段库、图标(不含历史基线快照:v3.7 起基线随调用实时拉取至输出目录.baseline-cache/,见references/historical-data-source.md)
城市维度增量 Resources(地域=城市时引用)
references/caliber-dictionary-city.md-- 城市维度口径字典 v1.1(城市 8 增量字段、勾稽两类规则、勾稽状态枚举、R-CITY-1~4、修订状态与采集时点对齐)references/templates-city.md-- 城市 30 字段 schema、勾稽校验表、城市报告六部分框架、可视化组件清单(C1–C6)、城市预测台账references/holiday-config-city.md-- 城市级数据源矩阵 v1.1(城市来源优先级、纳入城市集合约 40 城、区域分组、覆盖率预期、检索词)references/style-guide-viz.md-- 城市可视化规范 v1.1(图表选型、配色、口径标注、SVG 组件约定、图文配比)references/development-prompt-city.md-- 城市版五阶段操作细则assets/report-template-city.html-- 城市版单文件 HTML 报告骨架(含图表容器与示例组件)assets/landing-page-template-city.html-- 城市版首页门户骨架assets/chart-kit.html-- 内联 SVG 图表片段库(C1 排名条 / C2 区域条 / C3 发散条 / C4 占比环 / C5 热力矩阵 / C6 折线)
Usage Notes
- 参数确认优先:运行前先按「Parameter Resolution」解析 [年份][节日][地域];年份默认今年、地域默认全国、节日默认当前日期所在节假日,任一无法默认(尤其节日)则主动提示用户,绝不臆造。
- 年度可变:将提示词/模板中的【目标年度】替换为目标年份即可复用。
- 节假日可变:将【节假日】替换为目标节假日即可复用。查阅
references/holiday-config.md获取该节假日的检索关键词与数据源。 - 城市模式须先有全国 SSOT:域名为城市时,确保本次已生成或用户已提供对应 [年度][节日] 的全国数据集,作为勾稽基准。
- 若用户只要四件套中的某几件,可按需裁剪,但报告取数仍须来自数据集。
- 交付后用 present_files 打开 HTML 文件(首页、报告与真实性说明)供读者预览;数据集与说明文档以卡片列出。
- 若用户需要发布到 EdgeOne:将整个报告目录作为静态站点部署,首页
index.html自动作为默认入口。
Scan to join WeChat group