返回 Skill 列表
extension
分类: 开发与工程无需 API Key

一句话生成节日数据报告

一句话生成节假日消费数据报告。示例:“帮我生成2026年暑假数据报告”,“帮我生成2026年暑假[城市(具体城市名称)]暑假报告”

person作者: wingwayhubModelScope

Consumption Data Report (节假日消费数据报告)

Overview

This skill produces a four-deliverable package (四件套) for holiday consumption data reports, with data verification built in before the report is written -- never after:

  1. 消费数据集 -- structured dataset file (CSV) where every data point carries its source metadata
  2. 消费数据报告 -- single-file HTML report in Economist/FT newspaper style
  3. 数据真实性说明 -- single-file HTML provenance document, tracing every figure to its source with clickable URLs
  4. 首页 (index.html) -- single-file HTML landing page that serves as a portal, featuring report headline, provenance introduction, and CSV preview with links to all three deliverables; designed for EdgeOne deployment

Core methodology: data first, report last (先建数据集后出报告). Any data problem is caught before the report exists, so the report never needs rework for sourcing reasons.

Parameter Resolution (参数确认 · 必先于一切采集)

本技能在动手采集/写报告之前,必须确定三项参数:[年份] [节日] [地域(全国/城市)]。这三项驱动后续全部检索、口径与交付形态。

解析顺序

  1. 从用户对话中提取三项。若用户已明确给出(如"2026 五一 成都消费报告"),直接使用。
  2. 应用默认值(仅当用户未提供时):
    • [年份] → 取当前系统日期的年份(如运行于 2026-08-20,则默认 2026)。
    • [地域] → 默认 全国;若用户给出城市名(如"成都""上海""县域-某某县"),则 地域 = 该城市,进入城市模式。
    • [节日] → 若用户明确给出节日名则采用;否则取当前系统日期所在节假日(依据 references/holiday-config.md 各节假日日期范围判定,如 2026-08-20 不在任何假期窗口 → 无法默认)。
  3. 缺失处理(关键 · 必须提示)
    • [节日] 无法从对话获取,且当前日期不在任何节假日窗口内必须主动提示用户补充 [年份][节日][地域],不得臆造节日
    • 使用 AskUserQuestion(或自然语言提问)向用户确认三项,并给出建议默认值:年份=今年、地域=全国、节日=当前节日或提供可选节日列表。
    • 仅当三项全部明确(用户已给,或已用默认值且用户未反驳)后,才进入阶段一采集。
  4. 回显确认:进入采集前,向用户一句话回显解析结果,例如:"将为您生成 [2026][十一][全国] 消费数据报告(四件套)" 或 "-[2026][端午][成都] 城市视角报告(需先有/生成全国 SSOT 基准)",给用户一次纠正机会。

地域路由(决定走哪条流水线)

  • 地域 = 全国 → 仅执行全国五阶段(阶段一至五)→ 产出四件套
  • 地域 = 具体城市 → 先确保存在/生成全国 SSOT 数据集(本次运行生成,或读取用户既有的全国数据集),再叠加城市层(30 字段 + 勾稽)→ 产出城市五件套(引用全国数据集,不重造全国数字)。详见下方「城市维度扩展」与 references/*-city.md
  • 地域 = 全国 + 城市(用户要两者)→ 先全国(四件套)后城市(五件套),共用同一 SSOT。

解析示例

| 用户原话 | 解析结果 | 模式 | | --- | --- | --- | | "做个五一消费报告" | 年份=2026(今年) · 节日=五一 · 地域=全国 | 全国四件套,直接执行 | | "成都端午怎么样" | 年份=2026 · 节日=端午 · 地域=成都 | 城市模式(需全国 SSOT) | | "消费报告"(运行于 2026-08-20,非假期) | 节日缺失且当前非假期 → 提示用户选年份/节日/地域 | 暂停,待补参数 | | "2025 春节 全国" | 年份=2025 · 节日=春节 · 地域=全国 | 全国四件套 |

默认值的目的是"少问多跑";但当任何一项(尤其节日)无法可靠默认时,宁可多问一次,不可臆造,以守住数据可信底线。

When to Use

Trigger when the user asks to produce a holiday consumption / travel spending data report for any year and any Chinese holiday, including:

| 节假日 | 典型时间范围 | 假期天数 | | --- | --- | --- | | 春节假期 | 除夕至初七 | 约 8 天 | | 端午假期 | 端午前后 | 3 天 | | 五一假期 | 5 月 1 日前后 | 5 天 | | 暑假 | 7-8 月 | 约 62 天 | | 中秋假期 | 中秋前后 | 3 天 | | 十一假期 | 10 月 1-7 日 | 7 天 |

Also use when the user asks to re-run the pipeline for a new year/holiday combination. 节假日配置详见 references/holiday-config.md.

Out of Scope / 不适用场景(边界,请勿越界)

本技能专为中国节假日消费数据报告设计。以下情形不适用,应明确告知用户并建议改用其他方案,而非强行套用本流程:

  1. 非中国节假日:如圣诞节、万圣节、感恩节、黑色星期五等境外节日。其消费结构与数据来源体系与中国节假日差异巨大,holiday-config 未覆盖,套用会产生错配。
  2. 无公开数据来源:目标节假日/年度过于冷门、或所涉消费领域几乎无联网公开数据。本流程的核心前提是"数据可溯源",无源则无法生成合规数据集与真实性说明。
  3. 实时/秒级数据需求:本流程产出的是周期性报告(节假日结束后或期间阶段性发布),不提供实时刷新、动态仪表盘或流数据监控。
  4. 非消费主题:如纯人口统计、气象灾害评估、医疗健康报告等与本主题无关的分析需求。
  5. 需原创调研/抽样调查:本流程依赖既有公开来源(政府公告、媒体、研报),不执行问卷、访谈、实地抽样等一手调研。
  6. 跨境/全球消费对比:聚焦中国节假日境内外消费,不做多国平行对比报告(除非作为单点引述)。

边界判定原则:凡涉及"数据必须可溯源 + 中国节假日 + 消费主题 + 周期性产出"四要素任一不满足,即属本技能不适用范围。

Deliverables (交付物 · 按地域分两套)

全国模式(地域 = 全国)→ 四件套(数据集为 L1+L2 双轨)

| # | 交付物 | 格式 | 用途 | | --- | --- | --- | --- | | 1 | 数据集(如 2026年暑假消费数据集.csv) | CSV(22 字段) | L1 结构化层:数据台账,每条数据含来源元数据,纵向可比 | | 1b | 现象素材库(现象素材库.json + .md) | JSON + Markdown | L2 非结构化层:该节日时点特有现象/榜单/区间/定性/政策素材,含来源 URL(详见 references/data-architecture.md) | | 2 | 数据报告(消费数据报告.html) | 单文件 HTML | 面向读者阅读,经济学人/FT 风格(L1 撑纵向, L2 撑本期现象) | | 3 | 数据真实性说明(数据真实性说明.html) | 单文件 HTML | 逐条溯源与质量声明(含 L2 现象素材清单) | | 4 | 首页(index.html) | 单文件 HTML | 门户入口,收录三件套精华,可发布到 EdgeOne |

双轨原则:L1 保延续性(22 字段口径治理),L2 保时点丰度(榜单/区间/定性/政策全保留,不因入不了 22 字段而被丢弃)。二者分栏呈现、不混同;L2 素材进入正文须标"现象级/定性素材"。详见 references/data-architecture.md

可选第 6 交付物 · 跨年纵向趋势专题报告:当用户需要「从 2023 到 2026 看未来」类多年度趋势专题时,从 SSOT 数据集(多年份 CSV)聚合产出 节假日[主题]报告_从[起始年]到[终止年]看未来.html + 同名 .md(框架见 references/templates.md 第 7 节)。历史年份数据优先取自实时拉取的 .baseline-cache/(上游 atomgit 仓库 g_ww/holiday_data_reports),按 references/historical-data-source.md 做 17→22 适配与 canon 规范化后再聚合。

城市模式(地域 = 具体城市)→ 五件套

| # | 交付物 | 格式 | 用途 | | --- | --- | --- | --- | | 1 | 城市数据集([年度][节假日][城市]消费数据集.csv) | CSV(30 字段) | 城市台账,含城市 8 字段 + 勾稽元数据 | | 2 | 城市消费数据报告(城市消费数据报告.html) | 单文件 HTML(图文) | 城市视角主报告,含勾稽总表与可视化 | | 3 | 数据真实性说明(数据真实性说明.html) | 单文件 HTML | 逐条溯源 + 勾稽校验与覆盖率声明 | | 4 | 首页(index.html) | 单文件 HTML | 门户入口,收录四件套精华,可发 EdgeOne | | 5 | (勾稽基准)全国数据集 | CSV(22 字段) | 来自全国模式,城市层引用不重造 |

全国四件套由全国模式产出(或用户既有);城市模式在其之上叠加城市层。若用户仅要城市剖面,仍须先确认/生成或读取全国数据集作为勾稽基准(详见「城市维度扩展」)。城市模式同样产出 L2 现象素材库(城市视角榜单/现象,存 现象素材库-city.json/.md)。

可选第 6 交付物 · 跨年纵向趋势专题报告:当用户需要「从 2023 到 2026 看未来」类多年度趋势专题时,从 SSOT 数据集(多年份 CSV)聚合产出 节假日[主题]报告_从[起始年]到[终止年]看未来.html + 同名 .md(框架见 templates.md 第 7 节)。它消费既有四件套资产,不重复采集,是延续性方法论的进阶产出;历史年份数据优先取自实时拉取的 .baseline-cache/(上游 atomgit 仓库),按 references/historical-data-source.md 适配与 canon 规范化后聚合。

Analysis Framework (分析主题框架)

方法论原则:提示词固化的是分析框架,不是分析结论。

固定分析维度 (8 项,采集前确定,构成报告栏目骨架)

下列维度为必采骨架;括注项为专家评估补全的系统性子维度,缺失须在报告中标注"本期暂无公开数据",不得留白或编凑。

  1. 游客画像:出游人次、客群结构(亲子/大学生/银发)、出行方式与时长变化
  2. 景区数据:门票政策、限流预约、热门景区接待量;必采子项:二消结构(餐饮/住宿/文创/游乐)拆解、承载率与限流方式、文博/演艺独立细分;出现"客流增速 vs 二消/门票收入增速"背离时须做悖论分析
  3. 目的地:国内热门城市与县域、出境目的地、入境客源国(边检口径,不同时段数据不聚合)
  4. 酒店:RevPAR/ADR/OCC 三件套(必填,缺失标"本期无权威来源")、各档次(奢华/高端/中端/经济)价格表现;必采子项:渠道结构(OTA/直营/会员 + 佣金率侵蚀)
  5. 旅行社:订单量、产品结构(跟团/小团/定制)
  6. 旅游行业平台:携程、去哪儿、同程、飞猪、途牛等(以数据可获取性为准,不强制全覆盖);C 级平台增速须标"该平台自身口径,非全市场"
  7. 交通出行:铁路、民航、公路、水路的客运量与同比;必采子项:公路"跨区域人员流动量"须与公共客运量分列标注(口径字典第三节)、城市交通(地铁/网约车/出租)、购票提前期等前瞻指标
  8. 政策与宏观:促消费政策、免签政策、社零与出行宏观数据;必采子项:消费分级维度(升级/平替/悦己/折扣/下沉)与品类颗粒度(餐饮/服饰/3C/文旅/生鲜);旅游总花费与商务部社零分列不可相加

探索性主题 (1 项,具体项目由数据决定)

热门新消费:不预设具体业态清单。入选标准(须同时满足,且须可被数据集机器校验):

  1. 量化显著性阈值(满足任一):
    • 同比增速 ≥ 30%(A/B/C 级来源均须披露统计基数)
    • 或绝对规模 ≥ 对应品类可观测量级(如平台 GMV ≥ 10 亿元、人次 ≥ 100 万)
  2. ≥2 个独立机构来源交叉印证:须是**≥2 个不同机构的 URL,且在数据集中同一主题项目互链**(同一"数据点/主题"行下出现 ≥2 条不同来源机构记录);仅 1 源或同源多 URL 一律不进报告主叙事,降级为"待核实"仅在真实性说明中单列。
  3. 平台 C 级约束:若来源为携程/同程/美团等平台,增速/规模须标注"该平台自身口径,非全市场",不得作为行业代表。
  4. 阶段二硬圈定:阶段二必须在数据集 CSV 中以独立行显式圈定入选项目(主题列标"新消费"或具体业态名),未圈定进数据集的项目,阶段四报告不得凭印象自建"新消费"章节(解决暑假散落问题)。
  5. 具备消费带动效应或社会关注度;数据不足的候选项目不得强行写入报告。

反模式警示:宣称"≥2 独立来源印证"但实际仅单源 C 级,属虚假交叉印证,违反零虚构原则——见反模式第 7 条。

Continuity Methodology (纵向延续性分析框架)

方法论原则:单期报告是「快照」,系列报告才是「资产」。节假日消费数据具有强延续性——去年同节、本年上期、上一周期预测,共同构成本期判断的坐标系。本技能把"延续性"作为与"口径治理"并列的核心方法论,而非可选装饰。

机制底座:所有预测须进预测台账(数据集 数据性质=预计 + 缺口标记=预判待回填 + 预测ID),下一报告期回填核验,形成"预测→实测→复盘→反哺"闭环(详见 caliber-dictionary.md 第六节与 templates.md 第 5/6 节)。

延续性四问(每期报告必答)

  1. 去年同期回顾(YoY):本节假日 vs 去年同节假日。核心指标(出游人次/总花费/人均)必须先归一为 per-day 或可比天数再比较——春节 7/8/8/9 天、十一 8/7/8/7 天的天数漂移,未折算的绝对量对比一律判为口径错误。判读须区分"增量来自天数/口径"还是"真实增长"。
  2. 本年上期回顾(同年内节奏):本节假日 vs 本年已发生的其他节假日(如十一 vs 五一/端午/暑假)。观察年内消费节奏、增速收敛斜率(报复性出游退潮后是否进入中低个位数稳态)。
  3. 上一周期预测复盘(忠实诚恳):读取上一报告期预测台账,逐条对比「预测值→实测值→偏差%→归因→判语」。偏差 > ±10% 必须标失准并区分三类归因(口径效应 / 外生变量 / 方法偏差),不美化、不选择性引用。若本期为首期,标注"暂无上期预测可比",不编造。
  4. 下一节假日前瞻 + 中长期趋势:基于可比序列与已确认的放假安排/免签/促消费政策,给出下一节假日预测(中心值+区间+置信度+口径效应提示,不得当实测);并给出未来 3–12 月及更久的中长期结构性判断,附拐点判据(可观测指标,提前 1–2 假期预警)与置信度分级(已验证 / 待核验 / 存疑)。

纵向数据来源

  • 去年同期 / 本年上期:从 SSOT 数据集目录读取往年同节假日、本年已发生节假日的 消费数据集.csv,经 audit_caliber.py 口径校验后提取可比行(须 per-day 折算)。
  • 历史纵向基线库(优先,实时):阶段一第 4c 步已实时拉取 .baseline-cache/(唯一路径,2023–2026 × 5 节假日,上游 https://atomgit.com/g_ww/holiday_data_reports,clone/pull 实测约 9 秒;技能包不再内置快照);离线/拉取失败时纵向模块降级为首期基线标注,不编造历史。接入须按 references/historical-data-source.md17→22 字段适配(补 单位粒度/统计起止日/口径版本/指标口径类型/数据性质 5 派生字段)+ 数据点 canon 规范化(去年份/节假日名,如 2023春节国内旅游出游人次国内旅游出游人次)+ 枚举归一复合值复合、主题归并至字典 9 类)。
  • MCP 实时检索层(v3.8 互补):调用 holiday-data-mcpcompare_across_years 取去年同期/本年上期代表值,优先采用其自动 per-day 折算与口径/单位不一致告警(如 2024 亿人次 vs 2025 万人次 单位不一致、口径版本不同 → 提示不可直接相加比较);结果与 .baseline-cache/ 取数交叉验证,共同喂给四元键可比判定。另 get_data_point_detail 可按 id 取回完整 22 字段溯源,补入真实性说明逐条溯源表。详见 references/mcp-retrieval-layer.md
  • 上一周期预测:读取往年数据集 缺口标记=预判待回填 的行(预测台账)。
  • 跨年可比元组铁律:纵向比对键 = (节假日, canon(数据点), 口径类型, 地域scope),四元一致且覆盖 ≥2 年才可做同比/环比;否则标「单年/不可比」,不得编造趋势线(实证:历史库仅 1 元组跨 ≥3 年可直接 join,不 canon 规范化几乎无法跨年)。
  • 首期生成(无历史)时,上述对比优雅降级为"本期为首期基线",不编造历史数字。

City Dimension Extension (城市维度扩展 · 地域=城市时启用)

参数确认 解析出 地域 = 具体城市(或用户显式要"城市视角")时,在全国 SSOT 数据集之上叠加城市层。城市数据是全国数据集的空间剖面,不是另一套数字——每条城市数据必须勾稽(reconcile)到某一全国指标键,城市加总在可比口径下与全国总量闭合。

城市维度的全部细则在 references/*-city.mdassets/*-city.html / assets/chart-kit.html,本技能主流程沿用全国五阶段,仅在阶段一/二/三/四/五叠加【城市】增量步骤。

核心定位三句话

  1. 继承不重造:全国总量、口径字典、节假日配置、五阶段方法论继承自本技能全国模式;城市维度只增量定义城市字段、城市数据源、勾稽规则。
  2. 勾稽不脱钩:城市数据集每条数据 关联全国指标 字段指向全国 SSOT 某一行;可加指标(旅游总花费/社零/酒店RevPAR等)用闭合勾稽(占比 ≤ 100% + 未披露残差),流量指标(出游人次/客运量等)用上限勾稽(呈现倍数 1.5–2.5× 为正常,> 3× 触发阻断)。
  3. 图文要可读:城市报告大量使用内联 SVG 可视化(排名条形 / 区域分布 / 占比环 / 热力矩阵 / 对比发散条),图表与数据表双轨。

城市模式五阶段增量(【城市】标记步骤)

  • 阶段一·采集:读取 references/holiday-config.md 全国矩阵 + references/holiday-config-city.md 城市矩阵;9 大主题基础上追加城市组合检索词(城市总量/景区/酒店/交通/平台榜/县域);确定纳入城市集合(约 40 城基线 + 县域样本)与区域分组;平台城市榜标 C 级 + "该平台自身口径,非全市场"。
  • 阶段二·整理:城市数据集强制 30 字段(22 全国 + 8 城市:城市/区域/城市层级/关联全国指标/占全国比重/勾稽状态/城市排名/修订状态);每条城市数据必须关联全国指标(R-CITY-3);勾稽计算(可加指标算占比+残差生成测算行,流量指标算倍数标 流量非加和);勾稽校验 R-CITY-1~4。
  • 阶段三·输出:真实性说明六部件 + 城市增量「勾稽校验与覆盖率声明」节(总表 + 未披露清单 + 口径差异说明)。
  • 阶段四·报告:套用 assets/report-template-city.html(含图表容器),必含勾稽总表 + 排名图 + 区域图 + 对比图;图表片段见 assets/chart-kit.html,规范见 references/style-guide-viz.md;框架见 references/templates-city.md(六部分:导语→城市总览与勾稽→分区域→县域下沉→纵向演化→口径声明)。
  • 阶段五·交付:五件套齐备;首页套用 assets/landing-page-template-city.html(三卡片 + 连续性高亮条);三方勾稽校验:城市数据集 ↔ 全国 SSOT ↔ 真实性说明 数字闭合。

勾稽五铁律(城市 ⊂ 全国)

  1. 同口径才可比:城市与全国勾稽须「指标口径类型 + 口径版本 + 统计窗口 + 假期天数」四同,任一不同标 口径差异,不得相加。
  2. 占比规则分家族:可加指标合计 ≤ 100%+容差(> 100% 触发 R-CITY-1);流量指标占比可 > 100% 为正常(跨城重复),仅呈现倍数,> 3× 才阻断。
  3. 缺失不臆造:全国有数、城市无分城市披露时,仅以"其他/未披露"测算行(D 级、推算)兜底,不得编造具体城市值。
  4. 覆盖率声明(仅可加指标):给出「已披露城市占比合计」与「未披露残差」= 100%;覆盖率 < 40% 的排名标"局部样本,非全域排名";流量指标改报"披露城市倍数"。
  5. 排名仅在同口径城市间有效:跨指标/跨口径混排禁止;排名表须注明口径版本与可比城市集合。

城市模式反模式(增量,继承全国 11 条全部适用)

  • C1 城市加总超全国:可加指标城市加总 > 全国总量(重复计算)或流量指标倍数 > 3×(错配 bug)→ 阻断整改。
  • C2 幽灵城市:城市数据无 关联全国指标,自成"城市榜"不勾稽 → R-CITY-3 阻断。
  • C3 臆造未披露残差:用虚构城市值填满"其他/未披露" → 违反零虚构,仅许测算占位行。
  • C4 平台城市榜当全域排名:携程/同程榜直接称"全国城市排名"不标平台口径 → 标 C 级 + "该平台自身口径"。
  • C5 低覆盖率假装全域:仅披露 < 40% 城市却称"城市格局" → 必须标"局部样本",显式列未披露残差。

城市模式 FAQ

  • Q(城市):没有全国数据集怎么办? 先运行全国模式产出 SSOT,或以权威全国发布(文旅部等 A 级)建最小勾稽基准;无全国基准则城市数据无法勾稽,本模式不适用。
  • Q(城市):城市披露很少? 诚实标"部分勾稽/局部样本",仅呈现已披露城市排名并声明覆盖率,不编造未披露城市。
  • Q(城市):城市口径和全国不一致?勾稽状态=口径差异,并列说明,禁止相加;占比填"不可比"。
  • Q(城市):平台城市榜能用吗? 能,但 C 级 + "该平台自身口径,非全市场",作热度参考不与官方城市接待量加总。
  • Q(城市):县域数据? 城市层级=县域,与地级市及以上分列;"奔县"新消费标县域口径,不混加。

城市模式 Resources(增量文件)

  • references/caliber-dictionary-city.md — 城市维度口径字典 v1.1:城市 8 增量字段、勾稽两类规则(可加闭合/流量上限)、勾稽状态枚举(含 流量非加和)、R-CITY-1~4、修订状态与采集时点对齐
  • references/templates-city.md — 城市 30 字段 schema、勾稽校验表、城市报告六部分框架、可视化组件清单(C1–C6)、城市预测台账
  • references/holiday-config-city.md — 城市级数据源矩阵 v1.1:城市来源优先级、纳入城市集合(约 40 城)、区域分组、覆盖率预期、检索词
  • references/style-guide-viz.md — 城市可视化规范 v1.1:图表选型、配色、口径标注、SVG 组件约定、图文配比
  • references/development-prompt-city.md — 城市版五阶段操作细则
  • assets/report-template-city.html — 城市版单文件 HTML 报告骨架(含图表容器与示例组件)
  • assets/landing-page-template-city.html — 城市版首页门户骨架
  • assets/chart-kit.html — 内联 SVG 图表片段库(C1 排名条 / C2 区域条 / C3 发散条 / C4 占比环 / C5 热力矩阵 / C6 折线)

Five-Stage Workflow (五阶段工作流程)

阶段一:数据采集 (Data Collection)

  1. 确定目标参数:【目标年度】【节假日】,查阅 references/holiday-config.md 获取该节假日的日期范围、检索关键词矩阵、主要数据源优先级。
  2. 围绕 9 大主题建立检索关键词矩阵,逐主题联网检索(不少于 8 轮)。
  3. 探索性主题采用开放式检索:检索词用"[节假日]新消费热点/[节假日]消费新业态/[节假日]新兴消费"等宽泛表述,禁止预置具体业态关键词——业态必须在检索结果中涌现,而非在检索词中预设。
  4. 每轮检索记录《采集日志》,字段: 检索关键词 | 检索时间 | 标题 | 来源机构 | 报告/资料名 | 发布时间 | URL | 内容摘要 4b. 同源双录(v3.5 新增,L2 现象层入口):每轮检索除结构化数据点外,把榜单(TOP10 清单)、区间值(130%/60% 区间)、定性句("显著增长""翻倍")、政策事件(免签/消费券/放假安排)、平台热点等"现象级素材"一并记录(标题+URL+内容摘要即可),并尽力下载原文快照至 素材快照/(命名=来源机构_标题摘要)。这些素材不因"入不了 22 字段口径"而被丢弃——它们是 L2 现象素材库的原料。 4c. 基线实时拉取(v3.6 新增,v3.7 纯实时,默认开启):纵向分析前先拉取最新历史基线——在报告输出目录 .baseline-cache/ 执行 git clone --depth 1 https://atomgit.com/g_ww/holiday_data_reports.git .baseline-cache/(首次)或 git -C .baseline-cache pull --depth 1(后续增量,实测约 9 秒);技能包不内置快照,离线/拉取失败时纵向模块降级为首期基线标注(不得用任何过期数据冒充最新)。报告页脚须注明 历史基线版本: live@<commit>(刷新时间)未获取(离线/仓库不可达)(详见 references/historical-data-source.md 1.1 节)。 4d. MCP 实时检索层(v3.8 新增,可选互补):在 4c 拉取 .baseline-cache/ 后,可调用已连接的 holiday-data-mcp(已配置于 ~/.workbuddy/mcp.json,https://ai-x-ai.online/mcp,Bearer 鉴权)做结构化即时检索,作为 L1/L2 取数的交叉验证通道——list_holidays 确认本年/本期数据集可用性;query_data_points(按 年份/节日/主题/关键词/最低可信度/数据性质 过滤)取 L1 结构化数据点初稿;query_phenomena 取 L2 现象素材初稿。MCP 返回每行自带 可信度等级/数据性质/口径类型/来源URL/采集日期,可直接映射进 22 字段口径治理。MCP 与 4c 基线、联网检索互为交叉验证,不替代其中任一;MCP 不可达时跳过本步,回退 4c+联网检索,页脚标 MCP 未获取,不中断流程、不编造数据(详见 references/mcp-retrieval-layer.md)。
  5. 来源优先级:A 级(政府公告/官方统计/权威通讯社通稿)> B 级(权威媒体转引机构数据)> C 级(企业自我披露/券商研报)> D 级(弱溯源)。
  6. 旧闻剔除:核对发布时间,凡非目标年度/节假日口径的数据一律不入库(但历史性背景素材可记入 L2 备注,不进 L1)。
  7. 口径冲突暂存:同一指标出现多个口径时全部记录,不急于取舍。
  8. 阶段产出:《数据采集日志》(含 L1 数据点 + L2 现象素材双轨记录)。

详细规则见 references/development-prompt.md 阶段一。

阶段门禁 Checklist(阶段一结束前核对)

  • [ ] 【目标年度】与【节假日】已确认,holiday-config.md 已查阅
  • [ ] 9 大主题检索 ≥8 轮,探索性主题采用开放式检索(无预设业态关键词)
  • [ ] 采集日志字段齐全(含 URL、来源机构、发布时间)
  • [ ] 旧闻已剔除(非目标年度/节假日口径不入库)
  • [ ] 口径冲突已暂存,未急于取舍
  • [ ] 同源双录已执行(v3.5):现象级素材(榜单/区间/定性/政策/热点)已随轮记录,未因入不了 L1 口径而被丢弃
  • [ ] 基线实时拉取已执行(v3.6/v3.7).baseline-cache/ 已 clone/pull(或离线降级为首期基线标注),页脚标注基线来源与刷新时间
  • [ ] MCP 实时检索层已调用(v3.8,可选)holiday-data-mcp 已用于 L1/L2 交叉验证(或离线标注 MCP 未获取);返回数据已按 口径/可信度/数据性质 审查,未因便捷而绕过 4c/联网检索

阶段二:数据整理与质量评估 (Data Cleaning & QA)

  1. 数据质量快检:去重、缺失率、类型规范、数值单位统一。
  2. 逐条分级 + 口径字段填充:为每个数据点评估可信度等级 A/B/C/D,并强制填充新增 6 字段(单位粒度 / 统计起止日 / 口径版本 / 数据性质 / 是否测算 / 指标口径类型)。口径取值必须能在 references/caliber-dictionary.md 中找到对应条目,否则退回重标。
  3. 口径冲突处理:官方口径优先;无法判定主次时并列说明(同指标多口径均保留)。
  4. 弱溯源处理:找不到直接出处的数据点降级为 D 级,标注"弱溯源",附最接近的佐证口径。
  5. 推算/派生值强制规则:凡 数据性质=推算口径类型∈{测算,弱溯源}数值类型≠水平值 的数据点(含 per-day 人均、等效天数折算值、第三方推算),可信度强制 D 级,绝对禁止进入 B 级,且与实测数据分栏、不得混同;生成后须自动校验,消除跨年漂移(同性质数据今年标 D、明年不得标 B)。
  6. 人均口径规范人均消费 唯一指 per-trip(单位粒度=人均trip,数据性质=实际);人均每日消费 指 per-day(单位粒度=人均day,数据性质=推算且等级 D)。二者不得在同一报告混称"人均"。
  7. 跨年/调休天数折算:假期天数变动或合并拆分(春节 9 天 vs 八天、十一 8 天 vs 7 天)时,数据集须同时记录 per-day 等效值或等效天数口径;报告标题禁止用未折算的绝对增量做"创新高"主叙事(见口径字典第一节)。
  8. 探索性主题硬圈定:基于已分级数据集,按第三节量化标准筛选,在 CSV 中以独立行显式圈定入选项目(主题列标"新消费"或具体业态名);未圈定进数据集者,阶段四不得凭印象自建"新消费"章节。
  9. 纵向数据归集(延续性底座):从 SSOT 数据集目录读取(a)去年同节假日 CSV、(b)本年已发生节假日 CSV、(c)往年 缺口标记=预判待回填 的预测台账行;经 audit_caliber.py 口径校验后提取可比行,统一 per-day 折算,为阶段四"纵向延续与前瞻"模块备料。历史补齐:SSOT 历史不全时,读取阶段一第 4c 步实时拉取的 .baseline-cache/(上游 atomgit 仓库 g_ww/holiday_data_reports)作去年同期/本年上期补数,按 references/historical-data-source.md 做 17→22 字段适配 + 数据点 canon 规范化 + 枚举归一(复合值复合、主题归并至字典 9 类);归一动作记入 缺口标记。首期无历史(含离线拉取失败)时优雅降级(见 Continuity Methodology)。
  10. 预测入账(闭环机制):阶段四若给出下一节假日前瞻/中长期点位预测,须在本数据集以独立行记录:数据性质=预计缺口标记=预判待回填、备注写 预测ID=[年度][节假日]-F0X 与「中心值/区间/置信度」;预测不得混入实测栏,且报告正文须用预测卡并标置信度。
  11. 阶段产出:《数据集》(CSV),强制 22 字段主题 | 数据点 | 数值 | 单位 | 单位粒度 | 统计起止日 | 统计窗口 | 口径版本 | 指标口径类型 | 口径类型 | 数据性质 | 基期 | 假期天数 | 数值类型 | 采集日期 | 缺口标记 | 来源机构 | 报告/资料名 | 发布时间 | 可信度等级 | URL | 备注
  12. L2 现象素材库整理(v3.5 新增):将采集日志中入不了 L1 22 字段的素材(榜单/区间/定性/政策/热点)整理进 现象素材库.json + 现象素材库.md:贴 现象标签、按 9 类字典归 主题归属、记 来源URL/采集日期/与L1指标键(可空)、HTML 快照入 素材快照/素材不因口径门槛被丢弃(唯一删除条件:无 URL 佐证的纯臆测)。同一现象标签连续 ≥2 期出现且可量化 → 记入备注"建议升 L1 跟踪",下期写入 holiday-config.md 检索词/指标清单。

阶段门禁 Checklist(阶段二结束前核对)

  • [ ] 去重、单位、类型已统一,缺失率已知
  • [ ] 每个数据点已标注 A/B/C/D,且 数据性质=推算/口径类型∈{测算,弱溯源}/数值类型≠水平值全部为 D 级(无推算值混入 B)
  • [ ] 22 字段口径元数据已填充且可在 caliber-dictionary.md 追溯(主题取自 9 类字典、指标口径类型取自指标字典、口径类型取自取值表)
  • [ ] 口径冲突已处理(官方优先 / 无法判定则并列说明)
  • [ ] 弱溯源已降级 D 级并附最接近佐证口径
  • [ ] 人均口径合规:per-trip 称"人均消费"、per-day 称"人均每日消费(推算, D 级)"
  • [ ] 跨年天数变动已附 per-day 等效值,标题无未折算绝对增量
  • [ ] 探索性主题(热门新消费)入选项目已在数据集 CSV 显式圈定(≥2 独立机构 URL 互链,否则降级"待核实")
  • [ ] 纵向数据已归集:去年同期/本年上期可比行、上期预测台账行已读取(首期标注"无历史")
  • [ ] 本期预测(若有)已入账:数据性质=预计+缺口标记=预判待回填+预测ID,未混入实测
  • [ ] 数据集 22 字段齐全,无空 URL 字段未加说明
  • [ ] L2 现象素材库已产出(v3.5):榜单/区间/定性/政策/热点素材已入库(含 URL),无 URL 纯臆测已剔除;拟升 L1 的现象已在备注标记

阶段三:数据输出 (Data Output)

基于数据集生成《数据真实性说明》,包含六部件:

  1. 引言:采集与核实方法、数据局限(时点口径差异、转述性概括、推算标注)
  2. 可信度分级标准:A/B/C/D 定义与图例
  3. 台账差异与修正声明:与原稿/不同口径的差异逐条列出并更正
  4. 逐条溯源表:数据点 | 来源机构 | 发布时间 | 等级 | 可点击 URL
  5. 预测复盘与回填声明:若有上期预测台账,逐条列「预测值→实测值→偏差%→归因→判语」;偏差 > ±10% 诚实标"失准"并分三类归因(口径效应/外生变量/方法偏差),不美化、不选择性引用
  6. 全量来源机构清单
  7. L2 现象素材清单(v3.5 新增):列 现象素材库 全部条目(现象标签 | 现象描述 | 来源机构 | 可点击 URL),并声明"以下为现象级/定性素材,非统计口径,仅供趋势与热点观察"。

无公开 URL 的(券商研报付费资料等)如实标注,并给出替代验证路径。

阶段门禁 Checklist(阶段三结束前核对)

  • [ ] 六部件齐备:引言 / 分级标准 / 修正声明 / 逐条溯源表 / 预测复盘 / 来源清单
  • [ ] 每条数据含可点击 URL 或可溯源声明(无 URL 项已如实标注+替代路径)
  • [ ] 修正声明已列出口径差异与原稿更正
  • [ ] 溯源表等级徽章与数据集 A/B/C/D 一一对应
  • [ ] 预测复盘已诚实呈现(吻合/失准均写明,含三类归因)
  • [ ] L2 现象素材清单已列(v3.5):全部素材条目含 URL,并声明"现象级素材,非统计口径"

阶段四:报告生成 (Report Generation)

  1. 仅从《数据集》取数:报告中每个数字(含纵向对比、预测点位)必须在数据集或预测台账有对应条目;本期现象/榜单/定性素材从 L2 现象素材库取数,引用时标"现象级/定性素材,非统计口径"(v3.5 双轨)。
  2. 报告整体框架(信息布局 v2,四部分)——全面梳理后的新布局,核心是把"延续性"前移到读者第一屏:
    • 第一部分 · 导语与核心结论:标题 + standfirst + 首段正文(结论先行)+ 关键数字带(6 卡:出游人次/总花费/铁路/民航/酒店 RevPAR/出境游,均取自数据集)。
    • 第二部分 · 纵向延续与前瞻(紧接导语,凸显数据延续性):按 templates.md 第 6 节六子节搭建——2.1 口径裁决 → 2.2 去年同期回顾(per-day 折算后比)→ 2.3 本年上期回顾 → 2.4 上一周期预测复盘(忠实诚恳,失准须标)→ 2.5 下一节假日前瞻(预测卡+置信度,不得当实测)→ 2.6 中长期趋势预判(拐点判据+置信度分级)。
    • 第三部分 · 分主题深度分析:8 固定维度 + 1 探索性(沿用现有骨架,栏目依阶段二圈定清单)。本期现象/热门新消费/目的地热点/政策速览等"丰度栏目"以 L2 现象素材库为素材,与 L1 统计叙事分栏呈现,不混同。
    • 第四部分 · 口径与数据质量声明:摘要(详细见真实性说明)。
  3. 排版与风格:严格按 references/style-guide.md 执行;可直接套用 assets/report-template.html 骨架(已含纵向模块与预测/偏差/拐点组件)。
  4. 技术约束:全部 CSS/JS 内联、无外链、无 emoji、简体中文、响应式。
  5. 测算/预计标注:数据集 数据性质=推算(含 per-day 人均)标"测算(D 级)";数据性质=预计 的预测点位用预测卡并标置信度,不得混入实测数字栏;页脚注明来源机构与报告年份。涉及"创新高"等规模叙事且基期天数不同时,必须显式折算并标注口径版本,禁止未折算绝对增量。
  6. 阶段产出:消费数据报告.html

阶段门禁 Checklist(阶段四结束前核对)

  • [ ] 报告每个数字均在数据集/预测台账有对应条目(无无源数字)
  • [ ] 框架为 v2 四部分:导语 → 纵向延续与前瞻 → 分主题深度 → 口径声明
  • [ ] 纵向延续与前瞻六子节齐备;去年同期/本年上期对比已 per-day 折算
  • [ ] 上一周期预测复盘已诚实呈现(吻合/失准,失准标出且含三类归因)
  • [ ] 下一节假日前瞻用预测卡标置信度,未当实测写入消费数字栏
  • [ ] 规模叙事"创新高"已按口径字典折算(基期天数不同必有 per-day 等效值)
  • [ ] 人均口径合规:仅 per-trip 称"人均消费",per-day 称"人均每日消费(测算, D 级)"
  • [ ] 探索性主题栏目依阶段二圈定清单搭建,未凭印象自建章节
  • [ ] 排版符合 style-guide.md(CSS/JS 内联、无外链、无 emoji、简体中文、响应式)
  • [ ] 探索性主题栏目依阶段二圈定清单搭建,未预固化业态、未凭印象自建章节

阶段五:成果交付 (Delivery)

  1. 交付物齐备:数据集(L1 CSV)+ 现象素材库(L2 JSON/MD, v3.5) + 数据报告 + 数据真实性说明 + 首页
  2. 首页生成
    • 套用 assets/landing-page-template.html 骨架
    • 卡片一:摘录数据报告的头条部分(大标题 + standfirst + 首段正文),链接指向 消费数据报告.html
    • 卡片二:摘录数据真实性说明的引言部分(方法说明 + 数据局限声明),链接指向 数据真实性说明.html
    • 卡片三:数据集 CSV 前 5 行以表格形式预览,链接指向 CSV 文件下载
    • 连续性高亮条(推荐):当存在跨年纵向报告或下一节假日前瞻时,在卡片上方加一条"纵向趋势 / 下一节假日前瞻"入口,链向跨年专题报告或报告第二部分
    • 首页文件名固定为 index.html(EdgeOne 默认入口)
    • 技术约束同报告:全部 CSS/JS 内联、无外链、无 emoji、简体中文、响应式
  3. 一致性校验:报告所有数字 <-> 数据集 <-> 真实性说明一一对应,首页链接全部可达,缺失即返工。跨年纵向专题报告(若产出)须与其引用的各年份数据集三方一致。
  4. 目录结构(分年分节持久化,v3.5):
    data/{年份}/{节假日}/              # 每年每节独立目录,与历史基线库同构,持续沉淀
    ├── index.html                  # 首页(EdgeOne 默认入口)
    ├── 消费数据报告.html             # 完整报告(L1 纵向 + L2 本期现象)
    ├── 数据真实性说明.html            # 真实性说明(含 L2 素材清单)
    ├── [年度][节假日]消费数据集.csv    # L1 结构化数据集(22 字段)
    ├── 现象素材库.json / .md         # L2 非结构化现象素材(v3.5)
    ├── 素材快照/                    # L2 原文 HTML/PDF/图片快照(尽力而为)
    ├── 采集日志.csv                 # 阶段一检索记录
    └── overview.md                  # 交付说明 + 沉淀登记(L1 行数/L2 条数/快照数)
    

    每期完成后将 数据集.csv + 现象素材库.json 同步至历史基线上游(atomgit g_ww/holiday_data_reports),实现跨期资产沉淀(见 references/data-architecture.md 第二节)。

  5. 交付说明:各文件用途、使用方法、数据等级分布概览(含 L1/L2 数量)。
  6. EdgeOne 发布说明(如用户需要):首页 index.html 为 EdgeOne 部署入口,部署后读者通过首页访问三件套全部资源。

阶段门禁 Checklist(阶段五结束前核对)

  • [ ] 交付物齐备:数据集(L1) + 现象素材库(L2) + 数据报告 + 数据真实性说明 + 首页 index.html
  • [ ] 报告含 v2 框架:纵向延续与前瞻模块六子节齐备(首期无历史已优雅降级)
  • [ ] 首页三卡片链接全部可达(报告/说明/CSV);连续性高亮条(若有)指向正确
  • [ ] 三向对照校验通过:报告 ↔ 数据集 ↔ 真实性说明 数字一一对应
  • [ ] 预测台账闭环:本期预测已入账(数据性质=预计+缺口标记=预判待回填+预测ID),供下期回填
  • [ ] 分年分节目录已落盘(v3.5)data/{年份}/{节假日}/ 含 L1 CSV + L2 现象素材库,overview 登记 L1/L2/快照数量
  • [ ] 目录结构与 overview.md 交付说明已完成(含纵向/预测说明)
  • [ ] 任务未越过"不适用场景"边界(如非中国节假日、需实时数据等已排除)

Format & Delivery Rules (格式分工,硬性)

  • 面向读者阅读的成果(首页、数据报告、数据真实性说明) -> 单文件 HTML
  • 面向报告开发者的文档(开发提示词、说明文档) -> Markdown (.md),不产出 HTML 版
  • 数据集 -> CSV(便于程序化消费与下载)
  • 本技能所有阶段性规则文档均为 md,仅供执行者(AI/开发者)参考,不交付给读者。

Anti-Patterns / 反模式与修正(不可逾越,附后果与修正步骤)

下列条目即原"质量红线",以反模式 → 后果 → 修正步骤形式呈现,便于执行时自查与纠错。

1. 编造或杜撰数据

  • 反模式:凭印象/记忆填充数字,或虚构来源机构与 URL。
  • 后果:报告可信度崩塌,一旦被核验即全盘失信,真实性说明失效。
  • 修正:无来源数据一律不入库;来源缺失时标注 D 级"弱溯源"并附最接近佐证口径,或剔除。

2. 公开数据不附可核验 URL

  • 反模式:互联网公开数据只写"据某报道",不附链接,或给失效/模糊地址。
  • 后果:读者无法核验,逐条溯源形同虚设。
  • 修正:每条公开数据必须附可点击 URL;付费研报如实标注"无公开 URL"并给替代验证路径(如 STR 官网、券商新浪财经页)。

3. 推算值当实测值呈现

  • 反模式:把测算/估算值混入实测数据,不标记"测算"。
  • 后果:读者无法区分事实与推断,溯源表口径混淆。
  • 修正:测算值单独标记"测算"并与实测数据分栏,不得混同。

4. 口径冲突擅自二选一

  • 反模式:遇到多口径直接合并或凭偏好取舍。
  • 后果:丢失信息,可能选错口径,读者无从判断差异。
  • 修正:官方口径优先;无法判定主次时并列说明,注明差异与各自适用场景。

5. 交付前跳过全量对照校验

  • 反模式:报告成稿后不逐条核对"数据 ↔ 来源"对应关系。
  • 后果:报告数字与数据集/真实性说明脱节,出现无源数字。
  • 修正:交付前强制完成三向对照校验(报告 ↔ 数据集 ↔ 真实性说明),缺失即返工。

6. 采集前固化探索性主题

  • 反模式:在检索词中预设"音乐节/咖啡节"等具体业态清单。
  • 后果:检索变"验证预设"引入确认偏误,冷门业态被强行写入,热门业态被遗漏。
  • 修正:探索性主题仅给入选标准,具体项目由检索结果涌现、阶段二圈定;固维度可预置,结论由数据决定。

7. 违反口径字典 / 口径混用未折算

  • 反模式:公路"人员流动量"与铁/民/水"客运量"直接加总;人均 per-trip 与 per-day 混称"人均";旅游总花费与社零相加;跨年天数不同仍用未折算绝对增量做"创新高"主标题;GMV/客流/播放量混为同一"消费"概念。
  • 后果:量级与结论误导,读者无法识别口径差异,溯源表口径混淆。
  • 修正:严格按 references/caliber-dictionary.md 标注每条数据的「指标口径类型 / 单位粒度 / 口径版本」;跨家族指标分列不可相加;天数变动必附 per-day 等效值,标题禁用未折算绝对增量。

8. 虚假交叉印证(探索性主题)

  • 反模式:报告宣称"≥2 独立来源印证",实际仅单源 C 级,或同源多 URL 充数;或凭印象自建"新消费"章节而数据集无对应圈定行。
  • 后果:虚构探索性结论,违反零虚构原则,是真实性说明的致命漏洞。
  • 修正:入选须满足 ≥2 个不同机构 URL 且在数据集同项目互链;不足则降级"待核实"仅列真实性说明;阶段四栏目必须源自阶段二 CSV 显式圈定行,禁止凭印象自建。

9. 预测无台账 / 无法复盘

  • 反模式:报告给出下一节假日前瞻或中长期点位预测,但不记入数据集/预测台账(无 预测ID、无 缺口标记=预判待回填);或下期报告对上期预测只字不提、选择性引用"说对的"。
  • 后果:延续性断裂,预测永远无法被核验,「预测→复盘→反哺」闭环失效,读者无法判断预测可靠性。
  • 修正:凡预测必入账(阶段二第 10 步);下期阶段二读取上期预测台账,在报告 2.4 与真实性说明逐条复盘,偏差 > ±10% 标"失准"并给三类归因,不美化。

10. 纵向比较不折算 / 直接比绝对量

  • 反模式:去年同期/本年上期对比直接用未折算绝对量(如 2026 春节 9 天 5.96 亿 vs 2025 八天 5.01 亿,称"+18.9% 创新高"),忽略春节 7/8/8/9 天、十一 8/7/8/7 天的天数漂移。
  • 后果:系统性高估增速,漂亮曲线掩盖口径陷阱,结论反转。
  • 修正:任何跨年/跨节假日纵向对比,先归一为 per-day 或可比天数再谈增减(口径字典第一节、第二节);报告纵向模块标题禁用未折算绝对增量。

11. 预测当实测 / 前瞻混入消费数字栏

  • 反模式:假期未至(如 2026 十一)却把前瞻预测值写入"消费数据"栏目,或预测卡不标置信度、不留"待回填"痕迹,读者误当已发生事实。
  • 后果:无中生有,违背零虚构底线,一旦实测偏离即信用破产。
  • 修正:假期未发生/数据未发布时,消费类栏目统一标"本期暂无数据(假期未发生)";预测仅置于 2.5 前瞻模块,用预测卡标置信度与口径效应提示,数据集 数据性质=预计 单独成行,绝不与实测混栏。

12. 数据点内嵌年份 / 纵向无法 join

  • 反模式数据点 写成 2023春节国内旅游出游人次(内嵌年份+节假日名),导致去年/今年同名无法跨年 join(实测:历史库按 (节假日,数据点,口径类型) 跨 ≥3 年的元组仅 1 个)。
  • 后果:纵向延续章节无米下锅,强行"对比"只能靠编或靠猜。
  • 修正数据点 一律去年份/去节假日名(canon 键,如 国内旅游出游人次);纵向比对前按 references/historical-data-source.md 第 3 节做 canon 规范化,四元键 (节假日, canon, 口径类型, 地域scope) 一致且 ≥2 年才可比。

13. 非数值误标水平值

  • 反模式数值三亚/厦门近700超四成3-12月 等列表/定性句,却标 数值类型=水平值(实测:历史库 59 行此错误)。
  • 后果:纵向聚合把定性文本当数字入趋势线,图表与结论失真。
  • 修正数值 非数值时必须标 定性;含「/」的列表标 复合;禁标 水平值;水平值 仅限可直接入趋势线的纯数字。

14. 历史数据不归一直接聚合

  • 反模式:接入历史 CSV 时不归一枚举(复合值 未改 复合政策与宏观/新消费 等主题别名未并回字典 9 类、口径类型与字典写法不一致),纵向聚合按别名分裂出多条同义曲线。
  • 后果:跨年曲线断裂、主题分散,读者误判趋势。
  • 修正:历史接入强制枚举归一(见 references/historical-data-source.md 2.3 节归一表),归一动作记 缺口标记,保证可追溯可回滚。

FAQ / 常见问题

Q1:单一弱来源的数据点怎么办? 标注 D 级"弱溯源",附最接近佐证口径;若无可交叉印证且为关键结论,降级为"待核实"或在报告中弱化呈现,不得作为硬数字引用。

Q2:假期跨年/调休导致统计区间怎么处理? 以国务院办公厅放假安排为准(如春节常跨农历年、部分节假日调休连休)。数据集每条数据须在「统计起止日」「口径版本」两列注明区间与天数口径(如 8天口径 9天口径);检索时覆盖跨年区间避免漏采。跨年天数变动时,报告主叙事须附 per-day 等效值,禁止用未折算绝对增量做"创新高"标题(详见口径字典第一节)。

Q3:两个口径都权威、相互冲突怎么办? 并列呈现,各自注明发布机构与时间,由读者自行判断;报告叙事可择主流口径,但不得掩盖差异,须在真实性说明修正声明中列明。

Q4:某个固定维度本期无公开数据? 该栏目可标注"本期暂无公开数据",不得编造填充以凑齐栏目;可保留栏目空位并说明原因。

Q5:用户只要四件套中的某几件? 可按需裁剪(如仅要报告+数据集),但报告取数仍须来自数据集,真实性说明与数据集保持对应;缺失交付物须在交付说明中注明。

Q6:数据集规模要多大? 无固定下限,但应覆盖 9 大主题主干;探索性主题入选项目须满足量化入选标准(增速≥30% 或绝对规模可观,且 ≥2 个不同机构 URL 在数据集同项目互链),宁缺毋滥,不足则降级"待核实"不进报告主叙事。

Q7:上一周期预测怎么复盘? 阶段二第 9 步读取 SSOT 目录中往年数据集 缺口标记=预判待回填 的行(预测台账);下期报告 2.4 节与真实性说明「预测复盘与回填声明」逐条对比:预测值→实测值→偏差%→归因(口径效应/外生变量/方法偏差)→判语(吻合/失准)。偏差 > ±10% 必须标"失准",不美化、不选择性引用。回填后改 缺口标记=已回填-偏差X%

Q8:纵向对比数据从哪来?怎么保证可比? 数据源为 SSOT 数据集目录中往年同节假日、本年已发生节假日的 消费数据集.csv,经 audit_caliber.py 口径校验后提取可比行。可比铁律:跨年/跨节假日先 per-day 折算(春节 7/8/8/9 天、十一 8/7/8/7 天漂移必须归一),再谈增减。首期生成无历史时,2.2/2.4 标注"本期为首期基线,暂无去年同期/上期预测可比",不编造。

Q9:假期还没到,要做预测怎么办? 只做前瞻,不做消费数字。数据集仅收录已确认的放假安排/政策(A 级);预测置于报告 2.5 前瞻模块,用预测卡标中心值+区间+置信度+口径效应提示,数据性质=预计 单独成行并 缺口标记=预判待回填,待假期结束后回填核验。消费类栏目统一标"本期暂无数据(假期未发生)"。

Q10:历史纵向数据从哪拿?历史 CSV 和当年 22 字段对不上怎么办? 历史纵向基线默认实时拉取(v3.6 起):阶段一第 4c 步在 .baseline-cache/ 执行 git clone --depth 1 https://atomgit.com/g_ww/holiday_data_reports.git(首次)/ git -C .baseline-cache pull --depth 1(增量),保证用上游最新数据;技能包不内置快照,离线或拉取失败时纵向模块降级为首期基线标注(页脚 未获取),不编造历史。历史 CSV 为专家团 P0 的 17 字段版本,是 22 字段的严格子集,按 references/historical-data-source.md 接入:补 5 个派生字段(单位粒度/统计起止日/口径版本/指标口径类型/数据性质)→ 数据点 canon 规范化(去年份/节假日名)→ 枚举归一(复合值复合政策与宏观消费宏观热门新消费新消费目的地/跨境/出入境景区目的地)。跨年可比四元键 (节假日, canon, 口径类型, 地域scope) 一致且 ≥2 年才可比,否则标"单年/不可比"。2026 各 CSV 多为进行中/前瞻数据(如 2026 十一仅 6 行全为放假安排),属预测台账输入,不得当实测。

Q11:会不会为了口径规范而丢掉该节日特有的现象信息?(双层数据模型) 会,这正是 v3.5 要解决的。实证:2026 暑假早版 78 行 vs 22 字段版 46 行,同名数据点仅 1 个,丢失的 77 条几乎全是榜单/区间/定性/政策等"现象层"素材。解法是数据双轨references/data-architecture.md):统计性质强、可直接入趋势线的进 L1 结构化层(22 字段,保延续性);榜单/区间/定性句/政策事件等进 L2 非结构化现象层现象素材库.json/.md + 原文快照,保时点丰度)。L2 不因入不了 22 字段而被丢弃(唯一删除条件:无 URL 佐证的纯臆测);进入报告正文须标"现象级/定性素材,非统计口径"。同一现象连续 ≥2 期出现且可量化 → 升级为 L1 跟踪指标,形成"现象→指标"正向循环。每期按 data/{年份}/{节假日}/ 分目录持久化,并与历史基线库(atomgit 仓库)同构沉淀,跨期资产持续积累。

Q12:历史基线是每次调用都实时下载吗?离线怎么办? 是的,v3.6 起默认每次调用实时拉取:阶段一第 4c 步在输出目录 .baseline-cache/ 执行 git clone --depth 1(首次,约 9 秒)或 git pull --depth 1(增量,秒级),保证使用上游 atomgit 仓库最新数据。技能包不内置快照(v3.7 已删除):离线/拉取失败时纵向模块降级为首期基线标注(页脚 未获取),不中断流程、不编造历史。镜像目录可写、不污染技能安装目录;可用参数 baseline_dir= 指定其他位置。若用户希望本次跳过拉取(如纯离线分析),可显式说明"不刷新基线",SKILL 将跳过 4c 步并以"无历史基线"处理。

Q13:怎么用 holiday-data-mcp 这个 MCP 做实时检索?它和 atomgit 基线什么关系? holiday-data-mcp(已配置于 ~/.workbuddy/mcp.json,https://ai-x-ai.online/mcp,Bearer 鉴权)是节假日消费数据的结构化实时检索入口,查询后端与本技能历史基线同源(atomgit g_ww/holiday_data_reports 的衍生索引)。它不是 atomgit 的替代,而是其上的检索互补层:atomgit clone/pull(4c)继续作为原始 CSV 落盘与跨期沉淀源,MCP 提供无需 clone 的即时检索——list_holidays 看可用数据集、query_data_points/query_phenomena 取 L1/L2 初稿、compare_across_years 做跨年同比(自动口径/单位不一致告警)、get_data_point_detail 完整溯源。三者互为交叉验证,任一不可达都降级不中断(详见 references/mcp-retrieval-layer.md)。

Resources

  • references/development-prompt.md -- 完整开发提示词(v3.5):五阶段操作细则、角色定位、质量红线、口径规范、纵向延续性方法论、历史纵向基线库与实时刷新机制,可按年度/节假日替换参数后作为独立提示词提交
  • references/holiday-config.md -- 节假日配置表(v1.2):六类节假日日期/关键词/全源 A-J 数据源矩阵/全源采集门禁/纵向与预测规则(含中秋独立/合并规则)
  • references/caliber-dictionary.md -- 口径字典(v2.0,强制):统一 22 字段字典、统一主题字典(9类)、统一指标口径字典、口径类型取值表(L1-L4)、基期规范、数值类型规范、预测台账与缺口标记;公路人员流动量≠客运量、人均 per-trip/per-day、跨年天数折算、旅游花费 vs 社零不可相加、中秋合并规则
  • references/templates.md -- 采集日志、数据集(22 字段 schema)、真实性说明(含预测复盘)、首页结构、预测台账模板、报告「纵向延续与前瞻」六子节模板、跨年纵向专题报告模板
  • references/historical-data-source.md -- 历史纵向基线数据源 v1.2:atomgit 仓库(g_ww/holiday_data_reports)唯一权威源、调用时实时拉取机制(.baseline-cache/,clone/pull 实测可行;v1.2 起不内置快照,离线降级为首期基线)、历史 17 字段 → SKILL 22 字段对账适配器(5 派生字段 + 枚举归一表)、数据点 canon 规范化(跨年 join 铁律)、去年同期/本年上期取数流程、R13–R15 质量规则实证
  • references/mcp-retrieval-layer.md -- MCP 实时检索层 v1.0(v3.8 新增)holiday-data-mcp 的 6 工具与技能阶段映射、调用纪律(引用必附 URL+采集日期 / 实际-预计-推算分离 / reliability=? 不引用 / 口径告警先对齐)、接入点(阶段一 4d 取数交叉验证、阶段二第 9 步纵向上游、阶段三溯源)、离线降级;作为 atomgit 基线的结构化检索互补层
  • references/data-architecture.md -- 数据架构 v1.0(v3.5 新增):L1 结构化层(22字段,保延续性) + L2 非结构化现象层(榜单/区间/定性/政策素材库,保时点丰度)双层模型;分年分节持久化目录 data/{年份}/{节假日}/;L2 素材库 JSON/MD schema;现象→指标升级通道;双轨质量红线
  • references/style-guide.md -- 经济学人/FT 排版规范:CSS 变量、字体、颜色、组件清单(含首页组件、预测卡/偏差卡/拐点判据/置信度徽章)
  • assets/report-template.html -- 经济学人/FT 风格单文件 HTML 报告骨架模板(v4 设计系统:明暗双主题 + 纵向延续与前瞻模块 + 预测卡/偏差卡/拐点判据/置信度徽章 + 可信组件[徽章/callout/预测块/来源披露] + Hero 卡/图表 + 页脚导航 + 可达性 + 响应式 + 全部内联 CSS;使用说明见文件末尾注释)
  • assets/landing-page-template.html -- 经济学人/FT 风格单文件 HTML 首页门户骨架(v4 设计系统:明暗双主题、appbar/breadcrumb 骨架、三卡片入口 + 连续性高亮条 + footer-nav、全部内联 CSS/JS;使用说明见文件末尾注释)
  • assets/icon.jpg -- 技能图标(1024x1024 JPG,体积<5MB),简洁大气:折叠报刊文档+递增柱形图+圆形核验徽章
  • assets/icon.svg -- 上述图标的 256x256 SVG 矢量源文件,便于后续修改
  • assets/ -- 报告/首页模板、图表片段库、图标(不含历史基线快照:v3.7 起基线随调用实时拉取至输出目录 .baseline-cache/,见 references/historical-data-source.md

城市维度增量 Resources(地域=城市时引用)

  • references/caliber-dictionary-city.md -- 城市维度口径字典 v1.1(城市 8 增量字段、勾稽两类规则、勾稽状态枚举、R-CITY-1~4、修订状态与采集时点对齐)
  • references/templates-city.md -- 城市 30 字段 schema、勾稽校验表、城市报告六部分框架、可视化组件清单(C1–C6)、城市预测台账
  • references/holiday-config-city.md -- 城市级数据源矩阵 v1.1(城市来源优先级、纳入城市集合约 40 城、区域分组、覆盖率预期、检索词)
  • references/style-guide-viz.md -- 城市可视化规范 v1.1(图表选型、配色、口径标注、SVG 组件约定、图文配比)
  • references/development-prompt-city.md -- 城市版五阶段操作细则
  • assets/report-template-city.html -- 城市版单文件 HTML 报告骨架(含图表容器与示例组件)
  • assets/landing-page-template-city.html -- 城市版首页门户骨架
  • assets/chart-kit.html -- 内联 SVG 图表片段库(C1 排名条 / C2 区域条 / C3 发散条 / C4 占比环 / C5 热力矩阵 / C6 折线)

Usage Notes

  • 参数确认优先:运行前先按「Parameter Resolution」解析 [年份][节日][地域];年份默认今年、地域默认全国、节日默认当前日期所在节假日,任一无法默认(尤其节日)则主动提示用户,绝不臆造。
  • 年度可变:将提示词/模板中的【目标年度】替换为目标年份即可复用。
  • 节假日可变:将【节假日】替换为目标节假日即可复用。查阅 references/holiday-config.md 获取该节假日的检索关键词与数据源。
  • 城市模式须先有全国 SSOT:域名为城市时,确保本次已生成或用户已提供对应 [年度][节日] 的全国数据集,作为勾稽基准。
  • 若用户只要四件套中的某几件,可按需裁剪,但报告取数仍须来自数据集。
  • 交付后用 present_files 打开 HTML 文件(首页、报告与真实性说明)供读者预览;数据集与说明文档以卡片列出。
  • 若用户需要发布到 EdgeOne:将整个报告目录作为静态站点部署,首页 index.html 自动作为默认入口。