← Back to skills
extension
Category: Data & AnalyticsNo API key required

经管实证分析结果一键输出

用于论文写作者一键完成基础实证分析。当用户提供 CSV、Excel、Parquet 或 DTA 数据目录,并指定因变量、自变量与控制变量时使用;自动读取和合并公司年度数据,输出 M1-M4 基准回归,并仅在基准结果不显著或不稳定时执行可追溯的有限探索,生成期刊论文风格 HTML、Excel 和可复现记录。所有统计数字必须来自脚本,禁止编造或选择性报告。

personAuthor: user_5f32bb48hubcommunity

Empirical Research Agent 客户使用说明

版本:v2026.07.21

本技能用于读取 CSV、Excel、Parquet 或 DTA 企业年度数据,自动清洗并安全合并多份文件,生成 M1–M4 基准回归、可追溯的有限探索、可选调节/中介/异质性分析,以及单时点或多时点 PSM-DID 报告。正式输出包括期刊式 HTML、Excel 和完整复现记录。

1. 安装到 Codex

  1. 解压交付的 ZIP。

  2. 将整个 empirical-research-agent 文件夹复制到:

    %USERPROFILE%/.codex/skills/empirical-research-agent
    
  3. 重新打开 Codex 任务,使技能被重新发现。

  4. 在 Codex 中使用 $empirical-research-agent 调用本技能。

如果你的 Codex 使用了自定义 CODEX_HOME,请改为复制到:

%CODEX_HOME%/skills/empirical-research-agent

2. 首次环境准备

本技能使用客户电脑中现有的 Python,不内置 Python 运行时。建议使用 Python 3.10–3.12 或 Anaconda。

在技能目录打开终端并检查入口:

python scripts/run_one_click.py --help

如果提示缺少第三方依赖,请先确认当前 Python 环境,再安装:

python -m pip install -r requirements.txt

如果 python 命令不可用,可尝试 Windows Python Launcher:

py -3 scripts/run_one_click.py --help
py -3 -m pip install -r requirements.txt

Codex 不应在未取得你许可时静默安装软件或修改全局 Python 环境。

3. 准备数据

  • 将数据放在技能目录之外的客户自有目录。
  • 支持 .csv、.xlsx、.xls、.parquet 和 .dta。
  • 可以在同一数据目录放置多份公司年度数据;技能会识别公司代码和年份、清理 CSMAR 元数据行,并按安全键合并。
  • 数据至少应包含公司代码、年份、因变量、核心自变量,以及你要求使用的控制变量。
  • 如果合并键重复、字段缺失或多表关系不安全,程序会停止或明确报告,而不会猜测或补造结果。

建议为每个研究主题单独建立输入和输出目录,例如:

D:/Research/MyProject/input/
D:/Research/MyProject/output/

4. 在 Codex 中使用

基础分析示例:

使用 $empirical-research-agent,读取 D:/Research/MyProject/input,
研究主题为“机构投资者持股与股价崩盘风险”,
因变量为 NCSKEW,核心自变量为 iih,
控制变量为 size,bm,roa,turnover,Ret,Sigma,level,
输出到 D:/Research/MyProject/output。

需要调节、中介或异质性分析时,明确告诉 Codex 对应变量:

另外使用 da 做调节变量、mediator 做中介变量、group 做异质性分组变量。

未明确请求的可选分析不会生成空章节或空工作表。

5. 直接运行命令

如需绕过自然语言直接运行:

python scripts/run_one_click.py `
  --data-dir "D:/Research/MyProject/input" `
  --output-dir "D:/Research/MyProject/output" `
  --topic "机构投资者持股与股价崩盘风险" `
  --y NCSKEW `
  --x iih `
  --controls "size,bm,roa,turnover,Ret,Sigma,level"

多因变量、多解释变量或绑定调节变量可使用 UTF-8 JSON 配置,通过 --analysis-config 传入。

6. PSM-DID

在普通分析参数之外提供以下信息即可启用独立 PSM-DID 主报告:

  • --first-treat-year:企业首次接受处理的年份列;从未处理企业保持缺失。
  • --psm-covariates:政策前用于倾向得分匹配的协变量。
  • --did-controls:DID 控制变量;未提供时默认复用 --controls。

示例:

python scripts/run_one_click.py `
  --data-dir "D:/Research/Policy/input" `
  --output-dir "D:/Research/Policy/output" `
  --topic "政策冲击与企业绩效" `
  --y performance `
  --x treatment `
  --controls "size,lev,roa" `
  --first-treat-year first_treat_year `
  --psm-covariates "size,lev,roa" `
  --did-controls "size,lev,roa"
  • 所有处理企业同年进入政策时,自动运行单时点双向固定效应 DID。
  • 存在多个首次处理年份时,自动运行多时点 cohort-time ATT。
  • 默认使用主种子 20260716、500 次 bootstrap 和 500 次 placebo。
  • 不得为了得到显著结果更换随机种子、筛选样本、调整数据生成逻辑或放宽显著性标准。

7. 输出文件

分析结果写入你指定的 --output-dir:

| 文件 | 用途 | |---|---| | 实证分析报告.html | 期刊式主报告,可使用浏览器查看和打印 | | 实证分析结果.xlsx | 回归、描述统计、相关性和审计明细 | | 清洗面板.parquet | 最终进入分析的清洗面板 | | 合并日志.csv | 多文件读取、清洗和合并记录 | | analysis_trace.json | 参数、模型、样本流转和完整复现记录 |

启用 PSM-DID 时,HTML 正文采用精简期刊格式,匹配对等技术明细进入 Excel 和 trace。

8. 常见问题

找不到 Python

确认已安装 Python 或 Anaconda,并在终端运行 python --version。如果使用 Conda,请先激活正确环境。

提示缺少模块

在技能目录运行:

python -m pip install -r requirements.txt

无法读取或写入 Parquet

确认当前 Python 环境已安装 pyarrow:

python -m pip install "pyarrow>=10.0.0"

报告字段缺失或合并被拒绝

检查公司代码、年份、Y、X、控制变量是否真实存在,以及公司—年份键是否唯一。不要让 Codex 临场修改合并逻辑来绕过错误。

PSM 没有共同支撑或匹配率过低

这属于研究数据风险,应按报告提示披露。不要通过删样本、换种子或放宽阈值强行得到结果。

9. 数据与隐私

  • 安装包不含任何客户数据、历史分析结果、测试数据或遥测代码。
  • 所有输入、清洗数据和分析结果只写入客户指定的本地目录。
  • 不要把客户数据放入技能安装目录。
  • 客户应自行控制输入目录、输出目录和备份文件的访问权限。