Empirical Research Agent 客户使用说明
版本:v2026.07.21
本技能用于读取 CSV、Excel、Parquet 或 DTA 企业年度数据,自动清洗并安全合并多份文件,生成 M1–M4 基准回归、可追溯的有限探索、可选调节/中介/异质性分析,以及单时点或多时点 PSM-DID 报告。正式输出包括期刊式 HTML、Excel 和完整复现记录。
1. 安装到 Codex
-
解压交付的 ZIP。
-
将整个
empirical-research-agent文件夹复制到:%USERPROFILE%/.codex/skills/empirical-research-agent -
重新打开 Codex 任务,使技能被重新发现。
-
在 Codex 中使用
$empirical-research-agent调用本技能。
如果你的 Codex 使用了自定义 CODEX_HOME,请改为复制到:
%CODEX_HOME%/skills/empirical-research-agent
2. 首次环境准备
本技能使用客户电脑中现有的 Python,不内置 Python 运行时。建议使用 Python 3.10–3.12 或 Anaconda。
在技能目录打开终端并检查入口:
python scripts/run_one_click.py --help
如果提示缺少第三方依赖,请先确认当前 Python 环境,再安装:
python -m pip install -r requirements.txt
如果 python 命令不可用,可尝试 Windows Python Launcher:
py -3 scripts/run_one_click.py --help
py -3 -m pip install -r requirements.txt
Codex 不应在未取得你许可时静默安装软件或修改全局 Python 环境。
3. 准备数据
- 将数据放在技能目录之外的客户自有目录。
- 支持
.csv、.xlsx、.xls、.parquet和.dta。 - 可以在同一数据目录放置多份公司年度数据;技能会识别公司代码和年份、清理 CSMAR 元数据行,并按安全键合并。
- 数据至少应包含公司代码、年份、因变量、核心自变量,以及你要求使用的控制变量。
- 如果合并键重复、字段缺失或多表关系不安全,程序会停止或明确报告,而不会猜测或补造结果。
建议为每个研究主题单独建立输入和输出目录,例如:
D:/Research/MyProject/input/
D:/Research/MyProject/output/
4. 在 Codex 中使用
基础分析示例:
使用 $empirical-research-agent,读取 D:/Research/MyProject/input,
研究主题为“机构投资者持股与股价崩盘风险”,
因变量为 NCSKEW,核心自变量为 iih,
控制变量为 size,bm,roa,turnover,Ret,Sigma,level,
输出到 D:/Research/MyProject/output。
需要调节、中介或异质性分析时,明确告诉 Codex 对应变量:
另外使用 da 做调节变量、mediator 做中介变量、group 做异质性分组变量。
未明确请求的可选分析不会生成空章节或空工作表。
5. 直接运行命令
如需绕过自然语言直接运行:
python scripts/run_one_click.py `
--data-dir "D:/Research/MyProject/input" `
--output-dir "D:/Research/MyProject/output" `
--topic "机构投资者持股与股价崩盘风险" `
--y NCSKEW `
--x iih `
--controls "size,bm,roa,turnover,Ret,Sigma,level"
多因变量、多解释变量或绑定调节变量可使用 UTF-8 JSON 配置,通过 --analysis-config 传入。
6. PSM-DID
在普通分析参数之外提供以下信息即可启用独立 PSM-DID 主报告:
--first-treat-year:企业首次接受处理的年份列;从未处理企业保持缺失。--psm-covariates:政策前用于倾向得分匹配的协变量。--did-controls:DID 控制变量;未提供时默认复用--controls。
示例:
python scripts/run_one_click.py `
--data-dir "D:/Research/Policy/input" `
--output-dir "D:/Research/Policy/output" `
--topic "政策冲击与企业绩效" `
--y performance `
--x treatment `
--controls "size,lev,roa" `
--first-treat-year first_treat_year `
--psm-covariates "size,lev,roa" `
--did-controls "size,lev,roa"
- 所有处理企业同年进入政策时,自动运行单时点双向固定效应 DID。
- 存在多个首次处理年份时,自动运行多时点 cohort-time ATT。
- 默认使用主种子
20260716、500 次 bootstrap 和 500 次 placebo。 - 不得为了得到显著结果更换随机种子、筛选样本、调整数据生成逻辑或放宽显著性标准。
7. 输出文件
分析结果写入你指定的 --output-dir:
| 文件 | 用途 |
|---|---|
| 实证分析报告.html | 期刊式主报告,可使用浏览器查看和打印 |
| 实证分析结果.xlsx | 回归、描述统计、相关性和审计明细 |
| 清洗面板.parquet | 最终进入分析的清洗面板 |
| 合并日志.csv | 多文件读取、清洗和合并记录 |
| analysis_trace.json | 参数、模型、样本流转和完整复现记录 |
启用 PSM-DID 时,HTML 正文采用精简期刊格式,匹配对等技术明细进入 Excel 和 trace。
8. 常见问题
找不到 Python
确认已安装 Python 或 Anaconda,并在终端运行 python --version。如果使用 Conda,请先激活正确环境。
提示缺少模块
在技能目录运行:
python -m pip install -r requirements.txt
无法读取或写入 Parquet
确认当前 Python 环境已安装 pyarrow:
python -m pip install "pyarrow>=10.0.0"
报告字段缺失或合并被拒绝
检查公司代码、年份、Y、X、控制变量是否真实存在,以及公司—年份键是否唯一。不要让 Codex 临场修改合并逻辑来绕过错误。
PSM 没有共同支撑或匹配率过低
这属于研究数据风险,应按报告提示披露。不要通过删样本、换种子或放宽阈值强行得到结果。
9. 数据与隐私
- 安装包不含任何客户数据、历史分析结果、测试数据或遥测代码。
- 所有输入、清洗数据和分析结果只写入客户指定的本地目录。
- 不要把客户数据放入技能安装目录。
- 客户应自行控制输入目录、输出目录和备份文件的访问权限。
Scan to join WeChat group