/daily-brief 今日 AI 信息流
把"追踪一手官方发布 + 亲自体验产品 + 解读论文"的信源策略,做成每日可跑的 Agent 工作流。
核心设计
- 零依赖:仅用 Python 3.8+ 标准库(urllib/re/json),无需
pip install - 零 key:不调用任何 LLM API、不需要任何密钥
- 并行抓取:
concurrent.futures线程池(默认 8 线程),慢源/失败源不阻塞整体,端到端约 30~60 秒 - 面向中文:脚本输出英文原始材料,汉化由你(执行 Agent)完成——这是本 skill 的关键
Resolve SKILL_DIR(任何命令前先做)
所有 python ... 命令运行 SKILL_DIR/scripts/today_digest.py。把 SKILL_DIR 设为你刚 Read 的这份 SKILL.md 所在目录的绝对路径。Guard 一次:
SKILL_DIR="<absolute path of the directory containing this SKILL.md>"
if [ ! -f "$SKILL_DIR/scripts/today_digest.py" ]; then
echo "ERROR: scripts/today_digest.py not found under SKILL_DIR=$SKILL_DIR" >&2
exit 1
fi
Python 解释器:本 skill 的命令示例用 python3(macOS/Linux)。Windows 上用 python——python3 是 Microsoft Store 桩,跑不了脚本。
When to use
- 用户说"生成今日 AI 信息流"、"今天有什么 AI 新消息"、"跑一下今日信息流"
- 用户输入
/daily-brief - 用户指定日期要回顾:"生成 2026-08-10 的 AI 信息流"
How to invoke
Step 1 — 跑脚本生成今日"待翻译工作表" + 美观 HTML
默认今天、UTC+8 时区。脚本会同时输出两个文件:
今日AI信息流_待翻译工作表_YYYY-MM-DD.md— 英文原始材料 + 中文任务指令(供你汉化)今日AI信息流_YYYY-MM-DD.html— 美观排版的信息流页面(浏览器打开即看)
python3 "${SKILL_DIR}/scripts/today_digest.py"
可选参数:
--date YYYY-MM-DD— 指定日期(默认今天)--tz N— 时区偏移小时(默认8即 UTC+8)--max-arxiv N— arXiv 应用导向精选上限(默认15)--out DIR— 输出目录(默认脚本所在目录)--mode agent|json|html—agent(默认,md工作表+HTML双文件) /json(结构化英文数据) /html(仅HTML)--template PATH— 自定义 HTML 模板路径(默认用SKILL_DIR/templates/digest_template.html)--proxy URL— 代理地址,如http://127.0.0.1:7890--prefer-mirror— 优先使用 RSSHub/镜像源,失败后再回官方源(国内无代理环境推荐)--mirror-file PATH— 自定义镜像源 JSON 文件路径,覆盖内置镜像源
示例:无代理时优先走镜像源
python3 "${SKILL_DIR}/scripts/today_digest.py" --prefer-mirror
示例:回顾 8 月 10 日,精选 20 篇:
python3 "${SKILL_DIR}/scripts/today_digest.py" --date 2026-08-10 --max-arxiv 20
Step 2 — Read 脚本生成的待翻译工作表
脚本会在输出目录生成 今日AI信息流_待翻译工作表_YYYY-MM-DD.md。用 Read 读它。
工作表顶部有中文任务指令,结构:
## 🏢 今日官方源发布— 今日官方博客/GitHub releases/期刊 RSS(英文标题+链接)## 📄 今日精选论文— 今日 arXiv 论文(英文标题+摘要+链接)
Step 3 — 你来汉化(这是核心一步)
按工作表顶部指令,逐条为每个条目生成:
- 汉化主题:英文标题翻译成简洁中文(≤30 字)
- 一句话中文总结(≤50 字):基于摘要概括核心价值
- 保留原文标题和原文链接
输出格式(Markdown):
### [汉化主题]
**【总结】** [一句话中文总结]
**【原文标题】** [英文原标题]
**【原文链接】** [链接]
Step 4 — 写出最终中文信息流(md + HTML 双文件,缺一不可)
⚠️ 强制要求(不能跳过):你的最终交付物必须是中文化版本,不是脚本生成的英文原版。 HTML 内置了汉化检测:只要有任何一张卡片的标题或摘要仍是英文,页面顶部就会显示红色警告 "⚠️ 检测到 N 张卡片尚未中文化"。交付英文原版 = 任务失败,会被退回重做。 脚本生成的
待翻译工作表_*.md是中间件,仅用于阅读,不要把它当作最终交付物。
你的最终交付物是 两个文件,都必须汉化:
- md 文件
今日AI信息流_YYYY-MM-DD.md(放用户工作目录) - HTML 文件
今日AI信息流_YYYY-MM-DD.html(必须原位替换英文,浏览器打开后不能还有英文大段残留)
4.1 汉化 md 文件
按 Step 3 的格式,逐条写出中文主题 + 一句话总结 + 原文标题 + 原文链接。
4.2 汉化 HTML 文件(重点,很多 Agent 会漏)
脚本生成的 HTML 里,每个卡片结构如下(示意):
<li class="card" data-kind="paper">
<div class="card-top">
<span class="num">01</span>
<span class="badge paper"><span class="dot"></span>论文精选</span>
<span class="badge src">arXiv</span>
</div>
<!-- 必须替换:英文主题 → 中文主题 -->
<h3>Tokenizer Generator Coupling in Medical Image Generation</h3>
<!-- 必须替换:英文摘要/占位 → 中文一句话总结 -->
<p class="sum">Latent medical image generators usually treat the tokenizer as fixed preprocessing</p>
<div class="card-foot">
<!-- 保留英文原标题,不要改 -->
<span class="orig">Tokenizer Generator Coupling in Medical Image Generation</span>
<a class="more" href="...">阅读原文 →</a>
</div>
</li>
你需要做的是:用 edit_file 工具,把每个卡片的 <h3> 和 <p class="sum"> 替换成你在 md 里写好的中文主题和中文总结。<span class="orig"> 保留英文原标题,不要动。
操作顺序建议:
- 先完成 md 文件的中文内容。
- 用
Read打开 HTML,找到第一个卡片的<h3>和<p class="sum">。 - 用
edit_file逐条替换。示例:
old: <h3>Tokenizer Generator Coupling in Medical Image Generation</h3>
<p class="sum">Latent medical image generators usually treat the tokenizer as fixed preprocessing</p>
new: <h3>医学图像生成中分词器与生成器的耦合研究</h3>
<p class="sum">研究表明分词器与生成器选择相互依赖,重构 PSNR 不可靠,提出免生成器统计量评估量化器。</p>
- 全部替换完后,用浏览器或预览面板打开 HTML 快速扫一遍,确保:
- 没有英文大段标题/摘要残留
- 中文能正常换行、不被截断
- 原文标题(.orig)和链接都还在
4.3 今日速览
在 HTML 的 <div class="glance"> 里,把占位条目换成 3~5 句中文亮点总结。支持 <b> 加粗。
示例:
<li><b>医疗 AI</b>:谷歌 AMIE 视频版首次在实时视频问诊中达到专家级水平,8 篇医疗相关论文集中涌现。</li>
4.4 交付前自检清单(每一条都要确认,不满足禁止交付)
- [ ] md 文件
今日AI信息流_YYYY-MM-DD.md已写入全部汉化条目(不是英文原版) - [ ] HTML 文件
今日AI信息流_YYYY-MM-DD.html已原位替换所有卡片的<h3>和<p class="sum">为中文 - [ ] 用浏览器/预览打开 HTML,顶部没有红色警告横幅(有警告 = 还有卡片没汉化,必须回去改)
- [ ]
.orig英文原标题和.more链接全部保留,没有误删 - [ ] 今日速览(
.glance)已替换为中文亮点 - [ ] 交付的文件名就是
今日AI信息流_YYYY-MM-DD.md/.html(中文化版本),不是待翻译工作表_*.md
任何一项未满足 → 立即回去修改,完成后再交付。
Step 5 — Agent 最终审核(交付前的最后一道关卡,必须执行)
写完后不能直接交付。你要切换成"审核员"视角,对两个交付文件做一次独立复审。
5.1 怎么审
- 用
Read重新打开今日AI信息流_YYYY-MM-DD.md和.html(不是工作表)。 - 用浏览器/预览打开 HTML,看渲染效果和警告横幅。
5.2 审核清单(全部通过才算合格)
- [ ] HTML 打开后顶部无红色"尚未中文化"警告横幅
- [ ] 每张卡片:
<h3>为中文主题、<p class="sum">为中文总结、.orig保留英文原标题 - [ ] 中文质量:主题 ≤30 字、总结 ≤50 字、语句通顺无机翻腔
- [ ] 信息准确:中文总结与英文摘要一致,无编造、无夸大
- [ ] 今日速览(
.glance)为 3~5 条中文亮点,覆盖今日重点 - [ ] md 与 HTML 内容一致,无遗漏条目
- [ ] 交付文件名是
今日AI信息流_YYYY-MM-DD.md/.html,不是待翻译工作表_*
5.3 输出审核报告(交付时附给用户)
## 交付审核报告
- 审核人:执行 Agent(交付前自审)
- 审核结果:✅ 通过 / ❌ 不通过
- 检查项:N/7 通过
- 发现的问题:无 / [列出具体问题]
- 处理动作:无需处理 / 已返回修改并复审
审核不通过 → 必须返回 Step 4 修改 → 重新审核,直到通过才能交付。
5.4 双人复核(可选,更强)
条件允许时,可让另一个 Agent/会话扮演独立审核员交叉复核,避免"自己审自己"的盲区。
关于网络与代理
脚本抓取大量国外官方源(OpenAI、Google、Anthropic、DeepMind、Meta、GitHub、Nature、Science、arXiv 等)。如果你在中国大陆运行,强烈建议开启系统代理(如 Clash/V2Ray/Shadowsocks 的 TUN 模式或全局代理)。
脚本已支持读取环境变量 HTTP_PROXY / HTTPS_PROXY,无需改代码。例如:
export HTTPS_PROXY=http://127.0.0.1:7890
export HTTP_PROXY=http://127.0.0.1:7890
python3 "${SKILL_DIR}/scripts/today_digest.py"
Windows 上在 PowerShell:
$env:HTTPS_PROXY="http://127.0.0.1:7890"
$env:HTTP_PROXY="http://127.0.0.1:7890"
python "${SKILL_DIR}\scripts\today_digest.py"
不开代理时,国外源大概率连接超时/SSL 错误,脚本会跳过并标记 ✗,这是预期容错行为。
Failure modes and handling
- 今日 arXiv 精选 0 篇 → 属正常。arXiv RSS 每日凌晨更新,若运行时今日论文尚未发布则为 0。在工作表里如实记录,不要编造论文。
- 个别信源
✗失败 → 脚本对单源失败有容错(网络抖动/API 限流),会跳过继续抓其他源。告诉用户哪几个源失败了即可,不要重试到死。 - GitHub 源全部 0 条 → 可能是 API 限流(60次/时)或仓库未发 formal release。脚本已优先走
releases.atom(不耗配额),通常稳定。 - 网络全挂 → 脚本会快速失败退出。告诉用户网络问题,建议稍后重试。
- 今日无任何内容 → 告诉用户"今日各大厂未发新品、arXiv 尚未更新",这是真实情况,不要硬凑。
信源清单(49 个)
- 官方博客(23):OpenAI、Google 官方、Google AI、DeepMind、Meta AI Engineering、HuggingFace、MIT、Anthropic(社区镜像 ×2)、Science News、Nature、Nature Communications、Microsoft AI、NVIDIA、Intel AI、Apple ML、Amazon Science、Stability AI、Cohere、Mistral、ScienceDaily、ScienceNews、IEEE Spectrum
- 官方新闻稿(2):Business Wire、GlobeNewswire(公司一手公告:融资 / 产品 / 合作,聚合全行业,按关键词过滤)
- 开源模型 GitHub(16):DeepSeek(V3/R1/V2)、Qwen(Qwen3/2.5/主仓/阿里)、Kimi(CLI/K2/K3)、百度(ERNIE/PaddleNLP)、腾讯混元、字节豆包、智谱 GLM、华为 MindSpore
- 学术(8):arXiv(AI/LG/CL/quant-ph)+ OpenAlex(AI应用/LLM产品/医疗AI/生成式AI,OA 免费全文)
💡 付费墙说明:Nature / Science 期刊正文为订阅付费,本工作流只用其 RSS 摘要(摘要已够总结)。需要读全文时,用 OpenAlex 补充源——它只输出开放获取(OA)论文,链接直接是免费 PDF/机构库,绕开付费墙。
Token efficiency
- 抓取过程零 token 消耗(脚本自己跑)
- 汉化阶段只读工作表 + 写最终文件,token 用在翻译总结上
- 一次运行约产出 15~30 条汉化内容,可控
Security & Permissions
做什么:
- 用 Python 标准库
urllib抓取公开 RSS/atom feed 和 arXiv 摘要 API - 把抓取结果写成本地
.md工作表
不做什么:
- 不调用任何 LLM API(汉化由 Agent 本身完成)
- 不需要任何 API key / 密钥
- 不上传任何数据到外部
- 不访问任何需要登录的平台
自定义
- 加/减信源:编辑
scripts/today_digest.py顶部的RSS_SOURCES/GITHUB_REPOS/ARXIV_SOURCES - 调筛选口味:编辑
APP_KEYWORDS(应用白名单)和THEORY_BLACKLIST(理论黑名单) - 调并行度:
fetch_all(tz, max_workers=N),默认 8
Scan to join WeChat group