返回 Skill 列表
extension
分类: 数据与分析无需 API Key

今日简报

今日 AI 信息流(今日简报)。并行抓取 27 个信源(OpenAI/Google/Anthropic/DeepMind/Meta/DeepSeek/Qwen/Kimi/百度/腾讯 + Nature/Science + arXiv),过滤今日内容,应用导向精选论文,输出 md 工作表 + 美观 HTML,由 Agent 逐条汉化。零依赖、零 API key。

person作者: user_72e89c6bhubcommunity

/daily-brief 今日 AI 信息流

把"追踪一手官方发布 + 亲自体验产品 + 解读论文"的信源策略,做成每日可跑的 Agent 工作流。

核心设计

  • 零依赖:仅用 Python 3.8+ 标准库(urllib/re/json),无需 pip install
  • 零 key:不调用任何 LLM API、不需要任何密钥
  • 并行抓取concurrent.futures 线程池(默认 8 线程),慢源/失败源不阻塞整体,端到端约 30~60 秒
  • 面向中文:脚本输出英文原始材料,汉化由你(执行 Agent)完成——这是本 skill 的关键

Resolve SKILL_DIR(任何命令前先做)

所有 python ... 命令运行 SKILL_DIR/scripts/today_digest.py。把 SKILL_DIR 设为你刚 Read 的这份 SKILL.md 所在目录的绝对路径。Guard 一次:

SKILL_DIR="<absolute path of the directory containing this SKILL.md>"
if [ ! -f "$SKILL_DIR/scripts/today_digest.py" ]; then
  echo "ERROR: scripts/today_digest.py not found under SKILL_DIR=$SKILL_DIR" >&2
  exit 1
fi

Python 解释器:本 skill 的命令示例用 python3(macOS/Linux)。Windows 上用 python——python3 是 Microsoft Store 桩,跑不了脚本。

When to use

  • 用户说"生成今日 AI 信息流"、"今天有什么 AI 新消息"、"跑一下今日信息流"
  • 用户输入 /daily-brief
  • 用户指定日期要回顾:"生成 2026-08-10 的 AI 信息流"

How to invoke

Step 1 — 跑脚本生成今日"待翻译工作表" + 美观 HTML

默认今天、UTC+8 时区。脚本会同时输出两个文件

  • 今日AI信息流_待翻译工作表_YYYY-MM-DD.md — 英文原始材料 + 中文任务指令(供你汉化)
  • 今日AI信息流_YYYY-MM-DD.html — 美观排版的信息流页面(浏览器打开即看)
python3 "${SKILL_DIR}/scripts/today_digest.py"

可选参数:

  • --date YYYY-MM-DD — 指定日期(默认今天)
  • --tz N — 时区偏移小时(默认 8 即 UTC+8)
  • --max-arxiv N — arXiv 应用导向精选上限(默认 15
  • --out DIR — 输出目录(默认脚本所在目录)
  • --mode agent|json|htmlagent(默认,md工作表+HTML双文件) / json(结构化英文数据) / html(仅HTML)
  • --template PATH — 自定义 HTML 模板路径(默认用 SKILL_DIR/templates/digest_template.html
  • --proxy URL — 代理地址,如 http://127.0.0.1:7890
  • --prefer-mirror — 优先使用 RSSHub/镜像源,失败后再回官方源(国内无代理环境推荐)
  • --mirror-file PATH — 自定义镜像源 JSON 文件路径,覆盖内置镜像源

示例:无代理时优先走镜像源

python3 "${SKILL_DIR}/scripts/today_digest.py" --prefer-mirror

示例:回顾 8 月 10 日,精选 20 篇:

python3 "${SKILL_DIR}/scripts/today_digest.py" --date 2026-08-10 --max-arxiv 20

Step 2 — Read 脚本生成的待翻译工作表

脚本会在输出目录生成 今日AI信息流_待翻译工作表_YYYY-MM-DD.md。用 Read 读它。

工作表顶部有中文任务指令,结构:

  • ## 🏢 今日官方源发布 — 今日官方博客/GitHub releases/期刊 RSS(英文标题+链接)
  • ## 📄 今日精选论文 — 今日 arXiv 论文(英文标题+摘要+链接)

Step 3 — 你来汉化(这是核心一步)

按工作表顶部指令,逐条为每个条目生成:

  1. 汉化主题:英文标题翻译成简洁中文(≤30 字)
  2. 一句话中文总结(≤50 字):基于摘要概括核心价值
  3. 保留原文标题原文链接

输出格式(Markdown):

### [汉化主题]

**【总结】** [一句话中文总结]

**【原文标题】** [英文原标题]

**【原文链接】** [链接]

Step 4 — 写出最终中文信息流(md + HTML 双文件,缺一不可)

⚠️ 强制要求(不能跳过):你的最终交付物必须是中文化版本,不是脚本生成的英文原版。 HTML 内置了汉化检测:只要有任何一张卡片的标题或摘要仍是英文,页面顶部就会显示红色警告 "⚠️ 检测到 N 张卡片尚未中文化"。交付英文原版 = 任务失败,会被退回重做。 脚本生成的 待翻译工作表_*.md 是中间件,仅用于阅读,不要把它当作最终交付物。

你的最终交付物是 两个文件,都必须汉化:

  1. md 文件 今日AI信息流_YYYY-MM-DD.md(放用户工作目录)
  2. HTML 文件 今日AI信息流_YYYY-MM-DD.html(必须原位替换英文,浏览器打开后不能还有英文大段残留)

4.1 汉化 md 文件

按 Step 3 的格式,逐条写出中文主题 + 一句话总结 + 原文标题 + 原文链接。

4.2 汉化 HTML 文件(重点,很多 Agent 会漏)

脚本生成的 HTML 里,每个卡片结构如下(示意):

<li class="card" data-kind="paper">
  <div class="card-top">
    <span class="num">01</span>
    <span class="badge paper"><span class="dot"></span>论文精选</span>
    <span class="badge src">arXiv</span>
  </div>
  <!-- 必须替换:英文主题 → 中文主题 -->
  <h3>Tokenizer Generator Coupling in Medical Image Generation</h3>
  <!-- 必须替换:英文摘要/占位 → 中文一句话总结 -->
  <p class="sum">Latent medical image generators usually treat the tokenizer as fixed preprocessing</p>
  <div class="card-foot">
    <!-- 保留英文原标题,不要改 -->
    <span class="orig">Tokenizer Generator Coupling in Medical Image Generation</span>
    <a class="more" href="...">阅读原文 →</a>
  </div>
</li>

你需要做的是:用 edit_file 工具,把每个卡片的 <h3><p class="sum"> 替换成你在 md 里写好的中文主题和中文总结。<span class="orig"> 保留英文原标题,不要动。

操作顺序建议:

  1. 先完成 md 文件的中文内容。
  2. Read 打开 HTML,找到第一个卡片的 <h3><p class="sum">
  3. edit_file 逐条替换。示例:
old: <h3>Tokenizer Generator Coupling in Medical Image Generation</h3>
     <p class="sum">Latent medical image generators usually treat the tokenizer as fixed preprocessing</p>
new: <h3>医学图像生成中分词器与生成器的耦合研究</h3>
     <p class="sum">研究表明分词器与生成器选择相互依赖,重构 PSNR 不可靠,提出免生成器统计量评估量化器。</p>
  1. 全部替换完后,用浏览器或预览面板打开 HTML 快速扫一遍,确保:
    • 没有英文大段标题/摘要残留
    • 中文能正常换行、不被截断
    • 原文标题(.orig)和链接都还在

4.3 今日速览

在 HTML 的 <div class="glance"> 里,把占位条目换成 3~5 句中文亮点总结。支持 <b> 加粗。

示例:

<li><b>医疗 AI</b>:谷歌 AMIE 视频版首次在实时视频问诊中达到专家级水平,8 篇医疗相关论文集中涌现。</li>

4.4 交付前自检清单(每一条都要确认,不满足禁止交付)

  • [ ] md 文件 今日AI信息流_YYYY-MM-DD.md 已写入全部汉化条目(不是英文原版)
  • [ ] HTML 文件 今日AI信息流_YYYY-MM-DD.html 已原位替换所有卡片的 <h3><p class="sum"> 为中文
  • [ ] 用浏览器/预览打开 HTML,顶部没有红色警告横幅(有警告 = 还有卡片没汉化,必须回去改)
  • [ ] .orig 英文原标题和 .more 链接全部保留,没有误删
  • [ ] 今日速览(.glance)已替换为中文亮点
  • [ ] 交付的文件名就是 今日AI信息流_YYYY-MM-DD.md / .html(中文化版本),不是 待翻译工作表_*.md

任何一项未满足 → 立即回去修改,完成后再交付。

Step 5 — Agent 最终审核(交付前的最后一道关卡,必须执行)

写完后不能直接交付。你要切换成"审核员"视角,对两个交付文件做一次独立复审。

5.1 怎么审

  1. Read 重新打开 今日AI信息流_YYYY-MM-DD.md.html(不是工作表)。
  2. 用浏览器/预览打开 HTML,看渲染效果和警告横幅。

5.2 审核清单(全部通过才算合格)

  • [ ] HTML 打开后顶部无红色"尚未中文化"警告横幅
  • [ ] 每张卡片:<h3> 为中文主题、<p class="sum"> 为中文总结、.orig 保留英文原标题
  • [ ] 中文质量:主题 ≤30 字、总结 ≤50 字、语句通顺无机翻腔
  • [ ] 信息准确:中文总结与英文摘要一致,无编造、无夸大
  • [ ] 今日速览(.glance)为 3~5 条中文亮点,覆盖今日重点
  • [ ] md 与 HTML 内容一致,无遗漏条目
  • [ ] 交付文件名是 今日AI信息流_YYYY-MM-DD.md/.html,不是 待翻译工作表_*

5.3 输出审核报告(交付时附给用户)

## 交付审核报告
- 审核人:执行 Agent(交付前自审)
- 审核结果:✅ 通过 / ❌ 不通过
- 检查项:N/7 通过
- 发现的问题:无 / [列出具体问题]
- 处理动作:无需处理 / 已返回修改并复审

审核不通过 → 必须返回 Step 4 修改 → 重新审核,直到通过才能交付。

5.4 双人复核(可选,更强)

条件允许时,可让另一个 Agent/会话扮演独立审核员交叉复核,避免"自己审自己"的盲区。

关于网络与代理

脚本抓取大量国外官方源(OpenAI、Google、Anthropic、DeepMind、Meta、GitHub、Nature、Science、arXiv 等)。如果你在中国大陆运行,强烈建议开启系统代理(如 Clash/V2Ray/Shadowsocks 的 TUN 模式或全局代理)。

脚本已支持读取环境变量 HTTP_PROXY / HTTPS_PROXY,无需改代码。例如:

export HTTPS_PROXY=http://127.0.0.1:7890
export HTTP_PROXY=http://127.0.0.1:7890
python3 "${SKILL_DIR}/scripts/today_digest.py"

Windows 上在 PowerShell:

$env:HTTPS_PROXY="http://127.0.0.1:7890"
$env:HTTP_PROXY="http://127.0.0.1:7890"
python "${SKILL_DIR}\scripts\today_digest.py"

不开代理时,国外源大概率连接超时/SSL 错误,脚本会跳过并标记 ,这是预期容错行为。

Failure modes and handling

  • 今日 arXiv 精选 0 篇 → 属正常。arXiv RSS 每日凌晨更新,若运行时今日论文尚未发布则为 0。在工作表里如实记录,不要编造论文。
  • 个别信源 失败 → 脚本对单源失败有容错(网络抖动/API 限流),会跳过继续抓其他源。告诉用户哪几个源失败了即可,不要重试到死。
  • GitHub 源全部 0 条 → 可能是 API 限流(60次/时)或仓库未发 formal release。脚本已优先走 releases.atom(不耗配额),通常稳定。
  • 网络全挂 → 脚本会快速失败退出。告诉用户网络问题,建议稍后重试。
  • 今日无任何内容 → 告诉用户"今日各大厂未发新品、arXiv 尚未更新",这是真实情况,不要硬凑。

信源清单(49 个)

  • 官方博客(23):OpenAI、Google 官方、Google AI、DeepMind、Meta AI Engineering、HuggingFace、MIT、Anthropic(社区镜像 ×2)、Science News、Nature、Nature Communications、Microsoft AI、NVIDIA、Intel AI、Apple ML、Amazon Science、Stability AI、Cohere、Mistral、ScienceDaily、ScienceNews、IEEE Spectrum
  • 官方新闻稿(2):Business Wire、GlobeNewswire(公司一手公告:融资 / 产品 / 合作,聚合全行业,按关键词过滤)
  • 开源模型 GitHub(16):DeepSeek(V3/R1/V2)、Qwen(Qwen3/2.5/主仓/阿里)、Kimi(CLI/K2/K3)、百度(ERNIE/PaddleNLP)、腾讯混元、字节豆包、智谱 GLM、华为 MindSpore
  • 学术(8):arXiv(AI/LG/CL/quant-ph)+ OpenAlex(AI应用/LLM产品/医疗AI/生成式AI,OA 免费全文

💡 付费墙说明:Nature / Science 期刊正文为订阅付费,本工作流只用其 RSS 摘要(摘要已够总结)。需要读全文时,用 OpenAlex 补充源——它只输出开放获取(OA)论文,链接直接是免费 PDF/机构库,绕开付费墙。

Token efficiency

  • 抓取过程零 token 消耗(脚本自己跑)
  • 汉化阶段只读工作表 + 写最终文件,token 用在翻译总结上
  • 一次运行约产出 15~30 条汉化内容,可控

Security & Permissions

做什么

  • 用 Python 标准库 urllib 抓取公开 RSS/atom feed 和 arXiv 摘要 API
  • 把抓取结果写成本地 .md 工作表

不做什么

  • 不调用任何 LLM API(汉化由 Agent 本身完成)
  • 不需要任何 API key / 密钥
  • 不上传任何数据到外部
  • 不访问任何需要登录的平台

自定义

  • 加/减信源:编辑 scripts/today_digest.py 顶部的 RSS_SOURCES / GITHUB_REPOS / ARXIV_SOURCES
  • 调筛选口味:编辑 APP_KEYWORDS(应用白名单)和 THEORY_BLACKLIST(理论黑名单)
  • 调并行度fetch_all(tz, max_workers=N),默认 8