Back to skills
extension
Category: Development & EngineeringNo API key required

文献解读与PPT制作

当用户上传学术文献 PDF,并要求生成中文全文翻译、缩写词/术语表、图表提取包、文献汇报 PPT 与逐页讲稿时使用。该技能将 PDF 文献汇报材料制作流程标准化为可复用的分步执行规范。

personAuthor: RainingoOhubgithub

Academic Literature Report Pipeline

1. 适用场景

当用户上传一篇或多篇学术文献 PDF,并要求生成以下任一组合交付物时,使用本技能:

  • 文献全文中文翻译;
  • 缩写词列表;
  • 专业术语或概念解释表;
  • Figure / Table 图表提取与索引;
  • 中文学术汇报 PPT;
  • PPT 逐页讲稿;
  • 可下载的 .docx.pptx.xlsx.zip 等正式文件。

典型用户请求示例:

请把这篇论文翻译成中文,整理缩写和术语,提取全部图表,制作汇报 PPT 和 15 分钟讲稿,并提供下载链接。

2. 总体原则

  1. 先定界,再执行:确认输入 PDF、目标语言、交付文件类型、是否需要完整翻译、PPT 页数或时长要求。
  2. 必须建立可验收清单:此类任务通常为多步骤、多交付物任务,执行前应创建或确认任务清单。
  3. Python 分步处理:PDF 解析、图表裁剪、Word/PPT/Excel/ZIP 生成均优先用 Python 脚本真实落盘,不得只在对话中描述。
  4. 主线程负责最终收口:可将长文解析、图表定位、PPT素材提炼等独立工作委派给子任务,但最终文件整合、命名、核验和下载链接必须由主线程确认。
  5. 保留限制说明:PDF 解析、图表裁剪、公式、参考文献、嵌入图片文字可能存在误差;应在最终说明或文档说明中保留。
  6. 结果文件必须写入结果目录:所有最终交付物放入 /mnt/data/result,便于下载和会话保留。

3. 标准输入

  • 用户上传的学术文献 PDF。
  • 可选信息:
    • 汇报语言;默认中文。
    • PPT 页数或汇报时长;默认 12–15 页、约 15 分钟。
    • 是否要求全文逐字翻译;默认尽量保持结构的中文翻译/转述。
    • 文件命名要求;若用户指定,严格使用指定文件名。

4. 标准输出

默认生成以下 4 个最终文件:

  1. 文献汇报_翻译与术语表.docx

    • 第一部分:一、原文中文翻译
    • 第二部分:二、缩写词列表
    • 第三部分:三、专业名词解释列表
  2. 文献图表与信息.zip

    • 所有 Figure / Table 图片,优先 PNG;
    • 图表索引.xlsx
    • 可选附加 图表索引.csv 或 Markdown 索引。
  3. 文献汇报PPT.pptx

    • 中文学术汇报幻灯片;
    • 必须嵌入全部已提取图表;
    • 建议学术浅蓝/白色风格。
  4. PPT讲稿.docx

    • 与 PPT 逐页对应;
    • 每页以 第X页讲稿: 开头;
    • 包含开场、页间衔接、要点扩展和总结。

5. 推荐任务清单

执行前建议创建如下任务清单:

  1. 提取并解析文献全文与页面信息,形成可用于翻译、术语识别和图表定位的结构化内容。
  2. 完成全文中文翻译并整理缩写词与专业术语表,生成包含三部分内容的 Word 文档。
  3. 提取文献中的全部图和表,整理中英文题注与索引,并生成包含图片和索引表的 ZIP 文件。
  4. 基于文献内容制作中文学术汇报 PPT,覆盖规定页面结构并嵌入全部图表。
  5. 为 PPT 逐页撰写约 15 分钟中文讲稿,形成 Word 文档。
  6. 核验四个交付文件是否真实生成且内容对应任务要求,汇总提供下载链接。

6. 执行流程

6.1 文件定位与初步解析

  1. 从用户上传文件区定位 PDF。
  2. 若存在多个 PDF,先确认目标文件;若用户已明确,直接处理。
  3. 使用 PDF 解析工具或 Python 读取:
    • 页数;
    • 标题、作者、摘要;
    • 章节结构;
    • 正文段落;
    • 图题、表题、题注;
    • 参考文献和补充材料。
  4. 将解析结果作为后续翻译、术语表、PPT 提炼和图表定位的基础。

6.2 翻译与术语文档

生成 文献汇报_翻译与术语表.docx,包含三部分。

第一部分:原文中文翻译

要求:

  • 标题为 一、原文中文翻译
  • 保持原文结构:标题、摘要、引言、方法、实验、结果、讨论、结论、参考文献、补充材料等。
  • 专业术语前后一致。
  • 对公式、图表说明、参考文献可保留必要英文信息。
  • 若 PDF 噪声导致无法可靠翻译,应在文档说明中标注限制。

第二部分:缩写词列表

标题为 二、缩写词列表

表格列固定为:

| 缩写 | 英文全称 | 中文全称 | 页码 | |---|---|---|---|

识别方法建议:

  • 检索 Full Name (ABBR)ABBR (Full Name) 模式;
  • 结合领域常见缩写补全;
  • 记录首次出现页码;
  • 对无法确认全称的缩写,不要强行编造,可写“原文未明确给出”。

第三部分:专业名词解释列表

标题为 三、专业名词解释列表

表格列固定为:

| 页码 | 中文术语 | 英文术语 | 概念解释 | |---|---|---|---|

要求:

  • 选择文中重要概念、方法名、数据集名、模型结构、评价指标、关键任务等;
  • 不重复收录通用缩写词;
  • 概念解释控制在 50 字以内;
  • 优先依据原文定义或上下文,不凭空扩展。

6.3 图表提取与 ZIP

生成 文献图表与信息.zip

步骤:

  1. 识别所有 FigureFig.Table 及其编号。
  2. 对每个图表记录:
    • 类型:图 / 表;
    • 编号;
    • 英文标题;
    • 英文题注 / 脚注;
    • 中文标题;
    • 中文题注;
    • 页码;
    • 图片文件名。
  3. 优先从 PDF 中直接提取嵌入图像。
  4. 若无法直接提取,则渲染 PDF 页面并裁剪图表区域。
  5. 图表命名:
    • Figure:Fig1.pngFig2.png……
    • Table:Table1.pngTable2.png……
  6. 若图表编号不清,按出现顺序编号。
  7. 生成 图表索引.xlsx,至少包含列:

| 编号 | 类型 | 英文标题 | 英文题注 | 中文标题 | 中文题注 | |---|---|---|---|---|---|

  1. 将所有 PNG 图片与索引表放入同一目录并压缩为 ZIP。

质量要求:

  • 必须尽量覆盖全部图表;
  • 图表主体要清晰可读;
  • 若采用粗略裁剪,应在最终说明中列出编号;
  • ZIP 中必须包含图片和索引表,不能只包含索引。

6.4 PPT 制作

生成 文献汇报PPT.pptx

推荐页面结构:

  1. 封面;
  2. 研究背景;
  3. 研究目的 / 问题;
  4. 方法;
  5. 数据集或实验设置;
  6. 关键结果;
  7. 消融实验或机制分析;
  8. 讨论与局限;
  9. 结论;
  10. 致谢 / 参考文献。

可根据论文内容扩展到 12–15 页。

强制要求:

  • PPT 必须嵌入任务 6.3 提取的全部图表;
  • 图表应尽量放在对应内容页;
  • 若图表过多,可增加“图表总览 / 附录”页,确保所有图表至少出现一次;
  • 标题和正文以中文为主;
  • 专业术语可保留英文或中英并列;
  • 使用清晰学术风格,推荐白底、浅蓝强调色。

6.5 PPT 讲稿

生成 PPT讲稿.docx

要求:

  • 与 PPT 每页一一对应;
  • 格式为:第X页讲稿:
  • 每页提供自然口头表达,不只是罗列要点;
  • 包含开场白、页间衔接和最后总结;
  • 总时长约 15 分钟,可按 12–15 页设计;
  • 对关键图表和实验结果做适度解释。

6.6 文件命名与保存

所有最终文件必须写入 /mnt/data/result

默认路径:

/mnt/data/result/文献汇报_翻译与术语表.docx
/mnt/data/result/文献图表与信息.zip
/mnt/data/result/文献汇报PPT.pptx
/mnt/data/result/PPT讲稿.docx

如用户指定不同文件名,以用户指定为准。

7. Python 实现建议

常用库:

  • PDF 解析 / 渲染:fitz / PyMuPDF
  • 图像处理:PIL
  • Word:python-docx
  • PPT:python-pptx
  • 表格:pandasopenpyxl
  • 压缩包:zipfile
  • 文本处理:recsvjson

注意:

  • 沙盒不能直接联网下载依赖;使用环境已有库。
  • 如果某个库不存在,改用已安装库或基础标准库实现。
  • 生成 PPT 时应先保存图片再插入,避免外部链接失效。
  • 生成 ZIP 时应重新打开核验内部文件列表。

8. 推荐并行委派策略

当文献较长、图表较多或用户要求完整材料时,建议 Fan-out / Fan-in:

  1. 子任务 A:全文解析、中文翻译、缩写与术语表整理。
  2. 子任务 B:图表识别、裁剪、题注翻译与索引。
  3. 子任务 C:PPT 页面大纲、汇报要点、讲稿素材提炼。

主线程负责:

  • 汇总子任务结果;
  • 统一生成最终 Word、PPT、ZIP 和讲稿;
  • 核验文件真实存在;
  • 提供最终下载链接。

9. 质量核验清单

最终回复前必须检查:

文件级核验

  • [ ] 文献汇报_翻译与术语表.docx 存在且非空;
  • [ ] 文献图表与信息.zip 存在且非空;
  • [ ] 文献汇报PPT.pptx 存在且非空;
  • [ ] PPT讲稿.docx 存在且非空。

内容级核验

  • [ ] Word 文档包含 一、原文中文翻译
  • [ ] Word 文档包含 二、缩写词列表,且为表格;
  • [ ] Word 文档包含 三、专业名词解释列表,且为表格;
  • [ ] ZIP 中包含所有识别到的图表 PNG;
  • [ ] ZIP 中包含 图表索引.xlsx
  • [ ] PPT 覆盖封面、背景、问题、方法、结果、讨论、结论、致谢/参考文献;
  • [ ] PPT 至少嵌入全部提取图表一次;
  • [ ] 讲稿页数与 PPT 页数一致;
  • [ ] 所有任务清单项均完成并写入结果。

最终回复格式

最终回复应给出 4 个下载链接:

1. [文献汇报_翻译与术语表.docx](sandbox:/mnt/data/result/文献汇报_翻译与术语表.docx)
2. [文献图表与信息.zip](sandbox:/mnt/data/result/文献图表与信息.zip)
3. [文献汇报PPT.pptx](sandbox:/mnt/data/result/文献汇报PPT.pptx)
4. [PPT讲稿.docx](sandbox:/mnt/data/result/PPT讲稿.docx)

并简要说明:

  • 图表数量;
  • PPT 页数;
  • 讲稿对应页数;
  • 任何已知限制。

10. 常见风险与处理

| 风险 | 处理方式 | |---|---| | PDF 文本抽取乱码 | 尝试 PDF 解析工具、页面 OCR、局部人工转写;保留限制说明。 | | 图表无法精确裁剪 | 使用页面渲染后裁剪包含图表主体和题注的区域,保证可读性优先。 | | 图表编号不连续或不清 | 按出现顺序编号,并在索引中说明。 | | 缩写首次页码不准 | 以 PDF 页面文本首次出现为准;若解析不稳定,标注“约第X页”。 | | PPT 图表过多 | 增加图表总览或附录页,保证全部嵌入。 | | 文献过长导致翻译过粗 | 先覆盖摘要、引言、方法、实验、结果、讨论、结论,再补充参考文献与附录结构。 | | 参考文献过多 | 保留编号、作者、题名或核心信息;无需逐条文学化翻译,除非用户要求。 |

11. 可复用执行模板

当用户直接调用本技能时,可按以下内部流程推进:

  1. 读取用户上传 PDF 元信息;
  2. 创建任务清单;
  3. 并行执行:全文/术语、图表、PPT素材;
  4. 使用 Python 生成:
    • 翻译术语 Word;
    • 图表 PNG + Excel + ZIP;
    • 汇报 PPT;
    • 逐页讲稿 Word;
  5. 用 Python 核验文件存在、大小、ZIP 内容、PPT 页数、Word 表格数量;
  6. 更新任务清单为完成;
  7. 最终提供 4 个下载链接和核验摘要。