Back to skills
extension
Category: Productivity & OfficeNo API key required

OpenVINO 本地文档智能分析器

基于 Intel OpenVINO 的 AI PC 本地文档智能分析 Skill,在端侧完成文档摘要、要点提取、关键词生成、文档问答、多文档对比与性能基准测试,数据全程不出本机。 核心亮点: · 异构加速——OpenVINO 自动调度 CPU/GPU/NPU,最大化端侧推理性能 · 双模式设计——有模型走 OpenVINO 大模型加速,无模型自动降级为轻量算法,零门槛即开即用 · 本地 RAG——文档分块 + 向量化 + 相似度检索,答案可溯源 · 多格式——PDF / DOCX / TXT / Markdown 全覆盖 适用场景:敏感文档处理、离线阅读辅助、企业知识库本地问答、AI PC 端侧应用开发。

personAuthor: cxyjiefeihubModelScope

OpenVINO 本地文档分析器

一个基于 Intel OpenVINO 工具链、在 AI PC 端侧运行的文档智能分析 Skill。

功能概述

本 Skill 在本地 AI PC 上完成文档的智能分析,支持:

  • 文档摘要:生成长文档的精简摘要(支持自定义长度)
  • 要点提取:自动提取文档中的核心要点(Key Points)
  • 关键词生成:提取文档中的关键主题词
  • 文档问答:基于文档内容回答用户的问题(RAG 模式)
  • 多格式支持:PDF、DOCX、TXT、Markdown 等常见文档格式

核心优势:

  • 数据不出机:所有推理在本地完成,文档内容不上传云端,保护隐私与商业机密
  • 异构算力加速:利用 OpenVINO 自动调度 CPU / GPU / NPU,最大化端侧推理性能
  • 低延迟响应:高频交互任务下沉到 AI PC 端,无需等待云端网络
  • 即开即用:预置最优模型配置,开箱即用

使用流程

第一步:确认环境

在首次使用前,检查 OpenVINO 环境是否就绪:

python scripts/check_env.py

如果环境未配置,请参考 references/openvino-setup.md 完成环境搭建。

第二步:文档摘要

对单个文档生成摘要:

python scripts/doc_analyzer.py summarize \
  --input "path/to/document.pdf" \
  --output "path/to/summary.md" \
  --max-length 500 \
  --device GPU

参数说明:

  • --input:输入文档路径(支持 PDF/DOCX/TXT/MD)
  • --output:输出摘要文件路径(可选,默认输出到控制台)
  • --max-length:摘要最大长度(可选,默认 300 字)
  • --device:推理设备 CPU / GPU / NPU / AUTO(可选,默认 AUTO)

第三步:要点提取

提取文档核心要点:

python scripts/doc_analyzer.py keypoints \
  --input "path/to/document.pdf" \
  --output "path/to/keypoints.md" \
  --num-points 5 \
  --device GPU

参数说明:

  • --num-points:提取要点数量(可选,默认 5 条)

第四步:关键词生成

python scripts/doc_analyzer.py keywords \
  --input "path/to/document.pdf" \
  --top-k 10 \
  --device GPU

第五步:文档问答

基于文档内容进行问答:

python scripts/doc_analyzer.py ask \
  --input "path/to/document.pdf" \
  --question "这篇文档的主要结论是什么?" \
  --device GPU

支持的模型

本 Skill 基于 OpenVINO 优化的开源大模型,推荐模型见 references/model-list.md

默认模型:

  • 摘要/问答:Qwen2-1.5B-Instruct(OpenVINO INT4 量化版)
  • 关键词:bge-small-zh-v1.5(OpenVINO FP16 版)

模型会在首次使用时自动下载并缓存到本地。

设备选择建议

| 设备类型 | 适用场景 | 性能特点 | |---------|---------|---------| | NPU | 轻量摘要、关键词提取 | 低功耗、高能效,适合长时运行 | | GPU | 文档问答、长文档摘要 | 高吞吐、并行推理,适合批量处理 | | CPU | 所有任务(兜底) | 兼容性好,无需额外硬件 | | AUTO | 自动选择 | 自动选择最优设备,推荐默认使用 |

输出格式

摘要输出为 Markdown 格式,结构如下:

# 文档摘要

**文档标题**:xxx
**文档页数/字数**:xxx
**生成时间**:xxxx-xx-xx xx:xx

## 内容摘要
...

## 核心要点
1. ...
2. ...
...

## 关键词
#标签1 #标签2 #标签3

质量与性能调优

提升摘要质量

  • 适当增大 --max-length 参数
  • 使用更大的模型(见模型列表)
  • 对超长文档,建议先按章节拆分再分别摘要

提升推理速度

  • 使用 --device GPU--device NPU 启用硬件加速
  • 使用 INT4 / INT8 量化模型
  • 减少 --max-length 降低生成 token 数

常见问题

Q: 首次运行很慢? A: 首次运行需要下载模型并进行 OpenVINO 图编译,后续运行会使用缓存,速度显著提升。

Q: NPU 设备找不到? A: 请确认使用的是 Intel Core Ultra 系列处理器,并已安装 NPU 驱动。详见 references/openvino-setup.md

Q: 支持哪些文档格式? A: 目前支持 PDF、DOCX、TXT、Markdown 格式。其他格式请先转换为纯文本再使用。

Q: 模型存在哪里? A: 默认缓存在 ~/.cache/openvino-models/ 目录下,可手动清理。

文件结构

openvino-doc-analyzer/
├── SKILL.md                    # 本文件:技能入口说明
├── scripts/
│   ├── doc_analyzer.py         # 主脚本:文档分析命令行工具
│   ├── check_env.py            # 环境检查脚本
│   ├── model_manager.py        # 模型下载与管理
│   ├── text_extractor.py       # 多格式文档文本提取
│   └── ov_inference.py         # OpenVINO 推理引擎封装
├── references/
│   ├── openvino-setup.md       # OpenVINO 环境搭建指南
│   └── model-list.md           # 支持的模型列表与性能对比
├── tests/
│   ├── test_doc_analyzer.py    # 功能测试用例
│   └── samples/                # 测试样本文档
│       └── sample_report.md
└── assets/
    └── summary_template.md     # 摘要输出模板

版本历史

  • v1.0.0:初始版本,支持文档摘要、要点提取、关键词生成、文档问答四大功能