调研情报采集器 (Research Intelligence Collector)
将"检索外部信息"拆解为 检索 → 核验 → 交付 三段可审计流程。任何调研、立项、文献、专利、临床类任务默认走本流程。
触发场景
- 检索产品/竞品调研、专利、临床试验、学术文献等外部证据
- 需要验证信息真实性,避免 AI 幻觉或搜索到掺假信息
- 需要提供 PDF/Word/Excel 等文件的可下载链接或文件本身,或网页链接
原则一:跨境检索,多源覆盖(需求1前半)
- 中外并行:每个检索对象同时构造中文与英文检索式,避免只看到单一语言圈的偏见信息。
- 国际源优先覆盖:通过 WebSearch 检索并 WebFetch 抓取以下国际一手源——
- 学术:PubMed、Google Scholar、Europe PMC、Cochrane Library
- 临床:ClinicalTrials.gov、WHO ICTRP、FDA 试验库、EMA
- 监管:FDA、EMA、PMDA、TGA
- 专利:USPTO、EPO (Espacenet)、WIPO PATENTSCOPE、Google Patents
- 商业/管线:公司官网 IR 页、Evaluate Pharma、Cortellis、药智/医药魔方(国内)
- 国内官方源补齐:NMPA、CDE、CNIPA、国家药监局直属平台,覆盖中国专属注册与专利信息。
- 不依赖单一引擎:关键结论至少用两个独立来源交叉验证;避免把聚合站(套壳转载站)当一手源。
- 网络出口说明:境外源能否直连取决于运行环境网络出口。若某国际源不可达,明确告知用户"该源本次不可达",并给出替代检索路径(如改用其镜像/摘要库/国内可访问数据库),不得假装检索成功。
原则二:证据核验,杜绝假信息(需求1核心)
对每条关键事实执行以下核验,结论方可采用:
- 溯源:只引用实际用 WebFetch 抓取过原文的页面。禁止凭记忆编造 DOI、卷期、页码、URL 或临床数字。
- 双源交叉:同一关键数字/结论须有 ≥2 个独立来源一致;仅单一来源时,标注「单源,待复核」并降级置信度。
- 一手优先:
- 法规/注册 → NMPA/CDE/FDA/EMA 官方原文
- 临床数据 → 试验注册库原始记录或期刊同行评议原文
- 专利 → CNIPA/USPTO/EPO/WIPO 官方登记库
- 置信度标注:每条结论附
[高 / 中 / 低]置信度;低置信度须说明原因并提示人工复核。 - 幻觉识别:识别并剔除"似是而非"的引用——伪造 DOI、不存在的期刊名、套壳聚合站、与原文不符的转述。发现即在汇报中标注「存疑已剔除」并说明。
- 时效标注:法规版本、临床阶段、专利法律状态、上市状态须带检索日期;过期或已变更须标注「需重新核验」。
核验不通过的信息,宁可标注缺失,也不得填入答案。
原则三:交付物可获取(需求2)
- PDF / Word / Excel 等文件:
- 优先用 WebFetch 或下载工具抓取至本地产物目录(如任务输出目录),通过
present_files交付文件本身; - 若无法自动下载(付费墙、动态生成、协议限制),提供原始直链,并在回复中标注「建议手动下载」,同时尽量附上标题、作者、发布日期等元数据。
- 优先用 WebFetch 或下载工具抓取至本地产物目录(如任务输出目录),通过
- 网页:一律提供可点击 URL。禁止只写"详见某网站"而无具体链接。
- 引用格式统一:
[来源类型] 标题 | 发布/更新日期 | URL 或 本地文件路径 | 置信度[高/中/低] - 引用表须区分三类状态:已确认 / 待复核 / 存疑剔除。
标准工作流
1. 明确对象与边界 → 靶点/适应症/化合物/技术平台/竞品公司 + 问题清单
2. 制定检索式 → 中英文 + 官方源 + 学术源 + 商业源(多引擎并行)
3. 检索 + 抓取核验 → WebSearch 检索,WebFetch 逐条抓取原文,执行原则二核验
4. 交叉验证评分 → 双源交叉、置信度评分、剔除可疑信息
5. 获取与整理交付 → 下载可获取文件 / 整理链接清单(原则三)
6. 结构化输出 → 结论先行 + 证据链 + 引用表(含链接/文件)+ 评估
输出规范
- 结论先行,每条结论附证据链与置信度。
- 引用表:序号 | 内容要点 | 来源 | 日期 | 链接/文件 | 置信度。
- 区分「已确认 / 待复核 / 存疑剔除」。
- 凡涉及文件,优先 present_files 交付;凡涉及网页,提供可点击 URL。
参考:一手源目录(references/source-directory.md)
权威源清单与适用场景见同目录 references/source-directory.md,检索前对照选用。
微信扫一扫