用 AI 帮自己读长文档越来越普遍,但有个绕不开的隐患:如果你压根没看过原文,根本无从判断它写出来的摘要准不准。XDA 一位编辑做了个实验,把同一份 47 页的路透社新闻研究院报告分别交给 ChatGPT、Claude 和 Gemini 提炼要点,还特意要求每条数字都标出处页码,结果三个模型全在关键处翻了车。想放心让 AI 代读,得先学会怎么核查它。

一、先给一份”硬约束”提示词
- 上传 PDF 后,明确告诉模型:用约 800 字总结、列出十大要点、附上相关统计、解释研究方法、区分实测结果与预测、每条数字都注明支持它的页码、且只引用所传文件。
- 加上”找不到就明说”的限制,避免模型从训练记忆里脑补出报告里没有的内容。
- 比起模糊地让它”总结一下”,把字数、要素、证据分级和引用格式一次性讲清,能大幅减少它自由发挥的空间。
二、挑最强的模型,并打开深度思考
- ChatGPT:选用 GPT-5.6 Sol,把推理档拉到 Extra High。
- Claude:选用 Opus 5,effort 至少设为 high,最高可到 Max 档。
- Gemini:选用 Pro 并开启 Deep Think(需 Google AI Ultra 订阅);没有就退而用 Extended thinking。
- 这轮实测里 ChatGPT 的摘要最稳,统计与页码大体对得上,但仍会混淆”实测”与”预测”的边界,不能全信。
三、把”区分证据类型”当成硬性检查项
- 拿到摘要后逐条核对:这个数字到底来自实测数据、受访者预期,还是作者本人的预测?
- 对照原文看几个翻车点:Claude 声称”报告里每个百分比都只是高管预期而非实测”,但报告第 10–12 页明明有来自 2576 个网站的实测数据——谷歌搜索引荐量全球下降 33%、美国下降 38%;Gemini 把”67% 出版商因 AI 未裁员”错放进”实测结果”,其实它来自 263 位高管的自报,并非独立统计。
- 凡是没标页码、或把”97% 认为后台自动化重要”(感知的重要性)当成”已有 97% 采用率”的,都要打问号。
四、要保真,换 NotebookLM
- 作者发现,把同一份报告传到 NotebookLM(现已更名 Gemini Notebook)让它对照概括,几乎不会冒出文件里没有的来源和事实。
- 它的回答严格限定在用户上传的资料范围内,比直接用聊天模型更不容易”瞎编”,适合论文、财报、合同这类不容有失的场景。
注意事项:AI 摘要适合快速摸底和抓重点,但凡涉及关键决策的内容,务必回到原文逐条核对页码与口径,别让一处幻觉带偏判断。
来源:XDA Developers







