直接回答:最适合分析PDF、表格和长文档的模型,不一定是标称上下文最长的模型。真正要比较的是五项能力:能否正确解析页面、读懂表格与图表、在长文中召回中间信息、给出页码或原文引用、跨多个文件整合结论。长上下文只代表“最多能放多少”,不代表“全部内容都能稳定使用”。[1][2]
产品信息核验日期:2026年8月5日。本文提供选型方法与测试清单,不给出未经统一实测的质量冠军。

文档分析的五层能力
| 层级 | 要解决的问题 | 典型失败 |
|---|---|---|
| 文件接入 | 支持PDF、Word、Excel、图片扫描件和多文件 | 文件过大、页数或格式不支持 |
| 文档解析 | 识别标题、段落、页码、脚注、图表与版面 | 两栏顺序错、页眉混入正文 |
| 内容理解 | 总结、问答、比较、计算和解释 | 只会复述,无法建立关系 |
| 引用定位 | 返回页码、段落或原文 | 结论正确但无法核验 |
| 长程召回 | 在文档开头、中间、结尾都能找到信息 | “Lost in the Middle”中间信息丢失 |
为什么上下文长度不是唯一指标
“Lost in the Middle”研究发现,模型对长上下文的利用会受相关信息位置影响,重要内容位于开头或结尾时通常更容易被找到,位于中间时性能可能下降。[1]LongBench v2覆盖单文档、多文档、代码仓库和长结构化数据等现实任务,说明长文能力必须按任务类型分别评估。[2]
因此,看到“1M上下文”时至少继续追问:有效召回有多长?表格和图片怎么计入Token?长输入的费用和延迟是多少?引用能否定位?
不同文档任务怎么选
1. 普通文本PDF摘要
重点看结构理解、事实保持和摘要层次。用同一份报告要求输出:100字摘要、章节摘要、关键数字、风险和页码。
2. 表格和财务数据
重点看表头、单位、合并单元格、同比/环比和跨页表格。模型能够“描述趋势”不代表能正确抄录每个数字。生产流程应把数值抽取结果交给程序规则二次校验。
3. 扫描件和复杂版面
需要原生视觉或专业OCR。Google官方文档说明Gemini可以分析PDF中的文字、图片、图表和表格,并支持结构化提取;复杂页面仍应准备旋转、模糊和小字样本测试。[3]
4. 多份合同或研究报告
重点看多文件命名、来源隔离、冲突信息与引用。不要只问“总结这50份文档”,而应先要求建立文件清单、主题索引和证据表。
5. 持续增长的知识库
当文档持续增加、需要权限过滤和精确检索时,RAG比每次塞入全部文件更合适。先检索相关片段,再让模型综合,可以降低输入成本并提高来源可追踪性。
官方产品能力只能作为候选筛选
Gemini官方文档列出最长1000页PDF、多模态页面理解和结构化输出;Kimi官方帮助中心列出PDF、Word、Excel、PPT、图片和视频文件处理,并区分不同模型的上下文能力。[3][4]这些信息能证明产品“支持什么”,不能证明它在你的表格和扫描件上“准确率最高”。
一套统一测试清单
- 准备一份原生文本PDF、一份扫描PDF、一份含复杂表格PDF、一份Excel和三份相关文档;
- 在开头、中间、结尾分别放置可验证关键事实;
- 要求模型输出摘要、字段表、引用页码、冲突列表和不确定项;
- 逐项核对数字、页码、单位和引用原文;
- 记录失败页、漏检率、错误率、首次响应、总耗时和Token费用;
- 同一模型至少重复三次,观察稳定性。
| 评分维度 | 建议权重 |
|---|---|
| 事实与数字准确 | 30% |
| 关键内容召回 | 20% |
| 表格和版面理解 | 20% |
| 引用定位 | 15% |
| 速度、成本与稳定性 | 15% |
常见误区
- 把最大上下文当有效记忆;
- 只检查总结是否通顺,不核对原数字;
- 扫描PDF仍按纯文本测试;
- 没有要求页码和原文引用;
- 把一次成功当成稳定能力;
- 一次上传所有文档,不做检索和分层处理。
选型建议:单份短期文档优先测试原生文件理解;大量长期文档采用解析器/OCR+检索+大模型;高风险数字必须程序校验和人工抽样。
文档预处理往往比换模型更有效
- 扫描页先旋转、去黑边、矫正透视和提高对比度;
- 给文件使用稳定名称,不要全部叫“附件1”;
- 按章节或页面保留来源标识,便于回溯;
- Excel保留原始表头、单位和工作表名称;
- 图片型PDF与原生文本PDF分开处理;
- 超长材料先建立目录、页码和摘要索引。
长上下文和RAG的选择矩阵
| 情况 | 优先方案 | 原因 |
|---|---|---|
| 单份文档、一次性分析 | 原生长上下文 | 流程简单、上下文完整 |
| 数百份文档持续更新 | RAG | 降低成本,支持增量和来源过滤 |
| 必须阅读全部条款 | 分段+长上下文复核 | 仅检索可能漏掉关键例外 |
| 问题高度明确 | RAG检索 | 只送相关片段,提高可追踪性 |
| 需要跨全文主题总结 | 分层摘要+最终综合 | 避免一次性输入造成中间信息丢失 |
表格分析的专项测试
- 随机抽取20个单元格,核对字符级准确;
- 检查行列标题是否对应正确;
- 加入百分比、负数、合并单元格和空值;
- 要求模型计算总和,并用程序独立重算;
- 测试跨页表格是否被拆成两张无关表;
- 要求输出来源工作表、单元格或页码。
长文档测试的“针刺法”
在文档开头、中间和结尾分别放入格式相近、答案不同的关键事实,再用多个问题测试召回。还可以把干扰信息放在正确答案附近,观察模型是否只抓关键词。此方法比只问“总结全文”更容易发现有效上下文不足。
生产环境需要哪些兜底
- 超过文件大小或页数时自动拆分;
- 解析失败页进入OCR或人工队列;
- 引用必须包含文件名与页码;
- 关键数字同时保存原始文本片段;
- 无证据时禁止模型补全;
- 对合同、财务和医疗材料设置人工审批。
补充常见问题
把PDF转成TXT再上传可以吗?
纯文本报告可以,但表格、图表、双栏、脚注和版面关系会丢失。复杂PDF应保留视觉页面或使用专业解析。
模型能直接分析Excel公式吗?
取决于产品是否解析公式、计算值和工作表关系。必须用含公式、跨表引用和隐藏行列的样本实测。
同一文档重复问答为什么结果不同?
可能来自采样随机性、文件解析、上下文截断、模型版本或检索结果变化,应保存原始请求并重复测试。
参考资料
© 版权声明
文章版权归作者所有,未经允许请勿转载。