怎么测试大模型幻觉率?一套可复现的事实核验评测方法

直接回答:测试大模型幻觉率,不能把整段回答粗暴标成“对”或“错”。更可靠的方法是把回答拆成可独立核验的原子声明,为每条声明搜索可信证据,再标注“支持、反驳、证据不足、不可核验”,最后分别计算支持率、错误率和不可判定率。FActScore与SAFE等研究都采用了“拆分事实—检索证据—逐条判断”的思路。[1][2]

方法整理日期:2026年8月5日。本文给出评测流程,不代表任何当前模型的幻觉率排名。

怎么测试大模型幻觉率?一套可复现的事实核验评测方法

先分清什么叫“幻觉”

幻觉主要指模型生成了看似明确、实际上没有可靠依据或与证据冲突的事实性内容。它不等同于文风不好、回答不够完整、拒绝回答或没有遵守格式。TruthfulQA早期用容易诱发常见误解的问题测试模型是否会模仿人类错误观念;FActScore则把长文本拆成原子事实,衡量其中有多少能够得到可靠知识源支持。[1][3]

四类结果必须分开

标签定义示例
支持可信证据直接支持该声明官方公告明确写有对应日期与功能
反驳可信证据明确显示该声明错误模型说产品已发布,但官方仍标注预览
证据不足当前资料无法确认没有公开数据的内部指标
不可核验主观建议、审美或价值判断“这个产品最好用”

如果把“证据不足”全部算成错误,会夸大幻觉率;如果只检查整段结论,又会掩盖一段话里真假混杂的情况。

一套可复现的六步流程

第1步:固定测试条件

记录模型、版本、产品入口、是否联网、推理强度、系统提示词、测试日期和完整输入。模型更新频繁,不保存这些信息,结果无法复现。

第2步:设计真实问题

测试集应覆盖你真正关心的领域,例如产品资料、行业数据、公司政策、历史事实、医学常识或研究总结。每道题要明确允许使用哪些来源,以及知识截止日期。

第3步:拆分原子声明

把“某公司在2026年发布了两款模型,均支持1M上下文并已在全球上线”拆成至少四条:发布日期、模型数量、上下文长度、全球可用性。原子声明越清楚,证据判断越稳定。

第4步:建立证据层级

  • 第一优先:官方文档、原始论文、政府数据库、公司公告;
  • 第二优先:权威媒体或专业数据库;
  • 不建议:无作者内容站、聚合转载、仅有搜索摘要的页面。

第5步:双人或双模型复核

自动评估可以提高效率,但高风险领域仍应人工抽样。SAFE研究显示,搜索增强的LLM评估器可以在大规模事实判断中降低成本,但自动评估器本身也会犯错。[2]

第6步:分别统计三个指标

指标计算方式用途
支持率支持声明数 ÷ 可核验声明数回答中被证据支持的比例
错误率反驳声明数 ÷ 可核验声明数真正事实错误的比例
证据不足率证据不足数 ÷ 全部声明数反映问题本身或检索覆盖不足

测试题怎么设计才有效

  • 常见误解题:测试模型是否会顺着错误前提回答;
  • 时效题:需要近30天资料,测试联网与日期判断;
  • 长文题:要求从多份材料提取事实,测试遗漏和串联错误;
  • 诱导题:用户故意给出不存在的人名、论文或版本;
  • 冲突证据题:不同来源说法不同,要求模型指出冲突而不是强行统一。

不要只测“会不会答错”

更成熟的评测还应记录:模型是否表达不确定性、是否主动请求更多信息、是否提供可点击来源、引用是否精确匹配、被纠正后是否能修复。一个模型偶尔拒答,可能比自信编造更安全。

常见错误

  1. 用模型自己当唯一裁判,没有人工抽样;
  2. 只核对结论,不核对数字、日期、人名和限定条件;
  3. 搜索到相关网页就判定“支持”,却没有阅读原文;
  4. 混用不同模型版本或联网设置;
  5. 测试题全部来自公开榜单,不能代表自己的业务。

推荐最小方案:先准备50道真实问题;每道问题输出后拆分原子事实;至少20%样本双人复核;保存输入、输出、证据URL、引用原文、标签和评测日期。

常见问题

幻觉率越低就一定越好吗?

不一定。模型可以通过少说、拒答来降低错误率,所以还要同时看任务完成度、信息量和证据不足率。

联网搜索能消除幻觉吗?

不能。搜索可能检索到错误来源,模型也可能引用不匹配,或把推断写成事实。

能否完全自动评测?

低风险、大规模回归测试可以高度自动化;医疗、法律、金融和公开发布内容仍应人工复核关键事实。

一个完整标注示例

问题:“某公司在2026年7月发布新模型,支持1M上下文,API已全球开放,价格为每百万输入Token 1美元。”回答看似只有一句,实际上包含四条可核验声明:

原子声明证据标签备注
发布时间为2026年7月官方发布公告支持/反驳核对事件日期而非网页更新时间
上下文为1M官方模型目录支持/反驳区分输入上限与有效召回
API全球开放地区支持列表支持/反驳/不足不能由“API已上线”推断全球开放
输入价为1美元当前价格页支持/反驳核对币种、缓存命中与模型版本

这种拆法可以避免“一半正确、一半错误”的回答被整体判成正确。

评测记录至少保存哪些字段

  • 测试ID、问题类别、风险级别和参考答案;
  • 模型名称、版本、产品入口、联网状态和推理强度;
  • 完整输入、完整输出、生成时间和重试次数;
  • 每条原子声明、证据URL、引用原文和证据日期;
  • 初审标签、复核标签、分歧原因和最终裁决;
  • 是否影响最终业务结论,以及需要什么补救。

领域不同,幻觉代价也不同

领域重点错误建议处理
内容写作人物、日期、数据、引语发布前逐条事实核验
代码不存在的API、参数和库版本运行代码与测试
研究虚假论文、错引来源、时间线混乱打开原文并记录证据
医疗/法律/金融错误建议和遗漏限制专业人员复核,模型不作最终决定

什么时候可以发布“幻觉率”结论

至少应满足:测试集公开或可复核、模型和日期明确、所有模型使用相同条件、原始输出保留、评分规则预先定义、抽样人工复核、置信区间或样本量公开。否则更合适的表达是“本次样本中的事实错误率”,不要把小样本包装成普遍结论。

补充常见问题

引用错误算不算幻觉?

如果模型声称某引用支持某结论,但原文并不支持,应算事实性错误或证据归因错误,并单独统计。

回答过时算不算幻觉?

若问题明确要求当前状态,而模型提供已失效信息,应计为错误;同时记录这是知识过期还是搜索/日期判断失败。

模型承认不知道是否扣分?

如果资料确实不足,合理表达不确定性不应扣事实分;可以在任务完成度中单独评价。

参考资料

  1. FActScore:长文本原子事实评估
  2. Google DeepMind:Long-form factuality与SAFE
  3. TruthfulQA:测试模型模仿人类错误观念
© 版权声明

相关文章