直接回答:测试大模型幻觉率,不能把整段回答粗暴标成“对”或“错”。更可靠的方法是把回答拆成可独立核验的原子声明,为每条声明搜索可信证据,再标注“支持、反驳、证据不足、不可核验”,最后分别计算支持率、错误率和不可判定率。FActScore与SAFE等研究都采用了“拆分事实—检索证据—逐条判断”的思路。[1][2]
方法整理日期:2026年8月5日。本文给出评测流程,不代表任何当前模型的幻觉率排名。

先分清什么叫“幻觉”
幻觉主要指模型生成了看似明确、实际上没有可靠依据或与证据冲突的事实性内容。它不等同于文风不好、回答不够完整、拒绝回答或没有遵守格式。TruthfulQA早期用容易诱发常见误解的问题测试模型是否会模仿人类错误观念;FActScore则把长文本拆成原子事实,衡量其中有多少能够得到可靠知识源支持。[1][3]
四类结果必须分开
| 标签 | 定义 | 示例 |
|---|---|---|
| 支持 | 可信证据直接支持该声明 | 官方公告明确写有对应日期与功能 |
| 反驳 | 可信证据明确显示该声明错误 | 模型说产品已发布,但官方仍标注预览 |
| 证据不足 | 当前资料无法确认 | 没有公开数据的内部指标 |
| 不可核验 | 主观建议、审美或价值判断 | “这个产品最好用” |
如果把“证据不足”全部算成错误,会夸大幻觉率;如果只检查整段结论,又会掩盖一段话里真假混杂的情况。
一套可复现的六步流程
第1步:固定测试条件
记录模型、版本、产品入口、是否联网、推理强度、系统提示词、测试日期和完整输入。模型更新频繁,不保存这些信息,结果无法复现。
第2步:设计真实问题
测试集应覆盖你真正关心的领域,例如产品资料、行业数据、公司政策、历史事实、医学常识或研究总结。每道题要明确允许使用哪些来源,以及知识截止日期。
第3步:拆分原子声明
把“某公司在2026年发布了两款模型,均支持1M上下文并已在全球上线”拆成至少四条:发布日期、模型数量、上下文长度、全球可用性。原子声明越清楚,证据判断越稳定。
第4步:建立证据层级
- 第一优先:官方文档、原始论文、政府数据库、公司公告;
- 第二优先:权威媒体或专业数据库;
- 不建议:无作者内容站、聚合转载、仅有搜索摘要的页面。
第5步:双人或双模型复核
自动评估可以提高效率,但高风险领域仍应人工抽样。SAFE研究显示,搜索增强的LLM评估器可以在大规模事实判断中降低成本,但自动评估器本身也会犯错。[2]
第6步:分别统计三个指标
| 指标 | 计算方式 | 用途 |
|---|---|---|
| 支持率 | 支持声明数 ÷ 可核验声明数 | 回答中被证据支持的比例 |
| 错误率 | 反驳声明数 ÷ 可核验声明数 | 真正事实错误的比例 |
| 证据不足率 | 证据不足数 ÷ 全部声明数 | 反映问题本身或检索覆盖不足 |
测试题怎么设计才有效
- 常见误解题:测试模型是否会顺着错误前提回答;
- 时效题:需要近30天资料,测试联网与日期判断;
- 长文题:要求从多份材料提取事实,测试遗漏和串联错误;
- 诱导题:用户故意给出不存在的人名、论文或版本;
- 冲突证据题:不同来源说法不同,要求模型指出冲突而不是强行统一。
不要只测“会不会答错”
更成熟的评测还应记录:模型是否表达不确定性、是否主动请求更多信息、是否提供可点击来源、引用是否精确匹配、被纠正后是否能修复。一个模型偶尔拒答,可能比自信编造更安全。
常见错误
- 用模型自己当唯一裁判,没有人工抽样;
- 只核对结论,不核对数字、日期、人名和限定条件;
- 搜索到相关网页就判定“支持”,却没有阅读原文;
- 混用不同模型版本或联网设置;
- 测试题全部来自公开榜单,不能代表自己的业务。
推荐最小方案:先准备50道真实问题;每道问题输出后拆分原子事实;至少20%样本双人复核;保存输入、输出、证据URL、引用原文、标签和评测日期。
常见问题
幻觉率越低就一定越好吗?
不一定。模型可以通过少说、拒答来降低错误率,所以还要同时看任务完成度、信息量和证据不足率。
联网搜索能消除幻觉吗?
不能。搜索可能检索到错误来源,模型也可能引用不匹配,或把推断写成事实。
能否完全自动评测?
低风险、大规模回归测试可以高度自动化;医疗、法律、金融和公开发布内容仍应人工复核关键事实。
一个完整标注示例
问题:“某公司在2026年7月发布新模型,支持1M上下文,API已全球开放,价格为每百万输入Token 1美元。”回答看似只有一句,实际上包含四条可核验声明:
| 原子声明 | 证据 | 标签 | 备注 |
|---|---|---|---|
| 发布时间为2026年7月 | 官方发布公告 | 支持/反驳 | 核对事件日期而非网页更新时间 |
| 上下文为1M | 官方模型目录 | 支持/反驳 | 区分输入上限与有效召回 |
| API全球开放 | 地区支持列表 | 支持/反驳/不足 | 不能由“API已上线”推断全球开放 |
| 输入价为1美元 | 当前价格页 | 支持/反驳 | 核对币种、缓存命中与模型版本 |
这种拆法可以避免“一半正确、一半错误”的回答被整体判成正确。
评测记录至少保存哪些字段
- 测试ID、问题类别、风险级别和参考答案;
- 模型名称、版本、产品入口、联网状态和推理强度;
- 完整输入、完整输出、生成时间和重试次数;
- 每条原子声明、证据URL、引用原文和证据日期;
- 初审标签、复核标签、分歧原因和最终裁决;
- 是否影响最终业务结论,以及需要什么补救。
领域不同,幻觉代价也不同
| 领域 | 重点错误 | 建议处理 |
|---|---|---|
| 内容写作 | 人物、日期、数据、引语 | 发布前逐条事实核验 |
| 代码 | 不存在的API、参数和库版本 | 运行代码与测试 |
| 研究 | 虚假论文、错引来源、时间线混乱 | 打开原文并记录证据 |
| 医疗/法律/金融 | 错误建议和遗漏限制 | 专业人员复核,模型不作最终决定 |
什么时候可以发布“幻觉率”结论
至少应满足:测试集公开或可复核、模型和日期明确、所有模型使用相同条件、原始输出保留、评分规则预先定义、抽样人工复核、置信区间或样本量公开。否则更合适的表达是“本次样本中的事实错误率”,不要把小样本包装成普遍结论。
补充常见问题
引用错误算不算幻觉?
如果模型声称某引用支持某结论,但原文并不支持,应算事实性错误或证据归因错误,并单独统计。
回答过时算不算幻觉?
若问题明确要求当前状态,而模型提供已失效信息,应计为错误;同时记录这是知识过期还是搜索/日期判断失败。
模型承认不知道是否扣分?
如果资料确实不足,合理表达不确定性不应扣事实分;可以在任务完成度中单独评价。
参考资料
© 版权声明
文章版权归作者所有,未经允许请勿转载。