中文能力怎么测?大模型中文写作、知识、指令遵循评测框架

直接回答:大模型中文能力至少要分成三类测试:中文写作看内容、结构、语言与文体;知识问答看准确性、证据、解释与推理;指令遵循看格式、约束、步骤和稳定性。C-Eval适合测中文知识与推理,AlignBench更接近中文真实场景的开放式回答,FollowBench专门检查内容、情境、风格、格式和示例约束。[1][2][3]

评测框架整理日期:2026年8月5日。本文不提供当前模型排名,重点是建立可重复使用的中文测试集。

中文能力怎么测?大模型中文写作、知识、指令遵循评测框架

为什么“让模型写一篇文章”测不出中文能力

一篇作文只能反映某个提示词下的第一稿印象。模型可能写得流畅,却会漏条件、改数字、套模板、过度排比、把英文表达直译成中文。中文能力需要同时覆盖客观知识、开放写作、指令约束、多轮修改和事实保持。

三大维度与建议权重

维度建议权重主要子项
中文写作35%内容质量、结构逻辑、语言自然、文体风格、修改稳定
知识问答35%准确性、覆盖度、解释深度、推理、来源意识
指令遵循30%格式、长度、角色、禁用项、多步骤、跨轮保持

权重应随业务调整。内容团队可提高写作权重;客服和结构化抽取应提高指令遵循;教育和研究则提高知识与证据权重。

中文写作怎么测

1. 从零起草

给出主题、受众、目的、字数和禁用词,观察模型是否建立清晰结构,而不是堆砌空话。

2. 基于资料写作

提供一份含数字、日期和限定条件的材料,要求写成报告。重点检查是否忠于原文、是否偷偷补充不存在的数据。

3. 风格改写

把同一段内容分别改为正式公文、公众号、小红书、客服说明。评分时看差异是否真实,而不是只换几个词。

4. 多轮编辑

连续要求“缩短20%”“保留全部数字”“减少AI腔”“改成更自然中文”。优秀模型应在修改中保持事实与结构。

写作评分项0分2分4分
内容空洞或偏题基本完整但泛泛信息具体且紧扣目的
结构混乱重复有层级但衔接一般逻辑清楚、段落服务结论
语言直译、生硬、病句流畅但模板化自然、准确、符合中文习惯
事实保持明显改错或编造有少量遗漏数字与限定条件完整

知识问答怎么测

C-Eval包含中学、高中、大学和专业级别、覆盖52个学科的选择题,适合测中文知识与推理基础。[1]但真实产品不能只做选择题,还应加入:

  • 解释一个概念,并给出反例;
  • 比较两个方案,写清适用条件;
  • 从给定材料回答,禁止使用外部知识;
  • 回答时区分事实、推断和建议;
  • 遇到信息不足时明确说明,而不是编答案。

AlignBench使用真实场景的开放式中文问题,并对知识密集问题附上可靠网页证据,说明中文评测应重视实际任务与可解释评分。[2]

指令遵循怎么测

FollowBench把约束分成内容、情境、风格、格式和示例五类,并逐级增加约束难度。[3]你可以建立类似测试:

  • 只输出三行,每行不超过20字;
  • 必须包含两个关键词,不得出现三个禁用词;
  • 先给结论,再给表格,最后给风险;
  • 输出合法JSON,不允许额外字段;
  • 连续三轮对话都保持同一角色和格式。

客观评分与主观评分如何结合

可自动评分需要人工或裁判模型
字数、格式、关键词、禁用词、字段、选择题正确率文体自然度、逻辑、可读性、是否空洞
数字是否保留、JSON是否有效、引用URL是否存在引用是否真正支持结论、表达是否符合目标受众

裁判模型不能成为唯一真相。建议抽取至少20%的样本由两名人工评分,并记录分歧原因。

一套50题的最小中文评测集

  • 写作20题:起草6、资料写作6、风格改写4、多轮编辑4;
  • 知识15题:常识5、专业5、材料限定问答5;
  • 指令15题:单约束5、多约束5、跨轮保持5。

每次模型升级都跑同一套题,保存原始输出。新增题目时不要一次替换全部旧题,否则无法比较版本变化。

常见误区

  1. 把中文知识选择题成绩等同于写作体验;
  2. 只测第一稿,不测多轮修改;
  3. 评分标准只有“好、一般、差”;
  4. 让同一个模型既参赛又当唯一裁判;
  5. 测试集全是公开题,模型可能见过。

最重要的原则:中文能力不是一个总分。请保留分项成绩和失败案例,让选型结果能够对应具体工作,而不是再造一个没有解释力的排行榜。

可直接使用的测试任务模板

类型示例要求主要检查
资料写作根据800字材料写1000字分析,所有数字原样保留事实保持、结构、语言
风格切换把同一内容改为正式通知和短视频口播文体差异、自然度
知识解释向高中生解释一个专业概念并给反例准确、层次、受众匹配
多约束三段、每段两句、含关键词A、不得出现B约束完成率
跨轮修改第二轮缩短,第三轮保留数字并改语气记忆、事实与格式稳定

中文写作常见失败类型

  • 空洞模板:大量“随着……不断发展”“值得注意的是”,信息密度低;
  • 伪正式:堆砌官样词,却缺少明确主体和动作;
  • 英文腔:名词化、被动句和不自然连接词过多;
  • 排比滥用:节奏看似有力,但内容重复;
  • 语气漂移:多轮修改后从专业报告变成营销文案;
  • 事实漂移:为了语句顺畅修改数字、日期或因果关系。

怎样降低人工评分分歧

  1. 先写评分锚点,给出0分、2分、4分示例;
  2. 评分人先独立打分,不先讨论;
  3. 差异超过1分的样本进入复核;
  4. 记录分歧来自事实、文体还是任务理解;
  5. 每轮评测前用10个样本校准评分标准。

数据集如何防止“刷榜”

公开题适合建立基础比较,但业务选型应保留一部分私有题。可以每季度替换20%的测试样本,保持任务类型与难度分布不变;同时加入真实失败案例,而不是只收集模型容易回答的标准题。

评测结果怎么呈现

不要只给总分。建议同时展示三大维度、子项、成功案例、典型失败和人工修改时间。对内容团队而言,“模型得分89”远不如“数字保持率99%,多轮格式遵循78%,人工编辑平均12分钟”有用。

补充常见问题

中文知识题需要联网吗?

基础知识评测可以关闭联网;时效性问题应单独开启搜索,并把搜索能力和模型知识分开评分。

繁体中文和方言要不要测?

如果业务涉及,就应单独建立样本,不要从简体中文成绩推断所有中文变体。

用LLM当裁判可靠吗?

可以提高效率,但应使用明确量表、隐藏参赛模型身份、随机交换答案顺序,并用人工样本校准偏差。

参考资料

  1. C-Eval:中文多层级多学科评测集
  2. AlignBench:中文真实场景对齐评测
  3. FollowBench:细粒度指令约束评测
  4. LongBench:中英双语长上下文评测
© 版权声明

相关文章