直接回答:大模型中文能力至少要分成三类测试:中文写作看内容、结构、语言与文体;知识问答看准确性、证据、解释与推理;指令遵循看格式、约束、步骤和稳定性。C-Eval适合测中文知识与推理,AlignBench更接近中文真实场景的开放式回答,FollowBench专门检查内容、情境、风格、格式和示例约束。[1][2][3]
评测框架整理日期:2026年8月5日。本文不提供当前模型排名,重点是建立可重复使用的中文测试集。

为什么“让模型写一篇文章”测不出中文能力
一篇作文只能反映某个提示词下的第一稿印象。模型可能写得流畅,却会漏条件、改数字、套模板、过度排比、把英文表达直译成中文。中文能力需要同时覆盖客观知识、开放写作、指令约束、多轮修改和事实保持。
三大维度与建议权重
| 维度 | 建议权重 | 主要子项 |
|---|---|---|
| 中文写作 | 35% | 内容质量、结构逻辑、语言自然、文体风格、修改稳定 |
| 知识问答 | 35% | 准确性、覆盖度、解释深度、推理、来源意识 |
| 指令遵循 | 30% | 格式、长度、角色、禁用项、多步骤、跨轮保持 |
权重应随业务调整。内容团队可提高写作权重;客服和结构化抽取应提高指令遵循;教育和研究则提高知识与证据权重。
中文写作怎么测
1. 从零起草
给出主题、受众、目的、字数和禁用词,观察模型是否建立清晰结构,而不是堆砌空话。
2. 基于资料写作
提供一份含数字、日期和限定条件的材料,要求写成报告。重点检查是否忠于原文、是否偷偷补充不存在的数据。
3. 风格改写
把同一段内容分别改为正式公文、公众号、小红书、客服说明。评分时看差异是否真实,而不是只换几个词。
4. 多轮编辑
连续要求“缩短20%”“保留全部数字”“减少AI腔”“改成更自然中文”。优秀模型应在修改中保持事实与结构。
| 写作评分项 | 0分 | 2分 | 4分 |
|---|---|---|---|
| 内容 | 空洞或偏题 | 基本完整但泛泛 | 信息具体且紧扣目的 |
| 结构 | 混乱重复 | 有层级但衔接一般 | 逻辑清楚、段落服务结论 |
| 语言 | 直译、生硬、病句 | 流畅但模板化 | 自然、准确、符合中文习惯 |
| 事实保持 | 明显改错或编造 | 有少量遗漏 | 数字与限定条件完整 |
知识问答怎么测
C-Eval包含中学、高中、大学和专业级别、覆盖52个学科的选择题,适合测中文知识与推理基础。[1]但真实产品不能只做选择题,还应加入:
- 解释一个概念,并给出反例;
- 比较两个方案,写清适用条件;
- 从给定材料回答,禁止使用外部知识;
- 回答时区分事实、推断和建议;
- 遇到信息不足时明确说明,而不是编答案。
AlignBench使用真实场景的开放式中文问题,并对知识密集问题附上可靠网页证据,说明中文评测应重视实际任务与可解释评分。[2]
指令遵循怎么测
FollowBench把约束分成内容、情境、风格、格式和示例五类,并逐级增加约束难度。[3]你可以建立类似测试:
- 只输出三行,每行不超过20字;
- 必须包含两个关键词,不得出现三个禁用词;
- 先给结论,再给表格,最后给风险;
- 输出合法JSON,不允许额外字段;
- 连续三轮对话都保持同一角色和格式。
客观评分与主观评分如何结合
| 可自动评分 | 需要人工或裁判模型 |
|---|---|
| 字数、格式、关键词、禁用词、字段、选择题正确率 | 文体自然度、逻辑、可读性、是否空洞 |
| 数字是否保留、JSON是否有效、引用URL是否存在 | 引用是否真正支持结论、表达是否符合目标受众 |
裁判模型不能成为唯一真相。建议抽取至少20%的样本由两名人工评分,并记录分歧原因。
一套50题的最小中文评测集
- 写作20题:起草6、资料写作6、风格改写4、多轮编辑4;
- 知识15题:常识5、专业5、材料限定问答5;
- 指令15题:单约束5、多约束5、跨轮保持5。
每次模型升级都跑同一套题,保存原始输出。新增题目时不要一次替换全部旧题,否则无法比较版本变化。
常见误区
- 把中文知识选择题成绩等同于写作体验;
- 只测第一稿,不测多轮修改;
- 评分标准只有“好、一般、差”;
- 让同一个模型既参赛又当唯一裁判;
- 测试集全是公开题,模型可能见过。
最重要的原则:中文能力不是一个总分。请保留分项成绩和失败案例,让选型结果能够对应具体工作,而不是再造一个没有解释力的排行榜。
可直接使用的测试任务模板
| 类型 | 示例要求 | 主要检查 |
|---|---|---|
| 资料写作 | 根据800字材料写1000字分析,所有数字原样保留 | 事实保持、结构、语言 |
| 风格切换 | 把同一内容改为正式通知和短视频口播 | 文体差异、自然度 |
| 知识解释 | 向高中生解释一个专业概念并给反例 | 准确、层次、受众匹配 |
| 多约束 | 三段、每段两句、含关键词A、不得出现B | 约束完成率 |
| 跨轮修改 | 第二轮缩短,第三轮保留数字并改语气 | 记忆、事实与格式稳定 |
中文写作常见失败类型
- 空洞模板:大量“随着……不断发展”“值得注意的是”,信息密度低;
- 伪正式:堆砌官样词,却缺少明确主体和动作;
- 英文腔:名词化、被动句和不自然连接词过多;
- 排比滥用:节奏看似有力,但内容重复;
- 语气漂移:多轮修改后从专业报告变成营销文案;
- 事实漂移:为了语句顺畅修改数字、日期或因果关系。
怎样降低人工评分分歧
- 先写评分锚点,给出0分、2分、4分示例;
- 评分人先独立打分,不先讨论;
- 差异超过1分的样本进入复核;
- 记录分歧来自事实、文体还是任务理解;
- 每轮评测前用10个样本校准评分标准。
数据集如何防止“刷榜”
公开题适合建立基础比较,但业务选型应保留一部分私有题。可以每季度替换20%的测试样本,保持任务类型与难度分布不变;同时加入真实失败案例,而不是只收集模型容易回答的标准题。
评测结果怎么呈现
不要只给总分。建议同时展示三大维度、子项、成功案例、典型失败和人工修改时间。对内容团队而言,“模型得分89”远不如“数字保持率99%,多轮格式遵循78%,人工编辑平均12分钟”有用。
补充常见问题
中文知识题需要联网吗?
基础知识评测可以关闭联网;时效性问题应单独开启搜索,并把搜索能力和模型知识分开评分。
繁体中文和方言要不要测?
如果业务涉及,就应单独建立样本,不要从简体中文成绩推断所有中文变体。
用LLM当裁判可靠吗?
可以提高效率,但应使用明确量表、隐藏参赛模型身份、随机交换答案顺序,并用人工样本校准偏差。
参考资料
© 版权声明
文章版权归作者所有,未经允许请勿转载。