一个小型但方法论完整的评测:主流国产大模型(对照前沿模型)在德语上的真实能力地图。
维度框架、标注口径与 harness 为语种无关设计;德语是第一个实例,复用到其他语种只需替换 case 集与审校人。
- 德语是「高资源小语种」:前沿模型(GPT/Claude/Gemini)德语已接近母语水准,但国产模型的德语与英语存在明显能力差,且这个差距缺少公开的、细粒度的测量。
- 现有多语言 benchmark(如 MMLU 翻译版)大多测「用德语答知识题」,测不出地道性、语域(Register)、文体规范这些真实出海场景里最致命的短板。
- 小语种评测有个方法论死结:用 LLM 当 judge 评德语,judge 自己的德语可信吗? 本项目用人工 gold 标注对 judge 做校准,给出一个量化答案。
- 能力评测:5 大维度 × ~50 case,跑国产模型 + 前沿对照,人工标注(德语专业背景)产出 failure taxonomy——国产模型德语到底差在哪。
- Judge 校准:用人工标注作 gold set,测 LLM-as-judge 在德语评估任务上与人类专家的一致率(整体 + 分错误类型的 TPR/TNR)——回答「德语评测能不能自动化、哪些维度能哪些不能」。
docs/eval-design.md 评测设计:维度框架、标注口径、judge 校准方案
cases/ case 集(JSONL)+ 字段口径
harness/ 运行脚本 + 模型配置
results/ 模型输出、标注结果、报告(数据以实测为准)
EuroEval、GermanBenchmark、OMGEval 等测「模型能否用德语完成任务」;本项目测「模型生成的德语本身质量如何」(地道性/语域/文体/变体),被测组聚焦国产旗舰模型,且对 LLM-as-judge 做人工 gold 校准。详见 docs/eval-design.md 第 7 节。
- 评测设计 & 维度框架
- Case 集(种子 15 → 目标 50,人工审校中)
- 模型输出采集
- 人工标注(gold)
- Judge 校准 & 报告
所有结论以实测数据为准;本 repo 不含任何演示用假数据。