发表于 2026 年 4 月 21 日
QIMMA 在评估模型之前先对基准进行验证,确保报告的分数真实反映大语言模型在阿拉伯语方面的能力。
🏆 排行榜 · 🔧 GitHub · 📄 论文
如果你一直在关注阿拉伯语大语言模型的评估,你可能已经注意到一个日益突出的矛盾:基准测试和排行榜的数量正在迅速增长,但我们真的在衡量我们以为在衡量的东西吗?
我们构建了 QIMMA قمّة(阿拉伯语中意为“顶峰”),旨在系统地回答这个问题。我们没有直接照搬现有的阿拉伯语基准测试并在其上运行模型,而是在任何评估进行之前,先应用了一套严格的质量验证流程。我们的发现令人警醒:即使是广泛使用、备受认可的阿拉伯语基准测试,也包含系统性的质量问题,这些问题会悄然破坏评估结果。
本文将介绍 QIMMA 是什么、我们如何构建它、发现了哪些问题,以及在清理问题后模型排名会变成什么样。
🔍 问题:阿拉伯语 NLP 评估碎片化且未经验证
阿拉伯语有超过 4 亿人使用,涵盖多种方言和文化背景,然而阿拉伯语 NLP 评估领域仍然支离破碎。以下几个关键痛点推动了这项工作:
翻译问题。许多阿拉伯语基准测试是从英语翻译而来。这引入了分布偏移。在英语中感觉自然的问题,翻译成阿拉伯语后会变得别扭或文化上不匹配,使得基准数据对阿拉伯语实际使用方式的代表性降低。
缺乏质量验证。即使是原生阿拉伯语基准测试,也常常在未经严格质量检查的情况下发布。在已有的资源中,已经记录到标注不一致、标准答案错误、编码错误以及真实标签中的文化偏见等问题。
可复现性差距。评估脚本和每个样本的输出结果很少公开发布,这使得审计结果或在先前工作基础上继续研究变得困难。
覆盖范围碎片化。现有的排行榜涵盖孤立的任务和狭窄的领域,使得对模型进行整体评估变得困难。
为了说明 QIMMA 相对于现有平台的位置:
| 排行榜 | 开源 | 原生阿拉伯语 | 质量验证 | 编程评估 | 公开输出 |
|---|---|---|---|---|---|
| OALL v1 | ✅ | 混合 | ❌ | ❌ | ✅ |
| OALL v2 | ✅ | 大部分 | ❌ | ❌ | ✅ |
| BALSAM | 部分 | 50% | ❌ | ❌ | ❌ |
| AraGen | ✅ | 100% | ✅ | ❌ | ❌ |
| SILMA ABL | ✅ | 100% | ✅ | ❌ | ✅ |
| ILMAAM | 部分 | 100% | ✅ | ❌ | ❌ |
| HELM Arabic | ✅ | 混合 | ❌ | ❌ | ✅ |
| ⛰ QIMMA | ✅ | 99% | ✅ | ✅ | ✅ |
QIMMA 是唯一一个同时具备以下五项特性的平台:开源、以原生阿拉伯语内容为主、系统性质量验证、代码评估,以及公开每个样本的推理输出。
⛰ QIMMA 包含什么?
QIMMA 将来自 14 个源基准测试的 109 个子集整合为一个统一的评估套件,包含超过 52,000 个样本,涵盖 7 个领域:
| 领域 | 基准测试 | 任务类型 |
|---|---|---|
| 文化 | AraDiCE-Culture, ArabCulture, PalmX | 多选题 |
| 理工 | ArabicMMLU, GAT, 3LM STEM | 多选题 |
| 法律 | ArabLegalQA, MizanQA | |
| 多选题, 问答 | 医疗 | MedArabiQ, MedAraBench |
| 多选题, 问答 | 安全 | AraTrust |
| 多选题 | 诗歌与文学 | FannOrFlop |
| 问答 | 编程 | 3LM HumanEval+, 3LM MBPP+ |
代码
- 这种设计有几个突出特点:
- 99% 的原生阿拉伯语内容。唯一的例外是代码评估,它本质上与语言无关。
- 首个包含代码评估的阿拉伯语排行榜。QIMMA 集成了 HumanEval+ 和 MBPP+ 的阿拉伯语适配版本,使得使用阿拉伯语问题陈述评估编程能力成为可能。
领域和任务的多样性。QIMMA 评估了现实世界的能力领域,包括教育、治理、医疗保健、创意表达和软件开发。
🔬 质量验证流程
这是 QIMMA 的方法论核心。在运行任何单个模型之前,我们对每个基准测试中的每个样本应用了多阶段验证流程。
第一阶段:多模型自动评估
- 每个样本由两个最先进的大语言模型独立评估:
- Qwen3-235B-A22B-Instruct
DeepSeek-V3-671B
我们选择了两个具有强大阿拉伯语能力但训练数据组成不同的模型,这样它们的联合判断比任何一个单独模型都更稳健。
每个模型根据一个 10 分量表对样本进行评分,每个标准采用二元评分(0 或 1):
如果任一模型对样本的评分低于 7/10,则该样本被淘汰。两个模型都同意淘汰的样本会立即被剔除。但是,如果只有一个模型标记了某个样本,则该样本将进入第二阶段的人工审核。
被标记的样本由熟悉文化和方言的阿拉伯语母语者进行审核。人工标注员对以下方面做出最终判断:
- 文化背景与地区差异
- 方言细微差别
- 主观解读
- 自动化评估可能遗漏的细微质量问题
对于文化敏感内容,会考虑多种视角,因为“正确性”在阿拉伯各地区确实可能存在差异。
⚠️ 我们的发现:系统性的质量问题
该流程揭示了各基准测试中反复出现的质量问题;这些并非孤立的错误,而是反映了基准测试最初构建方式存在缺陷的系统性模式。
数据一览
| 基准测试 | 总样本数 | 已剔除 | 剔除率 |
|---|---|---|---|
| ArabicMMLU | 14,163 | 436 | 3.1% |
| MizanQA | 1,769 | 41 | 2.3% |
| PalmX | 3,001 | 25 | 0.8% |
| MedAraBench | 4,960 | 33 | 0.7% |
| FannOrFlop | 6,984 | 43 | 0.6% |
| ArabCulture | 3,482 | 7 | 0.2% |
| MedArabiQ | 499 | 1 | 0.2% |
| GAT | 13,986 | 1 | ~0.0% |
| 3LM STEM | 2,609 | 1 | ~0.0% |
| AraDiCE-Culture | 180 | 0 | 0.0% |
| ArabLegalQA | 79 | 0 | 0.0% |
| AraTrust | 522 | 0 | 0.0% |
发现的问题分类
⚖️ 答案质量
错误或不匹配的标准答案索引、事实性错误的答案、缺失或为原始文本的答案。
📄 文本与格式质量
损坏或无法辨认的文本、拼写和语法错误、以及重复样本。
💬 文化敏感性
强化刻板印象以及对多元社群进行笼统概括。
🤝 标准答案合规性
标准答案与评估协议不一致。
💻 代码基准测试:另一种类型的质量工作
代码基准测试需要不同的处理方式。我们没有剔除样本,而是优化了 3LM 对 HumanEval+ 和 MBPP+ 进行阿拉伯语改编版本中的阿拉伯语问题陈述,同时完全保留了任务标识符、参考解决方案和测试套件不变。
修改率非常显著:
| 基准测试 | 总提示词数 | 已修改 | 未修改 | 修改率 |
|---|---|---|---|---|
| 3LM HumanEval+ | 164 | 145 | 19 | 88% |
| 3LM MBPP+ | 378 | 308 | 70 | 81% |
修改分为五类:
- 语言优化:向自然的现代标准阿拉伯语和一致的祈使句式风格靠拢
- 清晰度改进:修正模糊的指令和不清晰的约束条件
- 一致性标准化:统一数学术语、标点符号和示例格式
- 结构修正:修复损坏的三引号字符串、缩进错误、损坏的文本片段
- 语义精炼:明确范围是包含还是排除,保留任务意图
⚙️ 评估设置
评估框架
QIMMA 使用 LightEval、EvalPlus 和 FannOrFlop 作为其评估框架,选择这些框架是为了保证一致性、多语言社区的采用度以及可复现性。
按任务类型划分的指标
| 任务类型 | 指标 | 基准测试 |
|---|---|---|
| 单选题 | 归一化对数似然准确率 | AraDiCE-Culture、ArabicMMLU、ArabCulture、PalmX、3LM STEM、MedArabiQ、GAT、MedAraBench、AraTrust |
| 多选单选题 | 正确选项的概率质量 | MizanQA |
| 生成式问答 | F1 BERTScore(AraBERT v02) | MedArabiQ、ArabLegalQA、FannOrFlop |
| 代码 | Pass@1 | 3LM HumanEval+、3LM MBPP+ |
提示词模板
QIMMA 根据问题格式标准化提示词,共有六种模板类型:
MCQ:通用选择题 · MCQ-C:带上下文段落的选择题 · MCQ-I:带特定指令的选择题(GAT 类比/完形填空) · QA:通用开放式问答 · QA-C:带上下文的问答 · QA-F:填空题式问答
所有提示词均为阿拉伯语。对于 MizanQA 和 ArabCulture,保留了原始论文中特定于基准测试的系统提示词。
🏆 排行榜结果
数据截至 2026 年 4 月;涵盖排名前 10 的评估模型。请访问实时排行榜查看当前排名。
| 排名 | 模型 | 平均分 | AraDiCE-Culture | ArabicMMLU | ArabCulture | PALMX | 3LM STEM | AraTrust | MizanQA | MedArabiQ | ArabLegalQA | GAT | MedAraBench | HumanEval+ | MBPP+ | FannOrFlop |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 🥇 1 | Qwen/Qwen3.5-397B-A17B-FP8 | 68.06 | 82.78 | 77.54 | 61.75 | 83.91 | 88.67 | 90.04 | 73.36 | 47.30 | 54.94 | 55.89 | 47.97 | 67.68 | 76.72 | 44.33 |
| 🥈 2 | Applied-Innovation-Center/Karnak | 66.20 | 73.33 | 80.94 | 53.49 | 81.40 | 93.10 | 89.08 | 55.92 | 55.78 | 71.58 | 61.06 | 54.19 | 33.54 | 64.55 | 58.91 |
| 🥉 3 | inceptionai/Jais-2-70B-Chat | 65.81 | 78.89 | 81.29 | 83.24 | 83.73 | 87.96 | 90.23 | 71.78 | 52.79 | 69.60 | 51.67 | 50.89 | 19.51 | 43.65 | 56.13 |
| #4 | Qwen/Qwen2.5-72B-Instruct | 65.75 | 77.22 | 73.78 | 63.83 | 77.77 | 87.55 | 88.51 | 63.49 | 50.06 | 70.74 | 55.90 | 44.19 | 37.20 | 72.75 | 57.51 |
| #5 | Applied-Innovation-Center/AIC-1 | 65.37 | 73.33 | 72.02 | 77.52 | 76.11 | 88.13 | 90.61 | 56.36 | 53.75 | 68.96 | 62.11 | 50.78 | 28.05 | 69.58 | 47.83 |
| #6 | Qwen/Qwen3.5-122B-A10B | 64.84 | 74.44 | 73.17 | 37.78 | 81.46 | 86.18 | 86.97 | 64.01 | 47.04 | 55.11 | 50.90 | 52.49 | 65.24 | 72.43 | 60.54 |
| #7 | Sakalti/Ultiima-72B | 64.49 | 78.33 | 72.28 | 68.79 | 76.75 | 83.70 | 89.08 | 60.44 | 44.58 | 69.12 | 46.91 | 42.25 | 39.02 | 74.07 | 57.56 |
| #8 | meta-llama/Llama-3.3-70B-Instruct | 63.96 | 77.22 | 71.57 | 78.05 | 77.95 | 88.28 | 85.63 | 67.44 | 56.25 | 64.00 | 51.13 | 54.86 | 27.44 | 71.16 | 24.43 |
| #9 | Qwen/Qwen2.5-32B-Instruct | 63.26 | 70.56 | 68.76 | 75.80 | 72.07 | 81.03 | 85.82 | 53.78 | 48.08 | 69.27 | 56.94 | 36.51 | 34.15 | 72.75 | 93.10 |
| 第10名 | FreedomIntelligence/AceGPT-v2-32B-Chat | 61.14 | 76.67 | 70.62 | 79.79 | 74.46 | 84.88 | 86.97 | 63.89 | 49.96 | 71.46 | 56.04 | 47.32 | 23.78 | 54.50 | 15.56 |
- 规模并不能保证最佳性能。前十名涵盖从32B到397B参数的模型,其中多个中等规模模型在特定领域上超越了更大的模型。
- 阿拉伯语专用模型在文化和语言任务上领先。Jais-2-70B-Chat在ArabicMMLU和ArabCulture上排名最高,而Karnak在3LM STEM和ArabLegalQA上领先。
- 代码生成仍然是阿拉伯语专用模型最难的领域。HumanEval+和MBPP+的最高得分属于多语言模型,其中Qwen3.5-397B在这两项上均领先。
规模与性能的关系
在整个排行榜(46个模型)中,呈现出清晰但不完美的规模-性能相关性。然而,存在一些有趣的例外情况:
- 阿拉伯语专用模型通常优于同等规模的多语言模型
- 经过指令微调的模型始终优于其基础版本,但Qwen3除外
- 一些较小的阿拉伯语专用模型(Fanar-1-9B、ALLaM-7B)在特定领域上优于大得多的多语言模型
🌟 QIMMA的独特之处
总结一下QIMMA的独特属性:
| 属性 | 详情 |
|---|---|
| 质量优先理念 | 先进行验证运行,再进行评估,而非事后才考虑 |
| 多模型验证 | 两个训练方式不同的LLM,加上对标记案例的人工审核 |
| 99%原生阿拉伯语 | 几乎完全避免了翻译痕迹 |
| 多领域、多任务 | 7个领域,3种任务类型(多选题、问答、代码),109个子集 |
| 代码评估 | 首个包含代码生成的阿拉伯语排行榜 |
| 完全透明 | 公开发布每个样本的推理输出,而不仅仅是汇总分数 |
| 基于LightEval | 统一、可复现的评估代码库 |
| 方言意识 | 在提示词和评分标准中明确处理现代标准阿拉伯语与方言变体 |
🔗 资源
- 🏆 排行榜:QIMMA排行榜
- 💻 代码:GitHub
- 📄 论文:阿拉伯语基准测试可靠吗?QIMMA以质量为先的LLM评估方法
🔖 引用
@misc{alqadi2026arabicbenchmarksreliableqimmas,
title={Are Arabic Benchmarks Reliable? QIMMA's Quality-First Approach to LLM Evaluation},
author={Leen AlQadi and Ahmed Alzubaidi and Mohammed Alyafeai and Hamza Alobeidli and Maitha Alhammadi and Shaikha Alsuwaidi and Omar Alkaabi and Basma El Amel Boussaha and Hakim Hacid},
year={2026},
eprint={2604.03395},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2604.03395},
}