# QIMMA：一个质量优先的阿拉伯语大语言模型排行榜

- 来源：Hugging Face：Blog（RSS）
- 发布时间：2026-04-21 18:09
- AIHOT 分数：63
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmoegbhaj008islxxs2kw6yab
- 原文链接：https://huggingface.co/blog/tiiuae/qimma-arabic-leaderboard

## 精选理由

QIMMA 把阿拉伯语基准的质量问题扒了一层皮，揭示现有数据集存在系统性错误，这个验证管线思路对所有多语言评估都有参考价值。

## AI 摘要

QIMMA 是一个首创质量验证流程的阿拉伯语大语言模型评估平台。它整合了14个基准测试的109个子集、超5.2万个样本，覆盖文化、STEM等7大领域，其中99%为原生阿拉伯语内容。平台采用双阶段质量验证：先由两个大模型自动评估，再经人工审核，发现并剔除了现有基准中存在的系统性质量问题。此外，QIMMA首次集成了阿拉伯语问题描述的代码评估任务，并公开逐样本推理结果，确保了评估的可靠性与透明度。

## 正文

发表于 2026 年 4 月 21 日

QIMMA 在评估模型之前先对基准进行验证，确保报告的分数真实反映大语言模型在阿拉伯语方面的能力。

🏆 排行榜 · 🔧 GitHub · 📄 论文

如果你一直在关注阿拉伯语大语言模型的评估，你可能已经注意到一个日益突出的矛盾：基准测试和排行榜的数量正在迅速增长，但我们真的在衡量我们以为在衡量的东西吗？

我们构建了 QIMMA قمّة（阿拉伯语中意为“顶峰”），旨在系统地回答这个问题。我们没有直接照搬现有的阿拉伯语基准测试并在其上运行模型，而是在任何评估进行之前，先应用了一套严格的质量验证流程。我们的发现令人警醒：即使是广泛使用、备受认可的阿拉伯语基准测试，也包含系统性的质量问题，这些问题会悄然破坏评估结果。

本文将介绍 QIMMA 是什么、我们如何构建它、发现了哪些问题，以及在清理问题后模型排名会变成什么样。

🔍 问题：阿拉伯语 NLP 评估碎片化且未经验证

阿拉伯语有超过 4 亿人使用，涵盖多种方言和文化背景，然而阿拉伯语 NLP 评估领域仍然支离破碎。以下几个关键痛点推动了这项工作：

翻译问题。许多阿拉伯语基准测试是从英语翻译而来。这引入了分布偏移。在英语中感觉自然的问题，翻译成阿拉伯语后会变得别扭或文化上不匹配，使得基准数据对阿拉伯语实际使用方式的代表性降低。

缺乏质量验证。即使是原生阿拉伯语基准测试，也常常在未经严格质量检查的情况下发布。在已有的资源中，已经记录到标注不一致、标准答案错误、编码错误以及真实标签中的文化偏见等问题。

可复现性差距。评估脚本和每个样本的输出结果很少公开发布，这使得审计结果或在先前工作基础上继续研究变得困难。

覆盖范围碎片化。现有的排行榜涵盖孤立的任务和狭窄的领域，使得对模型进行整体评估变得困难。

为了说明 QIMMA 相对于现有平台的位置：

排行榜 开源 原生阿拉伯语 质量验证 编程评估 公开输出

OALL v1 ✅ 混合 ❌ ❌ ✅

OALL v2 ✅ 大部分 ❌ ❌ ✅

BALSAM 部分 50% ❌ ❌ ❌

AraGen ✅ 100% ✅ ❌ ❌

SILMA ABL ✅ 100% ✅ ❌ ✅

ILMAAM 部分 100% ✅ ❌ ❌

HELM Arabic ✅ 混合 ❌ ❌ ✅

⛰ QIMMA ✅ 99% ✅ ✅ ✅

QIMMA 是唯一一个同时具备以下五项特性的平台：开源、以原生阿拉伯语内容为主、系统性质量验证、代码评估，以及公开每个样本的推理输出。

⛰ QIMMA 包含什么？

QIMMA 将来自 14 个源基准测试的 109 个子集整合为一个统一的评估套件，包含超过 52,000 个样本，涵盖 7 个领域：

领域 基准测试 任务类型

文化 AraDiCE-Culture, ArabCulture, PalmX 多选题

理工 ArabicMMLU, GAT, 3LM STEM 多选题

法律 ArabLegalQA, MizanQA

多选题, 问答 医疗 MedArabiQ, MedAraBench

多选题, 问答 安全 AraTrust

多选题 诗歌与文学 FannOrFlop

问答 编程 3LM HumanEval+, 3LM MBPP+

代码

这种设计有几个突出特点：

99% 的原生阿拉伯语内容。唯一的例外是代码评估，它本质上与语言无关。

首个包含代码评估的阿拉伯语排行榜。QIMMA 集成了 HumanEval+ 和 MBPP+ 的阿拉伯语适配版本，使得使用阿拉伯语问题陈述评估编程能力成为可能。

领域和任务的多样性。QIMMA 评估了现实世界的能力领域，包括教育、治理、医疗保健、创意表达和软件开发。

🔬 质量验证流程

这是 QIMMA 的方法论核心。在运行任何单个模型之前，我们对每个基准测试中的每个样本应用了多阶段验证流程。

第一阶段：多模型自动评估

每个样本由两个最先进的大语言模型独立评估：

Qwen3-235B-A22B-Instruct

DeepSeek-V3-671B

我们选择了两个具有强大阿拉伯语能力但训练数据组成不同的模型，这样它们的联合判断比任何一个单独模型都更稳健。

每个模型根据一个 10 分量表对样本进行评分，每个标准采用二元评分（0 或 1）：

如果任一模型对样本的评分低于 7/10，则该样本被淘汰。两个模型都同意淘汰的样本会立即被剔除。但是，如果只有一个模型标记了某个样本，则该样本将进入第二阶段的人工审核。

被标记的样本由熟悉文化和方言的阿拉伯语母语者进行审核。人工标注员对以下方面做出最终判断：

文化背景与地区差异

方言细微差别

主观解读

自动化评估可能遗漏的细微质量问题

对于文化敏感内容，会考虑多种视角，因为“正确性”在阿拉伯各地区确实可能存在差异。

⚠️ 我们的发现：系统性的质量问题

该流程揭示了各基准测试中反复出现的质量问题；这些并非孤立的错误，而是反映了基准测试最初构建方式存在缺陷的系统性模式。

数据一览

基准测试 总样本数 已剔除 剔除率

ArabicMMLU 14,163 436 3.1%

MizanQA 1,769 41 2.3%

PalmX 3,001 25 0.8%

MedAraBench 4,960 33 0.7%

FannOrFlop 6,984 43 0.6%

ArabCulture 3,482 7 0.2%

MedArabiQ 499 1 0.2%

GAT 13,986 1 ~0.0%

3LM STEM 2,609 1 ~0.0%

AraDiCE-Culture 180 0 0.0%

ArabLegalQA 79 0 0.0%

AraTrust 522 0 0.0%

发现的问题分类

⚖️ 答案质量

错误或不匹配的标准答案索引、事实性错误的答案、缺失或为原始文本的答案。

📄 文本与格式质量

损坏或无法辨认的文本、拼写和语法错误、以及重复样本。

💬 文化敏感性

强化刻板印象以及对多元社群进行笼统概括。

🤝 标准答案合规性

标准答案与评估协议不一致。

💻 代码基准测试：另一种类型的质量工作

代码基准测试需要不同的处理方式。我们没有剔除样本，而是优化了 3LM 对 HumanEval+ 和 MBPP+ 进行阿拉伯语改编版本中的阿拉伯语问题陈述，同时完全保留了任务标识符、参考解决方案和测试套件不变。

修改率非常显著：

基准测试 总提示词数 已修改 未修改 修改率

3LM HumanEval+ 164 145 19 88%

3LM MBPP+ 378 308 70 81%

修改分为五类：

语言优化：向自然的现代标准阿拉伯语和一致的祈使句式风格靠拢

清晰度改进：修正模糊的指令和不清晰的约束条件

一致性标准化：统一数学术语、标点符号和示例格式

结构修正：修复损坏的三引号字符串、缩进错误、损坏的文本片段

语义精炼：明确范围是包含还是排除，保留任务意图

⚙️ 评估设置

评估框架

QIMMA 使用 LightEval、EvalPlus 和 FannOrFlop 作为其评估框架，选择这些框架是为了保证一致性、多语言社区的采用度以及可复现性。

按任务类型划分的指标

任务类型 指标 基准测试

单选题 归一化对数似然准确率 AraDiCE-Culture、ArabicMMLU、ArabCulture、PalmX、3LM STEM、MedArabiQ、GAT、MedAraBench、AraTrust

多选单选题 正确选项的概率质量 MizanQA

生成式问答 F1 BERTScore（AraBERT v02） MedArabiQ、ArabLegalQA、FannOrFlop

代码 Pass@1 3LM HumanEval+、3LM MBPP+

提示词模板

QIMMA 根据问题格式标准化提示词，共有六种模板类型：

MCQ：通用选择题 · MCQ-C：带上下文段落的选择题 · MCQ-I：带特定指令的选择题（GAT 类比/完形填空） · QA：通用开放式问答 · QA-C：带上下文的问答 · QA-F：填空题式问答

所有提示词均为阿拉伯语。对于 MizanQA 和 ArabCulture，保留了原始论文中特定于基准测试的系统提示词。

🏆 排行榜结果

数据截至 2026 年 4 月；涵盖排名前 10 的评估模型。请访问实时排行榜查看当前排名。

排名 模型 平均分 AraDiCE-Culture ArabicMMLU ArabCulture PALMX 3LM STEM AraTrust MizanQA MedArabiQ ArabLegalQA GAT MedAraBench HumanEval+ MBPP+ FannOrFlop

🥇 1 Qwen/Qwen3.5-397B-A17B-FP8 68.06 82.78 77.54 61.75 83.91 88.67 90.04 73.36 47.30 54.94 55.89 47.97 67.68 76.72 44.33

🥈 2 Applied-Innovation-Center/Karnak 66.20 73.33 80.94 53.49 81.40 93.10 89.08 55.92 55.78 71.58 61.06 54.19 33.54 64.55 58.91

🥉 3 inceptionai/Jais-2-70B-Chat 65.81 78.89 81.29 83.24 83.73 87.96 90.23 71.78 52.79 69.60 51.67 50.89 19.51 43.65 56.13

#4 Qwen/Qwen2.5-72B-Instruct 65.75 77.22 73.78 63.83 77.77 87.55 88.51 63.49 50.06 70.74 55.90 44.19 37.20 72.75 57.51

#5 Applied-Innovation-Center/AIC-1 65.37 73.33 72.02 77.52 76.11 88.13 90.61 56.36 53.75 68.96 62.11 50.78 28.05 69.58 47.83

#6 Qwen/Qwen3.5-122B-A10B 64.84 74.44 73.17 37.78 81.46 86.18 86.97 64.01 47.04 55.11 50.90 52.49 65.24 72.43 60.54

#7 Sakalti/Ultiima-72B 64.49 78.33 72.28 68.79 76.75 83.70 89.08 60.44 44.58 69.12 46.91 42.25 39.02 74.07 57.56

#8 meta-llama/Llama-3.3-70B-Instruct 63.96 77.22 71.57 78.05 77.95 88.28 85.63 67.44 56.25 64.00 51.13 54.86 27.44 71.16 24.43

#9 Qwen/Qwen2.5-32B-Instruct 63.26 70.56 68.76 75.80 72.07 81.03 85.82 53.78 48.08 69.27 56.94 36.51 34.15 72.75 93.10

第10名 FreedomIntelligence/AceGPT-v2-32B-Chat 61.14 76.67 70.62 79.79 74.46 84.88 86.97 63.89 49.96 71.46 56.04 47.32 23.78 54.50 15.56

规模并不能保证最佳性能。前十名涵盖从32B到397B参数的模型，其中多个中等规模模型在特定领域上超越了更大的模型。

阿拉伯语专用模型在文化和语言任务上领先。Jais-2-70B-Chat在ArabicMMLU和ArabCulture上排名最高，而Karnak在3LM STEM和ArabLegalQA上领先。

代码生成仍然是阿拉伯语专用模型最难的领域。HumanEval+和MBPP+的最高得分属于多语言模型，其中Qwen3.5-397B在这两项上均领先。

规模与性能的关系

在整个排行榜（46个模型）中，呈现出清晰但不完美的规模-性能相关性。然而，存在一些有趣的例外情况：

阿拉伯语专用模型通常优于同等规模的多语言模型

经过指令微调的模型始终优于其基础版本，但Qwen3除外

一些较小的阿拉伯语专用模型（Fanar-1-9B、ALLaM-7B）在特定领域上优于大得多的多语言模型

🌟 QIMMA的独特之处

总结一下QIMMA的独特属性：

属性 详情

质量优先理念 先进行验证运行，再进行评估，而非事后才考虑

多模型验证 两个训练方式不同的LLM，加上对标记案例的人工审核

99%原生阿拉伯语 几乎完全避免了翻译痕迹

多领域、多任务 7个领域，3种任务类型（多选题、问答、代码），109个子集

代码评估 首个包含代码生成的阿拉伯语排行榜

完全透明 公开发布每个样本的推理输出，而不仅仅是汇总分数

基于LightEval 统一、可复现的评估代码库

方言意识 在提示词和评分标准中明确处理现代标准阿拉伯语与方言变体

🔗 资源

🏆 排行榜：QIMMA排行榜

💻 代码：GitHub

📄 论文：阿拉伯语基准测试可靠吗？QIMMA以质量为先的LLM评估方法

🔖 引用

@misc{alqadi2026arabicbenchmarksreliableqimmas, title={Are Arabic Benchmarks Reliable? QIMMA's Quality-First Approach to LLM Evaluation}, author={Leen AlQadi and Ahmed Alzubaidi and Mohammed Alyafeai and Hamza Alobeidli and Maitha Alhammadi and Shaikha Alsuwaidi and Omar Alkaabi and Basma El Amel Boussaha and Hakim Hacid}, year={2026}, eprint={2604.03395}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2604.03395}, }
