Hugging Face:Blog(RSS)
精选
63AI 编辑部评分,满分 100

QIMMA:一个质量优先的阿拉伯语大语言模型排行榜

2026-04-21 18:09· 106天前
AI 导读

QIMMA 是一个首创质量验证流程的阿拉伯语大语言模型评估平台。它整合了14个基准测试的109个子集、超5.2万个样本,覆盖文化、STEM等7大领域,其中99%为原生阿拉伯语内容。平台采用双阶段质量验证:先由两个大模型自动评估,再经人工审核,发现并剔除了现有基准中存在的系统性质量问题。此外,QIMMA首次集成了阿拉伯语问题描述的代码评估任务,并公开逐样本推理结果,确保了评估的可靠性与透明度。

推荐理由

QIMMA 把阿拉伯语基准的质量问题扒了一层皮,揭示现有数据集存在系统性错误,这个验证管线思路对所有多语言评估都有参考价值。

正文 · AI 翻译

发表于 2026 年 4 月 21 日

QIMMA 在评估模型之前先对基准进行验证,确保报告的分数真实反映大语言模型在阿拉伯语方面的能力。

🏆 排行榜 · 🔧 GitHub · 📄 论文

如果你一直在关注阿拉伯语大语言模型的评估,你可能已经注意到一个日益突出的矛盾:基准测试和排行榜的数量正在迅速增长,但我们真的在衡量我们以为在衡量的东西吗?

我们构建了 QIMMA قمّة(阿拉伯语中意为“顶峰”),旨在系统地回答这个问题。我们没有直接照搬现有的阿拉伯语基准测试并在其上运行模型,而是在任何评估进行之前,先应用了一套严格的质量验证流程。我们的发现令人警醒:即使是广泛使用、备受认可的阿拉伯语基准测试,也包含系统性的质量问题,这些问题会悄然破坏评估结果。

本文将介绍 QIMMA 是什么、我们如何构建它、发现了哪些问题,以及在清理问题后模型排名会变成什么样。


🔍 问题:阿拉伯语 NLP 评估碎片化且未经验证

阿拉伯语有超过 4 亿人使用,涵盖多种方言和文化背景,然而阿拉伯语 NLP 评估领域仍然支离破碎。以下几个关键痛点推动了这项工作:

翻译问题。许多阿拉伯语基准测试是从英语翻译而来。这引入了分布偏移。在英语中感觉自然的问题,翻译成阿拉伯语后会变得别扭或文化上不匹配,使得基准数据对阿拉伯语实际使用方式的代表性降低。

缺乏质量验证。即使是原生阿拉伯语基准测试,也常常在未经严格质量检查的情况下发布。在已有的资源中,已经记录到标注不一致、标准答案错误、编码错误以及真实标签中的文化偏见等问题。

可复现性差距。评估脚本和每个样本的输出结果很少公开发布,这使得审计结果或在先前工作基础上继续研究变得困难。

覆盖范围碎片化。现有的排行榜涵盖孤立的任务和狭窄的领域,使得对模型进行整体评估变得困难。

为了说明 QIMMA 相对于现有平台的位置:

排行榜 开源 原生阿拉伯语 质量验证 编程评估 公开输出
OALL v1 混合
OALL v2 大部分
BALSAM 部分 50%
AraGen 100%
SILMA ABL 100%
ILMAAM 部分 100%
HELM Arabic 混合
⛰ QIMMA 99%

QIMMA 是唯一一个同时具备以下五项特性的平台:开源、以原生阿拉伯语内容为主、系统性质量验证、代码评估,以及公开每个样本的推理输出。


⛰ QIMMA 包含什么?

QIMMA 将来自 14 个源基准测试的 109 个子集整合为一个统一的评估套件,包含超过 52,000 个样本,涵盖 7 个领域:

领域 基准测试 任务类型
文化 AraDiCE-Culture, ArabCulture, PalmX 多选题
理工 ArabicMMLU, GAT, 3LM STEM 多选题
法律 ArabLegalQA, MizanQA
多选题, 问答 医疗 MedArabiQ, MedAraBench
多选题, 问答 安全 AraTrust
多选题 诗歌与文学 FannOrFlop
问答 编程 3LM HumanEval+, 3LM MBPP+

代码

  • 这种设计有几个突出特点:
  • 99% 的原生阿拉伯语内容。唯一的例外是代码评估,它本质上与语言无关。
  • 首个包含代码评估的阿拉伯语排行榜。QIMMA 集成了 HumanEval+ 和 MBPP+ 的阿拉伯语适配版本,使得使用阿拉伯语问题陈述评估编程能力成为可能。

领域和任务的多样性。QIMMA 评估了现实世界的能力领域,包括教育、治理、医疗保健、创意表达和软件开发。

🔬 质量验证流程

这是 QIMMA 的方法论核心。在运行任何单个模型之前,我们对每个基准测试中的每个样本应用了多阶段验证流程。

第一阶段:多模型自动评估

  • 每个样本由两个最先进的大语言模型独立评估:
  • Qwen3-235B-A22B-Instruct

DeepSeek-V3-671B

我们选择了两个具有强大阿拉伯语能力但训练数据组成不同的模型,这样它们的联合判断比任何一个单独模型都更稳健。

每个模型根据一个 10 分量表对样本进行评分,每个标准采用二元评分(0 或 1):

如果任一模型对样本的评分低于 7/10,则该样本被淘汰。两个模型都同意淘汰的样本会立即被剔除。但是,如果只有一个模型标记了某个样本,则该样本将进入第二阶段的人工审核。

被标记的样本由熟悉文化和方言的阿拉伯语母语者进行审核。人工标注员对以下方面做出最终判断:

  • 文化背景与地区差异
  • 方言细微差别
  • 主观解读
  • 自动化评估可能遗漏的细微质量问题

对于文化敏感内容,会考虑多种视角,因为“正确性”在阿拉伯各地区确实可能存在差异。


⚠️ 我们的发现:系统性的质量问题

该流程揭示了各基准测试中反复出现的质量问题;这些并非孤立的错误,而是反映了基准测试最初构建方式存在缺陷的系统性模式。

数据一览

基准测试 总样本数 已剔除 剔除率
ArabicMMLU 14,163 436 3.1%
MizanQA 1,769 41 2.3%
PalmX 3,001 25 0.8%
MedAraBench 4,960 33 0.7%
FannOrFlop 6,984 43 0.6%
ArabCulture 3,482 7 0.2%
MedArabiQ 499 1 0.2%
GAT 13,986 1 ~0.0%
3LM STEM 2,609 1 ~0.0%
AraDiCE-Culture 180 0 0.0%
ArabLegalQA 79 0 0.0%
AraTrust 522 0 0.0%

发现的问题分类

⚖️ 答案质量

错误或不匹配的标准答案索引、事实性错误的答案、缺失或为原始文本的答案。

📄 文本与格式质量

损坏或无法辨认的文本、拼写和语法错误、以及重复样本。

💬 文化敏感性

强化刻板印象以及对多元社群进行笼统概括。

🤝 标准答案合规性

标准答案与评估协议不一致。


💻 代码基准测试:另一种类型的质量工作

代码基准测试需要不同的处理方式。我们没有剔除样本,而是优化了 3LM 对 HumanEval+ 和 MBPP+ 进行阿拉伯语改编版本中的阿拉伯语问题陈述,同时完全保留了任务标识符、参考解决方案和测试套件不变。

修改率非常显著:

基准测试 总提示词数 已修改 未修改 修改率
3LM HumanEval+ 164 145 19 88%
3LM MBPP+ 378 308 70 81%

修改分为五类:

  1. 语言优化:向自然的现代标准阿拉伯语和一致的祈使句式风格靠拢
  2. 清晰度改进:修正模糊的指令和不清晰的约束条件
  3. 一致性标准化:统一数学术语、标点符号和示例格式
  4. 结构修正:修复损坏的三引号字符串、缩进错误、损坏的文本片段
  5. 语义精炼:明确范围是包含还是排除,保留任务意图

⚙️ 评估设置

评估框架

QIMMA 使用 LightEval、EvalPlus 和 FannOrFlop 作为其评估框架,选择这些框架是为了保证一致性、多语言社区的采用度以及可复现性。

按任务类型划分的指标

任务类型 指标 基准测试
单选题 归一化对数似然准确率 AraDiCE-Culture、ArabicMMLU、ArabCulture、PalmX、3LM STEM、MedArabiQ、GAT、MedAraBench、AraTrust
多选单选题 正确选项的概率质量 MizanQA
生成式问答 F1 BERTScore(AraBERT v02) MedArabiQ、ArabLegalQA、FannOrFlop
代码 Pass@1 3LM HumanEval+、3LM MBPP+

提示词模板

QIMMA 根据问题格式标准化提示词,共有六种模板类型:

MCQ:通用选择题 · MCQ-C:带上下文段落的选择题 · MCQ-I:带特定指令的选择题(GAT 类比/完形填空) · QA:通用开放式问答 · QA-C:带上下文的问答 · QA-F:填空题式问答

所有提示词均为阿拉伯语。对于 MizanQA 和 ArabCulture,保留了原始论文中特定于基准测试的系统提示词。


🏆 排行榜结果

数据截至 2026 年 4 月;涵盖排名前 10 的评估模型。请访问实时排行榜查看当前排名。

排名 模型 平均分 AraDiCE-Culture ArabicMMLU ArabCulture PALMX 3LM STEM AraTrust MizanQA MedArabiQ ArabLegalQA GAT MedAraBench HumanEval+ MBPP+ FannOrFlop
🥇 1 Qwen/Qwen3.5-397B-A17B-FP8 68.06 82.78 77.54 61.75 83.91 88.67 90.04 73.36 47.30 54.94 55.89 47.97 67.68 76.72 44.33
🥈 2 Applied-Innovation-Center/Karnak 66.20 73.33 80.94 53.49 81.40 93.10 89.08 55.92 55.78 71.58 61.06 54.19 33.54 64.55 58.91
🥉 3 inceptionai/Jais-2-70B-Chat 65.81 78.89 81.29 83.24 83.73 87.96 90.23 71.78 52.79 69.60 51.67 50.89 19.51 43.65 56.13
#4 Qwen/Qwen2.5-72B-Instruct 65.75 77.22 73.78 63.83 77.77 87.55 88.51 63.49 50.06 70.74 55.90 44.19 37.20 72.75 57.51
#5 Applied-Innovation-Center/AIC-1 65.37 73.33 72.02 77.52 76.11 88.13 90.61 56.36 53.75 68.96 62.11 50.78 28.05 69.58 47.83
#6 Qwen/Qwen3.5-122B-A10B 64.84 74.44 73.17 37.78 81.46 86.18 86.97 64.01 47.04 55.11 50.90 52.49 65.24 72.43 60.54
#7 Sakalti/Ultiima-72B 64.49 78.33 72.28 68.79 76.75 83.70 89.08 60.44 44.58 69.12 46.91 42.25 39.02 74.07 57.56
#8 meta-llama/Llama-3.3-70B-Instruct 63.96 77.22 71.57 78.05 77.95 88.28 85.63 67.44 56.25 64.00 51.13 54.86 27.44 71.16 24.43
#9 Qwen/Qwen2.5-32B-Instruct 63.26 70.56 68.76 75.80 72.07 81.03 85.82 53.78 48.08 69.27 56.94 36.51 34.15 72.75 93.10
第10名 FreedomIntelligence/AceGPT-v2-32B-Chat 61.14 76.67 70.62 79.79 74.46 84.88 86.97 63.89 49.96 71.46 56.04 47.32 23.78 54.50 15.56
  • 规模并不能保证最佳性能。前十名涵盖从32B到397B参数的模型,其中多个中等规模模型在特定领域上超越了更大的模型。
  • 阿拉伯语专用模型在文化和语言任务上领先。Jais-2-70B-Chat在ArabicMMLU和ArabCulture上排名最高,而Karnak在3LM STEM和ArabLegalQA上领先。
  • 代码生成仍然是阿拉伯语专用模型最难的领域。HumanEval+和MBPP+的最高得分属于多语言模型,其中Qwen3.5-397B在这两项上均领先。

规模与性能的关系

在整个排行榜(46个模型)中,呈现出清晰但不完美的规模-性能相关性。然而,存在一些有趣的例外情况:

  • 阿拉伯语专用模型通常优于同等规模的多语言模型
  • 经过指令微调的模型始终优于其基础版本,但Qwen3除外
  • 一些较小的阿拉伯语专用模型(Fanar-1-9B、ALLaM-7B)在特定领域上优于大得多的多语言模型

🌟 QIMMA的独特之处

总结一下QIMMA的独特属性:

属性 详情
质量优先理念 先进行验证运行,再进行评估,而非事后才考虑
多模型验证 两个训练方式不同的LLM,加上对标记案例的人工审核
99%原生阿拉伯语 几乎完全避免了翻译痕迹
多领域、多任务 7个领域,3种任务类型(多选题、问答、代码),109个子集
代码评估 首个包含代码生成的阿拉伯语排行榜
完全透明 公开发布每个样本的推理输出,而不仅仅是汇总分数
基于LightEval 统一、可复现的评估代码库
方言意识 在提示词和评分标准中明确处理现代标准阿拉伯语与方言变体

🔗 资源

  • 🏆 排行榜:QIMMA排行榜
  • 💻 代码:GitHub
  • 📄 论文:阿拉伯语基准测试可靠吗?QIMMA以质量为先的LLM评估方法

🔖 引用

@misc{alqadi2026arabicbenchmarksreliableqimmas,
      title={Are Arabic Benchmarks Reliable? QIMMA's Quality-First Approach to LLM Evaluation}, 
      author={Leen AlQadi and Ahmed Alzubaidi and Mohammed Alyafeai and Hamza Alobeidli and Maitha Alhammadi and Shaikha Alsuwaidi and Omar Alkaabi and Basma El Amel Boussaha and Hakim Hacid},
      year={2026},
      eprint={2604.03395},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2604.03395}, 
}

来源:Hugging Face:Blog(RSS) · huggingface.co

QIMMA:一个质量优先的阿拉伯语大语言模型排行榜

Hugging Face:Blog(RSS)·2026-04-21 18:09·106天前
AI 导读

QIMMA 是一个首创质量验证流程的阿拉伯语大语言模型评估平台。它整合了14个基准测试的109个子集、超5.2万个样本,覆盖文化、STEM等7大领域,其中99%为原生阿拉伯语内容。平台采用双阶段质量验证:先由两个大模型自动评估,再经人工审核,发现并剔除了现有基准中存在的系统性质量问题。此外,QIMMA首次集成了阿拉伯语问题描述的代码评估任务,并公开逐样本推理结果,确保了评估的可靠性与透明度。

正文 · AI 翻译

发表于 2026 年 4 月 21 日

QIMMA 在评估模型之前先对基准进行验证,确保报告的分数真实反映大语言模型在阿拉伯语方面的能力。

🏆 排行榜 · 🔧 GitHub · 📄 论文

如果你一直在关注阿拉伯语大语言模型的评估,你可能已经注意到一个日益突出的矛盾:基准测试和排行榜的数量正在迅速增长,但我们真的在衡量我们以为在衡量的东西吗?

我们构建了 QIMMA قمّة(阿拉伯语中意为“顶峰”),旨在系统地回答这个问题。我们没有直接照搬现有的阿拉伯语基准测试并在其上运行模型,而是在任何评估进行之前,先应用了一套严格的质量验证流程。我们的发现令人警醒:即使是广泛使用、备受认可的阿拉伯语基准测试,也包含系统性的质量问题,这些问题会悄然破坏评估结果。

本文将介绍 QIMMA 是什么、我们如何构建它、发现了哪些问题,以及在清理问题后模型排名会变成什么样。


🔍 问题:阿拉伯语 NLP 评估碎片化且未经验证

阿拉伯语有超过 4 亿人使用,涵盖多种方言和文化背景,然而阿拉伯语 NLP 评估领域仍然支离破碎。以下几个关键痛点推动了这项工作:

翻译问题。许多阿拉伯语基准测试是从英语翻译而来。这引入了分布偏移。在英语中感觉自然的问题,翻译成阿拉伯语后会变得别扭或文化上不匹配,使得基准数据对阿拉伯语实际使用方式的代表性降低。

缺乏质量验证。即使是原生阿拉伯语基准测试,也常常在未经严格质量检查的情况下发布。在已有的资源中,已经记录到标注不一致、标准答案错误、编码错误以及真实标签中的文化偏见等问题。

可复现性差距。评估脚本和每个样本的输出结果很少公开发布,这使得审计结果或在先前工作基础上继续研究变得困难。

覆盖范围碎片化。现有的排行榜涵盖孤立的任务和狭窄的领域,使得对模型进行整体评估变得困难。

为了说明 QIMMA 相对于现有平台的位置:

排行榜 开源 原生阿拉伯语 质量验证 编程评估 公开输出
OALL v1 混合
OALL v2 大部分
BALSAM 部分 50%
AraGen 100%
SILMA ABL 100%
ILMAAM 部分 100%
HELM Arabic 混合
⛰ QIMMA 99%

QIMMA 是唯一一个同时具备以下五项特性的平台:开源、以原生阿拉伯语内容为主、系统性质量验证、代码评估,以及公开每个样本的推理输出。


⛰ QIMMA 包含什么?

QIMMA 将来自 14 个源基准测试的 109 个子集整合为一个统一的评估套件,包含超过 52,000 个样本,涵盖 7 个领域:

领域 基准测试 任务类型
文化 AraDiCE-Culture, ArabCulture, PalmX 多选题
理工 ArabicMMLU, GAT, 3LM STEM 多选题
法律 ArabLegalQA, MizanQA
多选题, 问答 医疗 MedArabiQ, MedAraBench
多选题, 问答 安全 AraTrust
多选题 诗歌与文学 FannOrFlop
问答 编程 3LM HumanEval+, 3LM MBPP+

代码

  • 这种设计有几个突出特点:
  • 99% 的原生阿拉伯语内容。唯一的例外是代码评估,它本质上与语言无关。
  • 首个包含代码评估的阿拉伯语排行榜。QIMMA 集成了 HumanEval+ 和 MBPP+ 的阿拉伯语适配版本,使得使用阿拉伯语问题陈述评估编程能力成为可能。

领域和任务的多样性。QIMMA 评估了现实世界的能力领域,包括教育、治理、医疗保健、创意表达和软件开发。

🔬 质量验证流程

这是 QIMMA 的方法论核心。在运行任何单个模型之前,我们对每个基准测试中的每个样本应用了多阶段验证流程。

第一阶段:多模型自动评估

  • 每个样本由两个最先进的大语言模型独立评估:
  • Qwen3-235B-A22B-Instruct

DeepSeek-V3-671B

我们选择了两个具有强大阿拉伯语能力但训练数据组成不同的模型,这样它们的联合判断比任何一个单独模型都更稳健。

每个模型根据一个 10 分量表对样本进行评分,每个标准采用二元评分(0 或 1):

如果任一模型对样本的评分低于 7/10,则该样本被淘汰。两个模型都同意淘汰的样本会立即被剔除。但是,如果只有一个模型标记了某个样本,则该样本将进入第二阶段的人工审核。

被标记的样本由熟悉文化和方言的阿拉伯语母语者进行审核。人工标注员对以下方面做出最终判断:

  • 文化背景与地区差异
  • 方言细微差别
  • 主观解读
  • 自动化评估可能遗漏的细微质量问题

对于文化敏感内容,会考虑多种视角,因为“正确性”在阿拉伯各地区确实可能存在差异。


⚠️ 我们的发现:系统性的质量问题

该流程揭示了各基准测试中反复出现的质量问题;这些并非孤立的错误,而是反映了基准测试最初构建方式存在缺陷的系统性模式。

数据一览

基准测试 总样本数 已剔除 剔除率
ArabicMMLU 14,163 436 3.1%
MizanQA 1,769 41 2.3%
PalmX 3,001 25 0.8%
MedAraBench 4,960 33 0.7%
FannOrFlop 6,984 43 0.6%
ArabCulture 3,482 7 0.2%
MedArabiQ 499 1 0.2%
GAT 13,986 1 ~0.0%
3LM STEM 2,609 1 ~0.0%
AraDiCE-Culture 180 0 0.0%
ArabLegalQA 79 0 0.0%
AraTrust 522 0 0.0%

发现的问题分类

⚖️ 答案质量

错误或不匹配的标准答案索引、事实性错误的答案、缺失或为原始文本的答案。

📄 文本与格式质量

损坏或无法辨认的文本、拼写和语法错误、以及重复样本。

💬 文化敏感性

强化刻板印象以及对多元社群进行笼统概括。

🤝 标准答案合规性

标准答案与评估协议不一致。


💻 代码基准测试:另一种类型的质量工作

代码基准测试需要不同的处理方式。我们没有剔除样本,而是优化了 3LM 对 HumanEval+ 和 MBPP+ 进行阿拉伯语改编版本中的阿拉伯语问题陈述,同时完全保留了任务标识符、参考解决方案和测试套件不变。

修改率非常显著:

基准测试 总提示词数 已修改 未修改 修改率
3LM HumanEval+ 164 145 19 88%
3LM MBPP+ 378 308 70 81%

修改分为五类:

  1. 语言优化:向自然的现代标准阿拉伯语和一致的祈使句式风格靠拢
  2. 清晰度改进:修正模糊的指令和不清晰的约束条件
  3. 一致性标准化:统一数学术语、标点符号和示例格式
  4. 结构修正:修复损坏的三引号字符串、缩进错误、损坏的文本片段
  5. 语义精炼:明确范围是包含还是排除,保留任务意图

⚙️ 评估设置

评估框架

QIMMA 使用 LightEval、EvalPlus 和 FannOrFlop 作为其评估框架,选择这些框架是为了保证一致性、多语言社区的采用度以及可复现性。

按任务类型划分的指标

任务类型 指标 基准测试
单选题 归一化对数似然准确率 AraDiCE-Culture、ArabicMMLU、ArabCulture、PalmX、3LM STEM、MedArabiQ、GAT、MedAraBench、AraTrust
多选单选题 正确选项的概率质量 MizanQA
生成式问答 F1 BERTScore(AraBERT v02) MedArabiQ、ArabLegalQA、FannOrFlop
代码 Pass@1 3LM HumanEval+、3LM MBPP+

提示词模板

QIMMA 根据问题格式标准化提示词,共有六种模板类型:

MCQ:通用选择题 · MCQ-C:带上下文段落的选择题 · MCQ-I:带特定指令的选择题(GAT 类比/完形填空) · QA:通用开放式问答 · QA-C:带上下文的问答 · QA-F:填空题式问答

所有提示词均为阿拉伯语。对于 MizanQA 和 ArabCulture,保留了原始论文中特定于基准测试的系统提示词。


🏆 排行榜结果

数据截至 2026 年 4 月;涵盖排名前 10 的评估模型。请访问实时排行榜查看当前排名。

排名 模型 平均分 AraDiCE-Culture ArabicMMLU ArabCulture PALMX 3LM STEM AraTrust MizanQA MedArabiQ ArabLegalQA GAT MedAraBench HumanEval+ MBPP+ FannOrFlop
🥇 1 Qwen/Qwen3.5-397B-A17B-FP8 68.06 82.78 77.54 61.75 83.91 88.67 90.04 73.36 47.30 54.94 55.89 47.97 67.68 76.72 44.33
🥈 2 Applied-Innovation-Center/Karnak 66.20 73.33 80.94 53.49 81.40 93.10 89.08 55.92 55.78 71.58 61.06 54.19 33.54 64.55 58.91
🥉 3 inceptionai/Jais-2-70B-Chat 65.81 78.89 81.29 83.24 83.73 87.96 90.23 71.78 52.79 69.60 51.67 50.89 19.51 43.65 56.13
#4 Qwen/Qwen2.5-72B-Instruct 65.75 77.22 73.78 63.83 77.77 87.55 88.51 63.49 50.06 70.74 55.90 44.19 37.20 72.75 57.51
#5 Applied-Innovation-Center/AIC-1 65.37 73.33 72.02 77.52 76.11 88.13 90.61 56.36 53.75 68.96 62.11 50.78 28.05 69.58 47.83
#6 Qwen/Qwen3.5-122B-A10B 64.84 74.44 73.17 37.78 81.46 86.18 86.97 64.01 47.04 55.11 50.90 52.49 65.24 72.43 60.54
#7 Sakalti/Ultiima-72B 64.49 78.33 72.28 68.79 76.75 83.70 89.08 60.44 44.58 69.12 46.91 42.25 39.02 74.07 57.56
#8 meta-llama/Llama-3.3-70B-Instruct 63.96 77.22 71.57 78.05 77.95 88.28 85.63 67.44 56.25 64.00 51.13 54.86 27.44 71.16 24.43
#9 Qwen/Qwen2.5-32B-Instruct 63.26 70.56 68.76 75.80 72.07 81.03 85.82 53.78 48.08 69.27 56.94 36.51 34.15 72.75 93.10
第10名 FreedomIntelligence/AceGPT-v2-32B-Chat 61.14 76.67 70.62 79.79 74.46 84.88 86.97 63.89 49.96 71.46 56.04 47.32 23.78 54.50 15.56
  • 规模并不能保证最佳性能。前十名涵盖从32B到397B参数的模型,其中多个中等规模模型在特定领域上超越了更大的模型。
  • 阿拉伯语专用模型在文化和语言任务上领先。Jais-2-70B-Chat在ArabicMMLU和ArabCulture上排名最高,而Karnak在3LM STEM和ArabLegalQA上领先。
  • 代码生成仍然是阿拉伯语专用模型最难的领域。HumanEval+和MBPP+的最高得分属于多语言模型,其中Qwen3.5-397B在这两项上均领先。

规模与性能的关系

在整个排行榜(46个模型)中,呈现出清晰但不完美的规模-性能相关性。然而,存在一些有趣的例外情况:

  • 阿拉伯语专用模型通常优于同等规模的多语言模型
  • 经过指令微调的模型始终优于其基础版本,但Qwen3除外
  • 一些较小的阿拉伯语专用模型(Fanar-1-9B、ALLaM-7B)在特定领域上优于大得多的多语言模型

🌟 QIMMA的独特之处

总结一下QIMMA的独特属性:

属性 详情
质量优先理念 先进行验证运行,再进行评估,而非事后才考虑
多模型验证 两个训练方式不同的LLM,加上对标记案例的人工审核
99%原生阿拉伯语 几乎完全避免了翻译痕迹
多领域、多任务 7个领域,3种任务类型(多选题、问答、代码),109个子集
代码评估 首个包含代码生成的阿拉伯语排行榜
完全透明 公开发布每个样本的推理输出,而不仅仅是汇总分数
基于LightEval 统一、可复现的评估代码库
方言意识 在提示词和评分标准中明确处理现代标准阿拉伯语与方言变体

🔗 资源

  • 🏆 排行榜:QIMMA排行榜
  • 💻 代码:GitHub
  • 📄 论文:阿拉伯语基准测试可靠吗?QIMMA以质量为先的LLM评估方法

🔖 引用

@misc{alqadi2026arabicbenchmarksreliableqimmas,
      title={Are Arabic Benchmarks Reliable? QIMMA's Quality-First Approach to LLM Evaluation}, 
      author={Leen AlQadi and Ahmed Alzubaidi and Mohammed Alyafeai and Hamza Alobeidli and Maitha Alhammadi and Shaikha Alsuwaidi and Omar Alkaabi and Basma El Amel Boussaha and Hakim Hacid},
      year={2026},
      eprint={2604.03395},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2604.03395}, 
}

来源:Hugging Face:Blog(RSS)· huggingface.co