# smevals：用于评测模型、提示词与评测框架的小型评测套件

- 来源：Simon Willison 博客
- 发布时间：2026-08-01 05:15
- AIHOT 分数：73
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms9has920ey7ro9k5oh4ooow
- 原文链接：https://simonwillison.net/2026/Jul/31/smevals

## 精选理由

一个轻量级评估框架，让编码代理帮你搭 eval，再直接跑模型对比。对想针对业务场景自建基准的团队，比通用榜单更实用。

## AI 摘要

smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具，用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 `uvx smevals run` 对 gpt-5.5、claude-opus-4.6 等模型运行评测，并将运行与打分分离，最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。

## 正文

这是一则列表来源，站内未收录完整正文。

> 站内仅提供摘要，全文见原文。
