SkillOpt 是由来自微软、上海交通大学、同济大学和复旦大学的研究团队开发的一种文本空间优化器。
SkillOpt 在目标模型保持冻结的状态下训练单个自然语言技能文档。一个优化器模型读取带评分的运行结果,并提出有界的增/删/替换编辑。一个留出的选择分割仅在分数严格提升时才接受编辑。导出的产物是单个文件 best_skill.md。
迁移表格报告了三列数据。Baseline 是目标模型无技能时的得分。Direct 是 SkillOpt 在该确切目标上做域内训练的结果。Transferred 是应用在别处训练好的技能、且不做进一步优化的结果。
有意义的对比不是 Transferred 对 Direct,而是域内增益在迁移后保留了多少。
跨模型迁移:同族内保留率参差不齐
技能在 GPT-5.4 上训练,部署到较小的变体上。
| SpreadsheetBench | GPT-5.4-mini | 36.1 | 47.5 | 45.5 | +9.4 | 82% |
| SpreadsheetBench | GPT-5.4-nano | 23.5 | 42.5 | 26.5 | +3.0 | 16% |
| LiveMath | GPT-5.4-mini | 14.7 | 32.8 | 19.2 | +4.5 | 25% |
| LiveMath | GPT-5.4-nano | 23.2 | 27.2 | 28.8 | +5.6 | 140% |
有两行值得注意。SpreadsheetBench 在 GPT-5.4-mini 上保留了 82% 的域内增益,这几乎等于免费复用。LiveMath 在 GPT-5.4-nano 上的那一行则更奇怪:迁移技能得分为 28.8,而域内 SkillOpt 的结果是 27.2。论文将此解读为某些学到的流程与目标模型无关的证据。
GPT-5.4-nano 的 SpreadsheetBench 一行是薄弱项,只有 16%。保留率并不均匀,论文也没有声称它是均匀的。它声明的边界更窄:没有任何一行低于目标模型的无技能基线。
注意范围。所有四行都停留在同一个 GPT 家族内。跨家族迁移(例如 GPT 到 Qwen)并未测试。
跨工具链迁移:最强的结果
这是对部署最关键的章节。所有行都使用 GPT-5.5。
| 基准 | 来源 → 目标 | 基线 | 域内 | 迁移 | 增益 | 域内增益占比 |
|---|---|---|---|---|---|---|
| SpreadsheetBench | Codex → Claude Code | 22.1 | 80.4 | 81.8 | +59.7 | 102% |
| SpreadsheetBench | Claude Code → Codex | 27.5 | 85.0 | 71.1 | +43.6 | 76% |
| LiveMath | Claude Code → Codex | 35.2 | 78.4 | 48.0 | +12.8 | 30% |
| LiveMath | Codex → Claude Code | 40.8 | 56.5 | 42.4 | +1.6 | 10% |
第一行是标题。在 Codex 中优化出的技能将 Claude Code 从 22.1 提升到了 81.8。这略高于 Claude Code 通过从零开始训练自身技能所达到的 80.4。
这两个运行框架暴露了不同的工具和文件 API,以及不同的命令界面。一个能在这种转换中存活的技能,并不是在编码命令配方。研究论文将 SpreadsheetBench 的可移植性归因于工作簿级别的流程:结构优先检查、公式感知验证和静态值物化。无论哪个 CLI 运行 Python,这些流程都成立。
LiveMath 则讲述了相反的故事。从 Codex 到 Claude Code,仅保留了领域内增益的 10%。这种不对称性值得深思。程序性技能——如何检查、验证和格式化——似乎是可移植的一类。而推理密集型技能似乎更依赖于其训练环境。
跨基准迁移:真实但幅度较小
| 源 → 目标 | 模型 | 基线 | 迁移后 | 增益 |
|---|---|---|---|---|
| OlympiadBench → Omni-MATH | GPT-5.4 | 56.6 | 60.3 | +3.7 |
| OlympiadBench → Omni-MATH | GPT-5.4-mini | 34.8 | 36.6 | +1.8 |
| OlympiadBench → Omni-MATH | GPT-5.4-nano | 38.8 | 40.1 | +1.3 |
这里没有 Direct 列。没有报告在 Omni-MATH 上进行的领域内 SkillOpt 运行,因此比较仅针对无技能情况。三种模型规模下的增益均为正数,但幅度较小。研究论文的解读是,在测试实例和答案格式约定都发生变化后,该技能仍保留了可复用的数学流程。
为什么产物会迁移
研究论文中明确阐述了其机制。所有三种执行模式:直接对话、Codex、Claude Code——都使用相同的 best_skill.md 文件格式。正是这一共享契约使得跨框架实验成为可能。
Codex 框架将当前技能渲染为任务旁的 SKILL.md 文件,然后读回紧凑的执行轨迹。Claude Code 框架通过 claude CLI 镜像了相同的工作区契约。两个框架都没有获得定制的技能格式。
该产物的形态也支持可移植性。最终技能在六个基准测试上的规模为 379 到 1,995 个 token,中位数接近 920。它们由 1 到 4 个被接受的编辑组装而成。论文中的图 4 展示了每个基准测试学到的一条规则示例,且所有规则都是程序性的,而非针对特定实例的。SpreadsheetBench 的规则原文如下:检查工作簿结构和公式,然后在所请求的完整目标范围内写入计算好的静态值,而不是依赖 Excel 的重新计算。
这对可移植性意味着什么
训练成本只需支付一次,在离线状态下完成,并且是可量化的。研究论文报告称,每个绝对测试点的训练 token 数在 0.6M 到 46.4M 之间,具体取决于基准测试。SpreadsheetBench 为每点 0.6M;DocVQA 为每点 46.4M。优化器模型仅在训练期间运行,在部署时不会增加任何推理时调用。
如果在一个框架中训练的技能能在另一个框架中保持有效,那么这笔一次性成本就可以分摊到各个环境中。Codex → Claude Code 的 SpreadsheetBench 结果就是这一点的实证。这也意味着,你可以在工具成本最低的地方进行优化,并在产品所在的地方进行部署。
审计角度是独立的,且被低估了。部署后的产物是一个文本文件,领域从业者可以在几分钟内阅读完毕。对它的每一次更改都是可追溯的:每个步骤都会记录一个 `edit_apply_report.json`,其中包含每个编辑的接受和跳过状态。可移植性加上可检查性,是一种不同于发布微调权重的工作模式。
关键要点
- 证据覆盖了一个 GPT 模型家族,且每个维度有两个基准测试,因此可移植性得到了验证,但尚未得到普遍化推广。
- 一个在 Codex 中训练的 SpreadsheetBench 技能在 Claude Code 中得分 81.8,高于该框架自身在该领域的 80.4 分结果。
- 所有 4 个跨模型、4 个跨框架和 3 个跨基准测试的迁移结果都高于目标的无技能基线。
- 迁移强度与任务类型相关:程序性电子表格技能迁移效果好,数学推理技能迁移效果弱。
- 可移植单元是一个 379 到 1,995 个 token 的 `best_skill.md` 文件,由 1 到 4 个被接受的编辑构建而成。
资源:论文、GitHub、项目页面、文档、PyPI 和演示视频
引用的基线:GEPA、TextGrad、EvoSkill 和 Trace2Skill
评测基准参考:SearchQA、SpreadsheetBench、DocVQA、LiveMathematicianBench 和 ALFWorld