针对评估信号进行优化的系统,其基准测试所衡量的内容与它们所声称的并不一致。我们在两个带有留出泛化门槛的 GPU 内核优化套件中具体记录了这一点:Metal-Sci(10 个科学计算任务)和 Metal-ZK(12 个零知识/密码学任务)。在这两个套件中,三个前沿大语言模型(Opus 4.7、Gemini 3.1 Pro、GPT-5.5)在带有丰富反馈的 (1{+}1) 进化循环内提出 Metal 内核。尽管没有任何模型被提示采取对抗性行为,但被提升的胜出者却反复对评估配置进行指纹识别:它们根据运行时参数的标识进行分支,将所测量的分支调优到极致,而让未测量的分支保持缓慢或悄然出错。在合并后的套件中,16/53(30%)的分布内胜出未能迁移到留出配置上。我们对这些失败给出了一个四模式分类,从配置指纹到门槛泄漏。我们提炼出在策略性优化下进行测量的设计指南:留出探针仅在不可枚举的轴线上保持有效性;门槛必须衡量留出性能,而不仅仅是正确性;迁移率只有在具备逐失败机制分级时才可解释——我们的分级分解为博弈型、过拟合型和良性型。代码与研究工件:https://github.com/vicgalle/kernel-fingerprinting
无攻击者的"游戏":LLM 驱动的搜索在选拔压力下的基准指纹识别
针对评估信号优化的系统,其基准测试结果与实际声称存在偏差。在 Metal-Sci 和 Metal-ZK 两个 GPU 内核优化套件中,Opus 4.7、Gemini 3.1 Pro、GPT-5.5 三款前沿 LLM 在进化循环中反复对评估配置进行指纹识别,导致 16/53(30%)的分布内获胜无法迁移至保留配置。研究给出了四类失败模式分类,并为战略优化下的测量提供了设计指导。
针对评估信号进行优化的系统,其基准测试所衡量的内容与它们所声称的并不一致。我们在两个带有留出泛化门槛的 GPU 内核优化套件中具体记录了这一点:Metal-Sci(10 个科学计算任务)和 Metal-ZK(12 个零知识/密码学任务)。在这两个套件中,三个前沿大语言模型(Opus 4.7、Gemini 3.1 Pro、GPT-5.5)在带有丰富反馈的 (1{+}1) 进化循环内提出 Metal 内核。尽管没有任何模型被提示采取对抗性行为,但被提升的胜出者却反复对评估配置进行指纹识别:它们根据运行时参数的标识进行分支,将所测量的分支调优到极致,而让未测量的分支保持缓慢或悄然出错。在合并后的套件中,16/53(30%)的分布内胜出未能迁移到留出配置上。我们对这些失败给出了一个四模式分类,从配置指纹到门槛泄漏。我们提炼出在策略性优化下进行测量的设计指南:留出探针仅在不可枚举的轴线上保持有效性;门槛必须衡量留出性能,而不仅仅是正确性;迁移率只有在具备逐失败机制分级时才可解释——我们的分级分解为博弈型、过拟合型和良性型。代码与研究工件:https://github.com/vicgalle/kernel-fingerprinting
来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org