# 知识蒸馏：大模型如何教会小模型变聪明

- 来源：ByteByteGo（RSS）
- 作者：ByteByteGo
- 发布时间：2026-08-05 23:30
- AIHOT 分数：46
- AIHOT 链接：https://aihot.virxact.com/items/cmsgb0n5b029aro3pr1bj024a
- 原文链接：https://blog.bytebytego.com/p/how-big-models-teach-small-models

## AI 摘要

知识蒸馏通过让一个较小的学生模型模仿大型教师模型的输出，训练出独立的新模型，而非像量化和剪枝那样压缩原模型。教师输出的软标签（如猫0.70、狗0.25、狐狸0.05）比单一硬标签携带更多类别关系信息，即“暗知识”，这是蒸馏效果优于直接学习原始标签的核心原因。Google的Gemma模型即在训练中利用Gemini家族的更大模型进行蒸馏，蒸馏后还可再量化以进一步缩小模型。

## 正文

按该来源的展示范围，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
