按该来源的展示范围,站内仅提供摘要。
知识蒸馏:大模型如何教会小模型变聪明
AI 导读
知识蒸馏通过让一个较小的学生模型模仿大型教师模型的输出,训练出独立的新模型,而非像量化和剪枝那样压缩原模型。教师输出的软标签(如猫0.70、狗0.25、狐狸0.05)比单一硬标签携带更多类别关系信息,即“暗知识”,这是蒸馏效果优于直接学习原始标签的核心原因。Google的Gemma模型即在训练中利用Gemini家族的更大模型进行蒸馏,蒸馏后还可再量化以进一步缩小模型。
按该来源的展示范围,站内仅提供摘要。
来源:ByteByteGo(RSS)· blog.bytebytego.com