# 社区将Kimi视觉编码器接入GLM 5.2，开源视觉版模型

- 来源：Berryxia.AI (@berryxia)
- 发布时间：2026-07-23 23:51
- AIHOT 分数：40
- AIHOT 链接：https://aihot.virxact.com/items/cmrxqyk0l01lrroxpuzhf7573
- 原文链接：https://x.com/berryxia/status/2080319812232941631

## AI 摘要

开发者将Kimi的MoonViT视觉编码器挂载到GLM 5.2上，组装出可用的视觉版本，并开源了NVFP4量化权重。该模型并非官方联合训练的多模态模型，而是将不同团队的视觉编码器与语言模型硬接，证明了“插件式”组装已具备实用效果。

## 正文

卧槽，Kimi &GLM 5.2 联合体牛 ！
让GLM 5.2 终于有眼睛了。

有人直接把Kimi的MoonViT视觉编码器挂到了GLM 5.2上，做成了一个可用的视觉版本，还开源了NVFP4量化权重。

这不是官方联合训练的完整多模态模型，而是把一个Kimi 强视觉编码器和另一个团队的强语言模型硬接在一起，居然能直接用。

以前大家觉得多模态必须从头一起训才能对齐好，现在这种"插件式"组装已经开始出现实用效果。

强视觉编码器可以像模块一样被复用，文本模型也能快速获得看图能力。

模型地址：

https://huggingface.co/baseten/GLM-5.2-Vision-NVFP4
