卧槽,Kimi &GLM 5.2 联合体牛 ! 让GLM 5.2 终于有眼睛了。
有人直接把Kimi的MoonViT视觉编码器挂到了GLM 5.2上,做成了一个可用的视觉版本,还开源了NVFP4量化权重。
这不是官方联合训练的完整多模态模型,而是把一个Kimi 强视觉编码器和另一个团队的强语言模型硬接在一起,居然能直接用。
以前大家觉得多模态必须从头一起训才能对齐好,现在这种"插件式"组装已经开始出现实用效果。
强视觉编码器可以像模块一样被复用,文本模型也能快速获得看图能力。
模型地址:
https://huggingface.co/baseten/GLM-5.2-Vision-NVFP4