# 小鹏集团发布 TuringViT 高效视觉编码器

- 来源：IT之家（RSS）
- 发布时间：2026-07-21 12:23
- AIHOT 分数：60
- AIHOT 链接：https://aihot.virxact.com/items/cmru6c51y5ih7bihzkeae18ju
- 原文链接：https://www.ithome.com/0/979/451.htm

## AI 摘要

小鹏集团发布面向 VLM/VLA 时代的 TuringViT 视觉编码器，推出 18L 和 24L 两个规格。该编码器在 1536×1536 分辨率下推理吞吐量达 Seed1.5-ViT 的 3.04 倍，仅用 0.85B 图文对便在六项零样本分类基准上取得 83.6% 平均准确率，超越使用 10B 数据的基线。

## 正文

IT之家 7 月 21 日消息，小鹏集团今日发布 TuringViT 高效视觉编码器，面向 VLM / VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。

小鹏集团表示，TuringViT 将全面支撑智能驾驶、智能座舱、IRON 人形机器人三大业务场景，同时为行业提供了一条可复现、低成本训练 SOTA 级（State-of-the-Art，最新技术水平）视觉 Transformer 的技术路径，推动先进视觉大模型从“头部团队专属”走向“行业普惠”。

▲ TuringViT 的块架构和模型配置

据介绍，TuringViT 从架构、数据、训练三个维度同步突破，打造了“线性注意力主导 + 高质量数据治理 + 原生动态分辨率”的完整技术体系，实现了效果、效率与落地性的三重提升。

TuringViT 共推出两个规格版本：

TuringViT-18L 包含 3 组 Turing Block（共 15 层 TLA+3 层 MHA），主打动态分辨率下的高效部署；

TuringViT-24L 包含 4 组 Turing Block（共 20 层 TLA+4 层 MHA），在保持线性计算主导的前提下进一步提升表征能力。

实测数据显示，随着输入分辨率提升，TuringViT 的延迟增长曲线远平缓于标准 softmax ViT，高分辨率下的效率优势愈发显著。在 1536×1536 分辨率下，TuringViT-18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍，相比 SigLIP2-ViT-L 提升 2.16 倍，为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。

不同于行业“堆数据规模”的粗放路线，TuringViT 打造了 VISTA-Curation 多模态数据治理流水线，通过提升单样本的监督价值实现数据效率的量级提升，从“用更多数据”转向“用更优质的监督”。

针对图文数据，流水线通过三步精细化筛选实现质量升级：

第一步过滤低分辨率、模糊、低纹理的低质量图片；

第二步通过多模型、多提示词生成多样化候选字幕，并交叉验证视觉一致性；

第三步在统一对比池中通过相对图文对齐度、文本信息量、歧义度综合打分，筛选出视觉贴合度高、语义信息密度高的优质标注，淘汰模糊、泛化、弱对齐的样本。

▲ 图像-文本筛选及处理流程

针对视频数据，流水线同样进行全流程治理：先将长视频切分为连续短片段并均匀采样代表帧；再通过语义一致性与运动一致性双重过滤，保留语义连贯、变化信息有效的片段；最后融合局部帧级细节字幕与全局时序语义字幕，生成具备变换感知能力的视频标注，让模型从连续画面中学习更鲁棒的视觉表征。

▲ 视频-语义筛选及处理流程

最终，TuringViT 仅用 0.85B 图文对（约为 SigLIP2-L 训练数据规模的 10%），便在 ImageNet-1K 等六项零样本分类基准上取得 83.6% 的平均准确率，超越使用 10B 数据训练的主流开源基线；在 COCO、Flickr30K 图文检索任务上同样优势显著，真正实现了“十分之一数据，更优效果”的突破。

TuringViT 还采用四阶段渐进式原生动态分辨率训练范式，从预训练之初就适配下游 VLM / VLA 的输入特性，告别“固定分辨率预训练 + 事后适配”的传统模式。

在智能驾驶领域，TuringViT 是第二代 VLA 模型的核心视觉编码器，负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入，为预测式世界模型提供视觉 token。

面向智能座舱与驾泊一体化场景，TuringViT 的 VLM 原生特性让视觉特征与语言模型实现更高效的对齐，可以提供更高的识别精度、不同画幅和比例的视觉输入，以支撑更多未来的车辆与用户交互的丰富座舱功能。

在小鹏 IRON 人形机器人的技术体系中，TuringViT 充当着“视觉视网膜”的核心角色，为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。

IT之家附 TuringViT 项目主页如下：
