# SANA-Video 2.0：混合线性注意力与注意力残差实现高效视频生成

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-07-23 08:00
- AIHOT 分数：77
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmryvpwy905kerolgy47s0xdn
- 原文链接：https://arxiv.org/abs/2607.21553

## 精选理由

SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒，比 Wan 2.2 快 120 倍，做视频应用的开发者该重新评估成本模型了。

## AI 摘要

SANA-Video 2.0 是一个混合视频扩散 Transformer，提供 5B 和 14B 两种规模，可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力，配合 Block Attention Residuals 将深层有效秩提升约 12%。

## 正文

我们推出 SANA-Video 2.0，这是一个在统一架构下以 5B 和 14B 规模实例化的混合视频扩散 Transformer。SANA-Video 2.0 专为在单张 GPU 上生成高达 720p 的高质量视频而设计，其质量与全 softmax 视频 DiT 相当，同时保留了线性注意力在长序列上的优异扩展能力。为避免全程使用二次复杂度注意力，混合线性-softmax 注意力机制将门控线性注意力（用于 O(N) 主导的混合）与周期性门控 softmax 锚点以 3:1 的比例结合，恢复了纯线性注意力所缺失的全秩 token 交互。为了将这些刷新后的表征沿深度方向传播，块注意力残差（AttnRes）将已完成的块摘要路由到后续线性层中，实现了锚点特征复用，并将深层有效秩提升了约 12%。通过从头开始训练，SANA-Video 2.0 直接学习完整的混合架构，而非对预训练模型进行线性化处理，并通过降分辨率代理研究确定 25% softmax 为质量与效率的最佳平衡点。在 40 步采样下，SANA-Video 2.0 在单张 H100 上以 480p 分辨率、13.2 秒内取得了 84.30 的 VBench 分数，其性能与规模大得多的 softmax 视频 DiT 相当，而延迟却低得多。在 720p/60 秒条件下，其编译后的 DiT 前向传播速度比匹配的全 softmax 基线快 3.2 倍，且这一差距随视频时长增加而扩大。此外，全栈 Sol-Engine 优化（内核融合、缓存和稀疏注意力）进一步将这一硬件友好的骨干网络加速了 3.58 倍，使得 5B 模型在 720p/5 秒条件下仅需 13.06 秒，在单张 H100 上比 Wan 2.2-A14B 快 120 倍。总体而言，我们的混合设计以大幅降低的成本恢复了 softmax 级别的表现力，为实现可扩展的长视频、高分辨率视频生成开辟了道路。
