We introduce Vidu S1, a real-time interactive video generation model supporting voice control of digital characters. Users can control video generation content at any moment through voice instructions. Vidu S1 supports infinite-length real-time video generation without blurring, drift, or visual distortion. Built with TurboDiffusion and TurboServe, Vidu S1 outputs 540p real-time videos at up to 42 FPS on regular consumer GPUs. Users can upload custom images of real people, anime, and pets, and choose different voice tones for personalized experiences. Experiments show that Vidu S1 achieves the best performance across all test metrics while fully meeting real-time inference requirements. A playable online demo is available at https://vidu.com/vidu-stream.
Vidu S1:支持语音控制的实时交互式视频生成模型
AI 导读
Vidu S1 是一款实时交互式视频生成模型,支持通过语音指令控制数字角色并实时改变视频生成内容。该模型可生成无限长度、无模糊、无漂移或视觉失真的实时视频。基于 TurboDiffusion 和 TurboServe 架构,Vidu S1 在普通消费级 GPU 上即可输出最高 42 FPS 的 540p 实时视频。用户可上传真人、动漫、宠物等自定义图像,并选择不同语音语调实现个性化体验。实验表明,Vidu S1 在所有测试指标上均达到最佳性能,同时完全满足实时推理需求。已提供可在线试玩的 demo。
HuggingFace Daily Papers(社区热门论文)
同事件
73
AI 编辑部评分,满分 100Vidu S1:支持语音控制的实时交互式视频生成模型
Vidu S1 是一款实时交互式视频生成模型,支持通过语音指令控制数字角色并实时改变视频生成内容。该模型可生成无限长度、无模糊、无漂移或视觉失真的实时视频。基于 TurboDiffusion 和 TurboServe 架构,Vidu S1 在普通消费级 GPU 上即可输出最高 42 FPS 的 540p 实时视频。用户可上传真人、动漫、宠物等自定义图像,并选择不同语音语调实现个性化体验。实验表明,Vidu S1 在所有测试指标上均达到最佳性能,同时完全满足实时推理需求。已提供可在线试玩的 demo。
原文 · 保持原样,未翻译原文 · 未翻译
来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org
事件后续 · 1查看事件全部 →