内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态一手 · 231 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「视频」清除

8月14日周五

00:19Google Developers Blog(RSS)37HeyGen 将 Avatar IV 视频生成模型移植到 Google Cloud Trillium TPU

8月13日周四

18:20公众号:可灵AI(快手·视频)33刷屏海内外的"中式天庭"《天宫之约》,出自可灵3.0

8月8日周六

12:31公众号:MiniMax(稀宇科技)53MiniMax H3 开源首周 AMA:技术团队回应稀疏注意力、长视频续写与推理优化

8月7日周五

22:01公众号:昆仑万维(天工)30昆仑万维荣膺"2026年度中经数字产业高质量发展优秀案例"
22:01公众号:昆仑万维(天工)57SkyProduction天工短剧工作台接入Seedance 2.5,720P低至0.4元/秒
14:11公众号:火山引擎81精选Seedance 2.5 API上线,视频生成开启「电影级长叙事」
12:00公众号:百度智能云(文心)30百度智能云在江西给出AI+内容产业新解法:从爆款到长红需跑通全链路

8月6日周四

21:30公众号:千问APP(阿里)64精选千问全网首发公测,全新 Wan3.0 来了!
07:24Runway:News(网页)31Chime 如何用 Runway 制作最新全国电视广告

8月5日周三

12:12字节 Seed:Research Feed(网页内嵌数据)78精选字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互
02:31Black Forest Labs:Blog(网页)43FLUX 3 Video, Part 1: Generation
02:15Runway:News(网页)45Edelman、Le Truc 与 WHY Brands 谈 AI 为何奖励有观点的创作者

8月4日周二

17:50公众号:生数科技(Vidu·视频)56Vidu 一键 MV 重磅升级:四大创作链路覆盖对口型唱、舞蹈演绎与剧情演绎
00:41Runway:News(网页)52Nvidia 高管:AI 是值得重建的全新计算模型
00:41Runway:News(网页)56Paramount CTO Phil Wiser:AI 属于史上最伟大技术趋势,但"iPhone 时刻"尚未到来
00:41Runway:News(网页)53Netflix 与 FutureCel 高管:AI 是工具,故事才是目的

8月3日周一

10:44公众号:MiniMax(稀宇科技)75精选MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声

7月31日周五

21:42公众号:百度智能云(文心)66精选百度搭子一镜Skill:一句话生成数字人口播视频
13:43公众号:火山引擎53Seedance 2.5发布,徐工、小鹏等多家企业达成合作意向
12:06字节 Seed:Research Feed(网页内嵌数据)80精选字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑

7月30日周四

17:00公众号:昆仑万维(天工)55昆仑万维方汉:AIGC进入内容通胀时代,稀缺资产定义投资新范式

7月29日周三

20:08公众号:火山引擎46从智能座舱到爆款视频,中国品牌全球化如何用AI找增量

7月27日周一

18:04公众号:豆包(字节)48豆包携手人教社推出名师 AI 共创版《桃花源记》,Seedance 视频模型还原课文画面

7月24日周五

18:40公众号:生数科技(Vidu·视频)40生数科技在 WAIC 2026 展示通用世界模型最新进展
18:36公众号:生数科技(Vidu·视频)34生数科技WAIC 2026展示通用世界模型:从数字世界生成到物理世界行动
17:30公众号:京东JoyAI37京东数字人携23家品牌IP进直播间,探索AI营销新玩法

7月23日周四

00:00Black Forest Labs:Blog(网页)25FLUX 3 x mimic: The Next Generation of Video-Action Models

7月22日周三

20:30公众号:可灵AI(快手·视频)44可灵AI创作者用微表情与长镜头还原影视级情绪表演
20:18公众号:可灵AI(快手·视频)48可灵创作者澜安:AI如何演好"隐忍落泪"这类复杂情绪
15:17公众号:生数科技(Vidu·视频)50生数科技骆怡航在 WAIC 2026 谈通用世界模型:从理解语言到理解世界
00:49Apple Machine Learning Research(RSS)55CalibAtt:无需训练的稀疏注意力方法,将文生视频速度提升至 1.58 倍

7月21日周二

19:10公众号:生数科技(Vidu·视频)32WAIC 2026 生数科技与万兴科技共论 AI 影视生产力新范式
19:04公众号:生数科技(Vidu·视频)28WAIC 2026 AI影视专场论坛金句合集:生数科技与万兴科技共探世界模型与影视生产力
13:10公众号:生数科技(Vidu·视频)48生数科技朱军:通用世界模型是连接数字与物理世界的新基础设施

7月20日周一

22:00公众号:昆仑万维(天工)64精选昆仑万维发布并开源可交互世界模型 Matrix-Game 3.5

7月18日周六

21:00公众号:生数科技(Vidu·视频)26央视对话生数科技朱军:AI从生成视频到理解世界
20:57公众号:生数科技(Vidu·视频)26央视对话朱军:AI 如何从生成视频走向理解世界

7月17日周五

15:20公众号:通义实验室(千问)69精选通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms
15:14公众号:通义实验室(千问)76精选Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话
00:32Google Blog:AI(RSS)60精选Google Vids 上线 Gemini Omni 与个人数字分身功能
已加载 40 条
全部 AI 动态
2026年8月17日星期一 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
一手信源 · 标签「视频」 · 231 条清除

8月14日

星期五 · 1 条
00:19
Google Developers Blog(RSS)
AI 评分 37/100
HeyGen 将 Avatar IV 视频生成模型移植到 Google Cloud Trillium TPU

HeyGen 将 18B+ 参数的 Avatar IV 视频生成模型移植到 Google Cloud Trillium (v6e) TPU,通过 torchax 和 XLA 实现,并采用 FSDP 与 Ulysses 序列并行。

Google教程/实践视频部署/工程

8月13日

星期四 · 1 条
18:20
公众号:可灵AI(快手·视频)
AI 评分 33/100
刷屏海内外的"中式天庭"《天宫之约》,出自可灵3.0

古风AI短片《天宫之约》爆火,播放近7000万、点赞超400万,被外交部发言人毛宁转发,海外平台观看超540万。该片由90后创作者栖光用可灵3.0制作,他看重可灵的画面质感、光影效果、精准提示词响应与生成稳定性。栖光已加入可灵AI创作者计划3.0,该计划设“灵感聚光计划”,提供每月百万现金池、千万级灵感值激励及单项目最高亿级曝光资源。

图像生成现象/趋势视频

8月8日

星期六 · 1 条
12:31
公众号:MiniMax(稀宇科技)
AI 评分 53/100
MiniMax H3 开源首周 AMA:技术团队回应稀疏注意力、长视频续写与推理优化

MiniMax H3 技术团队在 Reddit AMA 和 ComfyUI 直播中回应开发者提问:模型不使用 MSA,稀疏注意力策略更接近 MoBA,默认仅对视频 token 做 3D sparsification,近期将发布保守版本。

多模态教程/实践视频

8月7日

星期五 · 4 条
22:01
公众号:昆仑万维(天工)
AI 评分 30/100
昆仑万维荣膺"2026年度中经数字产业高质量发展优秀案例"

昆仑万维凭借智能体产业化领域的表现,入围“2026年度中经数字产业高质量发展优秀案例”,获评“智能体产业化优秀案例”。其天工Skywork全系列模型覆盖文本、多模态、视频、音乐等赛道,Skywork Super Agents在GAIA榜单得分82.42分居全球第一,Mureka V8人声、乐器双赛道登顶,SkyReels V4获Text to Video (With Audio)赛道全球第一。

智能体行业动态视频
22:01
公众号:昆仑万维(天工)
AI 评分 57/100
SkyProduction天工短剧工作台接入Seedance 2.5,720P低至0.4元/秒

SkyProduction天工短剧工作台正式接入Seedance 2.5,720P低至0.4元/秒、480P低至0.3元/秒,支持单段最长30秒视频直出、50个参考素材及10余种语言。同期推出“短剧出海转绘”功能,可将中文短剧快速本土化为欧美市场内容;三部通过该工作台创作的AI短剧已上线DramaWave,单部营收均达200万美元级别。

产品更新多模态视频
14:11
公众号:火山引擎精选
AI 评分 81/100
Seedance 2.5 API上线,视频生成开启「电影级长叙事」

火山引擎正式上线 Seedance 2.5 API,将单次视频生成时长从15秒提升至30秒,并支持最高50个全模态素材参考。模型在指令遵循、长叙事、真人感及声画质感上大幅提升,能稳定保持多角色外形与场景关系,兼容十余种语言。

产品更新图像生成视频
另有 1 家信源报道公众号:数字生命卡兹克
推荐理由:原生30秒时长和秒级时间戳控制,把长叙事视频从靠抽卡变为导演级调度;角色与光影的稳定提升让广告、影视等商业场景更接近实际生产标准。
12:00
公众号:百度智能云(文心)
AI 评分 30/100
百度智能云在江西给出AI+内容产业新解法:从爆款到长红需跑通全链路

8月6日,百度智能云在南昌举办云智Agent实践场·AIGC专场,发布面向AIGC内容生产的四层能力架构:以百度百舸为底座的AI Infra、依托百度千帆汇聚150余个模型的Agent Infra、Hogee与百度一镜等应用工具,以及串联全流程的百度搭子。现场还联合江西省数字经济企业协会等机构启动江西省AI漫剧产业合作,推动内容产业从效率提升迈向IP经营与商业变现的全链路升级。

行业动态视频

8月6日

星期四 · 2 条
21:30
公众号:千问APP(阿里)精选
AI 评分 64/100
千问全网首发公测,全新 Wan3.0 来了!

阿里千问全网首发公测视频生成模型 Wan3.0,在生成时长、镜头语言、角色真实感及一致性保持等维度全面升级。该模型支持稳定直出 30 秒一镜到底视频,具备导演级镜头与蒙太奇叙事,并强调角色、道具、场景高一致性保持。Wan3.0 主打超高性价比,现已在千问创作(c.qianwen.com)开放体验,千问 app 也将陆续开启。

产品更新视频
另有 2 家信源报道IT之家(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)
推荐理由:30秒一镜到底和导演级镜头控制将视频生成从短片段推向长叙事,配合低试错成本,可能加速短剧和广告的创作节奏。
07:24
Runway:News(网页)
AI 评分 31/100
Chime 如何用 Runway 制作最新全国电视广告

Chime 执行制片人 Shayla Love 透露,团队用 Runway 将原本需约 30 万美元、涉及 80 多名真实会员的电视广告尾卡制作压缩至 3 万美元以内,且几乎无制作开销。Runway 的定制工作流将质量参差的 UGC 照片转化为稳定、达到电视播出标准的动态画面。团队还计划用 Runway 制作概念故事板,以加速广告审批流程。

图像生成教程/实践视频

8月5日

星期三 · 3 条
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

多模态模型发布视频语音
另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
02:31
Black Forest Labs:Blog(网页)
AI 评分 43/100
FLUX 3 Video, Part 1: Generation
多模态模型发布视频
02:15
Runway:News(网页)
AI 评分 45/100
Edelman、Le Truc 与 WHY Brands 谈 AI 为何奖励有观点的创作者

三家广告与品牌公司的创意负责人一致认为,AI 技术已成熟,真正挑战在于重塑习惯、团队与预算。Le Truc 的 Williander 强调快速原型、展示 60-70% 完成度即可;Edelman 引入 Runway 后设计师效率提升五倍;WHY Brands 的 Harrelson 用 AI 实现当天响应文化热点。

现象/趋势视频

8月4日

星期二 · 4 条
17:50
公众号:生数科技(Vidu·视频)
AI 评分 56/100
Vidu 一键 MV 重磅升级:四大创作链路覆盖对口型唱、舞蹈演绎与剧情演绎

Vidu 一键 MV 全面升级,推出对口型唱、演唱穿插、舞蹈演绎、剧情演绎四大创作链路,覆盖音乐 MV 主流内容形态。用户上传图片和音乐即可生成口型、动作、表情、镜头与剧情,支持 720P 生成。对口型唱、演唱穿插、舞蹈演绎模式每秒 0.75 元,剧情演绎每秒 0.65 元。

产品更新视频
00:41
Runway:News(网页)
AI 评分 52/100
Nvidia 高管:AI 是值得重建的全新计算模型

Nvidia 媒体与娱乐部门副总裁 Richard Kerris 认为,AI 不是可叠加的功能,而是值得围绕其重建的全新计算模型。Runway 仅用一天便将 Gen-4.5 迁移至 Nvidia 最新平台 Vera Rubin,生成速度从分钟级提升至即时,使视频生成变为实时创作循环。

图像生成大佬观点视频
00:41
Runway:News(网页)
AI 评分 56/100
Paramount CTO Phil Wiser:AI 属于史上最伟大技术趋势,但"iPhone 时刻"尚未到来

Paramount 首席技术官 Phil Wiser 认为 AI 应跻身人类史上最伟大技术趋势前五,其影响堪比火的使用。他主张等待依赖条件成熟、以“aha 时刻”引导采用,而非以技术为先导;并警告行业巨头过度分析将错失窗口期,这一窗口可能仅 5 至 10 年。Paramount 两年前已通过 Runway 向全员开放 AI 工具,并以业务成果而非 token 消耗量衡量成效。

大佬观点视频
00:41
Runway:News(网页)
AI 评分 53/100
Netflix 与 FutureCel 高管:AI 是工具,故事才是目的

Netflix 创意创新总监 Girish Balakrishnan 与 FutureCel 创始人 Joel Kuwahara 一致认为,AI 是服务故事的工具。Netflix 用生成式工具为《Brazil '70》重现 1970 世界杯满场观众,保留原本会被剪掉的镜头;Kuwahara 则强调 AI 带来更多迭代机会,但最终仍取决于艺术家的技艺与视野。

大佬观点视频

8月3日

星期一 · 1 条
10:44
公众号:MiniMax(稀宇科技)精选
AI 评分 75/100
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声

MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。

多模态模型发布视频
另有 3 家信源报道X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)
推荐理由:与多数开源视频模型不同,H3 原生支持同步生成立体声音频,且通过上下文再生成实现 2K 分辨率,为音视频生成应用提供了更完整的开源基座。

7月31日

星期五 · 3 条
21:42
公众号:百度智能云(文心)精选
AI 评分 66/100
百度搭子一镜Skill:一句话生成数字人口播视频

百度搭子内置的一镜Skill支持仅凭一句话或一个主题,自动完成脚本生成、声音、数字人形象、口型驱动和视频渲染,生成可直接播放的数字人口播视频,全程无需拍摄、剪辑和露脸。该功能适用于旅游攻略、产品种草、知识科普、临时活动宣传、企业内部培训及个人IP起步等场景,大幅降低视频制作门槛。

产品更新多模态视频

推荐理由:拆解了从想法到成品视频的全链路,非专业用户能直观理解脚本生成、数字人驱动等环节如何协作,有助于判断这类工具能否嵌入现有创作流程。
13:43
公众号:火山引擎
AI 评分 53/100
Seedance 2.5发布,徐工、小鹏等多家企业达成合作意向

火山引擎发布新一代视频生成模型 Seedance 2.5,并将于近期面向企业用户上线 API 服务。徐工集团、小鹏汽车、智元机器人、灵初智能、微分智飞、穹彻智能、Xspark AI(无界智航)等多家企业已达成合作意向,率先接入。Seedance 系列正从内容工具延伸至工业制造、汽车、具身智能等实体产业,用于训练数据合成、场景仿真与作业流程培训。

具身智能模型发布视频
另有 7 家信源报道X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)
12:06
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 80/100
字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑

字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。

多模态模型发布视频
另有 7 家信源报道X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)
推荐理由:Seedance 2.5 把单次生成拉到 30 秒,加上多模态参考和精准编辑,让视频创作从片段拼凑变成完整叙事。对国内创作者来说,这是即梦和豆包里能马上用到的最强视频模型。

7月30日

星期四 · 1 条
17:00
公众号:昆仑万维(天工)
AI 评分 55/100
昆仑万维方汉:AIGC进入内容通胀时代,稀缺资产定义投资新范式

昆仑万维董事长兼CEO方汉在2026中国科创投资夏季峰会上指出,AIGC正带来“内容通胀”,AI短剧单部成本从超200万元降至不到10万元,音乐小样成本从数万元降至极低。他认为单品成本下降但行业总投入反升,稀缺性从生产能力转向优质内容、版权、IP、流量与分发能力,并给出图像看版权、视频看有效交付成本、音乐看权利分发的差异化投资逻辑。

大佬观点现象/趋势视频

7月29日

星期三 · 1 条
20:08
公众号:火山引擎
AI 评分 46/100
从智能座舱到爆款视频,中国品牌全球化如何用AI找增量

奇瑞OMODA在印尼发布搭载豆包大模型的超级AI智舱,OMODA4支持5种语言交互;传音、荣耀、爱奇艺分别将Seedream/Seedance集成进手机影像与影视创作。美的将单条视频广告制作周期从7-10个工作日压缩至2-6小时,Nativex的Seedance素材已占创意产出70%-80%。

多模态行业动态视频

7月27日

星期一 · 1 条
18:04
公众号:豆包(字节)
AI 评分 48/100
豆包携手人教社推出名师 AI 共创版《桃花源记》,Seedance 视频模型还原课文画面

豆包联合人民教育出版社发起「经典课文名师 AI 共创计划」,首期推出由复旦大学中文系教授梁永安讲述、Seedance 视频模型还原画面的《桃花源记》AI 版。梁永安从陶渊明创作背景与乱世对照切入,解读这篇不足四百字的散文如何写出乱世中无数人的共同渴望,并指出其深层是对人性欲望的批判。

行业动态视频

7月24日

星期五 · 3 条
18:40
公众号:生数科技(Vidu·视频)
AI 评分 40/100
生数科技在 WAIC 2026 展示通用世界模型最新进展

生数科技在 WAIC 2026 上展示了从数字世界生成到物理世界行动的通用世界模型。其视频生成模型 Vidu 已形成产品矩阵,实时交互模型 Vidu S1 支持 540P、最高 42FPS 的视频通话级输出。面向物理世界的世界动作模型 Motubrain 在 RoboTwin 2.0 榜单的 Clean 和 Randomized 场景下均位列第一。

产品更新具身智能视频
18:36
公众号:生数科技(Vidu·视频)
AI 评分 34/100
生数科技WAIC 2026展示通用世界模型:从数字世界生成到物理世界行动

生数科技在WAIC 2026集中展示通用世界模型最新进展,覆盖数字世界生成、实时交互与物理世界行动。其世界动作模型Motubrain在RoboTwin 2.0榜单Clean和Randomized场景分别取得95.8分和96.1分,均位列第一;在WorldArena榜单以63.77的总体EWM Score位列第一。

产品更新具身智能视频
17:30
公众号:京东JoyAI
AI 评分 37/100
京东数字人携23家品牌IP进直播间,探索AI营销新玩法

京东数字人技术支持联想拯救者、蒙牛、海信、五粮液、三只松鼠等23家品牌IP进入直播间,联动赛事热点与福利玩法,实现从内容露出到经营承接的转化。该系列直播以“万物皆可直播”为主题,将品牌IP从静态资产变为可互动、可承接转化的内容资产,为品牌商家打开AI营销新场景。

行业动态视频

7月23日

星期四 · 1 条
00:00
Black Forest Labs:Blog(网页)
AI 评分 25/100
FLUX 3 x mimic: The Next Generation of Video-Action Models
多模态模型发布视频

7月22日

星期三 · 4 条
20:30
公众号:可灵AI(快手·视频)
AI 评分 44/100
可灵AI创作者用微表情与长镜头还原影视级情绪表演

创作者@澜安自2025年下半年起使用可灵AIGC工具,通过拆解眼神变化、嘴角颤动、呼吸节奏等细节,让AI生成隐忍落泪、一秒变脸等复杂情绪表演。他认为AI需通过具体文字还原情绪对应的外在细节,而非仅告诉AI“要难过”。文章分享了从剧本、分镜、提示词到可灵生成的完整创作方法。

教程/实践视频
20:18
公众号:可灵AI(快手·视频)
AI 评分 48/100
可灵创作者澜安:AI如何演好"隐忍落泪"这类复杂情绪

创作者@澜安自2025年下半年接触AIGC,因可灵对人物微表情、细腻动作和长镜头稳定性的表现,开始探索AI呈现影视剧般自然复杂情绪的可能。他把情绪拆解为眼神变化、嘴角颤动、呼吸节奏和肢体反应等外在细节,再通过镜头、光影和节奏让表演成立,并分享了从剧本、分镜、提示词到可灵生成的完整创作方法。

多模态教程/实践视频
15:17
公众号:生数科技(Vidu·视频)
AI 评分 50/100
生数科技骆怡航在 WAIC 2026 谈通用世界模型:从理解语言到理解世界

生数科技联合创始人兼CEO骆怡航在WAIC 2026论坛上提出,仅靠大语言模型理解世界只使用了人类智能的一小部分,AI下一阶段需要达到LLM范式级别的通用世界模型。该模型需形成感知、预测与行动的动态闭环,并具备跨场景的通用性与泛化能力。生数科技已构建统一基座,通过Vidu Q系列、Vidu S系列和Motubrain分别覆盖数字内容生成、实时交互与物理世界行动。

具身智能大佬观点视频
00:49
Apple Machine Learning Research(RSS)
AI 评分 55/100
CalibAtt:无需训练的稀疏注意力方法,将文生视频速度提升至 1.58 倍

Apple 与特拉维夫大学联合提出 CalibAtt,一种无需训练的校准稀疏注意力方法,通过离线识别 token 间可跳过的低分连接并编译为优化操作,在推理时跳过无关计算。在 Wan 2.1 14B、Mochi 1 及少步蒸馏模型上,CalibAtt 实现最高 1.58 倍端到端加速,在保持视频质量和文本-视频对齐的同时优于现有免训练方法。

推理视频论文/研究

7月21日

星期二 · 3 条
19:10
公众号:生数科技(Vidu·视频)
AI 评分 32/100
WAIC 2026 生数科技与万兴科技共论 AI 影视生产力新范式

生数科技携手万兴科技,在 WAIC 2026 举办 AI 影视专场论坛,围绕通用世界模型底层技术革新,探讨 AI 影视生产力的全新范式与下一代产业未来。

行业动态视频
19:04
公众号:生数科技(Vidu·视频)
AI 评分 28/100
WAIC 2026 AI影视专场论坛金句合集:生数科技与万兴科技共探世界模型与影视生产力

生数科技携手万兴科技在WAIC 2026举办AI影视专场论坛,汇聚行业重磅嘉宾,围绕通用世界模型底层技术革新,探讨AI影视生产力的全新范式。论坛聚焦解锁AI影视创作的下一代产业未来。

行业动态视频
13:10
公众号:生数科技(Vidu·视频)
AI 评分 48/100
生数科技朱军:通用世界模型是连接数字与物理世界的新基础设施

生数科技创始人朱军在WAIC 2026上提出,通用世界模型需具备理解、想象与行动一体化能力,并发布全球首个MoT统一架构。该架构将理解、生成与行动专家统一于同一模型,支撑Vidu Q3等视频生成模型及具身智能机器人控制。最新模型可驱动多种异构机器人完成长程任务,在跨场景泛化上取得行业领先效果。

具身智能多模态大佬观点视频

7月20日

星期一 · 1 条
22:00
公众号:昆仑万维(天工)精选
AI 评分 64/100
昆仑万维发布并开源可交互世界模型 Matrix-Game 3.5

昆仑万维在 WAIC 2026 发布并开源新一代可交互世界模型 Matrix-Game 3.5。该模型通过 Patch Memory 与 Warped PRoPE 实现长期记忆与几何一致性建模,可在单张 GPU 上以 720P 分辨率、约 20FPS 实时生成流式视频。

开源生态模型发布视频

推荐理由:昆仑万维这次开源的Matrix-Game 3.5在记忆和几何一致性上给出了一套可插拔的方案,不是纯炫技,全球开发者能直接复用到自己的视频基座上,做游戏和仿真的该关注一下。

7月18日

星期六 · 2 条
21:00
公众号:生数科技(Vidu·视频)
AI 评分 26/100
央视对话生数科技朱军:AI从生成视频到理解世界

2026世界人工智能大会(WAIC)期间,央视总台《科技零距离》对话生数科技创始人、清华大学人工智能研究院副院长朱军,围绕世界模型、AI视频发展及未来智能展开交流。节目于今晚21:00全平台上线。

行业动态视频
20:57
公众号:生数科技(Vidu·视频)
AI 评分 26/100
央视对话朱军:AI 如何从生成视频走向理解世界

2026 世界人工智能大会(WAIC)期间,央视总台《科技零距离》对话生数科技创始人、清华大学人工智能研究院副院长朱军,围绕“AI 从生成视频到理解世界”展开交流,探讨世界模型、AI 视频发展及未来智能的可能。节目于今晚 21:00 全平台上线。

行业动态视频

7月17日

星期五 · 3 条
15:20
公众号:通义实验室(千问)精选
AI 评分 69/100
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms

通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。

多模态模型发布视频

推荐理由:通义实验室把实时视频交互延迟压到550ms,同时提升了分辨率,不是刷榜而是解决实际问题,对做数字人和实时助手的团队是个值得跟进的信号。
15:14
公众号:通义实验室(千问)精选
AI 评分 76/100
Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。

arXiv多模态模型发布视频

推荐理由:550ms端到端延迟把实时视频对话从拼接流水线推入单模型交互循环,原先因响应太慢而无法沉浸的口语陪练与面试模拟,开始具备自然对话的交互基础。
00:32
Google Blog:AI(RSS)精选
AI 评分 60/100
Google Vids 上线 Gemini Omni 与个人数字分身功能

Google Vids 推出两项更新:Gemini Omni 支持用户通过自然语言提示词和图片参考生成、逐步编辑高质量视频片段;个人数字分身功能允许用户上传自拍和语音录制后,输入文字即可让数字分身出镜。两项功能面向 Google AI Pro 和 Ultra 订阅者及 Google Workspace 商业客户开放,所有生成内容均含不可见的 SynthID 数字水印。

Google产品更新视频

推荐理由:如果你已经在用 Google Workspace,这两个更新让 Vids 的可用性提升了一档,但对于外部的 AI 视频生成,没带来新变量。
已加载 40 条