HeyGen 将 18B+ 参数的 Avatar IV 视频生成模型移植到 Google Cloud Trillium (v6e) TPU,通过 torchax 和 XLA 实现,并采用 FSDP 与 Ulysses 序列并行。
HeyGen 将 18B+ 参数的 Avatar IV 视频生成模型移植到 Google Cloud Trillium (v6e) TPU,通过 torchax 和 XLA 实现,并采用 FSDP 与 Ulysses 序列并行。
古风AI短片《天宫之约》爆火,播放近7000万、点赞超400万,被外交部发言人毛宁转发,海外平台观看超540万。该片由90后创作者栖光用可灵3.0制作,他看重可灵的画面质感、光影效果、精准提示词响应与生成稳定性。栖光已加入可灵AI创作者计划3.0,该计划设“灵感聚光计划”,提供每月百万现金池、千万级灵感值激励及单项目最高亿级曝光资源。
MiniMax H3 技术团队在 Reddit AMA 和 ComfyUI 直播中回应开发者提问:模型不使用 MSA,稀疏注意力策略更接近 MoBA,默认仅对视频 token 做 3D sparsification,近期将发布保守版本。
昆仑万维凭借智能体产业化领域的表现,入围“2026年度中经数字产业高质量发展优秀案例”,获评“智能体产业化优秀案例”。其天工Skywork全系列模型覆盖文本、多模态、视频、音乐等赛道,Skywork Super Agents在GAIA榜单得分82.42分居全球第一,Mureka V8人声、乐器双赛道登顶,SkyReels V4获Text to Video (With Audio)赛道全球第一。
SkyProduction天工短剧工作台正式接入Seedance 2.5,720P低至0.4元/秒、480P低至0.3元/秒,支持单段最长30秒视频直出、50个参考素材及10余种语言。同期推出“短剧出海转绘”功能,可将中文短剧快速本土化为欧美市场内容;三部通过该工作台创作的AI短剧已上线DramaWave,单部营收均达200万美元级别。
火山引擎正式上线 Seedance 2.5 API,将单次视频生成时长从15秒提升至30秒,并支持最高50个全模态素材参考。模型在指令遵循、长叙事、真人感及声画质感上大幅提升,能稳定保持多角色外形与场景关系,兼容十余种语言。
另有 1 家信源报道公众号:数字生命卡兹克8月6日,百度智能云在南昌举办云智Agent实践场·AIGC专场,发布面向AIGC内容生产的四层能力架构:以百度百舸为底座的AI Infra、依托百度千帆汇聚150余个模型的Agent Infra、Hogee与百度一镜等应用工具,以及串联全流程的百度搭子。现场还联合江西省数字经济企业协会等机构启动江西省AI漫剧产业合作,推动内容产业从效率提升迈向IP经营与商业变现的全链路升级。
阿里千问全网首发公测视频生成模型 Wan3.0,在生成时长、镜头语言、角色真实感及一致性保持等维度全面升级。该模型支持稳定直出 30 秒一镜到底视频,具备导演级镜头与蒙太奇叙事,并强调角色、道具、场景高一致性保持。Wan3.0 主打超高性价比,现已在千问创作(c.qianwen.com)开放体验,千问 app 也将陆续开启。
另有 2 家信源报道IT之家(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)Chime 执行制片人 Shayla Love 透露,团队用 Runway 将原本需约 30 万美元、涉及 80 多名真实会员的电视广告尾卡制作压缩至 3 万美元以内,且几乎无制作开销。Runway 的定制工作流将质量参差的 UGC 照片转化为稳定、达到电视播出标准的动态画面。团队还计划用 Runway 制作概念故事板,以加速广告审批流程。
字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。
另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)三家广告与品牌公司的创意负责人一致认为,AI 技术已成熟,真正挑战在于重塑习惯、团队与预算。Le Truc 的 Williander 强调快速原型、展示 60-70% 完成度即可;Edelman 引入 Runway 后设计师效率提升五倍;WHY Brands 的 Harrelson 用 AI 实现当天响应文化热点。
Vidu 一键 MV 全面升级,推出对口型唱、演唱穿插、舞蹈演绎、剧情演绎四大创作链路,覆盖音乐 MV 主流内容形态。用户上传图片和音乐即可生成口型、动作、表情、镜头与剧情,支持 720P 生成。对口型唱、演唱穿插、舞蹈演绎模式每秒 0.75 元,剧情演绎每秒 0.65 元。
Nvidia 媒体与娱乐部门副总裁 Richard Kerris 认为,AI 不是可叠加的功能,而是值得围绕其重建的全新计算模型。Runway 仅用一天便将 Gen-4.5 迁移至 Nvidia 最新平台 Vera Rubin,生成速度从分钟级提升至即时,使视频生成变为实时创作循环。
Paramount 首席技术官 Phil Wiser 认为 AI 应跻身人类史上最伟大技术趋势前五,其影响堪比火的使用。他主张等待依赖条件成熟、以“aha 时刻”引导采用,而非以技术为先导;并警告行业巨头过度分析将错失窗口期,这一窗口可能仅 5 至 10 年。Paramount 两年前已通过 Runway 向全员开放 AI 工具,并以业务成果而非 token 消耗量衡量成效。
Netflix 创意创新总监 Girish Balakrishnan 与 FutureCel 创始人 Joel Kuwahara 一致认为,AI 是服务故事的工具。Netflix 用生成式工具为《Brazil '70》重现 1970 世界杯满场观众,保留原本会被剪掉的镜头;Kuwahara 则强调 AI 带来更多迭代机会,但最终仍取决于艺术家的技艺与视野。
MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。
另有 3 家信源报道X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)百度搭子内置的一镜Skill支持仅凭一句话或一个主题,自动完成脚本生成、声音、数字人形象、口型驱动和视频渲染,生成可直接播放的数字人口播视频,全程无需拍摄、剪辑和露脸。该功能适用于旅游攻略、产品种草、知识科普、临时活动宣传、企业内部培训及个人IP起步等场景,大幅降低视频制作门槛。
火山引擎发布新一代视频生成模型 Seedance 2.5,并将于近期面向企业用户上线 API 服务。徐工集团、小鹏汽车、智元机器人、灵初智能、微分智飞、穹彻智能、Xspark AI(无界智航)等多家企业已达成合作意向,率先接入。Seedance 系列正从内容工具延伸至工业制造、汽车、具身智能等实体产业,用于训练数据合成、场景仿真与作业流程培训。
另有 7 家信源报道X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。
另有 7 家信源报道X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)昆仑万维董事长兼CEO方汉在2026中国科创投资夏季峰会上指出,AIGC正带来“内容通胀”,AI短剧单部成本从超200万元降至不到10万元,音乐小样成本从数万元降至极低。他认为单品成本下降但行业总投入反升,稀缺性从生产能力转向优质内容、版权、IP、流量与分发能力,并给出图像看版权、视频看有效交付成本、音乐看权利分发的差异化投资逻辑。
奇瑞OMODA在印尼发布搭载豆包大模型的超级AI智舱,OMODA4支持5种语言交互;传音、荣耀、爱奇艺分别将Seedream/Seedance集成进手机影像与影视创作。美的将单条视频广告制作周期从7-10个工作日压缩至2-6小时,Nativex的Seedance素材已占创意产出70%-80%。
豆包联合人民教育出版社发起「经典课文名师 AI 共创计划」,首期推出由复旦大学中文系教授梁永安讲述、Seedance 视频模型还原画面的《桃花源记》AI 版。梁永安从陶渊明创作背景与乱世对照切入,解读这篇不足四百字的散文如何写出乱世中无数人的共同渴望,并指出其深层是对人性欲望的批判。
生数科技在 WAIC 2026 上展示了从数字世界生成到物理世界行动的通用世界模型。其视频生成模型 Vidu 已形成产品矩阵,实时交互模型 Vidu S1 支持 540P、最高 42FPS 的视频通话级输出。面向物理世界的世界动作模型 Motubrain 在 RoboTwin 2.0 榜单的 Clean 和 Randomized 场景下均位列第一。
生数科技在WAIC 2026集中展示通用世界模型最新进展,覆盖数字世界生成、实时交互与物理世界行动。其世界动作模型Motubrain在RoboTwin 2.0榜单Clean和Randomized场景分别取得95.8分和96.1分,均位列第一;在WorldArena榜单以63.77的总体EWM Score位列第一。
京东数字人技术支持联想拯救者、蒙牛、海信、五粮液、三只松鼠等23家品牌IP进入直播间,联动赛事热点与福利玩法,实现从内容露出到经营承接的转化。该系列直播以“万物皆可直播”为主题,将品牌IP从静态资产变为可互动、可承接转化的内容资产,为品牌商家打开AI营销新场景。
创作者@澜安自2025年下半年起使用可灵AIGC工具,通过拆解眼神变化、嘴角颤动、呼吸节奏等细节,让AI生成隐忍落泪、一秒变脸等复杂情绪表演。他认为AI需通过具体文字还原情绪对应的外在细节,而非仅告诉AI“要难过”。文章分享了从剧本、分镜、提示词到可灵生成的完整创作方法。
创作者@澜安自2025年下半年接触AIGC,因可灵对人物微表情、细腻动作和长镜头稳定性的表现,开始探索AI呈现影视剧般自然复杂情绪的可能。他把情绪拆解为眼神变化、嘴角颤动、呼吸节奏和肢体反应等外在细节,再通过镜头、光影和节奏让表演成立,并分享了从剧本、分镜、提示词到可灵生成的完整创作方法。
生数科技联合创始人兼CEO骆怡航在WAIC 2026论坛上提出,仅靠大语言模型理解世界只使用了人类智能的一小部分,AI下一阶段需要达到LLM范式级别的通用世界模型。该模型需形成感知、预测与行动的动态闭环,并具备跨场景的通用性与泛化能力。生数科技已构建统一基座,通过Vidu Q系列、Vidu S系列和Motubrain分别覆盖数字内容生成、实时交互与物理世界行动。
Apple 与特拉维夫大学联合提出 CalibAtt,一种无需训练的校准稀疏注意力方法,通过离线识别 token 间可跳过的低分连接并编译为优化操作,在推理时跳过无关计算。在 Wan 2.1 14B、Mochi 1 及少步蒸馏模型上,CalibAtt 实现最高 1.58 倍端到端加速,在保持视频质量和文本-视频对齐的同时优于现有免训练方法。
生数科技携手万兴科技,在 WAIC 2026 举办 AI 影视专场论坛,围绕通用世界模型底层技术革新,探讨 AI 影视生产力的全新范式与下一代产业未来。
生数科技携手万兴科技在WAIC 2026举办AI影视专场论坛,汇聚行业重磅嘉宾,围绕通用世界模型底层技术革新,探讨AI影视生产力的全新范式。论坛聚焦解锁AI影视创作的下一代产业未来。
生数科技创始人朱军在WAIC 2026上提出,通用世界模型需具备理解、想象与行动一体化能力,并发布全球首个MoT统一架构。该架构将理解、生成与行动专家统一于同一模型,支撑Vidu Q3等视频生成模型及具身智能机器人控制。最新模型可驱动多种异构机器人完成长程任务,在跨场景泛化上取得行业领先效果。
昆仑万维在 WAIC 2026 发布并开源新一代可交互世界模型 Matrix-Game 3.5。该模型通过 Patch Memory 与 Warped PRoPE 实现长期记忆与几何一致性建模,可在单张 GPU 上以 720P 分辨率、约 20FPS 实时生成流式视频。
2026世界人工智能大会(WAIC)期间,央视总台《科技零距离》对话生数科技创始人、清华大学人工智能研究院副院长朱军,围绕世界模型、AI视频发展及未来智能展开交流。节目于今晚21:00全平台上线。
2026 世界人工智能大会(WAIC)期间,央视总台《科技零距离》对话生数科技创始人、清华大学人工智能研究院副院长朱军,围绕“AI 从生成视频到理解世界”展开交流,探讨世界模型、AI 视频发展及未来智能的可能。节目于今晚 21:00 全平台上线。
通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。
Google Vids 推出两项更新:Gemini Omni 支持用户通过自然语言提示词和图片参考生成、逐步编辑高质量视频片段;个人数字分身功能允许用户上传自拍和语音录制后,输入文字即可让数字分身出镜。两项功能面向 Google AI Pro 和 Ultra 订阅者及 Google Workspace 商业客户开放,所有生成内容均含不可见的 SynthID 数字水印。