内容
精选全部 AI 动态热点榜AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

精选

8月9日 · 周日
最新精选
全部模型产品行业论文教程观点
标签「多模态」清除

8月8日周六

17:11IT之家(RSS)76苹果 Mac 简体中文支持文档更新,"Apple 智能"阿里千问扩展现身苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。推荐理由:苹果智能在中国大陆的落地路径终于清晰,支持文档揭示了写作工具和Siri集成千问的具体方式,Mac用户将能在系统级直接使用大模型能力。

8月7日周五

19:13Runway75Runway 上线 Seedance 2.5,支持 50 个角色参考Seedance 2.5 现已登陆 Runway。每次生成最多可引用 50 个角色参考,构建充满角色的完整世界;可创作最长 30 秒、带完整音效与对白的片段,再按你的故事需求随意剪辑与延展。 点击下方链接立即开始。推荐理由:支持最多50个角色引用和30秒带对话的片段,从单镜头生成迈向构建完整场景,更适合需要连贯叙事的视频创意。
15:42Krea72Krea 推出 Seedance 2.5 视频模型推出 Seedance 2.5。 30 秒连续视频、完整多镜头序列,以及最多 50 个参考。 立即试用 👇推荐理由:连续30秒生成与多镜头序列支持,将视频创作从单次短片段推向长故事板,对需要连贯叙事的创作者更实用。

8月6日周四

21:12NVIDIA Blog(RSS)71NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。
21:11OpenBMB65面壁智能 AMNESIAC:反向图灵测试 AI 审讯游戏面壁智能 OpenBMB 在 #BuildSmall 黑客松推出 AMNESIAC,一款反向图灵测试交互游戏:玩家需说服 AI 审讯官 A.M.N. 自己是人类。该游戏由 MiniCPM-o 4.5 驱动实时对话与推理,VoxCPM 生成审讯官语音,并结合摄像头面部表情、脉搏信号与响应计时进行多模态审讯。项目已开源至 HuggingFace。推荐理由:将摄像头面部信号、语音对话和LoRA角色塑形组合进一个可玩演示,为交互式AI角色提供了比常见聊天机器人更丰富的多模态模板。
14:39Alibaba Cloud81Qwen-Image-3.0 发布:高分辨率低至 0.03 美元Qwen-Image-3.0 已可投入生产。支持 4.5K token 提示词。100%+ 文本准确率(无破损 logo)。原生支持 12 种语言。定价灵活可扩展:高分辨率低至 $0.03。完整详情见图片。👉 探索:• Model Studio:https://click.alibabacloud.com/m/20000001606/ • Qwen Cloud:https://click.qwencloud.com/m/20000001648/ #Qwen #QwenImage3 #AlibabaCloud #GenerativeAI #AICreativity推荐理由:文本渲染准确率从「需要后期修图」变为可能直接可用,多语言和透明定价让团队在商用评估时减少了不确定性。

8月5日周三

16:35MarkTechPost(RSS)79NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。推荐理由:轨迹与因果解释同时输出,可接入Halos安全验证,自动驾驶团队据此向监管证明决策合理性,减少黑盒依赖。
13:55HuggingFace Daily Papers(社区热门论文)74Video-DeepResearch:迈向下一代多模态深度研究智能体Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。推荐理由:将深度研究从静态图像扩展到视频流,通过强制视觉定位再检索的两阶段训练,让模型摆脱了对文本搜索的路径依赖,给视频智能体研发提供了可验证的训练范式。
12:12字节 Seed:Research Feed(网页内嵌数据)78字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
11:08Qwen68Qwen-Image-3.0-Pro 上线 Qwen Cloud阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。
02:00OpenRouter66OpenRouter 上线 FLUX 3 Video 统一多模态模型@bfl_ai 的 FLUX 3 Video 现已在 OpenRouter 上向所有人开放。 一个统一的视频、音频、图像和动作预测多模态模型家族。严肃、有趣、创意、真实、电影感,随你所需。基于统一架构联合训练。推荐理由:联合训练的统一架构下,视频生成与图像、音频共享基础能力,跨模态创作的结果可能更连贯,改变了单独优化各模态的传统思路。
00:07SenseTime67商汤 SenseNova U1 开源:统一推理与图像生成商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。推荐理由:把推理和图像生成整合进单一模型流,信息图模式和逐步教程展示了从推理到可视化的直接路径,为需要图文连贯输出的应用提供了可探索的开源方案。

8月4日周二

11:54HuggingFace Daily Papers(社区热门论文)70SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。推荐理由:通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。
11:54HuggingFace Daily Papers(社区热门论文)74UEmbed:统一稀疏与稠密的多模态嵌入模型UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。推荐理由:UEmbed 让一个解码器模型同时输出稀疏与稠密多模态嵌入,稀疏模式精度接近稠密且原生适配倒排索引,对兼顾效率和精度的检索系统,省去了维护多套模型的开销。
08:00HuggingFace Daily Papers(社区热门论文)72SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。推荐理由:基准将场景文字冲突转化为连续的地理定位诊断,揭示对抗性文本可让定位误差扩大4.8倍,为多模态模型的证据仲裁能力提供了可量化的评估框架。
06:35Greg Brockman66GPT-Live实时音频新架构发布GPT-Live 是一种用于实时音频的新架构和栈: GPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 规模下显得自然,我们从客户端到模型重建了语音栈。 这一新架构让音频持续流动,因此更深入的推理和工具使用不会打断对话。推荐理由:在 GPT-Live 架构下推理与工具调用期间音频流不间断,语音交互的等待感和打断感被显著消除,适用于需要持续对话的陪伴和协作场景。

8月3日周一

23:03SenseTime68商汤发布 SenseNova U1.5-Lite-Preview 开源模型商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。推荐理由:8B 参数的小模型在生成和编辑上接近闭源水平,有望降低轻量化多模态应用的门槛,但预览版功能可能尚不完整。
20:07Kimi.ai70Kimi Work 幻灯片制作教程发布使用 Kimi Work 制作幻灯片 - 教程 #1。 Kimi Slides 处理整个幻灯片制作流程: - 清晰的结构与研究,由 Kimi K3 驱动 - 连贯的设计,包括精美的图表和 SmartArts - 可编辑并可直接下载 欢迎在评论区告诉我们你还想看什么内容!推荐理由:教程展示了如何用 Kimi Slides 一站式完成幻灯片的结构、设计和下载,对需要快速产出演示文档的 Kimi 用户有直接可用性,但完整效果仍取决于实际模板和内容质量。
10:44公众号:MiniMax(稀宇科技)75MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。推荐理由:与多数开源视频模型不同,H3 原生支持同步生成立体声音频,且通过上下文再生成实现 2K 分辨率,为音视频生成应用提供了更完整的开源基座。
10:10Qwen:Blog Retrieval(API)89Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。推荐理由:首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。
精选
2026年8月9日星期日 · AI 自动挑选的高价值内容
全部模型产品行业论文教程观点

8月8日

星期六 · 1 条
17:11
IT之家(RSS)精选
76
苹果 Mac 简体中文支持文档更新,"Apple 智能"阿里千问扩展现身

苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。


推荐理由:苹果智能在中国大陆的落地路径终于清晰,支持文档揭示了写作工具和Siri集成千问的具体方式,Mac用户将能在系统级直接使用大模型能力。

8月7日

星期五 · 2 条
19:13
Runway@runwayml精选
75
Seedance 2.5 现已登陆 Runway。每次生成最多可引用 50 个角色参考,构建充满角色的完整世界;可创作最长 30 秒、带完整音效与对白的片段,再按你的故事需求随意剪辑与延展。点击下方链接立即开始。
另有 1 家信源报道X:Runway (@runwayml)
推荐理由:支持最多50个角色引用和30秒带对话的片段,从单镜头生成迈向构建完整场景,更适合需要连贯叙事的视频创意。
15:42
Krea@krea_ai精选
72
推出 Seedance 2.5。30 秒连续视频、完整多镜头序列,以及最多 50 个参考。立即试用 👇

推荐理由:连续30秒生成与多镜头序列支持,将视频创作从单次短片段推向长故事板,对需要连贯叙事的创作者更实用。

8月6日

星期四 · 3 条
21:12
NVIDIA Blog(RSS)精选
71
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。


推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。
21:11
OpenBMB@OpenBMB精选
65
面壁智能 AMNESIAC:反向图灵测试 AI 审讯游戏

面壁智能 OpenBMB 在 #BuildSmall 黑客松推出 AMNESIAC,一款反向图灵测试交互游戏:玩家需说服 AI 审讯官 A.M.N. 自己是人类。该游戏由 MiniCPM-o 4.5 驱动实时对话与推理,VoxCPM 生成审讯官语音,并结合摄像头面部表情、脉搏信号与响应计时进行多模态审讯。项目已开源至 HuggingFace。


推荐理由:将摄像头面部信号、语音对话和LoRA角色塑形组合进一个可玩演示,为交互式AI角色提供了比常见聊天机器人更丰富的多模态模板。
14:39
Alibaba Cloud@alibaba_cloud精选
81
Qwen-Image-3.0 已可投入生产。支持 4.5K token 提示词。100%+ 文本准确率(无破损 logo)。原生支持 12 种语言。定价灵活可扩展:高分辨率低至 $0.03。完整详情见图片。👉 探索:• Model Studio:https://click.alibabacloud.com/m/20000001606/ • Qwen Cloud:https://click.qwencloud.com/m/20000001648/ #Qwen #QwenImage3 #AlibabaCloud #GenerativeAI #AICreativity
另有 1 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)
推荐理由:文本渲染准确率从「需要后期修图」变为可能直接可用,多语言和透明定价让团队在商用评估时减少了不确定性。

8月5日

星期三 · 6 条
16:35
MarkTechPost(RSS)精选
79
NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。

另有 1 家信源报道IT之家(RSS)
推荐理由:轨迹与因果解释同时输出,可接入Halos安全验证,自动驾驶团队据此向监管证明决策合理性,减少黑盒依赖。
13:55
HuggingFace Daily Papers(社区热门论文)精选
74
Video-DeepResearch:迈向下一代多模态深度研究智能体

Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。


推荐理由:将深度研究从静态图像扩展到视频流,通过强制视觉定位再检索的两阶段训练,让模型摆脱了对文本搜索的路径依赖,给视频智能体研发提供了可验证的训练范式。
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
78
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

另有 2 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
11:08
Qwen@Alibaba_Qwen精选
68
阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。

Qwen Cloud: 🔔 Qwen-Image-3.0 is now live on Qwen Cloud! Ranked #1 among Chinese models and #2 among mainstream models in Arena. ai'...

另有 2 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。
02:00
OpenRouter@OpenRouter精选
66
@bfl_ai 的 FLUX 3 Video 现已在 OpenRouter 上向所有人开放。一个统一的视频、音频、图像和动作预测多模态模型家族。严肃、有趣、创意、真实、电影感,随你所需。基于统一架构联合训练。

推荐理由:联合训练的统一架构下,视频生成与图像、音频共享基础能力,跨模态创作的结果可能更连贯,改变了单独优化各模态的传统思路。
00:07
SenseTime@SenseTime_AI精选
67
商汤 SenseNova U1 开源:统一推理与图像生成

商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。

另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:把推理和图像生成整合进单一模型流,信息图模式和逐步教程展示了从推理到可视化的直接路径,为需要图文连贯输出的应用提供了可探索的开源方案。

8月4日

星期二 · 4 条
11:54
HuggingFace Daily Papers(社区热门论文)精选
70
SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成

SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。


推荐理由:通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。
11:54
HuggingFace Daily Papers(社区热门论文)精选
74
UEmbed:统一稀疏与稠密的多模态嵌入模型

UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。


推荐理由:UEmbed 让一个解码器模型同时输出稀疏与稠密多模态嵌入,稀疏模式精度接近稠密且原生适配倒排索引,对兼顾效率和精度的检索系统,省去了维护多套模型的开销。
08:00
HuggingFace Daily Papers(社区热门论文)精选
72
SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准

SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。


推荐理由:基准将场景文字冲突转化为连续的地理定位诊断,揭示对抗性文本可让定位误差扩大4.8倍,为多模态模型的证据仲裁能力提供了可量化的评估框架。
06:35
Greg Brockman@gdb精选
66
GPT-Live 是一种用于实时音频的新架构和栈:GPT-Live 可以在说话的同时聆听。为了让这种体验在 ChatGPT 规模下显得自然,我们从客户端到模型重建了语音栈。这一新架构让音频持续流动,因此更深入的推理和工具使用不会打断对话。

OpenAI: GPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 的规模下显得自然,我们从客户端到模型彻底重建了语音技术栈。 这一新架构让音频持续流动,因此更深入的推理和工具调用不会打断对话。

另有 1 家信源报道X:OpenAI (@OpenAI)
推荐理由:在 GPT-Live 架构下推理与工具调用期间音频流不间断,语音交互的等待感和打断感被显著消除,适用于需要持续对话的陪伴和协作场景。

8月3日

星期一 · 4 条
23:03
SenseTime@SenseTime_AI精选
68
商汤发布 SenseNova U1.5-Lite-Preview 开源模型

商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。

另有 1 家信源报道IT之家(RSS)
推荐理由:8B 参数的小模型在生成和编辑上接近闭源水平,有望降低轻量化多模态应用的门槛,但预览版功能可能尚不完整。
20:07
Kimi.ai@Kimi_Moonshot精选
70
使用 Kimi Work 制作幻灯片 - 教程 #1。Kimi Slides 处理整个幻灯片制作流程: • 清晰的结构与研究,由 Kimi K3 驱动 • 连贯的设计,包括精美的图表和 SmartArts • 可编辑并可直接下载欢迎在评论区告诉我们你还想看什么内容!

推荐理由:教程展示了如何用 Kimi Slides 一站式完成幻灯片的结构、设计和下载,对需要快速产出演示文档的 Kimi 用户有直接可用性,但完整效果仍取决于实际模板和内容质量。
10:44
公众号:MiniMax(稀宇科技)精选
75
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声

MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。

另有 3 家信源报道X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)
推荐理由:与多数开源视频模型不同,H3 原生支持同步生成立体声音频,且通过上下文再生成实现 2K 分辨率,为音视频生成应用提供了更完整的开源基座。
10:10
Qwen:Blog Retrieval(API)精选
89
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。

另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Nathan Lambert (@natolambert)X:阿易 AI Notes (@AYi_AInotes)X:Testing Catalog (@testingcatalog)公众号:数字生命卡兹克X:Kim (@kimmonismus)
推荐理由:首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。