Topic · 主题全部主题 →

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

3,091条收录
399条精选
● 持续更新

8月14日

星期五 · 3 条
23:22
Qwen@Alibaba_Qwen精选
AI 评分 71/100
通义千问开源 Qwen3.8 系列模型

通义千问兑现承诺,开源 Qwen3.8 系列模型。其中 Qwen3.8-27B 为原生多模态稠密模型,仅 27B 参数即全面超越 Qwen3.7-Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens,采用 Apache 2.0 许可。Max 级 Qwen3.8-2.4T-A95B 的开放权重也已同步发布。

另有 8 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)X:阿易 AI Notes (@AYi_AInotes)
推荐理由:官方称 27B 稠密多模态模型整体表现超过 Qwen3.7-Plus,262K 原生上下文可扩至 1M,Apache 2.0 协议下本地部署轻量应用多了一个更高效的选择。
19:31
公众号:小红书技术(dots.llm)精选
AI 评分 79/100
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

另有 1 家信源报道X:Kim (@kimmonismus)
推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
00:52
MiniMax:Blog(网页)精选
AI 评分 63/100
MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型

MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。

另有 2 家信源报道X:MiniMax (@MiniMax_AI)IT之家(RSS)
推荐理由:把简单描述扩展成包含配器进出、情绪曲线和演唱方式的专业模板,降低了非专业创作者控制音乐生成细节的门槛。

8月12日

星期三 · 2 条
15:13
IT之家(RSS)精选
AI 评分 71/100
LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI

LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。

另有 1 家信源报道MarkTechPost(RSS)
推荐理由:生成速度比同类快数倍,且开放权重允许微调,对需要高频出片或自定义视觉风格的应用,其自托管成本可能低于调用闭源API。
01:17
Google Blog:AI(RSS)精选
AI 评分 69/100
AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。


推荐理由:AMIE 在视频中融合视觉与听觉线索进行诊断,展示了多模态临床推理的可行性,对远程医疗产品方向有参考价值。

8月11日

星期二 · 1 条
13:47
MarkTechPost(RSS)精选
AI 评分 72/100
用 ComfyUI API 实现 MiniMax-H3 多模态视频与音频生成流水线

本教程演示如何以 ComfyUI 为无头推理后端,构建端到端的 MiniMax-H3 视频生成工作流。通过 Python 直接构建执行图,支持文生视频、首尾帧条件生成和参考图像条件生成,并自动根据 GPU 显存选择 quality、balanced、squeeze 三种权重配置。流水线涵盖模型自动下载、节点模式校验、音视频联合解码与进度监控,无需图形界面即可复现实验。


推荐理由:用 Python 编程替代 ComfyUI 图形界面,在 Colab 上搭建 MiniMax-H3 视频生成管道,并自动适配不同 GPU 显存方案,教程提供的全流程代码可直接复用。

8月10日

星期一 · 3 条
19:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。


推荐理由:SGLang对Muse Glimmer的优化使30B多模态模型在RTX 5090上达到236 tok/s用户速度,本地智能体工作流不再受限于云端延迟。
12:14
Qwen@Alibaba_Qwen精选
AI 评分 71/100
👀 看见只是开始。借助 Qwen-MM-Plugins,让你的智能体原生支持多模态--读取图片、视频和文档,编辑视频,处理 3D/CAD,以及更多。从多模态模型 → 多模态智能体。🚀观看实际效果:https://github.com/QwenLM/Qwen-MM-Plugins

推荐理由:让智能体直接获得视觉、文档和 3D 感知能力,把原本需要单独集成的工作流变成一组可调用的插件,原型开发速度可能因此加快。
08:14
MarkTechPost(RSS)精选
AI 评分 75/100
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。


推荐理由:端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。

8月8日

星期六 · 1 条
17:11
IT之家(RSS)精选
AI 评分 76/100
苹果 Mac 简体中文支持文档更新,"Apple 智能"阿里千问扩展现身

苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。


推荐理由:苹果智能在中国大陆的落地路径终于清晰,支持文档揭示了写作工具和Siri集成千问的具体方式,Mac用户将能在系统级直接使用大模型能力。

8月7日

星期五 · 2 条
19:13
Runway@runwayml精选
AI 评分 75/100
Seedance 2.5 现已登陆 Runway。每次生成最多可引用 50 个角色参考,构建充满角色的完整世界;可创作最长 30 秒、带完整音效与对白的片段,再按你的故事需求随意剪辑与延展。点击下方链接立即开始。
另有 1 家信源报道X:Runway (@runwayml)
推荐理由:支持最多50个角色引用和30秒带对话的片段,从单镜头生成迈向构建完整场景,更适合需要连贯叙事的视频创意。
15:42

8月6日

星期四 · 3 条
21:12
NVIDIA Blog(RSS)精选
AI 评分 71/100
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。


推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。
21:11
OpenBMB@OpenBMB精选
AI 评分 65/100
面壁智能 AMNESIAC:反向图灵测试 AI 审讯游戏

面壁智能 OpenBMB 在 #BuildSmall 黑客松推出 AMNESIAC,一款反向图灵测试交互游戏:玩家需说服 AI 审讯官 A.M.N. 自己是人类。该游戏由 MiniCPM-o 4.5 驱动实时对话与推理,VoxCPM 生成审讯官语音,并结合摄像头面部表情、脉搏信号与响应计时进行多模态审讯。项目已开源至 HuggingFace。


推荐理由:将摄像头面部信号、语音对话和LoRA角色塑形组合进一个可玩演示,为交互式AI角色提供了比常见聊天机器人更丰富的多模态模板。

8月5日

星期三 · 6 条
16:35
MarkTechPost(RSS)精选
AI 评分 79/100
NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。

另有 1 家信源报道IT之家(RSS)
推荐理由:轨迹与因果解释同时输出,可接入Halos安全验证,自动驾驶团队据此向监管证明决策合理性,减少黑盒依赖。
13:55
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
Video-DeepResearch:迈向下一代多模态深度研究智能体

Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。


推荐理由:将深度研究从静态图像扩展到视频流,通过强制视觉定位再检索的两阶段训练,让模型摆脱了对文本搜索的路径依赖,给视频智能体研发提供了可验证的训练范式。
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
11:08
Qwen@Alibaba_Qwen精选
AI 评分 68/100
阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。

Qwen Cloud: 🔔 Qwen-Image-3.0 is now live on Qwen Cloud! Ranked #1 among Chinese models and #2 among mainstream models in Arena. ai'...

另有 2 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。
02:00
OpenRouter@OpenRouter精选
AI 评分 66/100
@bfl_ai 的 FLUX 3 Video 现已在 OpenRouter 上向所有人开放。一个统一的视频、音频、图像和动作预测多模态模型家族。严肃、有趣、创意、真实、电影感,随你所需。基于统一架构联合训练。

推荐理由:联合训练的统一架构下,视频生成与图像、音频共享基础能力,跨模态创作的结果可能更连贯,改变了单独优化各模态的传统思路。
00:07
SenseTime@SenseTime_AI精选
AI 评分 67/100
商汤 SenseNova U1 开源:统一推理与图像生成

商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。

另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:把推理和图像生成整合进单一模型流,信息图模式和逐步教程展示了从推理到可视化的直接路径,为需要图文连贯输出的应用提供了可探索的开源方案。

8月4日

星期二 · 4 条
11:54
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成

SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。


推荐理由:通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。
11:54
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
UEmbed:统一稀疏与稠密的多模态嵌入模型

UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。


推荐理由:UEmbed 让一个解码器模型同时输出稀疏与稠密多模态嵌入,稀疏模式精度接近稠密且原生适配倒排索引,对兼顾效率和精度的检索系统,省去了维护多套模型的开销。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准

SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。


推荐理由:基准将场景文字冲突转化为连续的地理定位诊断,揭示对抗性文本可让定位误差扩大4.8倍,为多模态模型的证据仲裁能力提供了可量化的评估框架。
06:35
Greg Brockman@gdb精选
AI 评分 66/100
GPT-Live 是一种用于实时音频的新架构和栈:GPT-Live 可以在说话的同时聆听。为了让这种体验在 ChatGPT 规模下显得自然,我们从客户端到模型重建了语音栈。这一新架构让音频持续流动,因此更深入的推理和工具使用不会打断对话。

OpenAI: GPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 的规模下显得自然,我们从客户端到模型彻底重建了语音技术栈。 这一新架构让音频持续流动,因此更深入的推理和工具调用不会打断对话。

另有 1 家信源报道X:OpenAI (@OpenAI)
推荐理由:在 GPT-Live 架构下推理与工具调用期间音频流不间断,语音交互的等待感和打断感被显著消除,适用于需要持续对话的陪伴和协作场景。

8月3日

星期一 · 4 条
23:03
SenseTime@SenseTime_AI精选
AI 评分 68/100
商汤发布 SenseNova U1.5-Lite-Preview 开源模型

商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。

另有 1 家信源报道IT之家(RSS)
推荐理由:8B 参数的小模型在生成和编辑上接近闭源水平,有望降低轻量化多模态应用的门槛,但预览版功能可能尚不完整。
20:07
Kimi.ai@Kimi_Moonshot精选
AI 评分 70/100
使用 Kimi Work 制作幻灯片 - 教程 #1。Kimi Slides 处理整个幻灯片制作流程: • 清晰的结构与研究,由 Kimi K3 驱动 • 连贯的设计,包括精美的图表和 SmartArts • 可编辑并可直接下载欢迎在评论区告诉我们你还想看什么内容!

推荐理由:教程展示了如何用 Kimi Slides 一站式完成幻灯片的结构、设计和下载,对需要快速产出演示文档的 Kimi 用户有直接可用性,但完整效果仍取决于实际模板和内容质量。
10:44
公众号:MiniMax(稀宇科技)精选
AI 评分 75/100
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声

MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。

另有 3 家信源报道X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)
推荐理由:与多数开源视频模型不同,H3 原生支持同步生成立体声音频,且通过上下文再生成实现 2K 分辨率,为音视频生成应用提供了更完整的开源基座。
10:10
Qwen:Blog Retrieval(API)精选
AI 评分 89/100
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。

另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Nathan Lambert (@natolambert)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)公众号:数字生命卡兹克X:Testing Catalog (@testingcatalog)
推荐理由:首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。

8月2日

星期日 · 1 条
14:31

7月31日

星期五 · 6 条
21:42
公众号:百度智能云(文心)精选
AI 评分 66/100
百度搭子一镜Skill:一句话生成数字人口播视频

百度搭子内置的一镜Skill支持仅凭一句话或一个主题,自动完成脚本生成、声音、数字人形象、口型驱动和视频渲染,生成可直接播放的数字人口播视频,全程无需拍摄、剪辑和露脸。该功能适用于旅游攻略、产品种草、知识科普、临时活动宣传、企业内部培训及个人IP起步等场景,大幅降低视频制作门槛。


推荐理由:拆解了从想法到成品视频的全链路,非专业用户能直观理解脚本生成、数字人驱动等环节如何协作,有助于判断这类工具能否嵌入现有创作流程。
17:59
MiniMax:Blog(网页)精选
AI 评分 78/100
MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频

MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。

另有 4 家信源报道X:MiniMax (@MiniMax_AI)X:Testing Catalog (@testingcatalog)X:X.PIN (@thexpin)X:Artificial Analysis (@ArtificialAnlys)
推荐理由:MiniMax H3 把全模态生成打到了 2K 分辨率且价格不到主流三分之一,还计划开源权重,这对闭源视频模型是实打实的压力,开发者可以重点关注。
12:06
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 80/100
字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑

字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。

另有 8 家信源报道X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)公众号:火山引擎X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)
推荐理由:Seedance 2.5 把单次生成拉到 30 秒,加上多模态参考和精准编辑,让视频创作从片段拼凑变成完整叙事。对国内创作者来说,这是即梦和豆包里能马上用到的最强视频模型。
10:21
公众号:数字生命卡兹克精选
AI 评分 69/100
MiniMax H3 发布并将开源,主打视觉包装与后期特效

MiniMax 发布 AI 视频模型 H3,并宣布开源。该模型主打视觉包装与后期特效,可生成动态 MV、动态海报、Vlog、电影片头、游戏 UI 等,语义遵循能力极强,在广告与动效领域表现优于 Seedance 2.0,但影视级张力镜头稍逊。H3 开源后预计将出现大量垂直领域特化版本。

另有 4 家信源报道IT之家(RSS)X:MiniMax (@MiniMax_AI)MarkTechPost(RSS)The Decoder:AI News(RSS)
推荐理由:在 Seedance 统治的前期创作之外,H3 用语义强控制补上了视觉包装与后期特效这块拼图,广告和社媒短片的后期流程可能因此从剪辑软件迁移到提示词。
03:16
Google AI@GoogleAI精选
AI 评分 69/100
Google Earth 集成 Nano Banana 2 图像生成

Google Earth 网页版上线基于 Nano Banana 2 的图像生成功能,用户可通过文本提示词将卫星与 3D 影像结合,重新想象全球任意地点(如百年前的城市风貌或社区新球场)。该功能现已面向所有用户开放。


推荐理由:Google 把图像生成塞进地球,直接用 Nano Banana 2 在卫星图上创作,门槛低得谁都能玩,做城市设计或创意提案的人可以立刻试试。
01:57
Thinking Machines@thinkymachines精选
AI 评分 64/100
今天,我们发布 Inkling-Small。Inkling-Small 在仅为 Inkling 四分之一规模的情况下,实现了与之相当的性能。它拥有 276B 总参数,12B 激活参数。我们将开放完整权重。https://thinkingmachines.ai/news/inkling-small/现在即可在 Tinker 上对其进行微调,或在 Tinker Playground 中以文本、图像和音频形式与之对话。另有 7 家信源报道X:Rohan Paul (@rohanpaul_ai)IT之家(RSS)X:Kim (@kimmonismus)X:Artificial Analysis (@ArtificialAnlys)The Decoder:AI News(RSS)MarkTechPost(RSS)X:Testing Catalog (@testingcatalog)
推荐理由:Inkling-Small 将 Inkling 的性能塞进 1/4 大小的模型,权重完全开放,还支持文本、图像、音频,对想用低成本体验顶尖能力的开发者是个值得上手的信号。

7月30日

星期四 · 2 条
23:27
Google DeepMind:Blog(RSS)精选
AI 评分 60/100
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人

Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。

另有 4 家信源报道IT之家(RSS)Ars Technica:AI(RSS)X:Google AI for Developers (@googleaidevs)X:Testing Catalog (@testingcatalog)
推荐理由:DeepMind 把 Gemini 带到机器人领域,视频理解、任务编排和多机协作的叙事很宏大,但全是愿景,没有实测数据,是不是真正的 step change 得等细节。做机器人的可以先建个追踪。
00:26
Google DeepMind:Blog(RSS)精选
AI 评分 63/100
Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制

Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长。

另有 2 家信源报道The Decoder:AI News(RSS)IT之家(RSS)
推荐理由:Lyria 3.5 把音乐生成从玩具级推到了可用创作工具级别,歌词和情感人声的提升对内容创作者是实实在在的福音。

7月29日

星期三 · 1 条
23:56
TechCrunch:AI(RSS)精选
AI 评分 73/100
Martha Stewart 联合创办 AI 初创公司 Hint,为房主提供家居管理 AI 助手

Hint 今日上线,利用 AI 技术帮助房主管理维护计划、能耗、土壤与空气质量、保险理赔等事务,并支持存储和查询房屋相关合同与文件。该应用基于公开数据为每栋房屋建立档案,通过 AI 聊天机器人回答个性化问题,并提供主动维护提醒与“房屋评分”。Hint 目前免费提供 iOS 版,无订阅或广告,未来计划推出付费高级功能。


推荐理由:Martha Stewart 以联合创始人身份加入 Hint 绝非挂名,她亲自打磨体验,这个 AI 家居助手整合了图像识别和文档查询,让房主终于有了一个可用的家庭管理中枢,是 AI 从聊天走向实用的一次有趣尝试。

7月28日

星期二 · 1 条
03:02
Kimi.ai@Kimi_Moonshot精选
AI 评分 73/100
Kimi 发布视觉感知基准 PerceptionBench

Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。

另有 1 家信源报道HuggingFace Daily Papers(社区热门论文)
推荐理由:从模型失败中反向定义原子感知,把视觉感知从推理里拆出来很聪明,开源数据和方法对做视觉评测的产品人很有参考价值。