Topic · 主题全部主题 →

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

3,704条收录
405条精选

精选归档 · 第 15 页

281300 条 · 共 405

5月20日

星期三 · 4 条
02:18
Google Blog:AI(RSS)精选
AI 评分 75/100
Google Workspace 推出全新创建方式与高效工作功能

Google 在最新更新中为 Gmail、Docs 和 Keep 增添了新的语音功能,并推出了一款名为 Google Pics 的全新设计工具。同时,其 AI Inbox 功能也得到了升级与优化。这些更新旨在进一步提升用户在工作场景中的协作效率与创作体验,通过集成更智能的工具和交互方式,帮助用户更便捷地完成多项任务。


推荐理由:Google Workspace 直接植入了语音操作和设计工具 Pics,这波更新对办公效率很实在,做产品和运营的可以关注一下实际落地效果。
01:48
Google DeepMind:Blog(RSS)精选
AI 评分 83/100
推出Gemini Omni多模态AI模型

谷歌推出原生多模态AI模型Gemini Omni,能够整合视频、图像、音频和文本等多种输入,生成高质量视频内容。其核心能力是通过自然语言对话进行视频编辑,并能保持角色一致性、物理规律与场景连贯性。首个模型Gemini Omni Flash已上线,未来将支持图像和音频输出。Gemini Omni结合了对物理世界的直觉理解与丰富的知识库,支持从写实到叙事的创意生成,并可通过多轮对话持续编辑视频,而不丢失原始场景上下文。

另有 17 家信源报道IT之家(RSS)Google Developers Blog(RSS)Google Blog:AI(RSS)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Jeff Dean (@JeffDean)X:Logan Kilpatrick (@OfficialLoganK)Hacker News 热门(buzzing.cc 中文翻译)X:Google DeepMind (@GoogleDeepMind)X:阿易 AI Notes (@AYi_AInotes)The Verge:AI(RSS)X:Ethan Mollick (@emollick)X:Kim (@kimmonismus)X:Sundar Pichai (@sundarpichai)X:Google AI for Developers (@googleaidevs)X:Rohan Paul (@rohanpaul_ai)The Decoder:AI News(RSS)
推荐理由:Gemini Omni 把视频生成从画面堆砌推到了物理世界叙事,多轮自然语言编辑和世界知识融合是真正的代际升级,做视频内容的该重新理解工具的定义了。
01:36
🚨 AI News | TestingCatalog@testingcatalog精选
AI 评分 75/100
谷歌发布Gemini Omni Flash,Pro版即将推出GOOGLE I/O 🔥: GEMINI OMNI FLASH HAS BEEN ANNOUNCED AND IS NOW AVAILABLE ON GEMINI AND GOOGLE FLOW.GEMINI OMNI PRO IS COMING SOON 🤩谷歌 I/O 🔥:GEMINI OMNI FLASH 已发布,现已在 GEMINI 和 GOOGLE FLOW 上可用。 GEMINI OMNI PRO 即将推出 🤩

Google DeepMind: Omni brings together an improved understanding of physics with Gemini's knowledge of history, biology, and culture, brid...


推荐理由:Gemini Omni Flash 是 Google 对多模态生成的新尝试,把物理模拟和历史叙事揉在一起,做视频内容的人可以盯着看。
01:30
Chubby♨️@kimmonismus精选
AI 评分 77/100
Gemini Omni发布,迈向AGI新进展„Progress towards AGI“: Gemini Omni• world models -Gemini Omni official!!It can create anything from any input!!!"迈向AGI的进展":Gemini Omni • 世界模型 -Gemini Omni官方发布!! 它可以从任何输入创建任何内容!!!

Chubby♨️: Cap-ex at google is increasing at roughly 6x per year!


推荐理由:Google 放出 Gemini Omni,从任何输入生成任何内容,这个能力宣言直接把生成式 AI 的边界推到极限。虽然细节还不明朗,但看这架势,模型竞赛又要烧一把火。

5月19日

星期二 · 7 条
23:18
Qwen:Blog Retrieval(API)精选
AI 评分 77/100
Qwen3.5-LiveTranslate:从声音到视觉,从词语到准确

Qwen3.5-LiveTranslate-Flash 是 Qwen 家族最新的同声传译模型,基于 Qwen3.5-Omni 架构,支持实时多模态翻译(音频、视频及视觉上下文)。语言覆盖大幅扩展:输入音频与输出文本从18种增至60种,输出音频从10种增至29种。采用 Readable Unit 技术,平均端到端每 token 延迟降至2.8秒,相比前代首 token 延迟降低3.45秒、每 token 延迟降低1.88秒。支持一句话启动的实时语音克隆和可动态配置的热词增强。在 FLEURS 和 CoVoST2 基准上翻译准确率超越主流商用大语音模型。


推荐理由:这个版本让同声传译从“能用”变成了“好用”,语言覆盖从 18 跃升 60,延迟压到 2.8 秒,加上视觉消除歧义,做国际业务和直播的人值得跟进。
20:07
Apple:Newsroom(RSS)精选
AI 评分 57/100
苹果发布全新辅助功能,并引入Apple Intelligence进行更新

苹果公司宣布推出由Apple Intelligence驱动的重大辅助功能更新。此次更新为VoiceOver、放大镜(Magnifier)和语音控制(Voice Control)功能引入了新的能力,旨在提升残障用户设备的可用性。这是苹果首次将Apple Intelligence应用于其辅助功能技术组合。


推荐理由:Apple Intelligence为无障碍功能带来自然语言交互和更智能的视觉辅助,是不错的方向,但全是远期承诺,现在还不能上手。
12:55
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
StableVLA:无需额外数据的鲁棒视觉-语言-动作模型

视觉-语言-动作模型在面对训练数据未涵盖的视觉干扰时性能显著下降。为此,本文提出一种基于信息论的轻量级适配器模块(IB-Adapter),能从视觉输入中选择性过滤噪声,且无需额外数据或增强策略。该适配器以少于1000万的额外参数,平均提升性能30%。实验表明,即使骨干网络参数仅为0.5B(较现有7B模型小14倍),StableVLA在合成与真实视觉损坏场景下的长时程任务中,仍能达到与大模型相当的鲁棒性,并超越OpenPi基线。


推荐理由:VLA 模型在真实世界一遇到光照遮挡就崩,这篇用信息瓶颈原理做的轻量适配器,不加数据就拉回 30% 性能,还用 0.5B 小模型打平 7B,做机器人落地的团队值得看看。
03:50
03:34
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
Qwen 3.7 预览版
推荐理由:阿里 Qwen 3.7 预览版来了,国产模型在推理和多模态上的推进速度令人侧目,虽然还是预览,但已经是一个值得开发者提前盯紧的信号。

5月18日

星期一 · 3 条
23:52
Hugging Face:Blog(RSS)精选
AI 评分 68/100
PaddleOCR 3.5:使用Transformers后端运行OCR和文档解析任务

PaddleOCR 发布 3.5 版本,正式将 Transformers 确立为运行 PP-OCRv5 及 PaddleOCR-VL 1.5 模型的可选推理后端之一。此次更新引入了更灵活的 engineengine_config 参数,允许开发者自主选择后端并配置数据类型、设备等选项。其核心价值在于,显著降低了将文档处理能力集成至以 Transformers 为中心的主流开发栈(如 RAG、智能体、文档AI)的门槛,使开发者能更便捷地利用现有生态,减少集成阻力,从而专注于下游应用构建。


推荐理由:PaddleOCR 3.5 最大的变化不是新模型,而是终于能跑在 Transformers 上了,做 RAG 和文档智能的开发者可以少写一堆胶水代码。
15:50
Elon Musk@elonmusk精选
AI 评分 75/100
Grok现已支持视频理解与分析Grok groks videosGrok可以处理视频了 【引用 @XFreeze】:你现在可以将整个视频上传给Grok,让它实时为你分析、总结、翻译、解释场景或提取重要上下文。 Grok能够理解完整的视频--而不仅仅是图像和文本。 它具备原生多模态能力和极其强大的视觉理解能力。

X Freeze: You can now upload entire videos to Grok and have it analyze, summarize, translate, explain scenes, or extract important...


推荐理由:Grok 补上了视频理解这块拼图,不是抽帧而是整个视频的上下文分析,做媒体和内容的人多了一个实用的多模态工具,可以上手试试。
11:19

5月17日

星期日 · 1 条
21:43
Google DeepMind:Blog(RSS)精选
AI 评分 63/100
让了解网络内容的创建和编辑过程变得更简单

平台宣布扩展其内容透明工具,旨在让用户更便捷地追溯网络内容的创建与编辑历史。这项更新将适用于社交媒体平台、网页内容等多个场景,帮助用户识别信息的修改痕迹,提升数字内容的透明度。


推荐理由:Google 把 SynthID 水印和 C2PA 凭证推向搜索、Chrome 和 API,普通人也能随手查「这是 AI 做的吗?」,这对虚假信息是实际的约束。

5月16日

星期六 · 1 条
06:50
Google DeepMind:Blog(RSS)精选
AI 评分 75/100
Gemini 3.5:具备行动能力的前沿智能

Google发布了Gemini 3.5模型,该模型专注于提升执行复杂任务的能力。其核心特点是支持“代理式工作流”,即能够像助手一样自主规划并执行一系列多步骤、复杂的操作,旨在将先进的语言理解与实际问题解决能力相结合。

另有 17 家信源报道IT之家(RSS)Google Developers Blog(RSS)Google Blog:AI(RSS)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Jeff Dean (@JeffDean)X:Logan Kilpatrick (@OfficialLoganK)Hacker News 热门(buzzing.cc 中文翻译)X:Google DeepMind (@GoogleDeepMind)X:阿易 AI Notes (@AYi_AInotes)The Verge:AI(RSS)X:Ethan Mollick (@emollick)X:Kim (@kimmonismus)X:Sundar Pichai (@sundarpichai)X:Google AI for Developers (@googleaidevs)X:Rohan Paul (@rohanpaul_ai)The Decoder:AI News(RSS)
推荐理由:Gemini 3.5 Flash 把前沿级智能体和编程能力塞进了极低延迟和成本,四倍于竞品速度的同时基准表现超过 3.1 Pro,这可能是今年对开发者最实用的基座模型之一。

5月15日

星期五 · 3 条
11:02
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 56/100
蚂蚁集团提出 ARGenSeg-8B:基于自回归图像生成模型的图像分割框架

蚂蚁集团推出 ARGenSeg-8B,一种将多模态理解与像素级感知统一的自回归图像生成分割框架。它利用多模态大语言模型(MLLM)输出视觉 token,并通过通用 VQ-VAE 解码为分割掩码,使分割完全依赖 MLLM 的像素级理解。采用 next-scale-prediction 策略并行生成视觉 token,降低推理延迟。在多个分割数据集上超越此前最优方法,推理速度显著提升。论文已被 NeurIPS 2025 接收,模型已发布在 HuggingFace。


推荐理由:蚂蚁提出用自回归生成做分割,把理解和像素级感知统一到一个框架里,多个数据集SOTA且速度更快,做CV的值得看看。
10:18
SenseTime@SenseTime_AI精选
AI 评分 70/100
SenseNova-U1空间智能突破,开源最大空间问答数据集This is the frontier our innovators strive for. Excited to see passionate minds driving it forward.🔥主推文赞扬了创新者在前沿领域的探索。引用的推文具体指出,SenseNova-U1在空间智能能力上取得进展,其关键基准测试表现超越了Qwen3.5等强劲基线。同时,团队开源了目前最大的空间问答数据集SenseNova-SI-8M,并邀请业界在CVPR会议进行线下交流。

Zhongang Cai: Excited to have contributed to the spatial intelligence capabilities of SenseNova-U1, surpassing strong baselines such a...

另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤的 SenseNova-U1 在空间智能基准上压过 Qwen3.5,还顺手开源了目前最大的空间 QA 数据集 SenseNova-SI-8M,搞具身智能和多模态的可以直接抱走数据。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
PAGER:弥合点精确几何图形界面控制中的语义-执行鸿沟

研究针对需要点级精度的几何图形界面控制任务,揭示了现有视觉-语言模型存在的语义-执行鸿沟:通用模型动作类型准确率高但任务成功率极低。为此,我们构建了包含4,906个问题、超过22.4万次像素级动作的PAGE Bench基准,并提出了拓扑感知智能体PAGER。该智能体通过依赖结构规划与像素级执行分解任务,结合像素接地监督调优与精度对齐强化学习,将任务成功率提升至最强通用基线的4.1倍,步骤成功率从GUI专用智能体的不足9%提高到62%以上,实现了点精确GUI控制的新突破。


推荐理由:GUI agent一直绕着精确点击走,这篇直接硬碰硬,把成功率从6%拉到62%,做CAD自动化或工业软件的团队可以重点关注。

5月14日

星期四 · 1 条
11:53
CMU:Machine Learning Blog精选
AI 评分 63/100
教视觉-语言模型说"电影语言"

研究团队与百余名专业创作者历时一年,构建了一个视频描述生成流程,其核心在于扩展精细化的人类-AI协同监督,而非单纯扩大模型规模。该研究(入选CVPR 2026亮点论文)指出,当前主流视频生成模型在理解和生成具有电影感的专业运镜(如希区柯克式滑动变焦、精确的焦点转移或荷兰角镜头)时存在明显不足,常产出通用或焦点错误的画面。这项工作揭示了一条通过提升监督质量来增强模型“电影语言”表达能力的新路径。


推荐理由:这篇CVPR 2026 Highlight的博客版很有意思,它用100多个专业电影人来标注视频,教VLM学会推拉摇移的镜头语言,不是又多一个数据集,而是提醒我们:高质量的人工标注可能比堆模型更重要。