内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态一手 · 431 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「多模态」清除

8月15日周六

01:51OpenRouter:Announcements(RSS)60OpenRouter 视觉指南:如何通过 API 向多模态模型发送图像

8月14日周五

19:31公众号:小红书技术(dots.llm)79精选dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理
00:52MiniMax:Blog(网页)63精选MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型

8月12日周三

22:18Google DeepMind:Blog(RSS)35Google DeepMind 推出手语转文本模型 SL2T,为聋哑及听障用户带来新功能
01:17Google Blog:AI(RSS)69精选AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

8月11日周二

11:01公众号:千问APP(阿里)48千问开放AI眼镜生态,支持自建导游、教练、巡检等多种Skill

8月10日周一

19:51LMSYS:Blog(Chatbot Arena 团队)72精选SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

8月8日周六

12:31公众号:MiniMax(稀宇科技)53MiniMax H3 开源首周 AMA:技术团队回应稀疏注意力、长视频续写与推理优化
00:31Databricks:Blog(RSS)57Databricks 推出 FILE 原生列类型,面向多模态数据

8月7日周五

22:01公众号:昆仑万维(天工)57SkyProduction天工短剧工作台接入Seedance 2.5,720P低至0.4元/秒

8月6日周四

21:12NVIDIA Blog(RSS)71精选NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

8月5日周三

18:00公众号:小红书技术(dots.llm)46小红书"问一问"多模态推理加速实践:让视觉 Token 更精简、MoE 专家更聚焦
12:12字节 Seed:Research Feed(网页内嵌数据)78精选字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互
02:31Black Forest Labs:Blog(网页)43FLUX 3 Video, Part 1: Generation

8月4日周二

08:40公众号:MiniMax(稀宇科技)48MiniMax H3 开源 24 小时,超百家企业 Day 0 上线

8月3日周一

23:52Apple Machine Learning Research(RSS)51多模态大语言模型对齐的全面研究:Apple 团队独立拆解偏好对齐各环节
10:44公众号:MiniMax(稀宇科技)75精选MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声
10:10Qwen:Blog Retrieval(API)89精选Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

8月2日周日

21:56Nathan Lambert:Interconnects(RSS)45最新开源模型盘点(#23):Laguna S2.1、Inkling 与 Kimi K3 展现开源模型在帕累托前沿的价值
19:51公众号:百度智能云(文心)40百度智能云张玮ChinaJoy谈AI重构游戏产业:从效率赋能迈向体验重构

8月1日周六

04:34Runway:News(网页)49Runway Characters 入选 SIGGRAPH 2026 Real-Time Live! 现场演示

7月31日周五

21:42公众号:百度智能云(文心)66精选百度搭子一镜Skill:一句话生成数字人口播视频
17:59MiniMax:Blog(网页)78精选MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频
12:06字节 Seed:Research Feed(网页内嵌数据)80精选字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑

7月30日周四

23:27Google DeepMind:Blog(RSS)60精选Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人
00:26Google DeepMind:Blog(RSS)63精选Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制

7月29日周三

20:08公众号:火山引擎46从智能座舱到爆款视频,中国品牌全球化如何用AI找增量
12:00公众号:小红书技术(dots.llm)37小红书 dots 团队提出 Vision-OPD,让 9B 模型细粒度视觉理解超越 GPT-5.4

7月28日周二

19:00公众号:小红书技术(dots.llm)56小红书 dots 团队提出 Vision-OPD,让多模态大模型"看清细节"
18:01公众号:面壁智能(MiniCPM)53海外开发者用 OpenClaw + MiniCPM-V 4.6 搭建本地视觉私人助理,让图片进入 AI 工作流
12:00公众号:豆包(字节)38豆包携手人教社发起「经典课文名师 AI 共创计划」,Seedance 视频模型还原《桃花源记》
12:00公众号:月之暗面(Kimi)85精选Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

7月27日周一

23:35公众号:月之暗面(Kimi)81精选Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放
23:00公众号:百度智能云(文心)49百度智能云领跑中国AI游戏云市场,市场份额超第2-5名总和

7月24日周五

18:10公众号:小红书技术(dots.llm)49小红书等提出 UniNote:统一多模态嵌入模型
18:00公众号:小红书技术(dots.llm)40UniNote:小红书等提出统一多模态嵌入模型,融合表征与排序
12:00公众号:龙猫LongCat(美团)68精选MineExplorer:首个《我的世界》分钟级长程任务评测基准发布
03:55Claude:Blog(网页)75精选Claude 语音模式现已支持 Opus、Sonnet 及连接工具与多语言

7月23日周四

19:58公众号:龙猫LongCat(美团)62同事件MineExplorer:美团 LongCat 评测揭示顶级多模态大模型在动态开放世界中的能力断层同一事件,精选展示《MineExplorer:首个《我的世界》分钟级长程任务评测基准发布》
17:25Google AI:DEV 作者专属(RSS)73精选Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布
已加载 40 条
全部 AI 动态
2026年8月17日星期一 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
一手信源 · 标签「多模态」 · 431 条清除

8月15日

星期六 · 1 条
01:51
OpenRouter:Announcements(RSS)
AI 评分 60/100
OpenRouter 视觉指南:如何通过 API 向多模态模型发送图像

OpenRouter 发布视觉指南,详解通过 Chat Completions API 向多模态模型发送图像的方法。请求体采用 messages 数组,用户消息的 content 包含 text 和 image_url 两部分,支持公开 URL 或 base64 数据 URL 两种格式,兼容 PNG、JPEG、WebP 和 GIF。

检索增强多模态教程/实践

8月14日

星期五 · 2 条
19:31
公众号:小红书技术(dots.llm)精选
AI 评分 79/100
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

智能体Hugging Face多模态开源生态
另有 1 家信源报道X:Kim (@kimmonismus)
推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
00:52
MiniMax:Blog(网页)精选
AI 评分 63/100
MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型

MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。

多模态开源生态模型发布
另有 2 家信源报道IT之家(RSS)X:MiniMax (@MiniMax_AI)
推荐理由:把简单描述扩展成包含配器进出、情绪曲线和演唱方式的专业模板,降低了非专业创作者控制音乐生成细节的门槛。

8月12日

星期三 · 2 条
22:18
Google DeepMind:Blog(RSS)
AI 评分 35/100
Google DeepMind 推出手语转文本模型 SL2T,为聋哑及听障用户带来新功能

Google DeepMind 发布手语转文本(SL2T)模型,为聋哑及听障用户提供新的手语功能。该模型是此次发布的突破性技术核心,旨在将手语实时转化为文本,帮助用户更顺畅地沟通。目前尚未公布具体参数规模、基准测试分数或可用性细节。

DeepMind多模态模型发布
01:17
Google Blog:AI(RSS)精选
AI 评分 69/100
AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。

Google多模态推理论文/研究

推荐理由:AMIE 在视频中融合视觉与听觉线索进行诊断,展示了多模态临床推理的可行性,对远程医疗产品方向有参考价值。

8月11日

星期二 · 1 条
11:01
公众号:千问APP(阿里)
AI 评分 48/100
千问开放AI眼镜生态,支持自建导游、教练、巡检等多种Skill

千问开放平台上线,支持APP、PC和AI眼镜三端,在眼镜端提供技能平台和行业定制两大模块。开发者可调用眼镜拍照、语音交互等能力创建导游、教练等Skill,也可为视障群体开发“身边有什么”等辅助技能。平台面向行业客户提供巡检等定制能力,并计划陆续开放空间3D立体显示、运动健康状态感知等更多眼镜能力。

产品更新多模态端侧

8月10日

星期一 · 1 条
19:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。

智能体Meta多模态模型发布

推荐理由:SGLang对Muse Glimmer的优化使30B多模态模型在RTX 5090上达到236 tok/s用户速度,本地智能体工作流不再受限于云端延迟。

8月8日

星期六 · 2 条
12:31
公众号:MiniMax(稀宇科技)
AI 评分 53/100
MiniMax H3 开源首周 AMA:技术团队回应稀疏注意力、长视频续写与推理优化

MiniMax H3 技术团队在 Reddit AMA 和 ComfyUI 直播中回应开发者提问:模型不使用 MSA,稀疏注意力策略更接近 MoBA,默认仅对视频 token 做 3D sparsification,近期将发布保守版本。

多模态教程/实践视频
00:31
Databricks:Blog(RSS)
AI 评分 57/100
Databricks 推出 FILE 原生列类型,面向多模态数据

Databricks 发布 FILE 原生列类型,用于在 Lakehouse 中直接存储和管理多模态数据。该类型将文件作为一等公民纳入表结构,支持图像、音频、视频等非结构化数据与结构化数据统一处理,简化了多模态数据管线的构建与查询。

产品更新多模态数据/训练

8月7日

星期五 · 1 条
22:01
公众号:昆仑万维(天工)
AI 评分 57/100
SkyProduction天工短剧工作台接入Seedance 2.5,720P低至0.4元/秒

SkyProduction天工短剧工作台正式接入Seedance 2.5,720P低至0.4元/秒、480P低至0.3元/秒,支持单段最长30秒视频直出、50个参考素材及10余种语言。同期推出“短剧出海转绘”功能,可将中文短剧快速本土化为欧美市场内容;三部通过该工作台创作的AI短剧已上线DramaWave,单部营收均达200万美元级别。

产品更新多模态视频

8月6日

星期四 · 1 条
21:12
NVIDIA Blog(RSS)精选
AI 评分 71/100
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。

具身智能多模态开源生态模型发布

推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。

8月5日

星期三 · 3 条
18:00
公众号:小红书技术(dots.llm)
AI 评分 46/100
小红书"问一问"多模态推理加速实践:让视觉 Token 更精简、MoE 专家更聚焦

小红书针对“问一问”多图场景,从 Prefill 与 Decode 两端优化多模态推理:动态 Vision Token 压缩减少冗余视觉输入,SERE 专家重路由配合关键专家保护降低 Decode 阶段专家计算与权重搬运。

多模态推理教程/实践
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

多模态模型发布视频语音
另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
02:31
Black Forest Labs:Blog(网页)
AI 评分 43/100
FLUX 3 Video, Part 1: Generation
多模态模型发布视频

8月4日

星期二 · 1 条
08:40
公众号:MiniMax(稀宇科技)
AI 评分 48/100
MiniMax H3 开源 24 小时,超百家企业 Day 0 上线

MiniMax H3 开源 24 小时内,华为昇腾、AMD、Intel 等 9 家国内外芯片厂商完成 Day 0 适配,Hugging Face、魔搭、ComfyUI、vLLM-Omni、SGLang、腾讯云等超百家合作伙伴 Day 0 上线。在 Artificial Analysis 所有视频评测榜单中,H3 均跻身全球前三,并在质量/价格象限中进入最优梯队,为中国模型最佳表现。

多模态开源生态行业动态

8月3日

星期一 · 3 条
23:52
Apple Machine Learning Research(RSS)
AI 评分 51/100
多模态大语言模型对齐的全面研究:Apple 团队独立拆解偏好对齐各环节

Apple 研究团队系统梳理了多模态大语言模型(MLLM)中的偏好对齐方法,将算法分为离线(如 DPO)与在线(如 online-DPO)两类,并发现两者结合可在特定场景下提升模型性能。团队还提出无需额外标注或外部模型的新型多模态偏好数据构建方法 Bias-Driven Hallucination Sampling(BDHS),在多项基准上取得与既有对齐工作相当的竞争力。

多模态安全/对齐论文/研究
10:44
公众号:MiniMax(稀宇科技)精选
AI 评分 75/100
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声

MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。

多模态模型发布视频
另有 3 家信源报道X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)
推荐理由:与多数开源视频模型不同,H3 原生支持同步生成立体声音频,且通过上下文再生成实现 2K 分辨率,为音视频生成应用提供了更完整的开源基座。
10:10
Qwen:Blog Retrieval(API)精选
AI 评分 89/100
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。

智能体多模态模型发布编码
另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Testing Catalog (@testingcatalog)公众号:数字生命卡兹克X:阿易 AI Notes (@AYi_AInotes)X:Nathan Lambert (@natolambert)X:Kim (@kimmonismus)
推荐理由:首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。

8月2日

星期日 · 2 条
21:56
Nathan Lambert:Interconnects(RSS)
AI 评分 45/100
最新开源模型盘点(#23):Laguna S2.1、Inkling 与 Kimi K3 展现开源模型在帕累托前沿的价值

Thinking Machines 发布首个模型 Inkling,为 975B-A41B 多模态 MoE,支持文本、图像和音频输入,并推出 276B-A12B 小版本。

DeepSeek多模态开源生态现象/趋势
19:51
公众号:百度智能云(文心)
AI 评分 40/100
百度智能云张玮ChinaJoy谈AI重构游戏产业:从效率赋能迈向体验重构

百度智能云在ChinaJoy发布面向AI+游戏行业的全栈解决方案,以“从算力到体验的全栈基础设施供给者”为定位,构建覆盖AI Infra和Agent Infra两层能力体系。

智能体产品更新多模态

8月1日

星期六 · 1 条
04:34
Runway:News(网页)
AI 评分 49/100
Runway Characters 入选 SIGGRAPH 2026 Real-Time Live! 现场演示

Runway 的实时交互数字人系统 Characters 入选 SIGGRAPH 2026 的 Real-Time Live! 环节,团队在现场用一张照片数秒内生成可对话的角色。该系统从单张图片出发,无需微调即可适配任意风格,逐帧生成画面以支持长达 30 分钟以上的连续对话。Characters 于今年 3 月上线,团队正探索可导航环境、多参考图像及记忆功能等后续方向。

产品更新多模态

7月31日

星期五 · 3 条
21:42
公众号:百度智能云(文心)精选
AI 评分 66/100
百度搭子一镜Skill:一句话生成数字人口播视频

百度搭子内置的一镜Skill支持仅凭一句话或一个主题,自动完成脚本生成、声音、数字人形象、口型驱动和视频渲染,生成可直接播放的数字人口播视频,全程无需拍摄、剪辑和露脸。该功能适用于旅游攻略、产品种草、知识科普、临时活动宣传、企业内部培训及个人IP起步等场景,大幅降低视频制作门槛。

产品更新多模态视频

推荐理由:拆解了从想法到成品视频的全链路,非专业用户能直观理解脚本生成、数字人驱动等环节如何协作,有助于判断这类工具能否嵌入现有创作流程。
17:59
MiniMax:Blog(网页)精选
AI 评分 78/100
MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频

MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。

多模态开源生态模型发布
另有 4 家信源报道X:MiniMax (@MiniMax_AI)X:Testing Catalog (@testingcatalog)X:Artificial Analysis (@ArtificialAnlys)X:X.PIN (@thexpin)
推荐理由:MiniMax H3 把全模态生成打到了 2K 分辨率且价格不到主流三分之一,还计划开源权重,这对闭源视频模型是实打实的压力,开发者可以重点关注。
12:06
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 80/100
字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑

字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。

多模态模型发布视频
另有 8 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:阿易 AI Notes (@AYi_AInotes)公众号:火山引擎X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)
推荐理由:Seedance 2.5 把单次生成拉到 30 秒,加上多模态参考和精准编辑,让视频创作从片段拼凑变成完整叙事。对国内创作者来说,这是即梦和豆包里能马上用到的最强视频模型。

7月30日

星期四 · 2 条
23:27
Google DeepMind:Blog(RSS)精选
AI 评分 60/100
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人

Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。

DeepMind具身智能多模态模型发布
另有 4 家信源报道X:Testing Catalog (@testingcatalog)IT之家(RSS)Ars Technica:AI(RSS)X:Google AI for Developers (@googleaidevs)
推荐理由:DeepMind 把 Gemini 带到机器人领域,视频理解、任务编排和多机协作的叙事很宏大,但全是愿景,没有实测数据,是不是真正的 step change 得等细节。做机器人的可以先建个追踪。
00:26
Google DeepMind:Blog(RSS)精选
AI 评分 63/100
Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制

Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长。

DeepMindGoogle多模态模型发布
另有 2 家信源报道IT之家(RSS)The Decoder:AI News(RSS)
推荐理由:Lyria 3.5 把音乐生成从玩具级推到了可用创作工具级别,歌词和情感人声的提升对内容创作者是实实在在的福音。

7月29日

星期三 · 2 条
20:08
公众号:火山引擎
AI 评分 46/100
从智能座舱到爆款视频,中国品牌全球化如何用AI找增量

奇瑞OMODA在印尼发布搭载豆包大模型的超级AI智舱,OMODA4支持5种语言交互;传音、荣耀、爱奇艺分别将Seedream/Seedance集成进手机影像与影视创作。美的将单条视频广告制作周期从7-10个工作日压缩至2-6小时,Nativex的Seedance素材已占创意产出70%-80%。

多模态行业动态视频
12:00
公众号:小红书技术(dots.llm)
AI 评分 37/100
小红书 dots 团队提出 Vision-OPD,让 9B 模型细粒度视觉理解超越 GPT-5.4

小红书 dots 团队提出 Vision-OPD,一个无需外部教师或推理工具的区域到全局在线自蒸馏框架。仅用约 6.2K 条合成数据,便让基于 Qwen3.5 的 9B 模型在六个细粒度基准上平均准确率达 79.7%,超越 Gemini-3.5-Flash、GPT-5.4 等闭源模型及 Qwen3.5-397B,且不损失通用能力。

arXiv多模态论文/研究

7月28日

星期二 · 4 条
19:00
公众号:小红书技术(dots.llm)
AI 评分 56/100
小红书 dots 团队提出 Vision-OPD,让多模态大模型"看清细节"

小红书 dots 团队提出 Vision-OPD,一种区域到全局在线自蒸馏框架,让模型无需外部教师或推理工具即可从全图中识别细粒度证据。仅用约 6.2K 条全自动合成数据,Vision-OPD-9B 即在多个细粒度基准上以 79.68 平均分总体第一,超越 Gemini-3.5-Flash、GPT-5.4 等闭源模型,同时保持通用视觉任务表现。

arXiv多模态数据/训练论文/研究
18:01
公众号:面壁智能(MiniCPM)
AI 评分 53/100
海外开发者用 OpenClaw + MiniCPM-V 4.6 搭建本地视觉私人助理,让图片进入 AI 工作流

海外独立开发者 Mohammed 用 OpenClaw + MiniCPM-V 4.6 搭建了可本地“看图”的私人助理,通过 Ollama 在本地运行模型,配合 LitServe 封装接口和自定义 vision-photo 技能,实现图片理解、OCR 与问答。

多模态教程/实践端侧
12:00
公众号:豆包(字节)
AI 评分 38/100
豆包携手人教社发起「经典课文名师 AI 共创计划」,Seedance 视频模型还原《桃花源记》

豆包联合人民教育出版社发起「经典课文名师 AI 共创计划」,邀请五位名师讲解课文,并用 AI 呈现画面。首期作品《桃花源记》由复旦大学梁永安教授讲述,Seedance 视频模型还原课文场景,以全新方式重温这一千古名篇。

多模态行业动态
12:00
公众号:月之暗面(Kimi)精选
AI 评分 85/100
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。

GitHubHugging Face多模态开源生态
另有 14 家信源报道HuggingFace Daily Papers(社区热门论文)X:Kim (@kimmonismus)The Verge:AI(RSS)X:Kimi.ai (@Kimi_Moonshot)IT之家(RSS)The Decoder:AI News(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Rohan Paul (@rohanpaul_ai)X:Artificial Analysis (@ArtificialAnlys)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:AK (@_akhaliq)X:Elvis Saravia (@omarsar0, DAIR.AI)LMSYS:Blog(Chatbot Arena 团队)公众号:数字生命卡兹克
推荐理由:Kimi K3 的完全开放是一个明确信号,月之暗面把最核心的模型权重和技术细节全部公开,国内开发者从此有了媲美国际顶尖开源的底座。虽然部署门槛不低,但开放本身推动了生态发展。

7月27日

星期一 · 2 条
23:35
公众号:月之暗面(Kimi)精选
AI 评分 81/100
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

Kimi 发布 K3 模型权重与技术报告,并开源 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术。K3 是 2.8 万亿参数的 MoE 模型,支持原生视觉与 100 万 token 上下文,参数规模约为 K2.5 的 3 倍,规模化效率提升 2.5 倍。

多模态开源生态推理模型发布
另有 1 家信源报道公众号:数字生命卡兹克
推荐理由:权重开源伴随技术报告公开训练细节,为研究机构直接复现和改造千亿级MoE模型提供了完整路径,也降低企业自部署门槛。
23:00
公众号:百度智能云(文心)
AI 评分 49/100
百度智能云领跑中国AI游戏云市场,市场份额超第2-5名总和

国际数据公司(IDC)报告显示,百度智能云在中国AI游戏云整体市场及AI基础设施服务市场份额均居第一,超过第2-5名总和。报告预测AI游戏云市场未来5年年复合增长率约91.6%。百度智能云已为米哈游、网易、三七互娱等超半数主流头部游戏企业及百余家AI游戏创新企业提供全栈AI能力支撑。

智能体多模态行业动态

7月24日

星期五 · 4 条
18:10
公众号:小红书技术(dots.llm)
AI 评分 49/100
小红书等提出 UniNote:统一多模态嵌入模型

小红书、上海交通大学、华中科技大学和北京理工大学联合提出 UniNote,将多模态表示学习与排序能力融合于单一模型。通过两阶段训练(对比 SFT 强化表示 + 强化学习排序优化),UniNote 在单次嵌入传递中实现与两阶段检索-排序范式相当的性能,并大幅降低延迟。

arXiv多模态搜索论文/研究
18:00
公众号:小红书技术(dots.llm)
AI 评分 40/100
UniNote:小红书等提出统一多模态嵌入模型,融合表征与排序

小红书联合上海交大、华中科大、北理工提出 UniNote,将多模态表示学习与排序优化融合于单一嵌入模型,替代传统“Embedder + Reranker”两阶段管道,在单次嵌入传递内实现相当性能并大幅降低延迟。

arXiv多模态搜索论文/研究
12:00
公众号:龙猫LongCat(美团)精选
AI 评分 68/100
MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。

arXiv具身智能多模态论文/研究

推荐理由:18 个顶级多模态模型在 Minecraft 里全翻车,每多一层隐藏前置条件成功率就砍半,搞具身智能的该看看感知和行动之间还隔着什么。
03:55
Claude:Blog(网页)精选
AI 评分 75/100
Claude 语音模式现已支持 Opus、Sonnet 及连接工具与多语言

即日起,Claude 语音模式在 Opus、Sonnet 和 Haiku 上运行,并支持连接 Gmail、Slack 等工具及更多语言。用户可在对话中切换模型,语音模式默认沿用上次文本聊天使用的模型。该功能面向所有用户开放 beta 测试,免费版可使用 Haiku 及一个连接工具,付费版可访问更多模型和全部连接工具。

Anthropic产品更新多模态
另有 5 家信源报道IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)TechCrunch:AI(RSS)The Verge:AI(RSS)The Decoder:AI News(RSS)
推荐理由:Claude 语音模式终于能调用最强模型了,深度思考不再受限于轻量版,加上工具集成和多语言,移动端从随口问答升级为实时脑力伙伴,值得立即上手。

7月23日

星期四 · 2 条
19:58
公众号:龙猫LongCat(美团)同事件
AI 评分 62/100
MineExplorer:美团 LongCat 评测揭示顶级多模态大模型在动态开放世界中的能力断层

美团 LongCat 团队构建 MineExplorer,这是首个在开放世界中做到分钟级长程任务的评测基准,含 813 个人工验证实例(1-hop 到 4-hop)及规则化里程碑自动评测框架。

arXiv具身智能多模态论文/研究
同一事件,精选展示《MineExplorer:首个《我的世界》分钟级长程任务评测基准发布》
17:25
Google AI:DEV 作者专属(RSS)精选
AI 评分 73/100
Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布

Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。

Google多模态推理模型发布

推荐理由:Gemini 3.6 Flash 降本增效,3.5 Flash-Lite 主打低成本高速,弃用 temperature 等参数是个硬变更,使用 Gemini 的开发者必须检查迁移。
已加载 40 条