OpenRouter 发布视觉指南,详解通过 Chat Completions API 向多模态模型发送图像的方法。请求体采用 messages 数组,用户消息的 content 包含 text 和 image_url 两部分,支持公开 URL 或 base64 数据 URL 两种格式,兼容 PNG、JPEG、WebP 和 GIF。
OpenRouter 发布视觉指南,详解通过 Chat Completions API 向多模态模型发送图像的方法。请求体采用 messages 数组,用户消息的 content 包含 text 和 image_url 两部分,支持公开 URL 或 base64 数据 URL 两种格式,兼容 PNG、JPEG、WebP 和 GIF。
小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
另有 1 家信源报道X:Kim (@kimmonismus)MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。
另有 2 家信源报道IT之家(RSS)X:MiniMax (@MiniMax_AI)Google DeepMind 发布手语转文本(SL2T)模型,为聋哑及听障用户提供新的手语功能。该模型是此次发布的突破性技术核心,旨在将手语实时转化为文本,帮助用户更顺畅地沟通。目前尚未公布具体参数规模、基准测试分数或可用性细节。
Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。
千问开放平台上线,支持APP、PC和AI眼镜三端,在眼镜端提供技能平台和行业定制两大模块。开发者可调用眼镜拍照、语音交互等能力创建导游、教练等Skill,也可为视障群体开发“身边有什么”等辅助技能。平台面向行业客户提供巡检等定制能力,并计划陆续开放空间3D立体显示、运动健康状态感知等更多眼镜能力。
SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。
MiniMax H3 技术团队在 Reddit AMA 和 ComfyUI 直播中回应开发者提问:模型不使用 MSA,稀疏注意力策略更接近 MoBA,默认仅对视频 token 做 3D sparsification,近期将发布保守版本。
Databricks 发布 FILE 原生列类型,用于在 Lakehouse 中直接存储和管理多模态数据。该类型将文件作为一等公民纳入表结构,支持图像、音频、视频等非结构化数据与结构化数据统一处理,简化了多模态数据管线的构建与查询。
SkyProduction天工短剧工作台正式接入Seedance 2.5,720P低至0.4元/秒、480P低至0.3元/秒,支持单段最长30秒视频直出、50个参考素材及10余种语言。同期推出“短剧出海转绘”功能,可将中文短剧快速本土化为欧美市场内容;三部通过该工作台创作的AI短剧已上线DramaWave,单部营收均达200万美元级别。
NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。
小红书针对“问一问”多图场景,从 Prefill 与 Decode 两端优化多模态推理:动态 Vision Token 压缩减少冗余视觉输入,SERE 专家重路由配合关键专家保护降低 Decode 阶段专家计算与权重搬运。
字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。
另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)MiniMax H3 开源 24 小时内,华为昇腾、AMD、Intel 等 9 家国内外芯片厂商完成 Day 0 适配,Hugging Face、魔搭、ComfyUI、vLLM-Omni、SGLang、腾讯云等超百家合作伙伴 Day 0 上线。在 Artificial Analysis 所有视频评测榜单中,H3 均跻身全球前三,并在质量/价格象限中进入最优梯队,为中国模型最佳表现。
Apple 研究团队系统梳理了多模态大语言模型(MLLM)中的偏好对齐方法,将算法分为离线(如 DPO)与在线(如 online-DPO)两类,并发现两者结合可在特定场景下提升模型性能。团队还提出无需额外标注或外部模型的新型多模态偏好数据构建方法 Bias-Driven Hallucination Sampling(BDHS),在多项基准上取得与既有对齐工作相当的竞争力。
MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。
另有 3 家信源报道X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。
另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Testing Catalog (@testingcatalog)公众号:数字生命卡兹克X:阿易 AI Notes (@AYi_AInotes)X:Nathan Lambert (@natolambert)X:Kim (@kimmonismus)Thinking Machines 发布首个模型 Inkling,为 975B-A41B 多模态 MoE,支持文本、图像和音频输入,并推出 276B-A12B 小版本。
百度智能云在ChinaJoy发布面向AI+游戏行业的全栈解决方案,以“从算力到体验的全栈基础设施供给者”为定位,构建覆盖AI Infra和Agent Infra两层能力体系。
Runway 的实时交互数字人系统 Characters 入选 SIGGRAPH 2026 的 Real-Time Live! 环节,团队在现场用一张照片数秒内生成可对话的角色。该系统从单张图片出发,无需微调即可适配任意风格,逐帧生成画面以支持长达 30 分钟以上的连续对话。Characters 于今年 3 月上线,团队正探索可导航环境、多参考图像及记忆功能等后续方向。
百度搭子内置的一镜Skill支持仅凭一句话或一个主题,自动完成脚本生成、声音、数字人形象、口型驱动和视频渲染,生成可直接播放的数字人口播视频,全程无需拍摄、剪辑和露脸。该功能适用于旅游攻略、产品种草、知识科普、临时活动宣传、企业内部培训及个人IP起步等场景,大幅降低视频制作门槛。
MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。
另有 4 家信源报道X:MiniMax (@MiniMax_AI)X:Testing Catalog (@testingcatalog)X:Artificial Analysis (@ArtificialAnlys)X:X.PIN (@thexpin)字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。
另有 8 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:阿易 AI Notes (@AYi_AInotes)公众号:火山引擎X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。
另有 4 家信源报道X:Testing Catalog (@testingcatalog)IT之家(RSS)Ars Technica:AI(RSS)X:Google AI for Developers (@googleaidevs)Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长。
另有 2 家信源报道IT之家(RSS)The Decoder:AI News(RSS)奇瑞OMODA在印尼发布搭载豆包大模型的超级AI智舱,OMODA4支持5种语言交互;传音、荣耀、爱奇艺分别将Seedream/Seedance集成进手机影像与影视创作。美的将单条视频广告制作周期从7-10个工作日压缩至2-6小时,Nativex的Seedance素材已占创意产出70%-80%。
小红书 dots 团队提出 Vision-OPD,一个无需外部教师或推理工具的区域到全局在线自蒸馏框架。仅用约 6.2K 条合成数据,便让基于 Qwen3.5 的 9B 模型在六个细粒度基准上平均准确率达 79.7%,超越 Gemini-3.5-Flash、GPT-5.4 等闭源模型及 Qwen3.5-397B,且不损失通用能力。
小红书 dots 团队提出 Vision-OPD,一种区域到全局在线自蒸馏框架,让模型无需外部教师或推理工具即可从全图中识别细粒度证据。仅用约 6.2K 条全自动合成数据,Vision-OPD-9B 即在多个细粒度基准上以 79.68 平均分总体第一,超越 Gemini-3.5-Flash、GPT-5.4 等闭源模型,同时保持通用视觉任务表现。
海外独立开发者 Mohammed 用 OpenClaw + MiniCPM-V 4.6 搭建了可本地“看图”的私人助理,通过 Ollama 在本地运行模型,配合 LitServe 封装接口和自定义 vision-photo 技能,实现图片理解、OCR 与问答。
豆包联合人民教育出版社发起「经典课文名师 AI 共创计划」,邀请五位名师讲解课文,并用 AI 呈现画面。首期作品《桃花源记》由复旦大学梁永安教授讲述,Seedance 视频模型还原课文场景,以全新方式重温这一千古名篇。
月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。
另有 14 家信源报道HuggingFace Daily Papers(社区热门论文)X:Kim (@kimmonismus)The Verge:AI(RSS)X:Kimi.ai (@Kimi_Moonshot)IT之家(RSS)The Decoder:AI News(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Rohan Paul (@rohanpaul_ai)X:Artificial Analysis (@ArtificialAnlys)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:AK (@_akhaliq)X:Elvis Saravia (@omarsar0, DAIR.AI)LMSYS:Blog(Chatbot Arena 团队)公众号:数字生命卡兹克Kimi 发布 K3 模型权重与技术报告,并开源 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术。K3 是 2.8 万亿参数的 MoE 模型,支持原生视觉与 100 万 token 上下文,参数规模约为 K2.5 的 3 倍,规模化效率提升 2.5 倍。
另有 1 家信源报道公众号:数字生命卡兹克国际数据公司(IDC)报告显示,百度智能云在中国AI游戏云整体市场及AI基础设施服务市场份额均居第一,超过第2-5名总和。报告预测AI游戏云市场未来5年年复合增长率约91.6%。百度智能云已为米哈游、网易、三七互娱等超半数主流头部游戏企业及百余家AI游戏创新企业提供全栈AI能力支撑。
小红书、上海交通大学、华中科技大学和北京理工大学联合提出 UniNote,将多模态表示学习与排序能力融合于单一模型。通过两阶段训练(对比 SFT 强化表示 + 强化学习排序优化),UniNote 在单次嵌入传递中实现与两阶段检索-排序范式相当的性能,并大幅降低延迟。
小红书联合上海交大、华中科大、北理工提出 UniNote,将多模态表示学习与排序优化融合于单一嵌入模型,替代传统“Embedder + Reranker”两阶段管道,在单次嵌入传递内实现相当性能并大幅降低延迟。
美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。
即日起,Claude 语音模式在 Opus、Sonnet 和 Haiku 上运行,并支持连接 Gmail、Slack 等工具及更多语言。用户可在对话中切换模型,语音模式默认沿用上次文本聊天使用的模型。该功能面向所有用户开放 beta 测试,免费版可使用 Haiku 及一个连接工具,付费版可访问更多模型和全部连接工具。
另有 5 家信源报道IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)TechCrunch:AI(RSS)The Verge:AI(RSS)The Decoder:AI News(RSS)美团 LongCat 团队构建 MineExplorer,这是首个在开放世界中做到分钟级长程任务的评测基准,含 813 个人工验证实例(1-hop 到 4-hop)及规则化里程碑自动评测框架。
同一事件,精选展示《MineExplorer:首个《我的世界》分钟级长程任务评测基准发布》Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。