Topic · 主题全部主题 →

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

3,704条收录
405条精选

精选归档 · 第 2 页

2140 条 · 共 405

8月10日

星期一 · 1 条
08:14
MarkTechPost(RSS)精选
AI 评分 75/100
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。


推荐理由:端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。

8月8日

星期六 · 1 条
17:11
IT之家(RSS)精选
AI 评分 76/100
苹果 Mac 简体中文支持文档更新,"Apple 智能"阿里千问扩展现身

苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。


推荐理由:苹果智能在中国大陆的落地路径终于清晰,支持文档揭示了写作工具和Siri集成千问的具体方式,Mac用户将能在系统级直接使用大模型能力。

8月6日

星期四 · 3 条
21:12
NVIDIA Blog(RSS)精选
AI 评分 71/100
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。


推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。
21:11
OpenBMB@OpenBMB精选
AI 评分 65/100
面壁智能 AMNESIAC:反向图灵测试 AI 审讯游戏AMNESIAC — A Reverse Turing Test AI Interrogation Game 🪞Created by developer @HetanshWaghela during the #BuildSmall Hackathon, AMNESIAC flips the Turing Test: can you convince AI that you’re human?In this interactive experience, users face A.M.N., an AI interrogator that analyzes facial expressions, pulse signals, and response timing through the camera and microphone, continuously adapting its questions based on human reactions.Powered by MiniCPM-o and VoxCPM, AMNESIAC can: 🧠 Understand user responses and generate real-time interrogation dialogues with MiniCPM-o 4.5 🎙️ Create a unique AI interrogator personality through VoxCPM voice generation 👁️ Combine on-device facial analysis and biometric signals to build a more immersive interaction ✨ Use LoRA fine-tuning on a custom voice dataset to shape a cold, clinical AI voice styleAMNESIAC showcases how multimodal and speech models can combine perception, reasoning, and voice to create more expressive AI characters.Explore it: 🤗 https://huggingface.co/spaces/build-small-hackathon/amnesiacModels: 🔗 MiniCPM-o 4.5: http://huggingface.co/openbmb/MiniCPM-o-4_5 🔗 VoxCPM: http://huggingface.co/openbmb/VoxCPM2面壁智能 OpenBMB 在 #BuildSmall 黑客松推出 AMNESIAC,一款反向图灵测试交互游戏:玩家需说服 AI 审讯官 A.M.N. 自己是人类。该游戏由 MiniCPM-o 4.5 驱动实时对话与推理,VoxCPM 生成审讯官语音,并结合摄像头面部表情、脉搏信号与响应计时进行多模态审讯。项目已开源至 HuggingFace。

推荐理由:将摄像头面部信号、语音对话和LoRA角色塑形组合进一个可玩演示,为交互式AI角色提供了比常见聊天机器人更丰富的多模态模板。

8月5日

星期三 · 6 条
16:35
MarkTechPost(RSS)精选
AI 评分 79/100
NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。

另有 1 家信源报道IT之家(RSS)
推荐理由:轨迹与因果解释同时输出,可接入Halos安全验证,自动驾驶团队据此向监管证明决策合理性,减少黑盒依赖。
13:55
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
Video-DeepResearch:迈向下一代多模态深度研究智能体

Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。


推荐理由:将深度研究从静态图像扩展到视频流,通过强制视觉定位再检索的两阶段训练,让模型摆脱了对文本搜索的路径依赖,给视频智能体研发提供了可验证的训练范式。
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
11:08
Qwen@Alibaba_Qwen精选
AI 评分 68/100
Qwen-Image-3.0-Pro 上线 Qwen CloudQwen-Image-3.0-Pro is live on Qwen Cloud now! Try it out👇 https://www.qwencloud.com/models/qwen-image-3.0-pro?utm_content=g_20000001188阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。

Qwen Cloud: 🔔 Qwen-Image-3.0 现已上线通义千问云! 在 Arena 的 Text-to-Image Arena 中,位列中国模型第一、主流模型第二,现在只需一次 API 调用即可使用。 - 支持最长 4.5k token 的提示词:报...

另有 2 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。

8月4日

星期二 · 4 条
11:54
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成

SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。


推荐理由:通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。
11:54
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
UEmbed:统一稀疏与稠密的多模态嵌入模型

UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。


推荐理由:UEmbed 让一个解码器模型同时输出稀疏与稠密多模态嵌入,稀疏模式精度接近稠密且原生适配倒排索引,对兼顾效率和精度的检索系统,省去了维护多套模型的开销。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准

SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。


推荐理由:基准将场景文字冲突转化为连续的地理定位诊断,揭示对抗性文本可让定位误差扩大4.8倍,为多模态模型的证据仲裁能力提供了可量化的评估框架。
06:35
Greg Brockman@gdb精选
AI 评分 66/100
GPT-Live实时音频新架构发布GPT-Live is a new architecture and stack for realtime audio:GPT-Live 是一种用于实时音频的新架构和栈: GPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 规模下显得自然,我们从客户端到模型重建了语音栈。 这一新架构让音频持续流动,因此更深入的推理和工具使用不会打断对话。

OpenAI: GPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 的规模下显得自然,我们从客户端到模型彻底重建了语音技术栈。 这一新架构让音频持续流动,因此更深入的推理和工具调用不会打断对话。

另有 1 家信源报道X:OpenAI (@OpenAI)
推荐理由:在 GPT-Live 架构下推理与工具调用期间音频流不间断,语音交互的等待感和打断感被显著消除,适用于需要持续对话的陪伴和协作场景。

8月3日

星期一 · 3 条
23:03
SenseTime@SenseTime_AI精选
AI 评分 68/100
商汤发布 SenseNova U1.5-Lite-Preview 开源模型𝗜𝗻𝘁𝗿𝗼𝗱𝘂𝗰𝗶𝗻𝗴 𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨1.5-𝗟𝗶𝘁𝗲-𝗣𝗿𝗲𝘃𝗶𝗲𝘄.An early open-source preview of our lightweight, natively unified multimodal model — built on the native NEO-Unify architecture to natively understand, reason, generate, and edit across modalities. 𝗪𝗶𝘁𝗵 𝗷𝘂𝘀𝘁 8𝗕-𝗠𝗼𝗧 𝗽𝗮𝗿𝗮𝗺𝗲𝘁𝗲𝗿𝘀, 𝗶𝘁 𝗱𝗲𝗹𝗶𝘃𝗲𝗿𝘀 𝗴𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻 𝗮𝗻𝗱 𝗲𝗱𝗶𝘁𝗶𝗻𝗴 𝗾𝘂𝗮𝗹𝗶𝘁𝘆 𝘁𝗵𝗮𝘁 𝗿𝗶𝘃𝗮𝗹𝘀 𝗰𝗼𝗺𝗺𝗲𝗿𝗰𝗶𝗮𝗹 𝗰𝗹𝗼𝘀𝗲𝗱-𝘀𝗼𝘂𝗿𝗰𝗲 𝗺𝗼𝗱𝗲𝗹𝘀.🌟This preview brings: 🔹𝗨𝗽 𝘁𝗼 4𝗞 𝗿𝗲𝘀𝗼𝗹𝘂𝘁𝗶𝗼𝗻, delivering richer details and fewer visual artifacts 🔹𝗦𝘁𝗿𝗼𝗻𝗴𝗲𝗿 𝗘𝗡/𝗖𝗡 𝘁𝗲𝘅𝘁 𝗿𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴 𝗮𝗻𝗱 𝗰𝗼𝗺𝗽𝗹𝗲𝘅 𝗹𝗮𝘆𝗼𝘂𝘁 𝗰𝗼𝗺𝗽𝗼𝘀𝗶𝘁𝗶𝗼𝗻 🔹𝗠𝗼𝗿𝗲 𝗽𝗿𝗲𝗰𝗶𝘀𝗲 𝘃𝗶𝘀𝘂𝗮𝗹 𝗰𝗼𝗻𝘁𝗿𝗼𝗹 with long, multi-constraint prompts 🔹𝗠𝗼𝗿𝗲 𝗿𝗲𝗹𝗶𝗮𝗯𝗹𝗲 𝗻𝗮𝘁𝗶𝘃𝗲 𝗶𝗺𝗮𝗴𝗲 𝗲𝗱𝗶𝘁𝗶𝗻𝗴 across reference-guided style transfer, multi-reference composition, local infographic editing and text editing🌟Improvements over U1 on generation & editing benchmarks: 🔹Qwen-Image-Bench: 47.14 → 55.20 (w/ PE) 🔹ImgEdit-Bench: 3.90 → 4.37 🔹GEdit-Bench-en: 7.47 → 8.17 🔹GEdit-Bench-zh: 7.42 → 8.05From U1 to U1.5, this open-source journey reflects our continued innovation at the foundation-model level. Meanwhile, U1 Pro, our production-ready model for creators, will open for public access soon.🛠️ GitHub: https://github.com/OpenSenseNova/SenseNova-U1/blob/feat/u1.5_preview/docs/u1.5_preview.md 🤗 Hugging Face: https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview 👾 Discord: https://discord.com/invite/BuTXPHmQub商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。
另有 1 家信源报道IT之家(RSS)
推荐理由:8B 参数的小模型在生成和编辑上接近闭源水平,有望降低轻量化多模态应用的门槛,但预览版功能可能尚不完整。
10:44
公众号:MiniMax(稀宇科技)精选
AI 评分 75/100
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声

MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。

另有 3 家信源报道X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)
推荐理由:与多数开源视频模型不同,H3 原生支持同步生成立体声音频,且通过上下文再生成实现 2K 分辨率,为音视频生成应用提供了更完整的开源基座。