精选归档 · 第 2 页
第 21–40 条 · 共 405 条
17:11
苹果 Mac 简体中文支持文档更新,"Apple 智能"阿里千问扩展现身苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。
推荐理由:苹果智能在中国大陆的落地路径终于清晰,支持文档揭示了写作工具和Siri集成千问的具体方式,Mac用户将能在系统级直接使用大模型能力。
21:12
NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。
推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。
21:11
OpenBMB@OpenBMB精选 面壁智能 AMNESIAC:反向图灵测试 AI 审讯游戏AMNESIAC — A Reverse Turing Test AI Interrogation Game 🪞Created by developer @HetanshWaghela during the #BuildSmall Hackathon, AMNESIAC flips the Turing Test: can you convince AI that you’re human?In this interactive experience, users face A.M.N., an AI interrogator that analyzes facial expressions, pulse signals, and response timing through the camera and microphone, continuously adapting its questions based on human reactions.Powered by MiniCPM-o and VoxCPM, AMNESIAC can:
🧠 Understand user responses and generate real-time interrogation dialogues with MiniCPM-o 4.5
🎙️ Create a unique AI interrogator personality through VoxCPM voice generation
👁️ Combine on-device facial analysis and biometric signals to build a more immersive interaction
✨ Use LoRA fine-tuning on a custom voice dataset to shape a cold, clinical AI voice styleAMNESIAC showcases how multimodal and speech models can combine perception, reasoning, and voice to create more expressive AI characters.Explore it:
🤗 https://huggingface.co/spaces/build-small-hackathon/amnesiacModels:
🔗 MiniCPM-o 4.5: http://huggingface.co/openbmb/MiniCPM-o-4_5
🔗 VoxCPM: http://huggingface.co/openbmb/VoxCPM2译面壁智能 OpenBMB 在 #BuildSmall 黑客松推出 AMNESIAC,一款反向图灵测试交互游戏:玩家需说服 AI 审讯官 A.M.N. 自己是人类。该游戏由 MiniCPM-o 4.5 驱动实时对话与推理,VoxCPM 生成审讯官语音,并结合摄像头面部表情、脉搏信号与响应计时进行多模态审讯。项目已开源至 HuggingFace。
推荐理由:将摄像头面部信号、语音对话和LoRA角色塑形组合进一个可玩演示,为交互式AI角色提供了比常见聊天机器人更丰富的多模态模板。
13:55
HuggingFace Daily Papers(社区热门论文)精选
Video-DeepResearch:迈向下一代多模态深度研究智能体Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。
推荐理由:将深度研究从静态图像扩展到视频流,通过强制视觉定位再检索的两阶段训练,让模型摆脱了对文本搜索的路径依赖,给视频智能体研发提供了可验证的训练范式。
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。
另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
11:54
HuggingFace Daily Papers(社区热门论文)精选
SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。
推荐理由:通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。
11:54
HuggingFace Daily Papers(社区热门论文)精选
UEmbed:统一稀疏与稠密的多模态嵌入模型UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。
推荐理由:UEmbed 让一个解码器模型同时输出稀疏与稠密多模态嵌入,稀疏模式精度接近稠密且原生适配倒排索引,对兼顾效率和精度的检索系统,省去了维护多套模型的开销。
08:00
HuggingFace Daily Papers(社区热门论文)精选
SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。
推荐理由:基准将场景文字冲突转化为连续的地理定位诊断,揭示对抗性文本可让定位误差扩大4.8倍,为多模态模型的证据仲裁能力提供了可量化的评估框架。
23:03
SenseTime@SenseTime_AI精选 商汤发布 SenseNova U1.5-Lite-Preview 开源模型𝗜𝗻𝘁𝗿𝗼𝗱𝘂𝗰𝗶𝗻𝗴 𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨1.5-𝗟𝗶𝘁𝗲-𝗣𝗿𝗲𝘃𝗶𝗲𝘄.An early open-source preview of our lightweight, natively unified multimodal model — built on the native NEO-Unify architecture to natively understand, reason, generate, and edit across modalities. 𝗪𝗶𝘁𝗵 𝗷𝘂𝘀𝘁 8𝗕-𝗠𝗼𝗧 𝗽𝗮𝗿𝗮𝗺𝗲𝘁𝗲𝗿𝘀, 𝗶𝘁 𝗱𝗲𝗹𝗶𝘃𝗲𝗿𝘀 𝗴𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻 𝗮𝗻𝗱 𝗲𝗱𝗶𝘁𝗶𝗻𝗴 𝗾𝘂𝗮𝗹𝗶𝘁𝘆 𝘁𝗵𝗮𝘁 𝗿𝗶𝘃𝗮𝗹𝘀 𝗰𝗼𝗺𝗺𝗲𝗿𝗰𝗶𝗮𝗹 𝗰𝗹𝗼𝘀𝗲𝗱-𝘀𝗼𝘂𝗿𝗰𝗲 𝗺𝗼𝗱𝗲𝗹𝘀.🌟This preview brings:
🔹𝗨𝗽 𝘁𝗼 4𝗞 𝗿𝗲𝘀𝗼𝗹𝘂𝘁𝗶𝗼𝗻, delivering richer details and fewer visual artifacts
🔹𝗦𝘁𝗿𝗼𝗻𝗴𝗲𝗿 𝗘𝗡/𝗖𝗡 𝘁𝗲𝘅𝘁 𝗿𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴 𝗮𝗻𝗱 𝗰𝗼𝗺𝗽𝗹𝗲𝘅 𝗹𝗮𝘆𝗼𝘂𝘁 𝗰𝗼𝗺𝗽𝗼𝘀𝗶𝘁𝗶𝗼𝗻
🔹𝗠𝗼𝗿𝗲 𝗽𝗿𝗲𝗰𝗶𝘀𝗲 𝘃𝗶𝘀𝘂𝗮𝗹 𝗰𝗼𝗻𝘁𝗿𝗼𝗹 with long, multi-constraint prompts
🔹𝗠𝗼𝗿𝗲 𝗿𝗲𝗹𝗶𝗮𝗯𝗹𝗲 𝗻𝗮𝘁𝗶𝘃𝗲 𝗶𝗺𝗮𝗴𝗲 𝗲𝗱𝗶𝘁𝗶𝗻𝗴 across reference-guided style transfer, multi-reference composition, local infographic editing and text editing🌟Improvements over U1 on generation & editing benchmarks:
🔹Qwen-Image-Bench: 47.14 → 55.20 (w/ PE)
🔹ImgEdit-Bench: 3.90 → 4.37
🔹GEdit-Bench-en: 7.47 → 8.17
🔹GEdit-Bench-zh: 7.42 → 8.05From U1 to U1.5, this open-source journey reflects our continued innovation at the foundation-model level. Meanwhile, U1 Pro, our production-ready model for creators, will open for public access soon.🛠️ GitHub: https://github.com/OpenSenseNova/SenseNova-U1/blob/feat/u1.5_preview/docs/u1.5_preview.md
🤗 Hugging Face: https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
👾 Discord: https://discord.com/invite/BuTXPHmQub译商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。另有 1 家信源报道IT之家(RSS)
推荐理由:8B 参数的小模型在生成和编辑上接近闭源水平,有望降低轻量化多模态应用的门槛,但预览版功能可能尚不完整。
10:44
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。
另有 3 家信源报道X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)
推荐理由:与多数开源视频模型不同,H3 原生支持同步生成立体声音频,且通过上下文再生成实现 2K 分辨率,为音视频生成应用提供了更完整的开源基座。