Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。
另有 1 家信源报道X:Midjourney (@midjourney)Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。
另有 1 家信源报道X:Midjourney (@midjourney)Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。
另有 21 家信源报道X:宝玉 (@dotey)X:Yuchen Jin (@Yuchenj_UW)The Verge:AI(RSS)X:Thariq (@trq212)X:Claude (@claudeai)TechCrunch:AI(RSS)X:Testing Catalog (@testingcatalog)X:歸藏 (@op7418)X:Rohan Paul (@rohanpaul_ai)MarkTechPost(RSS)公众号:数字生命卡兹克X:AI Safety Memes (@AISafetyMemes)X:小北 (@frxiaobei)X:邵猛 (@shao__meng)The Decoder:AI News(RSS)X:Berry Xia (@berryxia)公众号:卡尔的AI沃茨X:Claude Devs (@ClaudeDevs)X:Kim (@kimmonismus)IT之家(RSS)Simon Willison 博客蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-flash,总参数量124B,激活参数量仅5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰Ring-2.6-1T。模型采用原生混合线性注意力架构与1/64稀疏MoE,并扩展至10,000+可交互训练环境,长输入下TTFT降低60%至80%以上。
另有 2 家信源报道X:蚂蚁百灵 (@AntLingAGI)IT之家(RSS)Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。
SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。
另有 6 家信源报道X:Deedy Das (@deedydas)X:Emad Mostaque (@EMostaque)X:歸藏 (@op7418)X:Berry Xia (@berryxia)The Decoder:AI News(RSS)X:邵猛 (@shao__meng)阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如[whisper]、[angry])、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。
另有 4 家信源报道X:小互 (@xiaohu)MarkTechPost(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)IT之家(RSS)Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。
We're rolling out three new models to make AI agents faster, smarter, and cheaper at scale: 🔵 Gemini 3.6 Flash: It uses...
另有 20 家信源报道X:小互 (@xiaohu)X:Jeff Dean (@JeffDean)X:Rohan Paul (@rohanpaul_ai)X:宝玉 (@dotey)Artificial Intelligence News(RSS)X:Google AI (@GoogleAI)MarkTechPost(RSS)X:Google DeepMind (@GoogleDeepMind)Ars Technica:AI(RSS)IT之家(RSS)X:Berry Xia (@berryxia)X:fofr (@fofrAI)The Verge:AI(RSS)X:Logan Kilpatrick (@OfficialLoganK)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)X:Google AI for Developers (@googleaidevs)TechCrunch:AI(RSS)The Decoder:AI News(RSS)X:Gemini (@GeminiApp)Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中 Gemini 3.6 Flash 为最新主力模型,3.5 Flash-Lite 主打更低成本与更高效率,3.5 Flash Cyber 则针对网络安全场景优化。三款模型均通过 Google AI 开发者平台提供 API 访问。
另有 20 家信源报道X:小互 (@xiaohu)X:Jeff Dean (@JeffDean)X:Rohan Paul (@rohanpaul_ai)X:宝玉 (@dotey)Artificial Intelligence News(RSS)X:Google AI (@GoogleAI)MarkTechPost(RSS)X:Google DeepMind (@GoogleDeepMind)Ars Technica:AI(RSS)IT之家(RSS)X:Berry Xia (@berryxia)X:fofr (@fofrAI)The Verge:AI(RSS)X:Logan Kilpatrick (@OfficialLoganK)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)X:Google AI for Developers (@googleaidevs)TechCrunch:AI(RSS)The Decoder:AI News(RSS)X:Gemini (@GeminiApp)小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。
另有 4 家信源报道X:歸藏 (@op7418)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)X:小互 (@xiaohu)通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。
另有 6 家信源报道Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:swyx (@swyx)X:通义千问 / Qwen (@Alibaba_Qwen)The Decoder:AI News(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。
另有 1 家信源报道MarkTechPost(RSS)通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
另有 4 家信源报道X:小互 (@xiaohu)MarkTechPost(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)IT之家(RSS)上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。
面壁智能联合 OpenBMB 发布并开源 MiniCPM-Robot 系列,包括通用 VLA 模型 MiniCPM-RobotManip(1.5B 参数)与移动跟踪模型 MiniCPM-RobotTrack(0.9B 参数)。
另有 1 家信源报道X:面壁智能 OpenBMB (@OpenBMB)面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。
另有 2 家信源报道公众号:面壁智能(MiniCPM)IT之家(RSS)昆仑万维董事长方汉在WAIC上宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p分辨率下单卡可达20FPS实时生成,核心架构已开源。
另有 1 家信源报道公众号:昆仑万维(天工)Qwen3.8 即将发布并很快开源权重!🌐 该模型拥有 2.4T 海量参数,正在持续进化。我们相信它是目前最强大的模型之一,可与领先的前沿 AI 模型媲美,仅次于 Fable 5。 你无需等待即可测试。就在刚才,Qwen3.8-Max-Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上首次亮相。快来抢先体验吧。 期待你的作品。敬请关注!🚀
另有 11 家信源报道X:Berry Xia (@berryxia)X:通义千问 / Qwen (@Alibaba_Qwen)X:Nathan Lambert (@natolambert)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:小互 (@xiaohu)X:邵猛 (@shao__meng)X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)X:Vista (@vista8)On our cyber range "The Last Ones", GLM-5.2 matches Opus 4.5, released ~7 months before it, while DeepSeek's V4-Pro fall...
另有 20 家信源报道X:OpenAI (@OpenAI)The Decoder:AI News(RSS)X:Rohan Paul (@rohanpaul_ai)IT之家(RSS)X:Sam Altman (@sama)TechCrunch:AI(RSS)MarkTechPost(RSS)Hacker News 热门(buzzing.cc 中文翻译)The Verge:AI(RSS)Simon Willison 博客X:Berry Xia (@berryxia)X:Nathan Lambert (@natolambert)X:邵猛 (@shao__meng)X:Kim (@kimmonismus)X:宝玉 (@dotey)X:Tibo (@thsottiaux)X:小北 (@frxiaobei)X:Gabriel (@gabriel1)OpenAI:官网动态(RSS · 排除企业/客户案例)X:阿易 AI Notes (@AYi_AInotes)NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。
另有 3 家信源报道X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)IT之家(RSS)通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
另有 1 家信源报道IT之家(RSS)Kimi K3 在 Frontend Code Arena 以 1679 分登顶,力压 Claude Fable 5 与 GPT-5.6 Sol,7 个前端细分赛道拿下 6 个第一。该模型为 2.8 万亿参数 MoE 架构,百万上下文窗口,7 月 27 日开放权重。K3 的 API 定价为输入每百万 tokens 15 美元,对标前沿闭源模型,放弃低价路线,转向长上下文智能体编码场景的定价策略。
Kimi K3 今日正式发布,Moonshot 官方官宣,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态能力,7月27日开放模型权重。 网上已有声音称其在多项基准测试中超越 Fable,翻完官方基准数据图后会发现,这是选择性解读的...
另有 2 家信源报道X:阿易 AI Notes (@AYi_AInotes)X:SemiAnalysis (@SemiAnalysis_)NVIDIA 推出 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),一个完全开源的音频-视觉大语言模型,专为理解和推理长视频中的音频、图像与复杂场景设计。
月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。
另有 18 家信源报道X:歸藏 (@op7418)The Decoder:AI News(RSS)公众号:月之暗面(Kimi)X:邵猛 (@shao__meng)IT之家(RSS)X:Berry Xia (@berryxia)X:Kimi.ai (@Kimi_Moonshot)X:Elvis Saravia (@omarsar0, DAIR.AI)X:Kim (@kimmonismus)X:Ethan Mollick (@emollick)X:Oran Ge (@oran_ge)X:洪明 (@hongming731)X:Artificial Analysis (@ArtificialAnlys)X:Testing Catalog (@testingcatalog)Nathan Lambert:Interconnects(RSS)公众号:数字生命卡兹克X:小互 (@xiaohu)X:卡兹克 (@Khazix0918)阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。
另有 1 家信源报道IT之家(RSS)Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。
另有 4 家信源报道X:Berry Xia (@berryxia)X:小互 (@xiaohu)IT之家(RSS)The Decoder:AI News(RSS)在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本,支持 vLLM 部署。配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。
另有 6 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:腾讯混元 (@TencentHunyuan)X:Testing Catalog (@testingcatalog)IT之家(RSS)The Decoder:AI News(RSS)X:Rohan Paul (@rohanpaul_ai)商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。
德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的MoE架构。模型完全在德国电信慕尼黑工业AI云上训练,训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。在基准测试中,Soofi S在所有完全开源模型中取得英语和德语综合最高分,超越OLMo 3 32B和Apertus 70B。在HumanEval上得分73.8%,MBPP得分70.2,德语版MBPP得分84.2。上下文窗口支持最高100万token,在4万token长度下,生成吞吐量约为同规模稠密模型的8倍。模型权重已开源。
另有 4 家信源报道HuggingFace Daily Papers(社区热门论文)X:阿易 AI Notes (@AYi_AInotes)MarkTechPost(RSS)Hacker News 热门(buzzing.cc 中文翻译)腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
腾讯混元团队发布Hy3模型,采用295B总参数、21B激活参数的MoE架构,推理效率可打平参数规模2-5倍的旗舰模型。Hy3定位为Agent向LLM,从preview到正式版基于50多个真实业务反馈迭代,内部WorkBuddy任务成功率从72%提升至90%,耗时降低34%,幻觉和常识错误持续下降。实测显示其在coding、办公、复杂任务规划方面表现突出,纯视觉能力为短板。Hy3已集成至微信服务10亿+用户,视频演示包括生成HTML网页、Agent网页和10页PPT,模型具备自检和主动说明不足的能力。
最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 ,...
另有 1 家信源报道X:阿易 AI Notes (@AYi_AInotes)♥️ GPT-5.6 在健康领域迈出了重要一步,无论是在前沿性能还是成本方面。 这些模型推动了每美元性能的边界,将最优秀的健康智能带给所有人。最小的变体 GPT-5.6 Luna,在最低推理努力下进行评估,其表现超过了最高推理努力下的 GP...
蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。
另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)GPT-5.6 is a major step forward for health intelligence. Across the lineup, we're delivering stronger performance at low...
GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。