内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态模型 · 88 条
来源全部一手资讯X
类型模型
全部模型产品行业论文教程观点
标签「部署/工程」清除

今天8月26日 周三

22:07Qwen57Qwen3.8-Flash-Next 发布,SGLang 首日支持
21:56LMSYS:Blog(Chatbot Arena 团队)70同事件Qwen 开源 Qwen3.8-Flash-Next,SGLang 提供 Day-0 支持同一事件,精选展示《Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览》
21:37Qwen47Qwen3.8-Flash-Next 获 SGLang 首发支持
21:37Qwen52Qwen3.8-Flash-Next 获 vLLM 首发支持

8月25日周二

06:29MarkTechPost(RSS)58Fastino 发布 GLiNER2.5:以边界预测取代跨度枚举的信息抽取架构

8月22日周六

01:30Ant Ling59蚂蚁百灵开源Ling-3.0-flash-dspark草稿模型

8月21日周五

02:55MarkTechPost(RSS)46Liquid AI 发布 LFM2.5-DSpark 草稿模型,解码速度最高提升 3.18 倍且输出不变
01:06Hugging Face:Blog(RSS)61精选Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

8月19日周三

23:41Elon Musk50Grok 4.6 上线 Amazon Bedrock
23:30SpaceXAI39Grok 4.6 登陆 Amazon Bedrock

8月15日周六

00:52Qwen54Qwen3.8-2.4T-A95B上线DeepInfra

8月14日周五

23:54Alibaba Cloud66Qwen 3.8-Max 登陆 Modal 支持百万上下文
23:52Qwen59Qwen3.8-Max 登陆 Nebius Token Factory
23:52Qwen47Qwen3.8-Max登陆DigitalOcean无服务器推理
23:52Qwen45通义千问发布 Qwen3.8-27B:单 GPU 运行,原生 262K 上下文可扩展至 1M
05:18TechCrunch:AI(RSS)54Writer 发布新旗舰模型 Palmyra X6 并升级智能体框架以控制 token 成本

8月13日周四

12:15AYi52微信3B激活参数模型WeLM嵌入14亿用户

8月11日周二

14:47MarkTechPost(RSS)57webAI 发布 TwIL-LM:1.7B 和 3B 形式逻辑模型家族,可在本地硬件上运行
08:11IT之家(RSS)50OpenAI 扩展网络安全防御服务 Daybreak,推出新模型 GPT-5.6-Cyber

8月9日周日

20:32蚂蚁 inclusionAI:HuggingFace 新模型60精选inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark

8月7日周五

20:31公众号:蚂蚁百灵(Ling)75精选蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

8月5日周三

23:39Ant Ling59蚂蚁百灵发布Ling-3.0-flash INT4与FP4版本

8月4日周二

16:20公众号:腾讯混元65精选腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

7月31日周五

16:57Tencent Hy60腾讯混元 Hy-MT2 开源下载超 70 万,30B 版发布 GGUF
01:27OpenAI:官网动态(RSS · 排除企业/客户案例)66精选GPT-5.6 如何推进性价比前沿

7月30日周四

23:33Google AI Developers64同事件Gemini Robotics ER 2 发布,专为物理 AI 设计同一事件,精选展示《Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人》
05:57Greg Brockman45GPT-5.6 Sol 提升生产推理效率

7月28日周二

00:02Kimi.ai57Kimi K3 上线 Baseten 模型 API
00:02Kimi.ai53Kimi K3 登陆 Fireworks,支持部署微调

7月24日周五

22:54Chubby♨️37GPT-5.6x 下周在 Cerebras 以 750 tokens/s 发布
22:50IT之家(RSS)64同事件蚂蚁集团发布百灵原生混合推理模型 Ling-3.0-flash同一事件,精选展示《蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰》

7月23日周四

17:25Google AI:DEV 作者专属(RSS)73精选Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布

7月22日周三

14:22Rohan Paul47Perplexity 发布基于 GLM 5.2 微调的编排模型,性能接近前沿且成本仅为 Opus 三分之一
03:52Google DeepMind58Gemini 3.5 Flash-Lite 高效处理重复任务

7月17日周五

12:02SemiAnalysis60Kimi K3 2.8T 模型需 GB300 等大显存 GPU

7月16日周四

17:31The Decoder:AI News(RSS)48Gemma 4 静默更新:修复工具调用错误并提升 Hopper GPU 性能

7月15日周三

12:15Tencent Hy69精选腾讯混元发布 Hy3 1-bit 与 4-bit 版本
07:06MarkTechPost(RSS)44PrismML 发布 Bonsai 27B:Qwen3.6-27B 的低比特版本,可在笔记本和手机上运行
03:38Emad47腾讯混元发布Hy3量化版本,Emad Mostaque称赞1-bit性能

7月14日周二

17:10Tencent Hy75同事件腾讯混元发布 Hy3 模型 1-bit/4-bit 量化版,单 GPU 可运行同一事件,精选展示《腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能》
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
模型 · 标签「部署/工程」 · 88 条清除

8月26日

星期三 · 4 条
22:07
Qwen@Alibaba_Qwen
AI 评分 57/100
通义千问发布 Qwen3.8-Flash-Next,SGLang 即日支持部署。该模型为 125B 主模型,含 51B N-gram 嵌入,每 token 激活 6B 参数。N-gram 嵌入几乎不增加计算成本即可扩展容量,并可通过异步预取驻留内存;GDN+QSA 混合注意力兼顾长任务效率与检索精度。

SGLang: Congrats to @Alibaba_Qwen on launching Qwen3.8-Flash! SGLang is proud to be a day-0 partner supporting the new architect...

推理模型发布部署/工程
21:56
LMSYS:Blog(Chatbot Arena 团队)同事件
AI 评分 70/100
Qwen 开源 Qwen3.8-Flash-Next,SGLang 提供 Day-0 支持

Qwen 团队开源多模态 MoE 模型 Qwen3.8-Flash-Next,作为 Qwen4 架构的早期预览版。该模型采用 125B 参数主模型加 51B N-gram Embedding,每 token 激活 6B 参数,共 48 层,MoE 层使用 512 个专家和 top-10 路由。

多模态开源生态模型发布部署/工程
同一事件,精选展示《Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览》
21:37
Qwen@Alibaba_Qwen
AI 评分 47/100
非常感谢 @sgl_project 的首日支持!🙌 Qwen3.8-Flash-Next 今日即可通过 SGLang 部署。

SGLang: @Alibaba_Qwen Congrats on launching Qwen3.8-Flash! SGLang is proud to be a day-0 partner supporting the new architecture...

开源生态模型发布部署/工程
21:37
Qwen@Alibaba_Qwen
AI 评分 52/100
通义千问 Qwen3.8-Flash-Next 获 vLLM 首发(day-0)支持,已在 NVIDIA 和 AMD GPU 上验证。该超稀疏多模态 MoE 模型拥有 125B 总参数、6B 激活参数、262K 原生上下文(经 YaRN 可扩展至 1M),并附带可卸载的 51B N-gram 表。模型现可通过 vllm/vllm-openai:qwen38-flash-next 镜像运行。

vLLM: Qwen3.8-Flash-Next from @Alibaba_Qwen has day-0 support in vLLM, verified on NVIDIA and AMD GPUs. 🎉 Ultra-sparse multim...

开源生态推理模型发布部署/工程

8月25日

星期二 · 1 条
06:29
MarkTechPost(RSS)
AI 评分 58/100
Fastino 发布 GLiNER2.5:以边界预测取代跨度枚举的信息抽取架构

Fastino 发布 GLiNER2.5,以边界预测取代跨度枚举,移除最大实体宽度限制,支持 4096 词上下文,计算量随序列长度线性增长。多语言检查点在 16 个零样本基准上整体 macro F1 达 56.17(GLiNER2 为 56.09),XNLI 提升 24.75 分。

Hugging Face开源生态模型发布部署/工程

8月22日

星期六 · 1 条
01:30
Ant Ling@AntLingAGI
AI 评分 59/100
今天我们开源了 Ling-3.0-flash-dspark,这是一个专为 Ling-3.0-flash 构建的 DSpark 草稿模型。在 4 块 NVIDIA Blackwell GPU 上,batch 为 1 时,它在 1,000 个请求中实现了 1,120 tok/s 的吞吐量、0.78 ms 的平均 TPOT,以及 9.95 的接受长度。🧵
开源生态模型发布部署/工程

8月21日

星期五 · 2 条
02:55
MarkTechPost(RSS)
AI 评分 46/100
Liquid AI 发布 LFM2.5-DSpark 草稿模型,解码速度最高提升 3.18 倍且输出不变

Liquid AI 为 LFM2.5 系列三款模型(1.2B-Instruct、2.6B、8B-A1B)发布 DSpark 草稿模型检查点,通过约 300M 参数的草稿模型一次提出 9 个候选 token,由目标模型单次前向验证,在 H100 上解码速度最高提升 3.18 倍,M4 Max MacBook Pro 上最高 2.87 倍。

推理模型发布部署/工程
01:06
Hugging Face:Blog(RSS)精选
AI 评分 61/100
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。

推理模型发布部署/工程

推荐理由:约300M参数的draft模型换最高3.18倍吞吐,贪心输出不变,LFM2.5-2.6B在M4 Max达139 tok/s,本地agent门槛被拉低。

8月19日

星期三 · 2 条
23:41
Elon Musk@elonmusk
AI 评分 50/100
Grok 4.6 现已上线 Bedrock。

SpaceXAI: Grok 4.6 is live on Amazon Bedrock https://x.ai/news/grok-4-6-amazon-bedrock

xAI模型发布部署/工程
23:30
SpaceXAI@SpaceXAI
AI 评分 39/100
Grok 4.6 已在 Amazon Bedrock 上线https://x.ai/news/grok-4-6-amazon-bedrock
xAI模型发布部署/工程

8月15日

星期六 · 1 条
00:52
Qwen@Alibaba_Qwen
AI 评分 54/100
顶级智能,一次 API 调用即可获得。Qwen3.8-2.4T-A95B 现已上线 DeepInfra,随时支持你的创意构建。🥳 快来 DeepInfra 深入了解吧!@DeepInfra

DeepInfra: New on DeepInfra: Qwen3.8-2.4T-A95B 🚀 @Alibaba_Qwen's latest sparse MoE — 2.4T total params, 95B active, 512 experts. B...

推理模型发布编码部署/工程

8月14日

星期五 · 5 条
23:54
Alibaba Cloud@alibaba_cloud
AI 评分 66/100
Qwen 3.8-Max 已在 Modal 上线,支持完整 1M 上下文窗口,并配备定制的 DFlash 投机解码器。很高兴看到我们的发布合作伙伴 Modal 从第一天起就全力投入!⚡️ 2.4T 参数。1M 上下文。而且,依然只需一次 Modal 调用即可使用。@modal

Modal: Qwen3.8-2.4T-A95B by @Alibaba_Qwen and @alibaba_cloud is now available on Modal. Served with a custom DFlash speculator ...

推理模型发布部署/工程
23:52
Qwen@Alibaba_Qwen
AI 评分 59/100
Qwen3.8-Max 将于 Day 0 登陆 Nebius Token Factory。很高兴与 Nebius 作为 Day 0 首发合作伙伴携手启动,为更多用户带来专属推理服务。大模型,从一开始就火力全开。🔥@nebiustf

Nebius Token Factory: Qwen3.8-2.4T-A95B is going open weight: 2.4T parameters, with 95B active, and Nebius Token Factory is joining as a Day 0...

开源生态模型发布部署/工程
另有 1 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)
23:52
Qwen@Alibaba_Qwen
AI 评分 47/100
Qwen3.8-Max已在DigitalOcean Serverless Inference上线。与DigitalOcean作为Day 0发布合作伙伴同步推出。大模型,平稳运行。现已登陆DigitalOcean。🌊🏄♀️ @digitalocean

DigitalOcean: Now available: @Alibaba_Qwen 3.8-2.4T-A95B from @alibaba_cloud on DigitalOcean Serverless Inference via NVIDIA HGX™ B300...

模型发布编码部署/工程
23:52
Qwen@Alibaba_Qwen
AI 评分 45/100
通义千问发布 Qwen3.8-27B,采用与 2.4T 旗舰相同的混合骨干架构,但为稠密而非 MoE,单张 Blackwell GPU 即可运行。原生 262K 上下文可扩展至 1M,GB300 上可同时处理 6 条全长序列;MTP 草稿头内置于检查点,短提示词接受率 BF16 达 92.2%、FP8 达 84.8%。

vLLM: 🎉 Qwen3.8-27B is here from @Alibaba_Qwen, and the whole thing fits on a single GPU. Same hybrid backbone as the 2.4T fl...

模型发布部署/工程
05:18
TechCrunch:AI(RSS)
AI 评分 54/100
Writer 发布新旗舰模型 Palmyra X6 并升级智能体框架以控制 token 成本

Writer 周四推出新旗舰模型 Palmyra X6,基于 Z.ai 开源模型 GLM-5.2 构建,结合框架基础设施升级,预计可为客户在基础任务上削减高达 50% 的成本。该公司同时发布标准智能体框架的重大升级,两项功能即日起对客户开放。Writer 研究显示,框架效率优化比模型选择更能可靠降低成本,测试中成本平均下降 40%。

智能体模型发布部署/工程

8月13日

星期四 · 1 条
12:15
AYi@AYi_AInotes
AI 评分 52/100
微信3B激活参数模型WeLM嵌入14亿用户

微信发布自研大模型WeLM,80B总参数、3B激活参数,主打资源效率而非跑分,已嵌入聊天、搜索、小程序等内部功能。3B激活是14亿用户规模下对推理成本、端侧延迟和并发压力的必然选择。617B的MoE版本也在开发中,面向智能小程序开发和工具生成。

WeChat: Meet WeLM — a family of large language models built by the Weixin team with resource efficiency at its core.

推理模型发布部署/工程
另有 1 家信源报道IT之家(RSS)

8月11日

星期二 · 2 条
14:47
MarkTechPost(RSS)
AI 评分 57/100
webAI 发布 TwIL-LM:1.7B 和 3B 形式逻辑模型家族,可在本地硬件上运行

webAI 发布 TwIL-LM 形式逻辑模型家族,含 1.7B 和 3B 两个版本,均可在本地硬件运行,仅限非商业使用。其中 TwIL-LM3 为 SmolLM3-3B 的合并微调版本,在六项平均得分上以 0.4488 落后于 gpt-oss-120b 的 0.5192,但生成效率更高,每秒可处理 32.9 个答案,而后者仅为 4.2。

推理模型发布部署/工程
08:11
IT之家(RSS)
AI 评分 50/100
OpenAI 扩展网络安全防御服务 Daybreak,推出新模型 GPT-5.6-Cyber

OpenAI 本周宣布扩展其网络防御服务 Daybreak,新增 Blue 和 Red 两个等级,分别面向基础防御与安全测试、漏洞研究。Red 等级独家提供基于 GPT-5.6 Sol 构建的新模型 GPT-5.6-Cyber,目前仅向埃森哲、IBM、CrowdStrike、Cloudflare 等可信客户合作伙伴开放。

OpenAI模型发布部署/工程

8月9日

星期日 · 1 条
20:32
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 60/100
inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark

inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。

Hugging Face推理模型发布部署/工程

推荐理由:该模型把投机解码的接受长度按工作负载分开报告,数学与代码任务明显高于对话类,部署时可据此对不同场景的加速收益有更实际预期。

8月7日

星期五 · 1 条
20:31
公众号:蚂蚁百灵(Ling)精选
AI 评分 75/100
蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。

推理模型发布部署/工程
另有 3 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)X:蚂蚁百灵 (@AntLingAGI)
推荐理由:提供FP4/INT4量化版本并验证单机推理,让数据敏感、预算有限的团队也能本地运行千亿参数模型,将大模型能力从云端拉回到可控环境。

8月5日

星期三 · 1 条
23:39
Ant Ling@AntLingAGI
AI 评分 59/100
🚀 今天,我们发布 Ling-3.0-flash 的 INT4 和 FP4(MXFP4)版本。两者均可通过我们适配 Spark 的 SGLang 路径,在单台 NVIDIA DGX Spark 上端到端运行。对于 FP4,W4A16 是稳定默认配置,而 W4A8 则为更高吞吐量而调优。量化模型的效率和精度仍在持续演进中。我们将持续更新推理实现和量化权重。
模型发布端侧部署/工程

8月4日

星期二 · 1 条
16:20
公众号:腾讯混元精选
AI 评分 65/100
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。

模型发布语音部署/工程
另有 2 家信源报道IT之家(RSS)X:腾讯混元 (@TencentHunyuan)
推荐理由:将 LLM 语义理解融入语音识别,上下文纠错和热词注入降低了专业场景的接入成本,元宝已集成可体验。

7月31日

星期五 · 2 条
16:57
Tencent Hy@TencentHunyuan
AI 评分 60/100
腾讯混元 Hy-MT2 开源下载超 70 万,30B 版发布 GGUF

腾讯混元 Hy-MT2 自 5 月开源以来下载量超 70 万次,其中 Hy-MT2-1.8B 登顶 Hugging Face 趋势榜,30B-A3B 位列第四,并已获 70 余项产品集成。现 Hy-MT2-30B-A3B 正式发布 GGUF 格式,支持本地推理,并已适配 Apple MLX-LM、NVIDIA NeMo 等生态。

Hugging Face开源生态模型发布部署/工程
01:27
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 66/100
GPT-5.6 如何推进性价比前沿

OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。

OpenAI推理模型发布部署/工程
另有 13 家信源报道X:Kim (@kimmonismus)X:Nathan Lambert (@natolambert)X:OpenAI Developers (@OpenAIDevs)X:Sam Altman (@sama)The Decoder:AI News(RSS)X:Tibo (@thsottiaux)X:Artificial Analysis (@ArtificialAnlys)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)Simon Willison 博客IT之家(RSS)
推荐理由:GPT-5.6 的价格调整不只是数字游戏,而是 OpenAI 用更高效的模型把推理成本往下压了一大截,企业部署的门槛又低了一个量级。

7月30日

星期四 · 2 条
23:33
Google AI Developers@googleaidevs同事件
AI 评分 64/100
Gemini Robotics ER 2 是我们最强大的具身推理模型,专为物理 AI 设计 🤖该模型作为机器人的高级大脑,可直接连接 Gemini Live API。它处理连续视频流以跟踪进度、调用工具、搜索网络,并实时指挥动作模型。面向开发者的升级包括:+ 增强的进度跟踪 + 实时执行中故障检测 + 多机器人协作 + 高级安全指令遵循
Google具身智能模型发布部署/工程
同一事件,精选展示《Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人》
05:57
Greg Brockman@gdb
AI 评分 45/100
GPT-5.6 Sol 用于改进生产服务效率。这是我们能够获得如此出色性价比的方式之一:部署后,我们应用 GPT-5.6 Sol 通过让自身运行更高效来推进效率前沿。结果: • 生产 GPU 内核改进使服务成本降低 20%。 • 改进的推测解码使 token 生成效率提升 15% 以上。

OpenAI: After deployment, we applied GPT-5.6 Sol to advance the frontier of efficiency by making itself more efficient to run. T...

OpenAI推理模型发布部署/工程

7月28日

星期二 · 2 条
00:02
Kimi.ai@Kimi_Moonshot
AI 评分 57/100
很高兴 @baseten 成为我们的 Day 0 启动合作伙伴,将 K3 带给更多用户! Baseten 的模型 API 提供对 Kimi K3 的快速、可靠访问。

Baseten: Kimi K3 is now live on our Model APIs, day 0.

模型发布部署/工程
00:02
Kimi.ai@Kimi_Moonshot
AI 评分 53/100
很高兴 @FireworksAI_HQ 成为我们的 day0 启动合作伙伴,将 Kimi K3 带给更多开发者。借助 Fireworks,你现在只需点击几下即可部署和微调 2.8T 参数的 Kimi K3 模型!

Fireworks: Kimi K3 is live on Fireworks. Day 0, inference and training. US-hosted, and zero data retention. This is the first front...

开源生态模型发布部署/工程

7月24日

星期五 · 2 条
22:54
Chubby♨️@kimmonismus
AI 评分 37/100
GPT-5.6xhigh on cerebras @ 750 tokens/s 终于下周发布。在承诺月的最后一天,本应发布的日子。然后我终于可以回家了……只有好心情~

jason: directorial debut was this thursday, next thursday, we go again. but something completely different. and then i can fina...

OpenAI推理模型发布部署/工程
22:50
IT之家(RSS)同事件
AI 评分 64/100
蚂蚁集团发布百灵原生混合推理模型 Ling-3.0-flash

蚂蚁集团发布百灵新一代原生混合推理模型 Ling-3.0-flash,总参数量 124B,激活参数量仅 5.1B,能力对标甚至超越上一代 1T 级旗舰 Ring-2.6-1T。该模型采用原生混合线性注意力架构,长输入下 TTFT 降低 60% 至 80%+。即日起至 8 月 3 日,模型在 OpenRouter 与百灵官方平台开放限时免费 API 调用,免费期结束后将正式开源。

推理模型发布部署/工程
同一事件,精选展示《蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰》

7月23日

星期四 · 1 条
17:25
Google AI:DEV 作者专属(RSS)精选
AI 评分 73/100
Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布

Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。

Google多模态推理模型发布

推荐理由:Gemini 3.6 Flash 降本增效,3.5 Flash-Lite 主打低成本高速,弃用 temperature 等参数是个硬变更,使用 Gemini 的开发者必须检查迁移。

7月22日

星期三 · 2 条
14:22
Rohan Paul@rohanpaul_ai
AI 评分 47/100
Perplexity 发布基于 GLM 5.2 微调的编排模型,性能接近前沿且成本仅为 Opus 三分之一

Perplexity 在 Perplexity Computer 中发布了一款基于 GLM 5.2 微调的编排模型研究预览。该模型在 Terminal-Bench 2.1 上得分 80,超越 Opus 4.8(76)和 GPT-5.5(78),平均任务成本仅为 Opus 的三分之一(0.344x)。

Perplexity: We're releasing a research preview of a new orchestrator model in Perplexity Computer. The model is an adapted version o...

智能体推理模型发布部署/工程
03:52
Google DeepMind@GoogleDeepMind
AI 评分 58/100
Gemini 3.5 Flash-Lite 是我们快速、经济高效的模型,适用于扩展重复性用例,如工单分类和数据提取。 观看它在一系列高容量任务中与 3.5 Flash 的对比表现 ↓
Google模型发布部署/工程
另有 3 家信源报道MarkTechPost(RSS)X:Rohan Paul (@rohanpaul_ai)X:Jeff Dean (@JeffDean)

7月17日

星期五 · 1 条
12:02
SemiAnalysis@SemiAnalysis_
AI 评分 60/100
Kimi K3 2.8T 规模太大,即使在 FP4 精度下也无法单机部署在 NVIDIA DGX B200 上。需要 GB300 NVL72、B300 或 MI355X 系统,因为每块 GPU 拥有 288 GB 显存。一种能让 Kimi K3 适配 B200 的优化方案是,将多个节点组合在一起并使用名为 WideEP 的技术。问题在于 B200 的节点间带宽仅为 400 Gbit/s,而 NVL72 的节点间带宽是其 18 倍。
推理模型发布部署/工程

7月16日

星期四 · 1 条
17:31
The Decoder:AI News(RSS)
AI 评分 48/100
Gemma 4 静默更新:修复工具调用错误并提升 Hopper GPU 性能

Google 为开源模型 Gemma 4 推送更新,在 Nvidia Hopper GPU 上启用 Flash Attention 4 后,提示词处理速度提升 25-70%,首 token 延迟降低 31%。更新还修复了工具调用错误和响应截断问题,Gemma 4 31B 在电信场景的智能体推理性能提升 10.1%。

Google模型发布部署/工程

7月15日

星期三 · 3 条
12:15
Tencent Hy@TencentHunyuan精选
AI 评分 69/100
找不到基准测试和下载链接?看这里👇https://huggingface.co/AngelSlim/Hy3-GGUF我们刚刚发布了 Hy3 的 1-bit 与 4-bit 版本,这是一个旗舰级 295B 模型,可在单张 GPU 上运行。👌使用 llama.cpp 运行 Hy3,启用 MTP,在显著更低的硬件上体验强大的智能。🚀🚀🚀迫不及待想看到你们的作品。#Hy3 #Hy #GGUF #llamacpp

Tencent Hy: 我们刚刚发布了 Hy3 的 1-bit 和 4-bit 版本,这是一款旗舰级规模的 295B 模型,可以在单张 GPU 上运行。👌 使用 llama.cpp 运行 Hy3,启用 MTP,在显著降低的硬件配置上体验强大的智能能力。🚀🚀�...

开源/仓库模型发布端侧部署/工程

推荐理由:混元把295B旗舰模型压进单GPU,1-bit和4-bit版本对本地部署是个大礼包,开源社区可以动起来了。
07:06
MarkTechPost(RSS)
AI 评分 44/100
PrismML 发布 Bonsai 27B:Qwen3.6-27B 的低比特版本,可在笔记本和手机上运行

PrismML 发布 Bonsai 27B,这是 Qwen3.6-27B 的低比特表示,非全新预训练模型。三值版使用 {−1, 0, +1} 权重,每权重 1.71 bits,大小 5.9GB;1-bit 版使用 {−1, +1} 权重,每权重 1.125 bits,大小 3.9GB。两者均支持多模态,上下文窗口 262K tokens。三值版保留 FP16 基线 94.6% 的推理性能,1-bit 版保留 89.5%。1-bit 版是首个可装入手机的 27B 级模型。PrismML 还提供 DSpark 推测解码 drafter,在 H100 上实现 1.37 倍加速。两者均以 Apache 2.0 许可证发布,支持 llama.cpp 和 MLX。

模型发布端侧部署/工程
03:38
Emad@EMostaque
AI 评分 47/100
腾讯混元发布旗舰级295B参数模型Hy3的1-bit与4-bit量化版本,可在单GPU上运行。Emad Mostaque引用该消息并指出,Hy3在1-bit量化下SWE-bench Verified得分75.4%、SWE-bench Pro得分53.9%,性能惊人。模型仅88GB,可在Macbook Max上运行。他预期基于NVP4训练的模型性能下降更少,并建议未来可全面采用二进制推理。用户可通过llama.cpp运行Hy3并启用MTP。

Tencent Hy: We’ve just released the 1-bit & 4-bit version of Hy3, a flagship-scale 295B model that can be served on a single GPU. 👌...

模型发布端侧部署/工程

7月14日

星期二 · 1 条
17:10
Tencent Hy@TencentHunyuan同事件
AI 评分 75/100
腾讯混元发布旗舰级 295B MoE 模型 Hy3 的 1-bit 与 4-bit 量化版本。Hy3 在同类规模中表现最佳,可媲美万亿参数级旗舰模型,适用于多数智能体场景。量化版可通过 llama.cpp 运行并启用 MTP,大幅降低硬件门槛,实现单 GPU 部署。模型采用 Apache 2.0 开源协议,支持商用,并提供 2 周免费 API(通过 OpenRouter)。

Tencent Hy: 🚀Hy3 来了。 295B MoE。同尺寸级别中最佳。媲美万亿参数级旗舰模型。 可靠且价格实惠,适用于大多数智能体使用场景。 采用 Apache 2.0 协议。对商业使用友好。 免费 API 开放两周 → https://openrout...

开源生态模型发布部署/工程
同一事件,精选展示《腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能》
已加载 40 条