Congrats to @Alibaba_Qwen on launching Qwen3.8-Flash! SGLang is proud to be a day-0 partner supporting the new architect...
Congrats to @Alibaba_Qwen on launching Qwen3.8-Flash! SGLang is proud to be a day-0 partner supporting the new architect...
Qwen 团队开源多模态 MoE 模型 Qwen3.8-Flash-Next,作为 Qwen4 架构的早期预览版。该模型采用 125B 参数主模型加 51B N-gram Embedding,每 token 激活 6B 参数,共 48 层,MoE 层使用 512 个专家和 top-10 路由。
同一事件,精选展示《Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览》@Alibaba_Qwen Congrats on launching Qwen3.8-Flash! SGLang is proud to be a day-0 partner supporting the new architecture...
Qwen3.8-Flash-Next from @Alibaba_Qwen has day-0 support in vLLM, verified on NVIDIA and AMD GPUs. 🎉 Ultra-sparse multim...
Fastino 发布 GLiNER2.5,以边界预测取代跨度枚举,移除最大实体宽度限制,支持 4096 词上下文,计算量随序列长度线性增长。多语言检查点在 16 个零样本基准上整体 macro F1 达 56.17(GLiNER2 为 56.09),XNLI 提升 24.75 分。
Liquid AI 为 LFM2.5 系列三款模型(1.2B-Instruct、2.6B、8B-A1B)发布 DSpark 草稿模型检查点,通过约 300M 参数的草稿模型一次提出 9 个候选 token,由目标模型单次前向验证,在 H100 上解码速度最高提升 3.18 倍,M4 Max MacBook Pro 上最高 2.87 倍。
Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。
Grok 4.6 is live on Amazon Bedrock https://x.ai/news/grok-4-6-amazon-bedrock
New on DeepInfra: Qwen3.8-2.4T-A95B 🚀 @Alibaba_Qwen's latest sparse MoE — 2.4T total params, 95B active, 512 experts. B...
Qwen3.8-2.4T-A95B by @Alibaba_Qwen and @alibaba_cloud is now available on Modal. Served with a custom DFlash speculator ...
Qwen3.8-2.4T-A95B is going open weight: 2.4T parameters, with 95B active, and Nebius Token Factory is joining as a Day 0...
另有 1 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)Now available: @Alibaba_Qwen 3.8-2.4T-A95B from @alibaba_cloud on DigitalOcean Serverless Inference via NVIDIA HGX™ B300...
🎉 Qwen3.8-27B is here from @Alibaba_Qwen, and the whole thing fits on a single GPU. Same hybrid backbone as the 2.4T fl...
Writer 周四推出新旗舰模型 Palmyra X6,基于 Z.ai 开源模型 GLM-5.2 构建,结合框架基础设施升级,预计可为客户在基础任务上削减高达 50% 的成本。该公司同时发布标准智能体框架的重大升级,两项功能即日起对客户开放。Writer 研究显示,框架效率优化比模型选择更能可靠降低成本,测试中成本平均下降 40%。
微信发布自研大模型WeLM,80B总参数、3B激活参数,主打资源效率而非跑分,已嵌入聊天、搜索、小程序等内部功能。3B激活是14亿用户规模下对推理成本、端侧延迟和并发压力的必然选择。617B的MoE版本也在开发中,面向智能小程序开发和工具生成。
Meet WeLM — a family of large language models built by the Weixin team with resource efficiency at its core.
另有 1 家信源报道IT之家(RSS)webAI 发布 TwIL-LM 形式逻辑模型家族,含 1.7B 和 3B 两个版本,均可在本地硬件运行,仅限非商业使用。其中 TwIL-LM3 为 SmolLM3-3B 的合并微调版本,在六项平均得分上以 0.4488 落后于 gpt-oss-120b 的 0.5192,但生成效率更高,每秒可处理 32.9 个答案,而后者仅为 4.2。
OpenAI 本周宣布扩展其网络防御服务 Daybreak,新增 Blue 和 Red 两个等级,分别面向基础防御与安全测试、漏洞研究。Red 等级独家提供基于 GPT-5.6 Sol 构建的新模型 GPT-5.6-Cyber,目前仅向埃森哲、IBM、CrowdStrike、Cloudflare 等可信客户合作伙伴开放。
inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。
蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。
另有 3 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)X:蚂蚁百灵 (@AntLingAGI)腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。
另有 2 家信源报道IT之家(RSS)X:腾讯混元 (@TencentHunyuan)腾讯混元 Hy-MT2 自 5 月开源以来下载量超 70 万次,其中 Hy-MT2-1.8B 登顶 Hugging Face 趋势榜,30B-A3B 位列第四,并已获 70 余项产品集成。现 Hy-MT2-30B-A3B 正式发布 GGUF 格式,支持本地推理,并已适配 Apple MLX-LM、NVIDIA NeMo 等生态。
OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。
另有 13 家信源报道X:Kim (@kimmonismus)X:Nathan Lambert (@natolambert)X:OpenAI Developers (@OpenAIDevs)X:Sam Altman (@sama)The Decoder:AI News(RSS)X:Tibo (@thsottiaux)X:Artificial Analysis (@ArtificialAnlys)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)Simon Willison 博客IT之家(RSS)After deployment, we applied GPT-5.6 Sol to advance the frontier of efficiency by making itself more efficient to run. T...
Kimi K3 is now live on our Model APIs, day 0.
Kimi K3 is live on Fireworks. Day 0, inference and training. US-hosted, and zero data retention. This is the first front...
directorial debut was this thursday, next thursday, we go again. but something completely different. and then i can fina...
蚂蚁集团发布百灵新一代原生混合推理模型 Ling-3.0-flash,总参数量 124B,激活参数量仅 5.1B,能力对标甚至超越上一代 1T 级旗舰 Ring-2.6-1T。该模型采用原生混合线性注意力架构,长输入下 TTFT 降低 60% 至 80%+。即日起至 8 月 3 日,模型在 OpenRouter 与百灵官方平台开放限时免费 API 调用,免费期结束后将正式开源。
同一事件,精选展示《蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰》Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。
Perplexity 在 Perplexity Computer 中发布了一款基于 GLM 5.2 微调的编排模型研究预览。该模型在 Terminal-Bench 2.1 上得分 80,超越 Opus 4.8(76)和 GPT-5.5(78),平均任务成本仅为 Opus 的三分之一(0.344x)。
We're releasing a research preview of a new orchestrator model in Perplexity Computer. The model is an adapted version o...
Google 为开源模型 Gemma 4 推送更新,在 Nvidia Hopper GPU 上启用 Flash Attention 4 后,提示词处理速度提升 25-70%,首 token 延迟降低 31%。更新还修复了工具调用错误和响应截断问题,Gemma 4 31B 在电信场景的智能体推理性能提升 10.1%。
我们刚刚发布了 Hy3 的 1-bit 和 4-bit 版本,这是一款旗舰级规模的 295B 模型,可以在单张 GPU 上运行。👌 使用 llama.cpp 运行 Hy3,启用 MTP,在显著降低的硬件配置上体验强大的智能能力。🚀🚀�...
PrismML 发布 Bonsai 27B,这是 Qwen3.6-27B 的低比特表示,非全新预训练模型。三值版使用 {−1, 0, +1} 权重,每权重 1.71 bits,大小 5.9GB;1-bit 版使用 {−1, +1} 权重,每权重 1.125 bits,大小 3.9GB。两者均支持多模态,上下文窗口 262K tokens。三值版保留 FP16 基线 94.6% 的推理性能,1-bit 版保留 89.5%。1-bit 版是首个可装入手机的 27B 级模型。PrismML 还提供 DSpark 推测解码 drafter,在 H100 上实现 1.37 倍加速。两者均以 Apache 2.0 许可证发布,支持 llama.cpp 和 MLX。
We’ve just released the 1-bit & 4-bit version of Hy3, a flagship-scale 295B model that can be served on a single GPU. 👌...
🚀Hy3 来了。 295B MoE。同尺寸级别中最佳。媲美万亿参数级旗舰模型。 可靠且价格实惠,适用于大多数智能体使用场景。 采用 Apache 2.0 协议。对商业使用友好。 免费 API 开放两周 → https://openrout...
同一事件,精选展示《腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能》