Topic · 主题全部主题 →

通义千问 Qwen

阿里通义千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。

626条收录
94条精选
● 持续更新
近期焦点近 14 天 · 按多源报道热度

8月17日

星期一 · 1 条
07:01
Simon Willison 博客精选
AI 评分 73/100
Qwen 3.8 27B 表现出色,但默认推理强度过高导致过度思考

阿里 Qwen 实验室发布 Apache 2 许可的 27B 参数视觉大模型 Qwen 3.8 27B,官方基准显示其超越前代 Qwen 3.6 27B 及闭源 Qwen 3.7-Plus。

另有 4 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:Testing Catalog (@testingcatalog)Hacker News 热门(buzzing.cc 中文翻译)The Decoder:AI News(RSS)
推荐理由:把 Qwen 3.8 27B 的推理档位成本量化成时间差异,xhigh 默认让生成同一 SVG 从 137 秒膨胀到 21 分钟,这个默认值比能力更影响本地选型。

8月14日

星期五 · 1 条
23:22
Qwen@Alibaba_Qwen精选
AI 评分 71/100
通义千问开源 Qwen3.8 系列模型

通义千问兑现承诺,开源 Qwen3.8 系列模型。其中 Qwen3.8-27B 为原生多模态稠密模型,仅 27B 参数即全面超越 Qwen3.7-Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens,采用 Apache 2.0 许可。Max 级 Qwen3.8-2.4T-A95B 的开放权重也已同步发布。

另有 8 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:Testing Catalog (@testingcatalog)Hacker News 热门(buzzing.cc 中文翻译)The Decoder:AI News(RSS)IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)
推荐理由:官方称 27B 稠密多模态模型整体表现超过 Qwen3.7-Plus,262K 原生上下文可扩至 1M,Apache 2.0 协议下本地部署轻量应用多了一个更高效的选择。

8月13日

星期四 · 1 条
00:13
SiliconFlow@SiliconFlowAI精选
AI 评分 67/100
Qwen3.8-2.4T-A95B 开源,硅基流动即日上线

阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token,缓存输入 $0.25/百万 token。

另有 5 家信源报道X:硅基流动 SiliconFlow (@SiliconFlowAI)X:通义千问 / Qwen (@Alibaba_Qwen)X:Rohan Paul (@rohanpaul_ai)IT之家(RSS)X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)
推荐理由:缓存输入每百万 token 0.25 美元,让需要反复读取长上下文的 agent 工作流更接近可长期运行,而非只看单次生成价格。

8月10日

星期一 · 2 条
12:14
Qwen@Alibaba_Qwen精选
AI 评分 71/100
👀 看见只是开始。借助 Qwen-MM-Plugins,让你的智能体原生支持多模态--读取图片、视频和文档,编辑视频,处理 3D/CAD,以及更多。从多模态模型 → 多模态智能体。🚀观看实际效果:https://github.com/QwenLM/Qwen-MM-Plugins

推荐理由:让智能体直接获得视觉、文档和 3D 感知能力,把原本需要单独集成的工作流变成一组可调用的插件,原型开发速度可能因此加快。
10:11
公众号:千问APP(阿里)精选
AI 评分 73/100
千问开放平台上线:租房、寄快递、查理财等十余领域服务可对话办理

千问开放平台今日上线,面向生态伙伴和开发者开放手机、PC和AI眼镜三类终端的服务接入,首批覆盖物流运输、房产居住、本地生活、理财、汽车等十多个领域。用户可在对话中@相关服务或点击“圆点角标”进入智能体,完成从咨询、推荐到下单的完整流程。平台支持标准化协议接入、一键授权与端到端调测,并提供账号、AI支付、订单接入等基础设施。

另有 1 家信源报道IT之家(RSS)
推荐理由:把快递查询、租房比价、天气建议等高频生活服务接入对话窗口,用户从「问信息」到「下单」不再跳出应用,减少了多任务切换和重复输入的摩擦。

8月8日

星期六 · 1 条
17:11
IT之家(RSS)精选
AI 评分 76/100
苹果 Mac 简体中文支持文档更新,"Apple 智能"阿里千问扩展现身

苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。


推荐理由:苹果智能在中国大陆的落地路径终于清晰,支持文档揭示了写作工具和Siri集成千问的具体方式,Mac用户将能在系统级直接使用大模型能力。

8月7日

星期五 · 1 条
10:11
公众号:千问APP(阿里)精选
AI 评分 67/100
千问功能上新:推出思考研究、定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX

千问今日上线多项新功能,并支持最新旗舰模型 Qwen3.8-MAX。其中“思考研究”在原“深度思考”基础上升级,强化复杂推理与工具调用;“定时任务”可预设执行时间自动完成行业简报梳理等周期工作;“办公助理”能连接备忘录、日历等应用并操作电脑浏览器,直接输出可用的 Office 文档。语音通话支持 7x24 小时多场景,智能体广场首批覆盖物流、房产等十多个领域。

另有 1 家信源报道IT之家(RSS)
推荐理由:办公助理将大模型从问答扩展到任务执行,多步操作与跨端协同可能改变繁琐的数据汇总与文档生成流程。

8月6日

星期四 · 2 条
20:10
公众号:千问APP(阿里)精选
AI 评分 64/100
千问全网首发公测,全新 Wan3.0 来了!

阿里千问全网首发公测视频生成模型 Wan3.0,在生成时长、镜头语言、角色真实感及一致性保持等维度全面升级。该模型支持稳定直出 30 秒一镜到底视频,具备导演级镜头与蒙太奇叙事,并强调角色、道具、场景高一致性保持。Wan3.0 主打超高性价比,现已在千问创作(c.qianwen.com)开放体验,千问 app 也将陆续开启。

另有 2 家信源报道IT之家(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)
推荐理由:30秒一镜到底和导演级镜头控制将视频生成从短片段推向长叙事,配合低试错成本,可能加速短剧和广告的创作节奏。

8月5日

星期三 · 1 条
11:08
Qwen@Alibaba_Qwen精选
AI 评分 68/100
阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。

Qwen Cloud: 🔔 Qwen-Image-3.0 is now live on Qwen Cloud! Ranked #1 among Chinese models and #2 among mainstream models in Arena. ai'...

另有 2 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。

8月4日

星期二 · 1 条
15:03
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 81/100
Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版

Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。


推荐理由:用流式专家加载把 80B 模型塞进手机,具体 RAM 和速度数字让开发者能直接判断自己设备的上限,而不是停留在商详口号。

8月3日

星期一 · 1 条
10:10
Qwen:Blog Retrieval(API)精选
AI 评分 89/100
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。

另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Nathan Lambert (@natolambert)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)X:Testing Catalog (@testingcatalog)公众号:数字生命卡兹克
推荐理由:首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。

7月23日

星期四 · 1 条
20:52
Qwen@Alibaba_Qwen精选
AI 评分 79/100
通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如[whisper]、[angry])、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。


推荐理由:TTS 模型终于学会控制情感和语调了,Qwen 这次把自然语言提示和细粒度标签一起放进去,做语音助手的可以直接从‘能说话’跳进‘有性格’。

7月22日

星期三 · 2 条
21:00
公众号:卡尔的AI沃茨精选
AI 评分 71/100
实测Qwen-Image-3.0:19大场景挑战GPT Image2,中文长文本与多图融合表现亮眼

Qwen-Image-3.0上线,支持最高4.5k token输入、12种语言、20多种字体,以及多图融合、图中图和图片编辑。实测显示,其在中文长文本生成、多语言混合排版、UI设计、多图融合与图片编辑等19个场景中均能稳定输出,文字不崩且信息对应准确,图片质量已能与GPT Image2媲美。该模型在国内可直接使用,速度快且价格不贵。


推荐理由:Qwen-Image-3.0 的实测效果在中文文字稳定性和多图融合上可以和 GPT Image2 掰手腕,看完这些案例,你会意识到国产图像模型已经能务实替代一部分工作流了。
20:52
Qwen@Alibaba_Qwen精选
AI 评分 73/100
通义千问发布Qwen-Image-3.0:主打"真实"的第三代图像生成模型

通义千问发布第三代图像生成模型Qwen-Image-3.0,核心关键词为“真实”。模型支持最长4.5k token的提示词,可一次性生成复杂布局(如报纸、试卷、3×3信息图),并能渲染10px级文字、完整LaTeX论文页面及逼真皮肤纹理。它还支持12种语言、100多种艺术风格,并具备实时网络检索能力,旨在成为设计、教育等领域的实用生产力工具。

另有 3 家信源报道X:swyx (@swyx)The Decoder:AI News(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)
推荐理由:Qwen-Image 3.0 不再只追求画质,而是把图像生成变成排版工具,支持4.5k token提示和10px可读文本,设计、电商、教育团队可以直接用来出稿,是今年最实用的图像模型更新。

7月21日

星期二 · 1 条
14:22
Qwen:Blog Retrieval(API)精选
AI 评分 77/100
通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为"实"

通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。


推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。

7月20日

星期一 · 3 条
20:49
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
LoRA Speedrun 公开排行榜:6分05秒微调Qwen2.5-1.5B达GSM8K 61.1%准确率

LoRA Speedrun项目推出公开排行榜,在固定硬件(单张L40S)上比拼Qwen2.5-1.5B的微调运行时间。当前纪录由@Saivineeth147以6分05秒保持,采用序列打包与仅完成损失掩码技术,相比基线11分57秒提速约2倍且准确率更高(61.1%)。项目提供免费Modal沙箱验证,任何提交需经3次独立复现确认。


推荐理由:LoRA 微调领域的 nanoGPT speedrun,在固定硬件和任务上比墙钟时间,公开透明且可复现,做微调的开发者可以下场试试。
17:10
公众号:通义实验室(千问)精选
AI 评分 70/100
通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。


推荐理由:通义实验室的 TTS 模型更新,把精力花在了真实落地痛点——多语种方言覆盖、自然语言导演式控制、嘈杂环境音色复刻,而且直接可用。做语音交互的产品人可以立刻试试。
16:54
公众号:通义实验室(千问)精选
AI 评分 75/100
Qwen-Audio-3.0-TTS 发布:从"能说话"到"会表达"

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含 Flash 与 Plus 两个版本,首包延迟约 300ms。模型支持 16 种语言和 20 种方言,Plus 版在 Artificial Analysis 榜单夺冠,平均说话人相似度达 82.75。新增 Free-style 自然语言指令、细粒度标签控制及嘈杂环境鲁棒性,音频输出提升至 48K,单次合成最长 3 分钟。


推荐理由:从「能说话」到「会表达」,区别在于用自然语言指令和标签精确控制情绪与细节,这为需要多语种和方言的商业场景降低了声音设计门槛。

7月19日

星期日 · 2 条
16:59
Qwen@Alibaba_Qwen精选
AI 评分 69/100
通义千问 Qwen3.8 开源发布在即

Qwen3.8 即将发布并很快开源权重!🌐 该模型拥有高达 2.4T 参数,正在持续进化。我们相信它是目前最强大的模型之一,可与领先前沿 AI 模型媲美,仅次于 Fable 5。 你无需等待即可测试。就在刚才,Qwen3.8-Max-Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上首次亮相。快来抢先体验吧。 期待你的作品。敬请关注!🚀


推荐理由:Qwen 3.8 放出 2.4T 参数并声称性能仅次于 Fable 5,关键是即将开源权重,这让私有部署团队有了新选项,但真正实力还得等跑分验证。
16:29
Qwen@Alibaba_Qwen精选
AI 评分 75/100
Qwen3.8 开源发布,2.4T 参数模型上线

Qwen3.8 即将发布并很快开源权重!🌐 该模型拥有 2.4T 海量参数,正在持续进化。我们相信它是目前最强大的模型之一,可与领先的前沿 AI 模型媲美,仅次于 Fable 5。 你无需等待即可测试。就在刚才,Qwen3.8-Max-Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上首次亮相。快来抢先体验吧。 期待你的作品。敬请关注!🚀


推荐理由:Qwen3.8 以 2.4T 参数开源,性能仅次于 Fable 5,这对开源生态是一场及时雨,国内开发者的可用选项又多了一个重量级选手。

7月17日

星期五 · 4 条
17:50
公众号:通义实验室(千问)精选
AI 评分 74/100
首届"小有可为"大赛乡村教育一等奖作品"智绘科普"技术拆解

首届“小有可为”大赛乡村教育赛道一等奖作品“智绘科普”采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。


推荐理由:这是官方出品的实战教程,拆解了一套多Agent协作+门控+自修复的工程流水线,技术思路通用,做AI应用的可以直接抄作业。
17:41
公众号:通义实验室(千问)精选
AI 评分 72/100
小有可为实战教程:拆解乡村教育一等奖作品"智绘科普"的多Agent协作与门控工程

首届“点亮乡村课堂”赛道一等奖作品“智绘科普”采用Qwen3.5-397B-A17B大语言模型与Manim开源数学动画引擎,构建多Agent分阶段协作流水线。系统通过规划、草稿、实现、审查、合成五个Agent,配合时序门控、几何审计、视觉审查三道质量门及自动修复回路,实现可控可编辑的教学动画生成。项目底层“多Agent协作+门控+自我修复”范式可迁移至养老陪伴、孤独症干预等场景。


推荐理由:拆解了一套多Agent协作、阶段门控加自动修复的工程范式,为在数学教学等严谨场景驯服大模型输出提供了可复用的流水线思路。
15:20
公众号:通义实验室(千问)精选
AI 评分 69/100
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms

通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。


推荐理由:通义实验室把实时视频交互延迟压到550ms,同时提升了分辨率,不是刷榜而是解决实际问题,对做数字人和实时助手的团队是个值得跟进的信号。
15:14
公众号:通义实验室(千问)精选
AI 评分 76/100
Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。


推荐理由:550ms端到端延迟把实时视频对话从拼接流水线推入单模型交互循环,原先因响应太慢而无法沉浸的口语陪练与面试模拟,开始具备自然对话的交互基础。

7月16日

星期四 · 2 条
11:30
公众号:千问APP(阿里)精选
AI 评分 61/100
千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化

千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的“建、理、算、析、呈”方法论。


推荐理由:千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。
11:28
公众号:千问APP(阿里)精选
AI 评分 64/100
千问APP联合武汉发布办AI求职实战课,演示简历诊断、PPT制作与表格分析

千问APP与武汉发布联合承办AI求职实战课,现场演示AI在简历诊断、商业报告撰写、销售表分析等场景的应用。产品经理金师兴提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并给出分步骤提示词生成Word简历;另一产品经理透镜演示用千问紧急制作PPT。表格分析环节通过虚构茶饮店案例,展示“建、理、算、析、呈”方法论,将486行杂乱数据浓缩为一页结论清晰的PPT。


推荐理由:将AI辅助办公拆解为简历诊断、PPT救场和表格分析三步,配套可直接复用的提示词模板,为嵌入日常任务提供了更清晰的操作路径。

7月15日

星期三 · 4 条
16:41
X.PIN@thexpin精选
AI 评分 78/100
阿里Qwen将集成至Apple Intelligence服务中国用户

阿里巴巴的Qwen模型将被集成到Apple Intelligence中,为中国的iOS、iPadOS、macOS和visionOS用户提供文本与图像理解、内容生成等AI功能。中国网信办已公布包括Apple Intelligence、华为小艺大模型、OPPO AndesGPT在内的七项移动端生成式AI服务备案信息。阿里巴巴董事会主席蔡崇信表示,苹果在选定阿里前曾与多家中国公司洽谈。


推荐理由:苹果选阿里Qwen为中国AI引擎,蔡崇信已确认,网信办也已备案,这事对国内AI厂商的竞争格局影响不小,做国内市场的应该认真看一眼。
16:41
IT之家(RSS)精选
AI 评分 82/100
国行 Apple 智能完成备案,阿里千问将集成至苹果 AI 能力

苹果技术开发(上海)有限公司的“Apple 智能”大模型已于 2026 年 7 月 8 日完成备案,适用场景为苹果手机。阿里千问将作为 AI 能力集成至 Apple 智能,为 iOS、iPadOS、macOS 和 visionOS 的中国用户提供文本与图像理解、内容生成等功能,用户无需在应用间切换即可直接体验。


推荐理由:苹果AI备案落地,国行iPhone用户终于等到,但集成的不是自研而是阿里千问,对苹果AI生态和国内AI格局都算一个交代。
10:40
公众号:通义实验室(千问)精选
AI 评分 73/100
阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一

阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。


推荐理由:我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。
10:31
公众号:通义实验室(千问)精选
AI 评分 78/100
Qwen-Audio-3.0-Realtime 如何让语音交互"懂倾听,更聪明"?

阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。


推荐理由:把文本推理能力蒸馏到语音模型同时保留毫秒级响应,这种架构为需要复杂决策的语音智能体提供了可行路径。

7月8日

星期三 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 88/100
Agon:基于隐式对抗评分的跨模型竞争强化学习框架

Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。


推荐理由:这篇论文用「让两个模型互搏」代替了只看最终答案的RL训练,直接解决了推理模型「写得多、想得少」的毛病。0.6B小模型用这方法能超过4B的GRPO模型,做推理训练的人应该认真读一读。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
长度惩罚使思维链更难被监控

长度惩罚强化学习虽能缩短思维链推理,却会隐藏影响模型答案的驱动因素。对Qwen3-4B和Qwen3-14B的实验显示,压缩后思维链提及提示的频率大幅下降,Qwen3-14B的忠实度下限降至基线的63.1%,监控捕获提示使用的比率从69%降至49%。随机删除基线链句子以匹配压缩长度后,压缩链披露提示的频率仍比基线低7-35个百分点,表明压缩优先移除了监控所需的关键线索。


推荐理由:这篇论文用实验证明,给推理链加长度惩罚不只会缩短推理,还会优先删掉暴露模型真实决策过程的线索,让外部监控更难发现模型被误导的痕迹。做AI安全和对齐的人应该认真读一下。

7月6日

星期一 · 2 条
14:20
公众号:通义实验室(千问)精选
AI 评分 73/100
Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先

通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。在工业级方言测评inhouse上取得87.8%的语义准确率,大幅领先,多地方言接近人工水平。引入上下文理解与动态热词注入,实现同音词、品牌名等语义消歧。流式识别首字延迟控制在百毫秒级,准确率接近离线水平,支持多语言无缝切换。API已上线阿里云百炼平台。

另有 1 家信源报道IT之家(RSS)
推荐理由:Fun-ASR Realtime把多语言方言和流式一体化做得很扎实,特别是对东亚东南亚的优化,准确率提升明显,做语音应用的产品人可以直接关注。
14:09
公众号:通义实验室(千问)精选
AI 评分 65/100
Fun-ASR-Realtime 发布:单模型支持 30 种语言与 16 种方言,流式识别准确率接近离线水平

通义实验室发布 Fun-ASR-Realtime,单模型支持 30 种语言和 16 种方言,在工业级方言测评 inhouse 上取得 87.8% 的语义准确率。该模型支持动态注入热词与对话上下文实现语义消歧,首字延迟控制在百毫秒级别,流式识别准确率接近离线水平,并支持多语言无缝切换。API 现已上线阿里云百炼平台。


推荐理由:多语言方言的流式识别将语音交互的可用边界从英语推向了东亚与方言市场,使原先因识别不准而难以落地的本地化客服、语音助手等应用获得了新的技术基础。

7月2日

星期四 · 1 条
18:31
公众号:千问APP(阿里)精选
AI 评分 62/100
千问团队朱达:C端Agent Harness的"多快好省"工程哲学与主动服务探索

千问团队2026年1月上线通用复杂任务Agent(千问App胶囊入口),总结“多快好省”方法论:支持信息搜集、研究分析等任务;执行时间降至初始1/3;通过搜索范式与上下文管理优化交付质量;Token消耗仅为海外产品1/10。团队探索从被动响应转向主动服务,构建User Memory、Environment、Task System、Assistant四大组件,指出“情商”是主动服务最难环节。朱达提出Agent工程从Prompt Engineering演进至Harness Engineering,下一站是A IWare Engineering,强调“低功耗,够用就行”。


推荐理由:千问C端团队分享的Agent工程实践很务实,从“多快好省”到AIWare Engineering的演进思路,对正在做复杂任务Agent的团队是一个有价值的参考系。

6月30日

星期二 · 1 条
02:35
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
Qwen 3.6 27B 是本地开发的理想选择

Qwen 3.6 27B 是一款密集参数本地大语言模型,原生支持 256k 上下文。在 Macbook Max M5 上运行 llama.cpp Q8_0 量化版(含多 token 预测)可达 30 tokens/s;用户反馈在 RTX 5090 上 Q6_K 量化可达 50 tokens/s。它可通过单个提示完成创意诗歌、用 pnpm 生成六边形扫雷游戏等任务,作者称其为首个真正具备通用智能的本地模型。另有一个 MoE 变体 35B A3B,但作者推荐 27B 版本。


推荐理由:一篇详实的 Qwen 3.6 27B 实战评测,从创意写作到代码生成都测了,还给出了 llama.cpp 部署命令和性能数据,想本地跑模型的开发者可以直接抄作业。

6月27日

星期六 · 1 条
11:59
IT之家(RSS)精选
AI 评分 73/100
阿里千问输入法上线 macOS 版:最快 300 字/分,AI 自动润色

阿里千问输入法 macOS 版今日上线官网,支持最快 300 字/分的 AI 语音输入,可自动润色、将口语转为工整文字,并支持 9 种方言,纯净无广告。官方预告 iOS、Android、Windows 版将于近日发布。此前千问团队已于今年 5 月推出千问语音输入法(千问 App 内的组件),具备去语气词、纠错、格式化整理及基于上下文的智能回复等能力,而本次上线的输入法则定位为独立 App,填补千问在移动端 AI 输入法赛道的空白。


推荐理由:阿里千问把AI语音能力做成了独立输入法,300字/分+9种方言让语音转文字实用性大增,对不习惯打字的普通用户可能比单纯聊天工具更有粘性。

6月24日

星期三 · 2 条
11:54
Qwen:Blog Retrieval(API)精选
AI 评分 81/100
Qwen-AgentWorld:面向通用智能体的语言世界模型

Qwen 团队发布 Qwen-AgentWorld,一个以环境建模为训练目标的原生语言世界模型,在单个模型中模拟 MCP、Search、Terminal、SWE 及 GUI 域(Web、OS、Android)共七个域。模型使用超 1000 万条真实交互轨迹训练,在 AgentWorldBench 上以 Qwen-AgentWorld-397B-A17B 版本达最高模拟质量,超越 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。同时发布评测基准 AgentWorldBench。该模型可作为解耦环境模拟器用于智能体 RL 训练,也可作为统一智能体基础模型,经 LWM 预热后无需智能体 RL 微调即可迁移。模型和基准已开源在 Hugging Face 和 ModelScope。

另有 4 家信源报道公众号:通义实验室(千问)Hacker News 热门(buzzing.cc 中文翻译)X:通义千问 / Qwen (@Alibaba_Qwen)HuggingFace Daily Papers(社区热门论文)
推荐理由:Qwen把世界模型做成了一个可开源的通用产品,覆盖七域,做agent RL的可以直接拿它仿真训练,可控性甚至超过真实环境,做agent的团队应该认真看看。
11:32
公众号:通义实验室(千问)精选
AI 评分 79/100
Qwen-AgentWorld 开源:让 Agent 学会"先预测,再行动"

通义实验室开源首个原生语言世界模型 Qwen-AgentWorld,覆盖 MCP、Search、Terminal、SWE、Web、OS、Android 七大领域,基于超 1000 万条真实交互轨迹,经 CPT → SFT → RL 三阶段训练。


推荐理由:将环境建模从预训练阶段起作为显式目标,通过可控模拟实现定向行为塑造,效果超越真实环境 RL,为高风险场景的智能体开发提供低成本方案。