内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

精选

7月26日 · 周日
最新精选
全部模型产品行业论文技巧
标签「端侧」清除

7月24日周五

19:50HuggingFace Daily Papers(社区热门论文)77SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。推荐理由:SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒,比 Wan 2.2 快 120 倍,做视频应用的开发者该重新评估成本模型了。

7月23日周四

13:53Hacker News 热门(buzzing.cc 中文翻译)70Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。

7月21日周二

00:49Hugging Face:Blog(RSS)70NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。

7月19日周日

21:30公众号:面壁智能(MiniCPM)68MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。

7月15日周三

16:41X.PIN78阿里Qwen将集成至Apple Intelligence服务中国用户阿里巴巴的Qwen模型将被集成到Apple Intelligence中,为中国的iOS、iPadOS、macOS和visionOS用户提供文本与图像理解、内容生成等AI功能。中国网信办已公布包括Apple Intelligence、华为小艺大模型、OPPO AndesGPT在内的七项移动端生成式AI服务备案信息。阿里巴巴董事会主席蔡崇信表示,苹果在选定阿里前曾与多家中国公司洽谈。推荐理由:苹果选阿里Qwen为中国AI引擎,蔡崇信已确认,网信办也已备案,这事对国内AI厂商的竞争格局影响不小,做国内市场的应该认真看一眼。
03:55Hacker News 热门(buzzing.cc 中文翻译)76Bonsai 27B:首款可在手机上运行的27B级多模态模型Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。推荐理由:1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。
00:51Google Developers Blog(RSS)58Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。推荐理由:我觉得这是端侧 AI 从实验到落地的信号,Gemma 4 E2B 的离线能力搭配新 SDK,让完全本地的多模态应用不再是期货,做移动隐私 AI 的开发者该上手试试了。

7月14日周二

10:30公众号:面壁智能(MiniCPM)61面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径面壁智能CTO曾国洋指出,端侧模型是AI落地的关键路径。其原创方法论“模型风洞”可在小规模实验中预测完整训练效果,并基于“知识密度”提出“面壁定律”:知识密度每3.5个月翻一番。2B参数的MiniCPM表现优于同期8B竞品。面壁已完成高通、联发科、英特尔、英伟达、AMD等芯片适配,新发布的BitCPM-CANN模型系列可在华为昇腾芯片上让同一内存多装约6倍模型。全双工全模态模型MiniCPM-o4.5支持实时打断与情绪调整。团队开发了全球首个完全由AI编写的生产级训练框架ForgeTrain,并引入行为模式库实现无需开口的“默契系统”。推荐理由:面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。

7月10日周五

05:21Google Developers Blog(RSS)62Google 推出 LiteRT.js:高性能 Web AI 推理运行时Google 发布 LiteRT.js,这是 LiteRT 跨平台边缘 AI 运行时的最新成员,专为 JavaScript 开发者设计,可直接在浏览器中运行机器学习模型。LiteRT.js 基于 WebGPU 和即将推出的 WebNN 实现 SOTA 推理性能,同时支持回退到 WebAssembly CPU 方案。推荐理由:Google 将 LiteRT 扩展到了浏览器端,让 Web 开发者可以直接在客户端跑 AI 推理,但发布缺少性能数据和对比,实质价值还要看后续的 benchmark。

7月9日周四

22:15OpenBMB71TeXada:基于MiniCPM的本地数学Agent发布社区开发者基于MiniCPM5-1B和MiniCPM-V 4.6构建了本地优先的数学智能体TeXada。该Agent支持自然语言直接转LaTeX、手写/图像公式OCR转可编辑LaTeX、LaTeX补全与错误修复等核心功能。所有推理在本地完成,无需依赖云服务,保障隐私安全,适用于学生、研究人员和开发者随时随地处理数学表达式。已开源至GitHub,并提供HuggingFace模型下载。推荐理由:社区开发者用 MiniCPM 轻量模型做的本地数学助手,LaTeX 输入变得像聊天一样自然,是个小而美的端侧实用案例。

7月7日周二

15:10Hacker News 热门(buzzing.cc 中文翻译)70在网络不稳定的地区,小型AI模型正逐渐普及2019年,Adebayo Alonge因服务器远在美国致RxScanner单次扫描超5分钟,工程师2小时内将AI模型缩小至可在Android手机本地运行,此后RxScanner能在无宽带、缺电地区验药。小AI模型参数通常至多几十亿,可在手机或Raspberry Pi上运行,功耗仅数瓦。类似案例包括印度腰果病害检测无人机、乌拉圭蚂蚁入侵识别、疟蚊检测及巴西基于Arduino的心电图设备。世界银行报告显示,全球最穷国家仅0.7%互联网用户用过ChatGPT,发达国家达四分之一;行长认为小AI是为缺乏算力与电力的地区提供生命救助服务的关键。推荐理由:这篇IEEE特写把AI的镜头从硅谷转向了没有宽带的地方,用假药检测、无人机农场等案例讲清楚了一个被忽视的真相:对多数世界而言,能跑在手机上的小型模型才是真正的AI。

7月4日周六

13:08IT之家(RSS)74我国研制全球首款基于可控存内计算的忆阻器神经动力学芯片北京大学集成电路学院联合中科院上海微系统所,发布全球首款基于可控存内计算的忆阻器神经动力学芯片,首次将单步运算时延压缩至2.12毫秒。芯片采用40纳米工艺,存内计算阵列与外围电路总面积0.28平方毫米,运行频率50 MHz,单步积分仅需9级流水。在脑皮层重建等任务中较当前GPU提速50至478倍,突破神经动力学实时计算瓶颈。相关成果7月3日发表于《科学》。推荐理由:全球首款神经动力学芯片将单步时延压至2.12毫秒,首次实现实时计算,比GPU快50倍以上,这是神经拟态芯片落地的关键一步,做实时仿真和边缘AI的可以留意。

7月1日周三

01:58TechCrunch:AI(RSS)72Acti 将 AI 智能体直接放入手机键盘新加坡初创公司 Acti 发布基于 Google Gemini 的智能体键盘,可代替用户在应用中执行操作。核心功能 Skills 允许用自然语言创建快捷方式,如长按 T 键翻译消息、C 键发送会议链接。早期测试者两周内创建超 1000 个 Skills。采用本地优先架构,默认不访问私人消息。公司获 530 万美元种子轮融资,由 BITKRAFT Ventures 领投,现已开放下载。推荐理由:Acti 想用 AI 代理重塑手机键盘,把 Gemini 塞进输入法,离不离开 App 都能用 AI 的思路很讨巧,但换键盘的阻力不小,目前更像一个有趣的试验品。刚拿到 530 万美元种子轮,有试错空间。
00:28ClaudeDevs67Claude Desktop 推出 Linux 公测版Claude Desktop 现已在 Linux(Ubuntu 和 Debian)上推出测试版。 除了浏览器和终端,你现在可以在所有付费计划中获得一流的桌面体验,包括 Claude Code、Claude Cowork 和聊天。推荐理由:Claude 桌面端终于来到 Ubuntu,补齐了 Linux 开发者工作流里缺失的一环,beta 状态不影响它与终端、浏览器的深度打通。

6月30日周二

05:35Ars Technica:AI(RSS)75韩国将投入1万亿美元扩大存储芯片生产和发展人形机器人韩国政府与三星、SK海力士等承诺1万亿美元实施三大旗舰项目。三星和SK海力士投资5850亿美元新建芯片工厂,目标五年内将DRAM产量翻倍;SK集团、GS集团和Naver投资3570亿美元在偏远省份建设AI数据中心;物理AI被指定为国家战略产业,现代汽车投资58亿美元建设机器人工厂和AI数据中心,计划到2028年每年生产3万台Atlas人形机器人,并在10大行业实现商业化。但现代汽车工会已批准罢工谈判,要求利润分享和岗位保护。推荐理由:韩国砸 1 万亿美元砸向内存芯片和机器人,不只是产能竞赛,更是试图锁住 AI 硬件供应链的关键位置。但工会抗议和芯片暴利税收争议也浮现,值得追踪。
04:26OpenClaw🦞71OpenClaw 发布原生 iOS 与 Android 应用OpenClaw 现已登陆 iOS 和 Android 🦞 📱 原生移动应用,终于来了 💬 智能体装进口袋 🔔 频道、任务、回复,随时处理 用你的大拇指,在任何地方运行智能体。 iOS: https://apps.apple.com/us/app/openclaw-ai-that-does-things/id6780396132 Android: https://play.google.com/store/apps/details?id=ai.openclaw.app推荐理由:OpenClaw 终于推出原生移动应用,智能体可以随时放进口袋,对已有用户是体验上的补完,但对新用户的吸引力可能有限。
02:35Hacker News 热门(buzzing.cc 中文翻译)75Qwen 3.6 27B 是本地开发的理想选择Qwen 3.6 27B 是一款密集参数本地大语言模型,原生支持 256k 上下文。在 Macbook Max M5 上运行 llama.cpp Q8_0 量化版(含多 token 预测)可达 30 tokens/s;用户反馈在 RTX 5090 上 Q6_K 量化可达 50 tokens/s。它可通过单个提示完成创意诗歌、用 pnpm 生成六边形扫雷游戏等任务,作者称其为首个真正具备通用智能的本地模型。另有一个 MoE 变体 35B A3B,但作者推荐 27B 版本。推荐理由:一篇详实的 Qwen 3.6 27B 实战评测,从创意写作到代码生成都测了,还给出了 llama.cpp 部署命令和性能数据,想本地跑模型的开发者可以直接抄作业。

6月26日周五

00:00Google Research:Blog(网页)55冻结多token预测加速Pixel上的Gemini Nano模型Google Research提出一种新架构,在已冻结的Gemini Nano v3模型上改造Multi-Token Prediction(MTP),以加速Pixel 9和10系列上的设备端推理。该方法基于EAGLE框架和CALM,无需单独训练占用内存的草稿模型,通过“晚期退出”策略实现加速。AI通知摘要和校对功能因此生成文本速度显著提升、能耗降低,开发者无需为每个新任务微调独立模型。推荐理由:谷歌这篇技术博客值得端侧开发者细读,他们把多令牌预测硬是装进了已部署的 Nano 模型,Pixel 上生成加速五成,还省了 130MB 内存,零拷贝架构的想法挺巧,但没法直接复现,主要是开脑洞用的。

6月24日周三

15:10OpenBMB65MiniCPM-V 4.6 在 Apple Core AI 上高速运行🥳感谢分享,@MLBoy_DaisukeMajima 🚀 MiniCPM-V 4.6 在设备上以这样的速度运行,实在令人印象深刻——尤其是在 Apple Core AI 上以不到 2B 参数跑出。 干得漂亮,推动高效多模态 AI 向前发展。🫡推荐理由:社区把 MiniCPM-V 4.6 搬上 iPhone 17 Pro,跑出 51 tok/s,还给了代码和模型,做端侧多模态的可以直接跑起来了。
03:21Hao AI Lab73FastWan-QAD:单卡5090上1.8秒生成5秒视频Sky Computing Lab 发布 FastWan-QAD 视频生成模型系列,基于 FastVideo 的量化感知蒸馏(QAD)方案训练。在单张 NVIDIA GeForce RTX 5090 上,端到端生成一段 5 秒 480P 视频仅需 1.8 秒。模型、代码及博客已开源。推荐理由:单张 RTX 5090 上 1.8 秒生成 5 秒视频,把消费级延迟压到了‘即时生成’的临界点,做短视频和互动应用的开发者可以认真把这个模型放进技术栈。

6月23日周二

16:12Hugging Face:Blog(RSS)59我们用免费本地模型对 OpenClaw 仓库进行实时分类Hugging Face 在 OpenClaw 仓库上测试用 Gemma 和 Qwen 等本地模型实时分类 issue 和 PR。他们使用 Pi agent harness 驱动模型,配合 reposhell 只允许读操作防止提示词注入。测试的模型包括 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,经性能优化后均可在本地生成数百 token/s。该方案运行在 NVIDIA GB10(128 GB 统一内存)上,相比每月 200 美元的 ChatGPT Pro 订阅,可实现近乎实时的通知且仅消耗电费。推荐理由:Hugging Face 演示了用本地模型自动 triage GitHub issue 的完整方案,包括只读 shell 防注入、agent harness 等工程技巧。对想用本地模型替代 API 做分类任务的团队,这是一套可直接借鉴的 recipe。

6月17日周三

12:50Tomer Tunguz 博客(VC 分析)625x for Free:本地编程栈Hacker News 讨论揭示:Qwen 3.6 35B-A3B 模型提及率 33% 领先,27B 变体以 20% 紧随其后,DeepSeek Pro 与 Gemma4 31B 位列前四。Agent 工具中 Pi (49%) 与 OpenCode (45%) 占主导。用户对比称,Claude Opus 可带来 15 倍加速,而本地离线 Qwen 提供 5 倍加速,且完全免费、保护隐私。SWE-bench Verified 基准测试显示,Qwen 3.6 27B 得分 77.2%,35B-A3B 得分 73.4%,接近 Claude Sonnet 4.6 的 79.6%。MoE 架构使大模型在消费级硬件上高效运行。推荐理由:本地模型在编码上正逼近云端前沿,Qwen 35B-A3B 已成社区标配,免费且完全离线让这场替代变得真实,选型逻辑可能从此改变。

6月13日周六

17:54公众号:通义实验室(千问)79MNN 适配 SME2 使 Qwen3-VL-4B 在端侧实时推理MNN 推理引擎深度适配 Arm SME2 指令集,使 Qwen3-VL-4B-Instruct 在支持 SME2 的 vivo X300 上实现实时多模态推理。Prefill 阶段性能提升 81%,Decode 阶段提升 13%。MNN 采用编译时内建 + 运行时自动检测设计,默认开启 SME2 加速。该模型为 4B 参数视觉语言模型,支持图文理解和对话,通过 MNN 官方已转换量化的模型可直接下载部署,开发者可通过编译开关一键开启硬件加速。推荐理由:这是一份硬核的端侧部署指南,实测数据让 Qwen3-VL 在 SME2 手机上 Prefill 提速超过 80%,做移动端 AI 的团队可以直接抄作业。
04:49Hacker News 热门(buzzing.cc 中文翻译)70如何在macOS上设置本地编码代理来自ikyle.me的教程,指导在macOS上搭建本地编码代理,获Hacker News社区104个点赞。推荐理由:这篇文章不是泛泛的「本地跑大模型」,而是给 Mac 开发者一个实测过的、能打的生产环境编码代理方案,尤其 MTP 加速让速度不再鸡肋,可以直接抄作业。

6月12日周五

10:34IT之家(RSS)75苹果 iOS 27 健康 App 大改:卡片布局、营养识别、围绝经期追踪苹果在 iOS 27 中优化健康 App,将列表改为卡片布局并增加导航栏。新增视觉智能营养识别,用户通过相机 Siri 模式拍摄食物可获取加工程度、蛋白质、含糖量等信息及营养价值评级,不提供精确卡路里,需 iPhone 15 Pro 及以上。经期追踪扩展支持围绝经期,可分析长期周期异常模式并推送提醒与指导。Fitness+ 新增围绝经期和绝经期课程。数据同步速度提升,GymKit 扩展至 iPhone,无需 Apple Watch 即可与健身设备配对同步数据。推荐理由:视觉智能营养识别不能给精确卡路里,但那个“深度加工食品”提醒对普通人很实用,健康App这次更新算得上近年最有用了。

6月11日周四

09:09Berryxia.AI76mlx-vlm v0.6.3 发布,Day-0 支持 Google DeepMind DiffusionGemma 和 Cohere North Mini Code 1.0mlx-vlm v0.6.3 上线,首发支持 DiffusionGemma 和 North Mini Code 1.0。DiffusionGemma 采用全新架构:以 256 token 块为单位并行生成、双向注意力、迭代自纠错;26B MoE 仅激活 3.8B,量化后 18GB 即可运行。North Mini Code 1.0 为 30B MoE,仅激活 3B,BF16 下约 66 tok/s。两款模型均通过深度合作实现 Day-0 MLX 支持,可在 Mac 本地运行。可通过 `uv pip install -U mlx-vlm` 安装体验。推荐理由:Google 和 Cohere 新模型发布同日,mlx-vlm 就把它们塞进了 Mac 本地,DiffusionGemma 用扩散思路生成文本,量化后 18GB 就跑得动,属于本地党必跟的更新。

6月9日周二

21:00公众号:火山引擎69全新汽车品牌AIVA发布,火山引擎助力打造AI汽车新体验由赛力斯、宁德时代等多方产业资本组建的AI出行品牌AIVA正式发布。火山引擎提供豆包大模型、智能座舱等技术服务。概念车AIVA Origin Concept亮相,首款量产车AIVA ME7将于2026年内亮相,全系覆盖20万元以上市场。AIVA提出“AI定义汽车”路径,让汽车成为具身AI生命体。火山引擎副总裁表示,人与汽车的关系将实现交互、智能、感受三方面根本转变。未来双方将围绕AI交互、智能体验、情感陪伴深度共创。推荐理由:AIVA把「先有AI再有车」当作造车逻辑,火山引擎直接下场定义汽车AI体验,这是豆包大模型从软件跑到物理世界的第一次大规模试水,做具身智能和车载产品的人该仔细看看。
08:03Berryxia.AI75Kimi Work 桌面 AI 代理上线,支持 300 个本地代理并行Kimi Work 是一款桌面 AI 代理,支持在本地最多 300 个代理并行执行任务,已适配 macOS(Apple Silicon)和 Windows。配合 WebBridge 扩展,代理可自主在浏览器中搜索、滚动、点击、打字完成操作。内置财经场景优化,原生调用 Yahoo Finance 和世界银行数据,无需复杂 API 配置。自带记忆系统记录用户偏好和决策历史。最终自动生成 PPTX、Word、PDF、Excel 文件。推荐理由:Kimi 这次把 300 个本地 agent 塞进桌面,外加浏览器操控和财经数据直连,让「AI 秘书团」从概念变成了一件能立刻上手的事,做桌面自动化的值得试试。
07:33Hacker News 热门(buzzing.cc 中文翻译)74Apple Core AI 框架一篇关于 Apple Core AI 框架的 Hacker News 帖子获得 109 个点赞。帖子内容包含一张苹果开发者 OG 图片和一个指向 Apple Core AI Framework 官方文档的链接(developer.apple.com)。该帖子由 buzzing.cc 中文翻译,发布于 2026 年 6 月 8 日 02:47(UTC)。推荐理由:Apple 在 WWDC 上发布的本地 AI 框架,统一了 CPU、GPU、Neural Engine 的推理接口,做 iOS/macOS AI 应用的开发者必看,提前适配就能低成本用上设备端能力。
05:15Apple Machine Learning Research(RSS)79苹果发布第三代 Apple Foundation Models(AFM)苹果推出第三代 Apple Foundation Models(AFM)基础模型家族,与 Google 合作定制,包含五个模型,覆盖从设备端到基于 Private Cloud Compute 的服务器端模型。这些模型旨在驱动 Apple Intelligence 功能,包括全新 Siri 和智能工具,以用户为中心深度融合操作系统,隐私为核心设计原则。推荐理由:Apple与Google罕见联手推出的第三代基础模型,直接为下一代Siri和系统级AI功能铺路,标志着消费级AI的深度整合,产品经理和iOS开发者必须关注。
03:14Apple:Newsroom(RSS)66Apple 推出 Siri AI:由 Apple Intelligence 驱动的更强大、更个性化的个人助理Apple 发布了 Siri AI,一款由 Apple Intelligence 驱动的个人助理,具备个人上下文、世界知识和屏幕感知能力,能提供更强大、更个性化的交互体验。推荐理由:苹果对 Siri 的这次重构不是简单地换个模型,它把个人上下文、屏幕感知和视觉智能实际嵌进了系统,对普通用户来说日常交互方式可能要变。

6月8日周一

22:34Kimi.ai76Kimi Work:本地桌面AI智能体,支持300智能体并行Kimi发布Kimi Work,一款本地运行的桌面AI智能体。支持最多300个AI智能体同时在本地机器并行运行;配合WebBridge浏览器扩展,智能体可在浏览器中导航、搜索、点击、填写并完成任务;内置全球市场数据工具,可直接调用Yahoo Finance和世界银行数据,无需复杂API设置;记忆系统会记录用户偏好、过往决策和上下文。支持macOS(Apple Silicon)和Windows。推荐理由:这个产品把AI agent从聊天窗口搬到了桌面,300个并行agent和内置金融工具直接对标专业人群,如果它能稳定运行,个人AI助手的形态又要被重新定义了。
18:00公众号:通义实验室(千问)68Agent 辅助开发,一站式打通 Qwen3-VL Android 端侧推理通义实验室教程演示了如何用 Agent(Qoder)辅助完成 Qwen3-VL-2B 模型在 Android 端侧的全流程部署。操作包括:检查 JDK 21、NDK 27、CMake 3.18.1 等环境;创建 arm64-v8a 的 Native C++ 工程(minSdk 29、compileSdk 35);通过 ModelScope CLI 下载约 1.4GB 的 MNN/Qwen3-VL-2B-Instruct-MNN 模型;编译开启 LLM 视觉支持(MNN_BUILD_LLM、LLM_SUPPORT_VISION)的 libMNN.so;构建 APK 并推送模型至手机私有目录。最终 App 提供图文推理页面,输出 MNN 版本(v3.5.0)、ABI 及推理指标。所有繁琐步骤均可由 Agent 自动执行。推荐理由:用Agent辅助走通Qwen3-VL安卓端侧推理全流程,从环境搭建到JNI桥接一步到位。如果你在做移动端AI应用,这可能是目前最详细的实战指南,可以直接抄作业。
17:53公众号:通义实验室(千问)67Agent辅助开发:通义实验室教程打通Qwen3-VL Android端侧推理通义实验室第二期教程展示如何利用Agent(如Qoder)自动完成Android端侧AI App开发全流程。Agent依次执行:检查并配置Android环境(JDK 21、NDK 27等)、创建Native C++工程PhotoTaggerMNN、下载约1.4GB的Qwen3-VL-2B-Instruct-MNN模型、编译支持视觉能力的libMNN.so、将MNN接入工程、构建APK、推送模型至手机私有目录,最终确认MNN版本3.5.0及模型文件全部ok。核心思路是开发者定义业务目标,Agent负责环境检查、代码编写、编译构建与排错。推荐理由:这是一篇手把手教程,用 Agent 简化 Qwen3-VL Android 部署,对想试端侧 VL 的开发者实用,但绑定阿里生态,通用性有限。

6月7日周日

19:27AYi78"我在田里雇了一名工程师,它叫 Codex" -- 北海道一个西兰花农的 8 个真实 AI 用法日本北海道农民富安弘毅用 ChatGPT 和 Codex 解决农场实际问题,涵盖 8 个用法:拍照识别西兰花病害、卫星监测获取 NDVI 数据、用 ESP32 和 LINE 机器人远程控制温室卷帘、为农场群聊开发机器人管理温度与排期、从聊天记录追踪播种数量、学习 RTK-GPS 自动转向原理并评估自建成本、设计基于 Airtable 的农场管理数据库。他说 AI 让传统昂贵的自动化变得低成本可及,“如同身边有一位超级工程师”。推荐理由:一个北海道农民把 ChatGPT 和 Codex 用成了农场的‘外挂工程师’,从病害诊断到温室远程控制,每个用法都附原始提示词——农业从业者可以直接抄作业。

6月6日周六

00:59Google AI Developers72谷歌发布 Gemma 4 QAT 检查点,支持消费级 GPU 和移动设备本地运行谷歌发布 Gemma 4 量化感知训练 (QAT) 检查点,支持在消费级 GPU 和移动设备上本地运行,质量损失极小。新检查点提供 GGUF(Q4_0)格式,覆盖所有尺寸及起草模型,实现最佳本地性能。自定义移动模式采用混合精度方案,将 Gemma 4 压缩至 1GB 以下,包含 2-bit 解码层、优化 KV 缓存和静态激活。通过在训练中模拟压缩(而非训练后量化),大幅降低内存占用并加速解码,同时保持推理质量。推荐理由:Gemma 4 的量化版把模型压到 1GB 以下,手机本地跑大模型的门槛又低了一大截。Google 这次没用传统的训练后量化,而是把压缩直接嵌进训练里,效果比 PTQ 好一截,搞端侧部署的可以拿 checkpoint 试起来了。
00:38Tomer Tunguz 博客(VC 分析)68AI的微型钢厂作者通过技能蒸馏将78%的AI工作交由Mac本地模型处理,仅复杂任务发往云端。智能体自动分类任务:简单任务本地数秒完成,复杂任务路由至云端。过去一周本地处理峰值达88%。双车道设计使吞吐量提升约25%,平均任务时长从47秒降至19秒,队列等待时间从73秒降至4秒(降幅94%)。该模式类比Nucor小钢厂,每台能运行蒸馏模型的边缘设备都成为小型AI工厂,仅对那1/5困难任务支付云费用。未来几年,数以千万计的此类设备将在企业内部增殖,逐步取代现阶段云厂商账单上的大部分工作负载。推荐理由:Tunguz 把自己 78% 的 AI 任务都挪到本地跑,吞吐量涨了 25%,延迟降了 60%。mini-mill 的类比把端侧 AI 的颠覆逻辑讲得比任何行业报告都清楚,做工作流自动化的值得细读。

6月5日周五

22:15IT之家(RSS)76Meta 智能眼镜 App 暗藏人脸识别代码,NameTag 功能已推送至超 5000 万设备据《连线》今日报道,Meta 通过多次应用更新将人脸识别代码推送到智能眼镜配套 App 中,代号“NameTag”。该功能利用已部署的三个 AI 模型将人脸转换为“人脸特征模板”,与手机本地数据库匹配,识别成功后向佩戴者发送通知。App 下载量超 5000 万次。Meta 回应称代码仅为探索,尚未决定推出,且不会建立中央人脸数据库。此前 Meta 曾因人脸识别问题在伊利诺伊州和得克萨斯州分别达成 6.5 亿美元和 14 亿美元和解。推荐理由:Meta一边付近百亿美元和解金,一边把完整人脸识别代码塞进 5000 万用户的眼镜里,「探索」这个解释太轻巧——代码都推送了,离功能上线只差一个开关。
05:17Hacker News 热门(buzzing.cc 中文翻译)80Meta 在智能眼镜上搭载人脸识别功能Meta 为其智能眼镜产品推出了人脸识别功能,用户可通过眼镜识别他人身份,并获取相关信息。该功能目前正通过早期测试版本向部分用户开放,旨在增强增强现实设备的社交与信息交互能力。推荐理由:Meta 把完整的人脸识别栈塞进了智能眼镜 App,这事一旦激活,公共场所的匿名性将被重新定义。作者的技术取证链条扎实,迫使 Meta 必须正面回应。
04:25Google Research:Blog(网页)79Google Research 发布被动心率监测系统 PHRMGoogle Research 开发了一种被动心率监测系统(PHRM),利用智能手机前置摄像头在日常使用中(人脸解锁后数秒内)捕捉面部视频,通过深度学习估算心率,平均绝对百分比误差(MAPE)低于10%(对比心电图金标准),满足各肤色人群的行业精度标准。系统将全天心率测量整合为每日静息心率(RHR),平均绝对误差(MAE)低于5 bpm(对比可穿戴设备)。研究同时发布了迄今最大规模的公开智能手机视频数据集及预训练模型PHRM-mini,合格研究人员可申请访问。推荐理由:Google 这项发表在 Nature 上的研究,把手机前置摄像头变成了被动心率仪,而且专门解决了深肤色人群精度差的老问题,虽然离产品还远,但方向很对,穿戴设备的护城河可能又浅了一点。
精选
2026年7月26日星期日 · AI 自动挑选的高价值内容
全部模型产品行业论文技巧

7月24日

星期五 · 1 条
19:50
HuggingFace Daily Papers(社区热门论文)精选
77
SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。

模型发布端侧视频

推荐理由:SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒,比 Wan 2.2 快 120 倍,做视频应用的开发者该重新评估成本模型了。

7月23日

星期四 · 1 条
13:53
Hacker News 热门(buzzing.cc 中文翻译)精选
70
Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。

开源/仓库推理模型发布端侧

推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。

7月21日

星期二 · 1 条
00:49
Hugging Face:Blog(RSS)精选
70
NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成

NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。

具身智能多模态模型发布端侧
另有 1 家信源报道MarkTechPost(RSS)
推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。

7月19日

星期日 · 1 条
21:30
公众号:面壁智能(MiniCPM)精选
68
MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片

面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。

数据/训练模型发布端侧
另有 2 家信源报道公众号:面壁智能(MiniCPM)IT之家(RSS)
推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。

7月15日

星期三 · 3 条
16:41
X.PIN@thexpin精选
78
阿里Qwen将集成至Apple Intelligence服务中国用户

阿里巴巴的Qwen模型将被集成到Apple Intelligence中,为中国的iOS、iPadOS、macOS和visionOS用户提供文本与图像理解、内容生成等AI功能。中国网信办已公布包括Apple Intelligence、华为小艺大模型、OPPO AndesGPT在内的七项移动端生成式AI服务备案信息。阿里巴巴董事会主席蔡崇信表示,苹果在选定阿里前曾与多家中国公司洽谈。

政策/监管端侧行业动态
另有 5 家信源报道X:Berry Xia (@berryxia)X:小互 (@xiaohu)X:X.PIN (@thexpin)IT之家(RSS)TechCrunch:AI(RSS)
推荐理由:苹果选阿里Qwen为中国AI引擎,蔡崇信已确认,网信办也已备案,这事对国内AI厂商的竞争格局影响不小,做国内市场的应该认真看一眼。
03:55
Hacker News 热门(buzzing.cc 中文翻译)精选
76
Bonsai 27B:首款可在手机上运行的27B级多模态模型

Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。

多模态推理模型发布端侧
另有 4 家信源报道X:Berry Xia (@berryxia)X:小互 (@xiaohu)IT之家(RSS)The Decoder:AI News(RSS)
推荐理由:1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。
00:51
Google Developers Blog(RSS)精选
58
Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来

在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。

Google多模态模型发布端侧

推荐理由:我觉得这是端侧 AI 从实验到落地的信号,Gemma 4 E2B 的离线能力搭配新 SDK,让完全本地的多模态应用不再是期货,做移动隐私 AI 的开发者该上手试试了。

7月14日

星期二 · 1 条
10:30
公众号:面壁智能(MiniCPM)精选
61
面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径

面壁智能CTO曾国洋指出,端侧模型是AI落地的关键路径。其原创方法论“模型风洞”可在小规模实验中预测完整训练效果,并基于“知识密度”提出“面壁定律”:知识密度每3.5个月翻一番。2B参数的MiniCPM表现优于同期8B竞品。面壁已完成高通、联发科、英特尔、英伟达、AMD等芯片适配,新发布的BitCPM-CANN模型系列可在华为昇腾芯片上让同一内存多装约6倍模型。全双工全模态模型MiniCPM-o4.5支持实时打断与情绪调整。团队开发了全球首个完全由AI编写的生产级训练框架ForgeTrain,并引入行为模式库实现无需开口的“默契系统”。

大佬观点数据/训练端侧

推荐理由:面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。

7月10日

星期五 · 1 条
05:21
Google Developers Blog(RSS)精选
62
Google 推出 LiteRT.js:高性能 Web AI 推理运行时

Google 发布 LiteRT.js,这是 LiteRT 跨平台边缘 AI 运行时的最新成员,专为 JavaScript 开发者设计,可直接在浏览器中运行机器学习模型。LiteRT.js 基于 WebGPU 和即将推出的 WebNN 实现 SOTA 推理性能,同时支持回退到 WebAssembly CPU 方案。

Google产品更新端侧

推荐理由:Google 将 LiteRT 扩展到了浏览器端,让 Web 开发者可以直接在客户端跑 AI 推理,但发布缺少性能数据和对比,实质价值还要看后续的 benchmark。

7月9日

星期四 · 1 条
22:15
OpenBMB@OpenBMB精选
71
TeXada:基于MiniCPM的本地数学Agent发布

社区开发者基于MiniCPM5-1B和MiniCPM-V 4.6构建了本地优先的数学智能体TeXada。该Agent支持自然语言直接转LaTeX、手写/图像公式OCR转可编辑LaTeX、LaTeX补全与错误修复等核心功能。所有推理在本地完成,无需依赖云服务,保障隐私安全,适用于学生、研究人员和开发者随时随地处理数学表达式。已开源至GitHub,并提供HuggingFace模型下载。

智能体GitHub开源/仓库端侧

推荐理由:社区开发者用 MiniCPM 轻量模型做的本地数学助手,LaTeX 输入变得像聊天一样自然,是个小而美的端侧实用案例。

7月7日

星期二 · 1 条
15:10
Hacker News 热门(buzzing.cc 中文翻译)精选
70
在网络不稳定的地区,小型AI模型正逐渐普及

2019年,Adebayo Alonge因服务器远在美国致RxScanner单次扫描超5分钟,工程师2小时内将AI模型缩小至可在Android手机本地运行,此后RxScanner能在无宽带、缺电地区验药。小AI模型参数通常至多几十亿,可在手机或Raspberry Pi上运行,功耗仅数瓦。类似案例包括印度腰果病害检测无人机、乌拉圭蚂蚁入侵识别、疟蚊检测及巴西基于Arduino的心电图设备。世界银行报告显示,全球最穷国家仅0.7%互联网用户用过ChatGPT,发达国家达四分之一;行长认为小AI是为缺乏算力与电力的地区提供生命救助服务的关键。

现象/趋势端侧

推荐理由:这篇IEEE特写把AI的镜头从硅谷转向了没有宽带的地方,用假药检测、无人机农场等案例讲清楚了一个被忽视的真相:对多数世界而言,能跑在手机上的小型模型才是真正的AI。

7月4日

星期六 · 1 条
13:08
IT之家(RSS)精选
74
我国研制全球首款基于可控存内计算的忆阻器神经动力学芯片

北京大学集成电路学院联合中科院上海微系统所,发布全球首款基于可控存内计算的忆阻器神经动力学芯片,首次将单步运算时延压缩至2.12毫秒。芯片采用40纳米工艺,存内计算阵列与外围电路总面积0.28平方毫米,运行频率50 MHz,单步积分仅需9级流水。在脑皮层重建等任务中较当前GPU提速50至478倍,突破神经动力学实时计算瓶颈。相关成果7月3日发表于《科学》。

端侧论文/研究

推荐理由:全球首款神经动力学芯片将单步时延压至2.12毫秒,首次实现实时计算,比GPU快50倍以上,这是神经拟态芯片落地的关键一步,做实时仿真和边缘AI的可以留意。

7月1日

星期三 · 2 条
01:58
TechCrunch:AI(RSS)精选
72
Acti 将 AI 智能体直接放入手机键盘

新加坡初创公司 Acti 发布基于 Google Gemini 的智能体键盘,可代替用户在应用中执行操作。核心功能 Skills 允许用自然语言创建快捷方式,如长按 T 键翻译消息、C 键发送会议链接。早期测试者两周内创建超 1000 个 Skills。采用本地优先架构,默认不访问私人消息。公司获 530 万美元种子轮融资,由 BITKRAFT Ventures 领投,现已开放下载。

智能体Google产品更新端侧

推荐理由:Acti 想用 AI 代理重塑手机键盘,把 Gemini 塞进输入法,离不离开 App 都能用 AI 的思路很讨巧,但换键盘的阻力不小,目前更像一个有趣的试验品。刚拿到 530 万美元种子轮,有试错空间。
00:28
ClaudeDevs@ClaudeDevs精选
67
Claude Desktop 现已在 Linux(Ubuntu 和 Debian)上推出测试版。 除了浏览器和终端,你现在可以在所有付费计划中获得一流的桌面体验,包括 Claude Code、Claude Cowork 和聊天。
Anthropic产品更新端侧

推荐理由:Claude 桌面端终于来到 Ubuntu,补齐了 Linux 开发者工作流里缺失的一环,beta 状态不影响它与终端、浏览器的深度打通。

6月30日

星期二 · 3 条
05:35
Ars Technica:AI(RSS)精选
75
韩国将投入1万亿美元扩大存储芯片生产和发展人形机器人

韩国政府与三星、SK海力士等承诺1万亿美元实施三大旗舰项目。三星和SK海力士投资5850亿美元新建芯片工厂,目标五年内将DRAM产量翻倍;SK集团、GS集团和Naver投资3570亿美元在偏远省份建设AI数据中心;物理AI被指定为国家战略产业,现代汽车投资58亿美元建设机器人工厂和AI数据中心,计划到2028年每年生产3万台Atlas人形机器人,并在10大行业实现商业化。但现代汽车工会已批准罢工谈判,要求利润分享和岗位保护。

具身智能数据/训练端侧行业动态

推荐理由:韩国砸 1 万亿美元砸向内存芯片和机器人,不只是产能竞赛,更是试图锁住 AI 硬件供应链的关键位置。但工会抗议和芯片暴利税收争议也浮现,值得追踪。
04:26
OpenClaw🦞@openclaw精选
71
OpenClaw 现已登陆 iOS 和 Android 🦞 📱 原生移动应用,终于来了 💬 智能体装进口袋 🔔 频道、任务、回复,随时处理 用你的大拇指,在任何地方运行智能体。 iOS: https://apps.apple.com/us/app/openclaw-ai-that-does-things/id6780396132 Android: https://play.google.com/store/apps/details?id=ai.openclaw.app
智能体产品更新端侧

推荐理由:OpenClaw 终于推出原生移动应用,智能体可以随时放进口袋,对已有用户是体验上的补完,但对新用户的吸引力可能有限。
02:35
Hacker News 热门(buzzing.cc 中文翻译)精选
75
Qwen 3.6 27B 是本地开发的理想选择

Qwen 3.6 27B 是一款密集参数本地大语言模型,原生支持 256k 上下文。在 Macbook Max M5 上运行 llama.cpp Q8_0 量化版(含多 token 预测)可达 30 tokens/s;用户反馈在 RTX 5090 上 Q6_K 量化可达 50 tokens/s。它可通过单个提示完成创意诗歌、用 pnpm 生成六边形扫雷游戏等任务,作者称其为首个真正具备通用智能的本地模型。另有一个 MoE 变体 35B A3B,但作者推荐 27B 版本。

开源生态端侧评测/基准

推荐理由:一篇详实的 Qwen 3.6 27B 实战评测,从创意写作到代码生成都测了,还给出了 llama.cpp 部署命令和性能数据,想本地跑模型的开发者可以直接抄作业。

6月26日

星期五 · 1 条
00:00
Google Research:Blog(网页)精选
55
冻结多token预测加速Pixel上的Gemini Nano模型

Google Research提出一种新架构,在已冻结的Gemini Nano v3模型上改造Multi-Token Prediction(MTP),以加速Pixel 9和10系列上的设备端推理。该方法基于EAGLE框架和CALM,无需单独训练占用内存的草稿模型,通过“晚期退出”策略实现加速。AI通知摘要和校对功能因此生成文本速度显著提升、能耗降低,开发者无需为每个新任务微调独立模型。

Google推理端侧论文/研究

推荐理由:谷歌这篇技术博客值得端侧开发者细读,他们把多令牌预测硬是装进了已部署的 Nano 模型,Pixel 上生成加速五成,还省了 130MB 内存,零拷贝架构的想法挺巧,但没法直接复现,主要是开脑洞用的。

6月24日

星期三 · 2 条
15:10
OpenBMB@OpenBMB精选
65
🥳感谢分享,@MLBoy_DaisukeMajima 🚀 MiniCPM-V 4.6 在设备上以这样的速度运行,实在令人印象深刻--尤其是在 Apple Core AI 上以不到 2B 参数跑出。 干得漂亮,推动高效多模态 AI 向前发展。🫡

MLBoy_DaisukeMajima: 📸 MiniCPM-V 4.6 - 参数量低于 2B 的最强视觉模型之一 - 现已在 iPhone 17 Pro 上通过 Apple Core AI 以约 51 tok/s 的速度运行。 🤗 http://huggingface.co/...

多模态开源/仓库端侧

推荐理由:社区把 MiniCPM-V 4.6 搬上 iPhone 17 Pro,跑出 51 tok/s,还给了代码和模型,做端侧多模态的可以直接跑起来了。
03:21
Hao AI Lab@haoailab精选
73
FastWan-QAD:单卡5090上1.8秒生成5秒视频

Sky Computing Lab 发布 FastWan-QAD 视频生成模型系列,基于 FastVideo 的量化感知蒸馏(QAD)方案训练。在单张 NVIDIA GeForce RTX 5090 上,端到端生成一段 5 秒 480P 视频仅需 1.8 秒。模型、代码及博客已开源。

GitHubHugging Face模型发布端侧

推荐理由:单张 RTX 5090 上 1.8 秒生成 5 秒视频,把消费级延迟压到了‘即时生成’的临界点,做短视频和互动应用的开发者可以认真把这个模型放进技术栈。

6月23日

星期二 · 1 条
16:12
Hugging Face:Blog(RSS)精选
59
我们用免费本地模型对 OpenClaw 仓库进行实时分类

Hugging Face 在 OpenClaw 仓库上测试用 Gemma 和 Qwen 等本地模型实时分类 issue 和 PR。他们使用 Pi agent harness 驱动模型,配合 reposhell 只允许读操作防止提示词注入。测试的模型包括 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,经性能优化后均可在本地生成数百 token/s。该方案运行在 NVIDIA GB10(128 GB 统一内存)上,相比每月 200 美元的 ChatGPT Pro 订阅,可实现近乎实时的通知且仅消耗电费。

智能体Hugging Face开源生态教程/实践

推荐理由:Hugging Face 演示了用本地模型自动 triage GitHub issue 的完整方案,包括只读 shell 防注入、agent harness 等工程技巧。对想用本地模型替代 API 做分类任务的团队,这是一套可直接借鉴的 recipe。

6月17日

星期三 · 1 条
12:50
Tomer Tunguz 博客(VC 分析)精选
62
5x for Free:本地编程栈

Hacker News 讨论揭示:Qwen 3.6 35B-A3B 模型提及率 33% 领先,27B 变体以 20% 紧随其后,DeepSeek Pro 与 Gemma4 31B 位列前四。Agent 工具中 Pi (49%) 与 OpenCode (45%) 占主导。用户对比称,Claude Opus 可带来 15 倍加速,而本地离线 Qwen 提供 5 倍加速,且完全免费、保护隐私。SWE-bench Verified 基准测试显示,Qwen 3.6 27B 得分 77.2%,35B-A3B 得分 73.4%,接近 Claude Sonnet 4.6 的 79.6%。MoE 架构使大模型在消费级硬件上高效运行。

现象/趋势端侧编码

推荐理由:本地模型在编码上正逼近云端前沿,Qwen 35B-A3B 已成社区标配,免费且完全离线让这场替代变得真实,选型逻辑可能从此改变。

6月13日

星期六 · 2 条
17:54
公众号:通义实验室(千问)精选
79
MNN 适配 SME2 使 Qwen3-VL-4B 在端侧实时推理

MNN 推理引擎深度适配 Arm SME2 指令集,使 Qwen3-VL-4B-Instruct 在支持 SME2 的 vivo X300 上实现实时多模态推理。Prefill 阶段性能提升 81%,Decode 阶段提升 13%。MNN 采用编译时内建 + 运行时自动检测设计,默认开启 SME2 加速。该模型为 4B 参数视觉语言模型,支持图文理解和对话,通过 MNN 官方已转换量化的模型可直接下载部署,开发者可通过编译开关一键开启硬件加速。

多模态教程/实践端侧

推荐理由:这是一份硬核的端侧部署指南,实测数据让 Qwen3-VL 在 SME2 手机上 Prefill 提速超过 80%,做移动端 AI 的团队可以直接抄作业。
04:49
Hacker News 热门(buzzing.cc 中文翻译)精选
70
如何在macOS上设置本地编码代理

来自ikyle.me的教程,指导在macOS上搭建本地编码代理,获Hacker News社区104个点赞。

开源生态教程/实践端侧编码

推荐理由:这篇文章不是泛泛的「本地跑大模型」,而是给 Mac 开发者一个实测过的、能打的生产环境编码代理方案,尤其 MTP 加速让速度不再鸡肋,可以直接抄作业。

6月12日

星期五 · 1 条
10:34
IT之家(RSS)精选
75
苹果 iOS 27 健康 App 大改:卡片布局、营养识别、围绝经期追踪

苹果在 iOS 27 中优化健康 App,将列表改为卡片布局并增加导航栏。新增视觉智能营养识别,用户通过相机 Siri 模式拍摄食物可获取加工程度、蛋白质、含糖量等信息及营养价值评级,不提供精确卡路里,需 iPhone 15 Pro 及以上。经期追踪扩展支持围绝经期,可分析长期周期异常模式并推送提醒与指导。Fitness+ 新增围绝经期和绝经期课程。数据同步速度提升,GymKit 扩展至 iPhone,无需 Apple Watch 即可与健身设备配对同步数据。

产品更新多模态端侧

推荐理由:视觉智能营养识别不能给精确卡路里,但那个“深度加工食品”提醒对普通人很实用,健康App这次更新算得上近年最有用了。

6月11日

星期四 · 1 条
09:09
Berryxia.AI@berryxia精选
76
mlx-vlm v0.6.3 上线,首发支持 DiffusionGemma 和 North Mini Code 1.0。DiffusionGemma 采用全新架构:以 256 token 块为单位并行生成、双向注意力、迭代自纠错;26B MoE 仅激活 3.8B,量化后 18GB 即可运行。North Mini Code 1.0 为 30B MoE,仅激活 3B,BF16 下约 66 tok/s。两款模型均通过深度合作实现 Day-0 MLX 支持,可在 Mac 本地运行。可通过 `uv pip install -U mlx-vlm` 安装体验。

Prince Canuma: mlx-vlm v0.6.3 is here 🚀 Day-0 support for TWO new models from our partners we work closely with: 🔥 @GoogleDeepMind Di...

Google产品更新端侧编码

推荐理由:Google 和 Cohere 新模型发布同日,mlx-vlm 就把它们塞进了 Mac 本地,DiffusionGemma 用扩散思路生成文本,量化后 18GB 就跑得动,属于本地党必跟的更新。

6月9日

星期二 · 5 条
21:00
公众号:火山引擎精选
69
全新汽车品牌AIVA发布,火山引擎助力打造AI汽车新体验

由赛力斯、宁德时代等多方产业资本组建的AI出行品牌AIVA正式发布。火山引擎提供豆包大模型、智能座舱等技术服务。概念车AIVA Origin Concept亮相,首款量产车AIVA ME7将于2026年内亮相,全系覆盖20万元以上市场。AIVA提出“AI定义汽车”路径,让汽车成为具身AI生命体。火山引擎副总裁表示,人与汽车的关系将实现交互、智能、感受三方面根本转变。未来双方将围绕AI交互、智能体验、情感陪伴深度共创。

具身智能端侧行业动态

推荐理由:AIVA把「先有AI再有车」当作造车逻辑,火山引擎直接下场定义汽车AI体验,这是豆包大模型从软件跑到物理世界的第一次大规模试水,做具身智能和车载产品的人该仔细看看。
08:03
Berryxia.AI@berryxia精选
75
Kimi Work 桌面 AI 代理上线,支持 300 个本地代理并行

Kimi Work 是一款桌面 AI 代理,支持在本地最多 300 个代理并行执行任务,已适配 macOS(Apple Silicon)和 Windows。配合 WebBridge 扩展,代理可自主在浏览器中搜索、滚动、点击、打字完成操作。内置财经场景优化,原生调用 Yahoo Finance 和世界银行数据,无需复杂 API 配置。自带记忆系统记录用户偏好和决策历史。最终自动生成 PPTX、Word、PDF、Excel 文件。

Kimi.ai: Meet Kimi Work - a local AI agent on your desktop that does the work for you. 🔹Native agent swarm: Up to 300 AI agents ...

智能体MCP/工具产品更新端侧

推荐理由:Kimi 这次把 300 个本地 agent 塞进桌面,外加浏览器操控和财经数据直连,让「AI 秘书团」从概念变成了一件能立刻上手的事,做桌面自动化的值得试试。
07:33
Hacker News 热门(buzzing.cc 中文翻译)精选
74
Apple Core AI 框架

一篇关于 Apple Core AI 框架的 Hacker News 帖子获得 109 个点赞。帖子内容包含一张苹果开发者 OG 图片和一个指向 Apple Core AI Framework 官方文档的链接(developer.apple.com)。该帖子由 buzzing.cc 中文翻译,发布于 2026 年 6 月 8 日 02:47(UTC)。

产品更新端侧

推荐理由:Apple 在 WWDC 上发布的本地 AI 框架,统一了 CPU、GPU、Neural Engine 的推理接口,做 iOS/macOS AI 应用的开发者必看,提前适配就能低成本用上设备端能力。
05:15
Apple Machine Learning Research(RSS)精选
79
苹果发布第三代 Apple Foundation Models(AFM)

苹果推出第三代 Apple Foundation Models(AFM)基础模型家族,与 Google 合作定制,包含五个模型,覆盖从设备端到基于 Private Cloud Compute 的服务器端模型。这些模型旨在驱动 Apple Intelligence 功能,包括全新 Siri 和智能工具,以用户为中心深度融合操作系统,隐私为核心设计原则。

Google多模态模型发布端侧

推荐理由:Apple与Google罕见联手推出的第三代基础模型,直接为下一代Siri和系统级AI功能铺路,标志着消费级AI的深度整合,产品经理和iOS开发者必须关注。
03:14
Apple:Newsroom(RSS)精选
66
Apple 推出 Siri AI:由 Apple Intelligence 驱动的更强大、更个性化的个人助理

Apple 发布了 Siri AI,一款由 Apple Intelligence 驱动的个人助理,具备个人上下文、世界知识和屏幕感知能力,能提供更强大、更个性化的交互体验。

智能体产品更新多模态端侧
另有 2 家信源报道TechCrunch:AI(RSS)Apple:Newsroom(RSS)
推荐理由:苹果对 Siri 的这次重构不是简单地换个模型,它把个人上下文、屏幕感知和视觉智能实际嵌进了系统,对普通用户来说日常交互方式可能要变。

6月8日

星期一 · 3 条
22:34
Kimi.ai@Kimi_Moonshot精选
76
Kimi Work:本地桌面AI智能体,支持300智能体并行

Kimi发布Kimi Work,一款本地运行的桌面AI智能体。支持最多300个AI智能体同时在本地机器并行运行;配合WebBridge浏览器扩展,智能体可在浏览器中导航、搜索、点击、填写并完成任务;内置全球市场数据工具,可直接调用Yahoo Finance和世界银行数据,无需复杂API设置;记忆系统会记录用户偏好、过往决策和上下文。支持macOS(Apple Silicon)和Windows。

智能体MCP/工具产品更新端侧
另有 2 家信源报道IT之家(RSS)公众号:月之暗面(Kimi)
推荐理由:这个产品把AI agent从聊天窗口搬到了桌面,300个并行agent和内置金融工具直接对标专业人群,如果它能稳定运行,个人AI助手的形态又要被重新定义了。
18:00
公众号:通义实验室(千问)精选
68
Agent 辅助开发,一站式打通 Qwen3-VL Android 端侧推理

通义实验室教程演示了如何用 Agent(Qoder)辅助完成 Qwen3-VL-2B 模型在 Android 端侧的全流程部署。操作包括:检查 JDK 21、NDK 27、CMake 3.18.1 等环境;创建 arm64-v8a 的 Native C++ 工程(minSdk 29、compileSdk 35);通过 ModelScope CLI 下载约 1.4GB 的 MNN/Qwen3-VL-2B-Instruct-MNN 模型;编译开启 LLM 视觉支持(MNN_BUILD_LLM、LLM_SUPPORT_VISION)的 libMNN.so;构建 APK 并推送模型至手机私有目录。最终 App 提供图文推理页面,输出 MNN 版本(v3.5.0)、ABI 及推理指标。所有繁琐步骤均可由 Agent 自动执行。

多模态推理教程/实践端侧

推荐理由:用Agent辅助走通Qwen3-VL安卓端侧推理全流程,从环境搭建到JNI桥接一步到位。如果你在做移动端AI应用,这可能是目前最详细的实战指南,可以直接抄作业。
17:53
公众号:通义实验室(千问)精选
67
Agent辅助开发:通义实验室教程打通Qwen3-VL Android端侧推理

通义实验室第二期教程展示如何利用Agent(如Qoder)自动完成Android端侧AI App开发全流程。Agent依次执行:检查并配置Android环境(JDK 21、NDK 27等)、创建Native C++工程PhotoTaggerMNN、下载约1.4GB的Qwen3-VL-2B-Instruct-MNN模型、编译支持视觉能力的libMNN.so、将MNN接入工程、构建APK、推送模型至手机私有目录,最终确认MNN版本3.5.0及模型文件全部ok。核心思路是开发者定义业务目标,Agent负责环境检查、代码编写、编译构建与排错。

多模态教程/实践端侧

推荐理由:这是一篇手把手教程,用 Agent 简化 Qwen3-VL Android 部署,对想试端侧 VL 的开发者实用,但绑定阿里生态,通用性有限。

6月7日

星期日 · 1 条
19:27
AYi@AYi_AInotes精选
78
"我在田里雇了一名工程师,它叫 Codex" -- 北海道一个西兰花农的 8 个真实 AI 用法

日本北海道农民富安弘毅用 ChatGPT 和 Codex 解决农场实际问题,涵盖 8 个用法:拍照识别西兰花病害、卫星监测获取 NDVI 数据、用 ESP32 和 LINE 机器人远程控制温室卷帘、为农场群聊开发机器人管理温度与排期、从聊天记录追踪播种数量、学习 RTK-GPS 自动转向原理并评估自建成本、设计基于 Airtable 的农场管理数据库。他说 AI 让传统昂贵的自动化变得低成本可及,“如同身边有一位超级工程师”。

OpenAI教程/实践端侧部署/工程

推荐理由:一个北海道农民把 ChatGPT 和 Codex 用成了农场的‘外挂工程师’,从病害诊断到温室远程控制,每个用法都附原始提示词——农业从业者可以直接抄作业。

6月6日

星期六 · 2 条
00:59
Google AI Developers@googleaidevs精选
72
谷歌发布 Gemma 4 QAT 检查点,支持消费级 GPU 和移动设备本地运行

谷歌发布 Gemma 4 量化感知训练 (QAT) 检查点,支持在消费级 GPU 和移动设备上本地运行,质量损失极小。新检查点提供 GGUF(Q4_0)格式,覆盖所有尺寸及起草模型,实现最佳本地性能。自定义移动模式采用混合精度方案,将 Gemma 4 压缩至 1GB 以下,包含 2-bit 解码层、优化 KV 缓存和静态激活。通过在训练中模拟压缩(而非训练后量化),大幅降低内存占用并加速解码,同时保持推理质量。

Google开源/仓库模型发布端侧
另有 8 家信源报道X:Demis Hassabis (@demishassabis)X:Sundar Pichai (@sundarpichai)Hacker News 热门(buzzing.cc 中文翻译)X:Jeff Dean (@JeffDean)The Decoder:AI News(RSS)Google Developers Blog(RSS)X:Google AI for Developers (@googleaidevs)Google DeepMind:Blog(RSS)
推荐理由:Gemma 4 的量化版把模型压到 1GB 以下,手机本地跑大模型的门槛又低了一大截。Google 这次没用传统的训练后量化,而是把压缩直接嵌进训练里,效果比 PTQ 好一截,搞端侧部署的可以拿 checkpoint 试起来了。
00:38
Tomer Tunguz 博客(VC 分析)精选
68
AI的微型钢厂

作者通过技能蒸馏将78%的AI工作交由Mac本地模型处理,仅复杂任务发往云端。智能体自动分类任务:简单任务本地数秒完成,复杂任务路由至云端。过去一周本地处理峰值达88%。双车道设计使吞吐量提升约25%,平均任务时长从47秒降至19秒,队列等待时间从73秒降至4秒(降幅94%)。该模式类比Nucor小钢厂,每台能运行蒸馏模型的边缘设备都成为小型AI工厂,仅对那1/5困难任务支付云费用。未来几年,数以千万计的此类设备将在企业内部增殖,逐步取代现阶段云厂商账单上的大部分工作负载。

智能体大佬观点端侧

推荐理由:Tunguz 把自己 78% 的 AI 任务都挪到本地跑,吞吐量涨了 25%,延迟降了 60%。mini-mill 的类比把端侧 AI 的颠覆逻辑讲得比任何行业报告都清楚,做工作流自动化的值得细读。

6月5日

星期五 · 3 条
22:15
IT之家(RSS)精选
76
Meta 智能眼镜 App 暗藏人脸识别代码,NameTag 功能已推送至超 5000 万设备

据《连线》今日报道,Meta 通过多次应用更新将人脸识别代码推送到智能眼镜配套 App 中,代号“NameTag”。该功能利用已部署的三个 AI 模型将人脸转换为“人脸特征模板”,与手机本地数据库匹配,识别成功后向佩戴者发送通知。App 下载量超 5000 万次。Meta 回应称代码仅为探索,尚未决定推出,且不会建立中央人脸数据库。此前 Meta 曾因人脸识别问题在伊利诺伊州和得克萨斯州分别达成 6.5 亿美元和 14 亿美元和解。

Meta多模态端侧行业动态

推荐理由:Meta一边付近百亿美元和解金,一边把完整人脸识别代码塞进 5000 万用户的眼镜里,「探索」这个解释太轻巧——代码都推送了,离功能上线只差一个开关。
05:17
Hacker News 热门(buzzing.cc 中文翻译)精选
80
Meta 在智能眼镜上搭载人脸识别功能

Meta 为其智能眼镜产品推出了人脸识别功能,用户可通过眼镜识别他人身份,并获取相关信息。该功能目前正通过早期测试版本向部分用户开放,旨在增强增强现实设备的社交与信息交互能力。

Meta现象/趋势端侧

推荐理由:Meta 把完整的人脸识别栈塞进了智能眼镜 App,这事一旦激活,公共场所的匿名性将被重新定义。作者的技术取证链条扎实,迫使 Meta 必须正面回应。
04:25
Google Research:Blog(网页)精选
79
Google Research 发布被动心率监测系统 PHRM

Google Research 开发了一种被动心率监测系统(PHRM),利用智能手机前置摄像头在日常使用中(人脸解锁后数秒内)捕捉面部视频,通过深度学习估算心率,平均绝对百分比误差(MAPE)低于10%(对比心电图金标准),满足各肤色人群的行业精度标准。系统将全天心率测量整合为每日静息心率(RHR),平均绝对误差(MAE)低于5 bpm(对比可穿戴设备)。研究同时发布了迄今最大规模的公开智能手机视频数据集及预训练模型PHRM-mini,合格研究人员可申请访问。

Google数据/训练端侧论文/研究

推荐理由:Google 这项发表在 Nature 上的研究,把手机前置摄像头变成了被动心率仪,而且专门解决了深肤色人群精度差的老问题,虽然离产品还远,但方向很对,穿戴设备的护城河可能又浅了一点。