Topic · 主题全部主题 →

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

2,095条收录
154条精选

精选归档 · 第 5 页

81100 条 · 共 154

5月31日

星期日 · 4 条
20:18
Chubby♨️@kimmonismus精选
AI 评分 75/100
苹果WWDC将推AI升级:Gemini蒸馏模型本地运行,但技术栈外部依赖显著Interesting updates on Apple AI: As Apple's WWDC lands next month, and the long-delayed Siri and on-device AI upgrades are expected to be the centerpiece: a smaller, distilled version of Google's Gemini running locally on iPhone silicon, pitched on privacy and lower token costs.Most of that stack is sourced from elsewhere. The local model is distilled from Gemini. Queries too heavy for the device route to Google Cloud (!), where Apple has now signed off on Nvidia's confidential-compute tech to process them. Apple is also reportedly hunting for small on-device-AI startups to speed up the model-shrinking work, having looked at Liquid AI among others.One quiet shift from the 2024 rollout: Apple promised then that anything leaving your iPhone would run on Apple silicon inside Private Cloud Compute. It couldn't get the full Gemini running there, so those queries now sit in Google Cloud. The Private Cloud Compute name is staying anyway. Via The Information苹果下月WWDC将重点展示延迟已久的Siri及设备端AI升级,核心是在iPhone芯片本地运行从Google Gemini蒸馏而来的更小模型,以强调隐私与降低token成本。但该技术栈大部分源自外部:本地模型由Gemini蒸馏,设备无法处理的复杂查询将路由至Google Cloud处理,并采用了Nvidia的机密计算技术。苹果据称正在寻觅小型设备端AI初创公司以加速模型缩减工作。此外,苹果2024年承诺的Private Cloud Compute方案原计划使用苹果芯片,因无法承载完整Gemini模型,现已部分转向谷歌云,但该名称仍将保留。
另有 6 家信源报道IT之家(RSS)TechCrunch:AI(RSS)Apple:Newsroom(RSS)公众号:数字生命卡兹克The Verge:AI(RSS)X:Testing Catalog (@testingcatalog)
推荐理由:苹果Siri的救命稻草原来是Gemini,更扎心的是那些‘离开iPhone的查询’现在跑在Google Cloud上,Private Cloud Compute只剩个名字,做端侧推理和隐私计算的同行该注意风向变了。
10:24
IT之家(RSS)精选
AI 评分 72/100
6000 多公里全程零干预:特斯拉 FSD 完成全球首次横穿加拿大自动驾驶

一辆特斯拉汽车搭载 FSD V14.3.3 版本软件,完成了全球首次全程零人工干预、横穿加拿大的自动驾驶行程。车辆从温哥华出发,历时 4 天 21 小时,行驶 3760 英里(6051 公里)抵达哈利法克斯,全程所有驾驶操作(包括高速并线、应对复杂路况与自动泊车)均由系统自主完成,无任何系统退出或人工修正。该版本随 2026.14.6.6 更新推送,整合了春季软件功能。


推荐理由:车主自己跑的6千公里零干预记录,比任何官方demo都实在。零接管、过施工、全自动泊车,FSD这个能力信号,对自动驾驶行业是颗定心丸。
05:43
Simon Willison 博客精选
AI 评分 73/100
在浏览器中通过 Pyodide 和 Service Worker 运行 Python ASGI 应用

作者展示了如何在浏览器中通过 Pyodide 和 Service Worker 运行 Python ASGI 应用。此前的 Datasette Lite 使用 Web Workers,但无法执行 <script> 标签中的 JavaScript。新方案由 Claude Opus 4.8 协助完成开发,解决了这一问题。作者已展示了基础的 ASGI FastCGI 演示和运行 Datasette 1.0a31 的演示,并计划后续将此方法应用于升级 Datasette Lite。


推荐理由:Simon Willison 用 Service Worker 让 Python ASGI 在浏览器里真正跑了起来,这个技巧补上了 Datasette Lite 长期缺的 JS 执行能力,搞 Pyodide 的值得看看。
02:34
AYi@AYi_AInotes精选
AI 评分 75/100
NVIDIA 或将于六月发布整合 Blackwell GPU 与 AI 单元的 ARM 笔记本芯片 N1Xdamn,NVIDIA 这回真是憋了个大的啊, 官号只发了三个词,A new era of PC,配一个坐标:25.0528, 121.5990。微软和 Arm 几乎同一时间,发了几乎一样的内容。那个坐标点开,是台北音乐中心——6 月 1 号黄仁勋 keynote 的场地。三家巨头同时塞给你一张藏宝图,图上就画了个叉,这件事本身就是一个巨大的信号了。藏在后面的,大概率是传了快一年的 N1X——NVIDIA 和联发科合做的一颗 ARM 笔记本芯片,联发科出 CPU,NVIDIA 把 Blackwell 显卡直接做进同一颗芯片里,两块 die 拼一起,跑 Windows、原生跑 AI。泄露的口风很猛,说轻薄本里能摸到接近 RTX 4070 的图形,但具体还得等 6 月 1 号发布会,先别太当真。我觉得真正值得琢磨的可能还不是这颗芯片有多强,关键是NVIDIA 站的位置已经完全变了。过去在一台笔记本里,NVIDIA 就是被请进来装那块独立显卡的供应商,整机怎么设计、配谁家的 CPU、装什么系统,轮不到它说话,它像个上门装空调的师傅,活儿干得全场最好,可房子是别人的。这次老黄不装空调了,他想要把 CPU、GPU、AI 单元打包成一整颗芯,直接卖给戴尔、联想去做整机。相当于那个最好的装空调师傅,转头自己当起了开发商,整套户型都按他的图纸来,这才是那三个词真正的分量。说白了,NVIDIA 不想再只卖那块最贵的配件了,它想定义整台机器的心脏长什么样,走的是 Apple M 系列那条垂直整合的老路,只不过这次的目标,是整个 Windows 阵营。真要走通了,最先慌的是 Intel 和 AMD,甚至连刚站稳脚跟的高通骁龙都得抖一抖。当然,新纪元这词,科技圈喊过太多次,喊完没下文的也不少。还得看一年后你换的那台笔记本,开机角落里,那个贴了几十年的 Intel inside是不是已经换了。NVIDIA、微软与 Arm 同步发布指向台北音乐中心的坐标,暗示 6 月 1 日发布会将有重大动作。此举被认为是 NVIDIA 与联发科合作的 ARM 笔记本芯片 N1X 的预告。该芯片整合了 CPU、基于 Blackwell 架构的 GPU 及 AI 单元,目标是使轻薄本具备接近 RTX 4070 的图形性能。这标志着 NVIDIA 的战略转变:从显卡供应商,转型为定义整机核心方案的提供商,将直接冲击 Intel、AMD 和高通在 PC 市场的地位。

NVIDIA: A new era of PC. 25.0528, 121.5990


推荐理由:三家巨头同发三个词和一个坐标,这比芯片参数更值得嗅的信号是,NVIDIA要从装空调的变成盖房子的,Windows 阵营的 Intel inside 可能真要换标了。

5月30日

星期六 · 1 条
05:40
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
Liquid AI 公布了在 38T 数据集上训练的 8B-A1B MoE 模型

Liquid AI 发布了其 LFM2-5 系列的 8B-A1B 模型,该模型采用混合专家(MoE)架构,在包含 38T token 的数据集上训练完成。


推荐理由:Liquid AI 把推理和工具调用塞进了消费级硬件,笔记本上跑 250 token/s,边缘 Agent 有了一个能打的离线选项。性能不算顶尖,但‘全本地’这个特性,对隐私敏感的场景是真卖点。

5月29日

星期五 · 2 条
17:44
公众号:通义实验室(千问)精选
AI 评分 64/100
通义实验室发布教程:在 Android 手机部署 MCP 感知服务器

通义实验室发布教程,演示如何在 Android 手机上部署 MCP 感知服务器,使手机具备本地视觉与听觉分析能力。核心基于端侧 MNN 推理引擎和 Qwen3-VL 2B 模型(约 1.3GB),摄像头与麦克风采集的音视频在本地实时转化为结构化 JSON,再通过 MCP Tool 供 Claude Code 等云端 Agent 远程调用。整个过程不上传原始数据,仅传输语义提取结果。项目已开源,实测可识别红绿灯状态等场景。


推荐理由:如果你做Agent总觉得AI对物理世界是瞎子,这篇教程就是解药。把Qwen3-VL塞进手机当本地眼睛,不传原始视频只给结构化文字,隐私友好又能被Claude直接调用。
11:35
公众号:面壁智能(MiniCPM)精选
AI 评分 61/100
面壁智能联合清华、OpenBMB开源最大中文预训练合成数据集及千万级SFT数据集,公开MiniCPM5-1B核心数据

面壁智能联合清华大学、OpenBMB发布并开源两大数据集:Ultra-FineWeb-L3(超600B Tokens,中文200B+,为当前最大中文预训练合成数据集)和UltraData-SFT-2605(国内首个千万级同时含深思考与非思考标注的SFT数据集)。两者基于UltraData数据分级治理体系构建,在MiniCPM5-1B训练流程中得到完全验证,覆盖预训练退火到后训练SFT全链路。已上线UltraData网站与HuggingFace,免费开放。

另有 1 家信源报道X:面壁智能 OpenBMB (@OpenBMB)
推荐理由:填补了中文大规模合成数据空白,三年前还在用英文数据做中文模型的日子可以翻篇了,做端侧模型的可以直接拿这份数据跑一版 MiniCPM5-1B 级别的效果。

5月28日

星期四 · 3 条
11:35
公众号:面壁智能(MiniCPM)精选
AI 评分 61/100
PilotDeck 开源:以 WorkSpace 为核心的智能体操作系统

清华大学 THUNLP 实验室、面壁智能、OpenBMB 与 AI9stars 联合研发并开源的智能体操作系统 PilotDeck,以 WorkSpace(工作舱)替代传统对话框,每个工作舱拥有独立文件系统、记忆和技能,实现项目隔离。三大核心能力:记忆白盒化,全链路可见可控,支持一键修改和回滚;智能路由,自动识别任务难度动态分配模型,开启后成本节省近 70%,复杂任务仅用 1/6 成本即可反超顶级模型方案;Always-on 常驻任务,AI 主动发现并持续推进工作。支持端云协同,可调用端侧模型作为子 Agent,自动部署 VoxCPM 等模型完成多语言播客等任务。


推荐理由:PilotDeck把Agent从对话框解放进「工作舱」,记忆可见、成本锐减、能无人值守运行。已开源,值得所有被多任务折磨的开发者试试。
10:14
IT之家(RSS)精选
AI 评分 74/100
人民日报专访华为何庭波:今年秋季的新麒麟手机芯片,性能等相比去年是"跳跃性"提升

华为何庭波提出半导体新演进路径“韬(τ)定律”,以“时间缩微”(如逻辑折叠)替代“几何缩微”作为新指导原则。她表示,过去6年华为已基于此自主研发381款芯片。今年秋季将发布新的麒麟手机芯片,这是首个完整的“韬芯片”,其性能、集成度相比去年是“跳跃性”提升。

另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:华为提出「韬定律」替代摩尔定律,不是空谈,何庭波说新麒麟芯片性能跳跃提升,证明了这条路的可行性。对半导体行业是一次认知冲击。
01:34
Google Research:Blog(网页)精选
AI 评分 70/100
通过零信任聚合实现的隐私分析

Google Research 推出了一种新的隐私分析解决方案。该方案结合了一种新的密码学安全聚合协议与可信执行环境(TEE)的透明性,旨在实现前沿的隐私与安全保证。其核心是基于零信任原则,通过密码学与硬件保护的结合,确保系统仅能获取群体的匿名化聚合洞察。


推荐理由:Google 的隐私聚合新方案把多轮交互砍成一次提交,对做设备端联邦分析的人来说是工程上的一大步,而且结合 TEE 做双层防护,这个思路值得抄。

5月26日

星期二 · 2 条
14:11
IT之家(RSS)精选
AI 评分 76/100
面壁智能开源 MiniCPM5-1B:在 AA-Index 上超越所有 2B 参数以下模型,能跑在手机、浏览器上

面壁智能开源其新一代端侧大语言模型MiniCPM5-1B。该模型仅1B参数,在AA-Index榜单上超越所有2B参数以下模型,相比3个月前的Qwen3.5-2B效果更优且参数量减半。经INT4量化后权重仅0.5GB,支持在手机和浏览器上运行。其Base Model版本由面壁智能自主研发的AI训练框架ForgeTrain预训练完成,现已全面开源模型权重、训练数据集与部署方案。


推荐理由:1B参数干翻所有2B以下模型,量化后0.5GB就能塞进手机和浏览器,这个效率把端侧模型的门槛又压低了,做移动端AI的值得跟进。
03:58
Chubby♨️@kimmonismus精选
AI 评分 79/100
苹果据称正使用定制版1.2T参数Google模型重塑下一代SiriApple isn’t just adding Gemini to Siri. It is reportedly using a custom 1.2T-parameter Google model as the brain behind parts of the next Siri overhaul (Reuters).That is no small size. The question, therefore, is how Apple’s Gemini will perform and how fast it runs. In particular, simple queries are expected to run locally.Gemini 3.5 Flash is estimated to have around 300 billion parameters; Apple’s model will thus be significantly larger. However, the question also remains whether size actually pays off in this context. Apple’s model must deliver answers to everyday queries quickly-and be fast enough while doing so.Anyways, next months will be exciting in so many ways:-WWDC / Apple Intelligence with Gemini • GPT-5.6 • Sonnet4.8/Opus 4.8 (probably) -Gemini 3.5 pro (confirmed)Super hyped!据报道,苹果为改造下一代Siri,正使用一个定制版、参数规模达1.2T的Google大模型作为其核心,这显著大于预估约300B参数的Gemini 3.5 Flash。该模型将驱动Siri的部分功能,其中简单查询预期会在本地设备运行。苹果面临的关键挑战是确保该大模型能够足够快速地响应日常问题。此外,下个月AI领域预计将有多项重要发布,包括WWDC上的Apple Intelligence与Gemini整合、GPT-5.6、可能的Sonnet 4.8/Opus 4.8,以及已确认的Gemini 3.5 Pro。
另有 6 家信源报道IT之家(RSS)TechCrunch:AI(RSS)Apple:Newsroom(RSS)公众号:数字生命卡兹克The Verge:AI(RSS)X:Testing Catalog (@testingcatalog)
推荐理由:Apple 把 1.2T 参数的定制 Gemini 塞进 Siri,简单查询还打算跑本地,这比单纯集成 Gemini 激进得多,WWDC 见真章。

5月25日

星期一 · 2 条
13:11
IT之家(RSS)精选
AI 评分 77/100
华为何庭波"韬定律"论文发布,逻辑折叠技术提升芯片性能

华为何庭波在ISCAS 2026上提出“韬定律”,并介绍逻辑折叠(LogicFolding)技术。该技术通过三维空间拓扑重组提升芯片性能,不依赖新光刻工艺。在麒麟2026芯片测试中,晶体管密度从155 MTr/mm²提升至238 MTr/mm²,性能核心能效提高41%,最大时钟频率提升近13%。论文显示,麒麟2027芯片已进入Silicon状态,后续规划包括麒麟2028、2029。AI芯片方面,昇腾990计划在2030年左右引入逻辑折叠,硬件集成预计到2035年提高超过100倍。

另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:华为用‘逻辑折叠’替代光刻进步,在不依赖新工艺下实现代际性能提升,这是中国芯片行业的一个技术转折,做硬件和AI推理的值得仔细看看。
12:11

5月22日

星期五 · 3 条
22:56
Rohan Paul@rohanpaul_ai精选
AI 评分 75/100
首个基于华为昇腾910B NPU全栈训练的1.58比特开源大模型BitCPM-CANN发布BitCPM-CANN just became the world’s first open-sourced 1.58-bit ternary LLM trained entirely on Chinese-developed AI infrastructure.Developed by ModelBest, Tsinghua Univ, and OpenBMB community, the entire training pipeline, from quantization operators and algorithms to the full-stack framework, was natively executed on Huawei Ascend 910B NPUs.1.58-bit ternary weights use only 3 weight states, so the model needs far less memory when deployed on phones, PCs, cars, and local industrial devices.The harder achievement is the training system behind it: QAT, STE, low-bit operators, algorithms, framework work, and reproducible training scripts all had to hold together on Ascend 910B.When hardware costs rise, the winning model is not merely the one that scores higher in a chart, but the one that can be trained, reproduced, deployed, and improved under real constraints.ModelBest、清华大学与OpenBMB社区联合发布了BitCPM-CANN,这是全球首个完全基于华为昇腾910B NPU训练的开源1.58比特三元大模型。其核心创新在于采用仅含三种权重状态的极低比特量化技术,使模型内存占用相比BF16降低约6倍,可高效部署于手机、电脑、车载设备等边缘端。更关键的是,整个训练全栈(从量化算子到框架)均在昇腾上原生构建与验证,而非简单移植。该模型家族(0.5B-8B)在多项基准测试上保持了全精度模型95-97%的性能,为资源受限环境下部署和复现大模型提供了可落地的解决方案。

OpenBMB: 🚀 BitCPM-CANN by ModelBest × @Tsinghua_Uni × OpenBMB is here — and it's not about stacking parameters. Memory costs are...


推荐理由:首个开源的1.58-bit三元LLM,直接在昇腾芯片上原生训练,内存压缩到BF16的六分之一,8B模型就能跑在手机上,做端侧部署的可以立刻上手试试了。
00:33
Google Developers Blog(RSS)精选
AI 评分 63/100
发布 Kotlin版ADK与Android版ADK 0.1.0:在Android及其他平台构建AI Agent

Google发布了面向开发者的新工具包:Kotlin版ADK与Android版ADK 0.1.0。这两个工具包旨在帮助开发者构建AI Agent。其中,Kotlin版ADK将代理工作流引入后端项目开发;Android版ADK则专注于移动端应用,提供了构建AI代理所需的特定功能。此次发布为开发者提供了在Android生态及更广泛平台创建AI应用的官方工具基础。

另有 17 家信源报道IT之家(RSS)Google DeepMind:Blog(RSS)Google Blog:AI(RSS)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Jeff Dean (@JeffDean)X:Logan Kilpatrick (@OfficialLoganK)Hacker News 热门(buzzing.cc 中文翻译)X:Google DeepMind (@GoogleDeepMind)X:阿易 AI Notes (@AYi_AInotes)The Verge:AI(RSS)X:Ethan Mollick (@emollick)X:Kim (@kimmonismus)X:Sundar Pichai (@sundarpichai)X:Google AI for Developers (@googleaidevs)X:Rohan Paul (@rohanpaul_ai)The Decoder:AI News(RSS)
推荐理由:Google 首次为 Android 推出端侧多 agent 开发框架,虽然还只是 0.1 版,但端云混合编排的思路已清晰,移动开发者可以提前踩坑了,这是端侧 AI 应用爆发前的一个信号。
00:33
Google Developers Blog(RSS)精选
AI 评分 75/100
推出 Gemini for Home 赋能服务提供商与硬件合作伙伴

Google 通过推出全栈 Gemini AI 解决方案扩展其智能家居生态系统。该方案集成了先进的摄像头智能、自然语言查询功能和日常活动摘要能力。它为服务提供商和硬件制造商提供了现成的参考设计与API,使其无需大量研发投入即可构建主动式、品牌化的智能家居服务。该计划旨在超越基础设备控制,迈向能够理解情境并实时响应用户需求的AI原生智能家居。


推荐理由:Google 把 Gemini 塞进智能家居,直接给硬件商和 ISP 提供交钥匙方案,这一步可能比 Nest 当年更有侵略性,做智能家居的得留意了。

5月21日

星期四 · 2 条
16:56
Tencent Hy@TencentHunyuan精选
AI 评分 74/100
腾讯开源Hy-MT2多语言翻译模型🚀 Introduce Hy-MT2: New Open-Source Multilingual Translation ModelWe proudly launch our new Hy-MT2 translation model and the Tencent Hy Translation mini-program!Hy-MT2 is a powerful multilingual model supporting seamless translation across 33 languages — and it's fully open-source!It's 7B and 30B-A3B models achieve state-of-the-art performance among all open-source models on various translation tasks, surpassing models with dozens of times more parameters.The lightweight 1.8B model even outperforms mainstream commercial APIs like Microsoft and so on. Powered by Tencent AngelSlim 1.25-bit extreme quantization, it needs just 440MB storage and enables effortless local inference on mainstream mobile chips — with 1.5x faster speed vs. Hy-MT1.5.Open-source AI translation just got way smarter, faster, and more accessible! 🌏Project Page: https://aistudio.tencent.com/llm/zh?tabIndex=0 Hugging Face: https://huggingface.co/collections/tencent/hy-mt2 Modelscope: https://modelscope.cn/collections/Tencent-Hunyuan/Hy-MT2 Github: https://github.com/Tencent-Hunyuan/Hy-MT2腾讯正式开源Hy-MT2多语言翻译模型,支持33种语言间的无缝互译。其7B与30B-A3B版本在开源模型中达到最先进的翻译性能,超越了许多参数规模大数十倍的模型。更具突破性的是,1.8B轻量级版本性能超越微软等主流商业API,并凭借腾讯AngelSlim 1.25-bit极量化技术,仅需440MB存储空间,即可在主流手机芯片上本地运行,推理速度较前代提升1.5倍,显著降低了高质量AI翻译的部署门槛。
另有 2 家信源报道IT之家(RSS)X:腾讯混元 (@TencentHunyuan)
推荐理由:虽然翻译领域不算最热,腾讯这个1.8B开源模型用1.25位量化直接跑在手机上,效果还超微软商业API,做本地化翻译工具的人值得关注。
07:56
IT之家(RSS)精选
AI 评分 78/100
腾讯张军官宣操作系统层级 AI 助手"马维斯"正式上工,Windows、Mac、安卓端同步上线

腾讯于5月21日发布了操作系统层级AI助手“马维斯”,支持Windows、Mac和安卓平台同步上线。该助手具备文档归类解析、图片智能识别处理、系统维护等功能,并强调与操作系统深度集成,可调度不同模型处理任务,部分功能可在离线状态下使用。腾讯表示“马维斯”能完成市面主流Agent的大部分工作,并具备桌面操控手机应用等能力。这是继3月WorkBuddy和“龙虾”产品矩阵后,腾讯推出的又一AI助手产品。


推荐理由:腾讯把 AI 助手压到系统层,预装本地模型、拔网线也能跑,不是又一个套壳工具,而是真正冲着‘电脑变成可对话对象’去的,值得装上看看实操体验。

5月20日

星期三 · 1 条
04:25
Google Developers Blog(RSS)精选
AI 评分 65/100
更智能的 Google AI Edge Gallery:MCP 集成、通知和会话连续性

Google AI Edge Gallery 应用在安卓平台上扩展了设备端 AI 能力,通过引入对开源模型上下文协议(MCP)的实验性支持,使得 Gemma 4 模型能够协调处理跨 Google Workspace 和 Google Maps 等外部数据源的复杂任务。此次更新添加了“定时通知”技能,用于实现日常事务的自动化管理,并新增了持久化聊天记录功能,允许用户近乎即时地恢复长会话上下文。该平台依托开源工具包,积极鼓励社区开发者通过其 GitHub 仓库构建并分享专注实用的工作流、提示配置与工具集成。


推荐理由:MCP 终于跑在 Android 设备上了,虽然是实验性支持,但 Gemma 4 能直连 Workspace 和 Maps,做自动化的开发者可以上手试试。