内容
精选全部 AI 动态热点榜AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

精选

8月8日 · 周六
最新精选
全部模型产品行业论文教程观点
标签「端侧」清除

8月5日周三

03:54Simon Willison 博客74MiniMax-H3 通过 MLX 移植可在 Apple Silicon 上运行MiniMax 发布 MiniMax-H3,一个可接受文本、图像、音频和视频并生成最长 15 秒带音频视频片段的通用全模态生成系统。Python 包 PipeNetwork/minimax-h3-mlx 将其移植到 MLX,支持 Apple Silicon 运行。作者在 M5 Max MacBook Pro 上实测,下载约 115 GB 模型文件,视频生成耗时不到 45 分钟。推荐理由:在 M5 Max 上生成本地视频的 45 分钟耗时,为判断这类模型何时能进入日常工作流提供了具体的参照。
02:34Hacker News 热门(buzzing.cc 中文翻译)73Soup v0.72.4:在4 GB显存笔记本GPU上微调8B模型Soup 推出 v0.72.4,支持在配备 4 GB 显存的笔记本 GPU 上通过 QLoRA 微调 8B 模型,无需 SSH 或云服务。推荐理由:Soup 将 8B 模型微调压低到 4GB 显存笔记本,使得原本受 GPU 预算限制的个人开发者也能直接在本地迭代模型行为。

8月4日周二

21:03Hacker News 热门(buzzing.cc 中文翻译)76在单颗 AMD MI300X 上运行 DeepSeek V4 Flash一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。推荐理由:为 MI300X 提供了可部署的生产栈,包含 FP8 格式修复、推测解码优化和混合 KV 缓存策略,单卡就能服务 256K 上下文。
15:03Hacker News 热门(buzzing.cc 中文翻译)81Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。推荐理由:用流式专家加载把 80B 模型塞进手机,具体 RAM 和速度数字让开发者能直接判断自己设备的上限,而不是停留在商详口号。
00:31Hacker News 热门(buzzing.cc 中文翻译)76AirLLM 实现单块 4GB GPU 运行 70B 模型推理AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。推荐理由:将 70B 模型推理压缩到 4GB 显存,让不带专用显卡的开发者也能本地测试大模型,但实际推理速度和质量仍需根据用例评估。

7月30日周四

00:26Hacker News 热门(buzzing.cc 中文翻译)74开源引擎可在任何 M 系列 Mac 上以 2 GB 内存运行 Gemma 4 26B一个开源引擎让 Gemma 4 26B 模型能在任何 M 系列 Mac 上运行,仅需 2 GB 内存。该项目已发布在 GitHub 上,大幅降低了本地运行大语言模型的硬件门槛。推荐理由:这是我见过最极端的端侧优化,把 26B 参数塞进 2GB 内存,意味着所有 M 系 Mac 都能本地跑大模型了,开发者值得马上 clone 试试。

7月29日周三

10:56Hacker News 热门(buzzing.cc 中文翻译)76在 M1 Max 上运行 2.8T 参数的 Kimi K3:Deltafin 项目实现 0.0687 token/s 推理Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。推荐理由:这是个在 M1 Max 上跑 2.8T MoE 的工程 hack,把不可能变成可能,虽然慢得只有聊天室节奏,但玩法足够硬核,玩硬件的看完会想开 issue 贡献数据。

7月26日周日

12:24Hacker News 热门(buzzing.cc 中文翻译)76在 8 美元的 ESP32-S3 微控制器上运行 28.9M 参数大语言模型开发者成功在售价约 8 美元的 ESP32-S3 微控制器上运行了一个 28.9M 参数的大语言模型,完全在芯片本地运行,无需连接服务器,生成速度约 9.5 tok/s。推荐理由:在8美元微控制器上跑28.9M参数LLM,之前同类只有260K参数,这套基于Flash查表的内存技巧首次搬到如此小的芯片上,工程细节和踩坑记录对嵌入式开发者参考价值很高。

7月24日周五

19:50HuggingFace Daily Papers(社区热门论文)77SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。推荐理由:SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒,比 Wan 2.2 快 120 倍,做视频应用的开发者该重新评估成本模型了。

7月23日周四

13:53Hacker News 热门(buzzing.cc 中文翻译)70Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。

7月21日周二

00:49Hugging Face:Blog(RSS)70NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。

7月19日周日

21:30公众号:面壁智能(MiniCPM)68MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。
21:13公众号:面壁智能(MiniCPM)64面壁智能发布端侧模型 MiniCPM5-2B,登顶 4B 以下性能榜首面壁智能联合 OpenBMB 在 WAIC 2026 发布端侧模型 MiniCPM5-2B,以 2B 参数量在 AA-Index 榜单登顶 4B 以下模型榜首,平均分 54.26,超 Qwen3.5-2B(41.66)。模型原生支持混合思考与 512K 上下文,Agent 能力得分 90.35,并完成华为昇腾、英伟达等 9 款芯片的 Day0 适配。推荐理由:长文本理解得分42.33、Agent能力τ²-Bench得分90.35,这些具体指标为端侧开发者评估2B模型的多步推理和工具调用提供了明确参照。

7月15日周三

16:41X.PIN78阿里Qwen将集成至Apple Intelligence服务中国用户阿里巴巴的Qwen模型将被集成到Apple Intelligence中,为中国的iOS、iPadOS、macOS和visionOS用户提供文本与图像理解、内容生成等AI功能。中国网信办已公布包括Apple Intelligence、华为小艺大模型、OPPO AndesGPT在内的七项移动端生成式AI服务备案信息。阿里巴巴董事会主席蔡崇信表示,苹果在选定阿里前曾与多家中国公司洽谈。推荐理由:苹果选阿里Qwen为中国AI引擎,蔡崇信已确认,网信办也已备案,这事对国内AI厂商的竞争格局影响不小,做国内市场的应该认真看一眼。
16:41IT之家(RSS)82国行 Apple 智能完成备案,阿里千问将集成至苹果 AI 能力苹果技术开发(上海)有限公司的“Apple 智能”大模型已于 2026 年 7 月 8 日完成备案,适用场景为苹果手机。阿里千问将作为 AI 能力集成至 Apple 智能,为 iOS、iPadOS、macOS 和 visionOS 的中国用户提供文本与图像理解、内容生成等功能,用户无需在应用间切换即可直接体验。推荐理由:苹果AI备案落地,国行iPhone用户终于等到,但集成的不是自研而是阿里千问,对苹果AI生态和国内AI格局都算一个交代。
12:15Tencent Hy69腾讯混元发布 Hy3 1-bit 与 4-bit 版本找不到基准测试和下载链接?看这里👇https://huggingface.co/AngelSlim/Hy3-GGUF 我们刚刚发布了 Hy3 的 1-bit 与 4-bit 版本,这是一个旗舰级 295B 模型,可在单张 GPU 上运行。👌 使用 llama.cpp 运行 Hy3,启用 MTP,在显著更低的硬件上体验强大的智能。🚀🚀🚀 迫不及待想看到你们的作品。 #Hy3 #Hy #GGUF #llamacpp推荐理由:混元把295B旗舰模型压进单GPU,1-bit和4-bit版本对本地部署是个大礼包,开源社区可以动起来了。
03:55Hacker News 热门(buzzing.cc 中文翻译)76Bonsai 27B:首款可在手机上运行的27B级多模态模型Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。推荐理由:1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。
00:51Google Developers Blog(RSS)58Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。推荐理由:我觉得这是端侧 AI 从实验到落地的信号,Gemma 4 E2B 的离线能力搭配新 SDK,让完全本地的多模态应用不再是期货,做移动隐私 AI 的开发者该上手试试了。

7月14日周二

10:30公众号:面壁智能(MiniCPM)61面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径面壁智能CTO曾国洋指出,端侧模型是AI落地的关键路径。其原创方法论“模型风洞”可在小规模实验中预测完整训练效果,并基于“知识密度”提出“面壁定律”:知识密度每3.5个月翻一番。2B参数的MiniCPM表现优于同期8B竞品。面壁已完成高通、联发科、英特尔、英伟达、AMD等芯片适配,新发布的BitCPM-CANN模型系列可在华为昇腾芯片上让同一内存多装约6倍模型。全双工全模态模型MiniCPM-o4.5支持实时打断与情绪调整。团队开发了全球首个完全由AI编写的生产级训练框架ForgeTrain,并引入行为模式库实现无需开口的“默契系统”。推荐理由:面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。

7月13日周一

19:13公众号:腾讯混元78腾讯混元开源 HyOCR-1.5:1B 端到端 OCR 大模型推理提速 6.37 倍腾讯混元开源端到端 OCR 大模型 HyOCR-1.5,仅 1B 参数覆盖 8 种以上 text-centric 任务,在 OmniDocBench v1.6 上以 94.74 分居端到端第一。推荐理由:轻量端到端OCR的实用化一步,投机解码让长文档生成加速可落地,智能体数据闭环提示了用短板驱动自进化的可复用路径。
精选
2026年8月8日星期六 · AI 自动挑选的高价值内容
全部模型产品行业论文教程观点

8月5日

星期三 · 2 条
03:54
Simon Willison 博客精选
74
MiniMax-H3 通过 MLX 移植可在 Apple Silicon 上运行

MiniMax 发布 MiniMax-H3,一个可接受文本、图像、音频和视频并生成最长 15 秒带音频视频片段的通用全模态生成系统。Python 包 PipeNetwork/minimax-h3-mlx 将其移植到 MLX,支持 Apple Silicon 运行。作者在 M5 Max MacBook Pro 上实测,下载约 115 GB 模型文件,视频生成耗时不到 45 分钟。


推荐理由:在 M5 Max 上生成本地视频的 45 分钟耗时,为判断这类模型何时能进入日常工作流提供了具体的参照。
02:34
Hacker News 热门(buzzing.cc 中文翻译)精选
73
Soup v0.72.4:在4 GB显存笔记本GPU上微调8B模型

Soup 推出 v0.72.4,支持在配备 4 GB 显存的笔记本 GPU 上通过 QLoRA 微调 8B 模型,无需 SSH 或云服务。


推荐理由:Soup 将 8B 模型微调压低到 4GB 显存笔记本,使得原本受 GPU 预算限制的个人开发者也能直接在本地迭代模型行为。

8月4日

星期二 · 3 条
21:03
Hacker News 热门(buzzing.cc 中文翻译)精选
76
在单颗 AMD MI300X 上运行 DeepSeek V4 Flash

一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。


推荐理由:为 MI300X 提供了可部署的生产栈,包含 FP8 格式修复、推测解码优化和混合 KV 缓存策略,单卡就能服务 256K 上下文。
15:03
Hacker News 热门(buzzing.cc 中文翻译)精选
81
Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版

Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。


推荐理由:用流式专家加载把 80B 模型塞进手机,具体 RAM 和速度数字让开发者能直接判断自己设备的上限,而不是停留在商详口号。
00:31
Hacker News 热门(buzzing.cc 中文翻译)精选
76
AirLLM 实现单块 4GB GPU 运行 70B 模型推理

AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。


推荐理由:将 70B 模型推理压缩到 4GB 显存,让不带专用显卡的开发者也能本地测试大模型,但实际推理速度和质量仍需根据用例评估。

7月30日

星期四 · 1 条
00:26
Hacker News 热门(buzzing.cc 中文翻译)精选
74
开源引擎可在任何 M 系列 Mac 上以 2 GB 内存运行 Gemma 4 26B

一个开源引擎让 Gemma 4 26B 模型能在任何 M 系列 Mac 上运行,仅需 2 GB 内存。该项目已发布在 GitHub 上,大幅降低了本地运行大语言模型的硬件门槛。


推荐理由:这是我见过最极端的端侧优化,把 26B 参数塞进 2GB 内存,意味着所有 M 系 Mac 都能本地跑大模型了,开发者值得马上 clone 试试。

7月29日

星期三 · 1 条
10:56
Hacker News 热门(buzzing.cc 中文翻译)精选
76
在 M1 Max 上运行 2.8T 参数的 Kimi K3:Deltafin 项目实现 0.0687 token/s 推理

Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。


推荐理由:这是个在 M1 Max 上跑 2.8T MoE 的工程 hack,把不可能变成可能,虽然慢得只有聊天室节奏,但玩法足够硬核,玩硬件的看完会想开 issue 贡献数据。

7月26日

星期日 · 1 条
12:24
Hacker News 热门(buzzing.cc 中文翻译)精选
76
在 8 美元的 ESP32-S3 微控制器上运行 28.9M 参数大语言模型

开发者成功在售价约 8 美元的 ESP32-S3 微控制器上运行了一个 28.9M 参数的大语言模型,完全在芯片本地运行,无需连接服务器,生成速度约 9.5 tok/s。


推荐理由:在8美元微控制器上跑28.9M参数LLM,之前同类只有260K参数,这套基于Flash查表的内存技巧首次搬到如此小的芯片上,工程细节和踩坑记录对嵌入式开发者参考价值很高。

7月24日

星期五 · 1 条
19:50
HuggingFace Daily Papers(社区热门论文)精选
77
SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。


推荐理由:SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒,比 Wan 2.2 快 120 倍,做视频应用的开发者该重新评估成本模型了。

7月23日

星期四 · 1 条
13:53
Hacker News 热门(buzzing.cc 中文翻译)精选
70
Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。


推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。

7月21日

星期二 · 1 条
00:49
Hugging Face:Blog(RSS)精选
70
NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成

NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。


推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。

7月19日

星期日 · 2 条
21:30
公众号:面壁智能(MiniCPM)精选
68
MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片

面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。


推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。
21:13
公众号:面壁智能(MiniCPM)精选
64
面壁智能发布端侧模型 MiniCPM5-2B,登顶 4B 以下性能榜首

面壁智能联合 OpenBMB 在 WAIC 2026 发布端侧模型 MiniCPM5-2B,以 2B 参数量在 AA-Index 榜单登顶 4B 以下模型榜首,平均分 54.26,超 Qwen3.5-2B(41.66)。模型原生支持混合思考与 512K 上下文,Agent 能力得分 90.35,并完成华为昇腾、英伟达等 9 款芯片的 Day0 适配。


推荐理由:长文本理解得分42.33、Agent能力τ²-Bench得分90.35,这些具体指标为端侧开发者评估2B模型的多步推理和工具调用提供了明确参照。

7月15日

星期三 · 5 条
16:41
X.PIN@thexpin精选
78
阿里Qwen将集成至Apple Intelligence服务中国用户

阿里巴巴的Qwen模型将被集成到Apple Intelligence中,为中国的iOS、iPadOS、macOS和visionOS用户提供文本与图像理解、内容生成等AI功能。中国网信办已公布包括Apple Intelligence、华为小艺大模型、OPPO AndesGPT在内的七项移动端生成式AI服务备案信息。阿里巴巴董事会主席蔡崇信表示,苹果在选定阿里前曾与多家中国公司洽谈。


推荐理由:苹果选阿里Qwen为中国AI引擎,蔡崇信已确认,网信办也已备案,这事对国内AI厂商的竞争格局影响不小,做国内市场的应该认真看一眼。
16:41
IT之家(RSS)精选
82
国行 Apple 智能完成备案,阿里千问将集成至苹果 AI 能力

苹果技术开发(上海)有限公司的“Apple 智能”大模型已于 2026 年 7 月 8 日完成备案,适用场景为苹果手机。阿里千问将作为 AI 能力集成至 Apple 智能,为 iOS、iPadOS、macOS 和 visionOS 的中国用户提供文本与图像理解、内容生成等功能,用户无需在应用间切换即可直接体验。


推荐理由:苹果AI备案落地,国行iPhone用户终于等到,但集成的不是自研而是阿里千问,对苹果AI生态和国内AI格局都算一个交代。
12:15
Tencent Hy@TencentHunyuan精选
69
找不到基准测试和下载链接?看这里👇https://huggingface.co/AngelSlim/Hy3-GGUF我们刚刚发布了 Hy3 的 1-bit 与 4-bit 版本,这是一个旗舰级 295B 模型,可在单张 GPU 上运行。👌使用 llama.cpp 运行 Hy3,启用 MTP,在显著更低的硬件上体验强大的智能。🚀🚀🚀迫不及待想看到你们的作品。#Hy3 #Hy #GGUF #llamacpp

Tencent Hy: 我们刚刚发布了 Hy3 的 1-bit 和 4-bit 版本,这是一款旗舰级规模的 295B 模型,可以在单张 GPU 上运行。👌 使用 llama.cpp 运行 Hy3,启用 MTP,在显著降低的硬件配置上体验强大的智能能力。🚀🚀�...


推荐理由:混元把295B旗舰模型压进单GPU,1-bit和4-bit版本对本地部署是个大礼包,开源社区可以动起来了。
03:55
Hacker News 热门(buzzing.cc 中文翻译)精选
76
Bonsai 27B:首款可在手机上运行的27B级多模态模型

Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。


推荐理由:1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。
00:51
Google Developers Blog(RSS)精选
58
Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来

在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。


推荐理由:我觉得这是端侧 AI 从实验到落地的信号,Gemma 4 E2B 的离线能力搭配新 SDK,让完全本地的多模态应用不再是期货,做移动隐私 AI 的开发者该上手试试了。

7月14日

星期二 · 1 条
10:30
公众号:面壁智能(MiniCPM)精选
61
面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径

面壁智能CTO曾国洋指出,端侧模型是AI落地的关键路径。其原创方法论“模型风洞”可在小规模实验中预测完整训练效果,并基于“知识密度”提出“面壁定律”:知识密度每3.5个月翻一番。2B参数的MiniCPM表现优于同期8B竞品。面壁已完成高通、联发科、英特尔、英伟达、AMD等芯片适配,新发布的BitCPM-CANN模型系列可在华为昇腾芯片上让同一内存多装约6倍模型。全双工全模态模型MiniCPM-o4.5支持实时打断与情绪调整。团队开发了全球首个完全由AI编写的生产级训练框架ForgeTrain,并引入行为模式库实现无需开口的“默契系统”。


推荐理由:面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。

7月13日

星期一 · 1 条
19:13
公众号:腾讯混元精选
78
腾讯混元开源 HyOCR-1.5:1B 端到端 OCR 大模型推理提速 6.37 倍

腾讯混元开源端到端 OCR 大模型 HyOCR-1.5,仅 1B 参数覆盖 8 种以上 text-centric 任务,在 OmniDocBench v1.6 上以 94.74 分居端到端第一。


推荐理由:轻量端到端OCR的实用化一步,投机解码让长文档生成加速可落地,智能体数据闭环提示了用短板驱动自进化的可复用路径。