内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

精选

7月26日 · 周日
最新精选
全部模型产品行业论文技巧
标签「部署/工程」清除

7月25日周六

01:25Claude:Blog(网页)65Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80%Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。推荐理由:Anthropic 官方首次分享他们为 Claude 5 代模型移除了 Claude Code 80% 系统提示的实践,五条新规则颠覆了旧有的提示工程常识,每个用 Claude Code 或自建 agent 的开发者都该对照看看自己的系统提示是否在「过度约束」模型。

7月24日周五

20:54OpenRouter:Announcements(RSS)62OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。推荐理由:OpenRouter推出分类器功能,允许按任务类型、部门等维度对API调用自动打标并归因成本,适合需要审计agent开销的团队。模板和采样率设计让落地门槛很低。
17:54Hacker News 热门(buzzing.cc 中文翻译)79Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。推荐理由:一个小工具解决了一个被忽视的成本黑洞,Claude Code 的缓存过期,作者自己测了 185 个会话,省下 22% 费用,对于把 Claude 当开发助手的团队来说是个必装工具。
00:55Satya Nadella65微软MAI模型:以更低成本实现前沿能力规模化微软CEO Satya Nadella详解MAI模型家族战略:通过优化成本-效果前沿,MAI模型在GitHub Copilot、Excel等产品中已用更少token超越通用前沿模型。核心是构建独立于模型的评估系统,让模型在产品真实环境中学习并完成用户关心的任务。微软正将这一模板通过Foundry平台开放给企业客户。推荐理由:微软CEO详细阐述MAI模型战略,从通用模型转向产品内优化,透露GitHub Copilot和Excel已开始路由流量到MAI,对微软生态开发者和企业是个风向标。

7月23日周四

13:20公众号:数字生命卡兹克66北京发布智能体新政,首次将Harness Engineering、Token经济、OPC等写入政策北京市发布《关于加快智能体引领发展的若干措施》,共十条,首次将Harness Engineering(驾驭层工程)、Token经济、OPC(一人公司)等前沿概念写入正式政策。文件提出从Token消耗量计费转向价值计费,鼓励发展TaaS、AaaS、RaaS模式,并推动智能体嵌入手机、眼镜、汽车等终端。推荐理由:这份政策把 Agent 时代的核心概念全部写进了红头文件,Harness Engineering、Token 经济、OPC 等首次在官方文件中出现,意味着智能体正式进入政策加速期,每个 AI 从业者都该读一遍。
12:10公众号:小红书技术(dots.llm)77小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%小红书引擎架构团队在OSDI 2026提出HELMSMAN,一个面向全闪存服务器的高性能向量近似最近邻搜索系统。该系统通过聚类式索引、定制化存储栈和分层学习式搜索剪枝,用约40台全闪存服务器承载了过去约35,000 CPU Core和约350 TB DRAM的负载,硬件成本节省超过90%。推荐理由:小红书把向量检索从纯内存搬到全闪存,成本省九成还能接近内存吞吐,OSDI 论文加开源代码,做搜索推荐的同仁值得细看。
03:23Hacker News 热门(buzzing.cc 中文翻译)76GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace TokenizersGigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。推荐理由:GigaToken 把分词速度直接拉到 GB/s 级别,对处理大规模文本的团队是实打实的效率提升,数据集预处理不再是瓶颈。

7月22日周三

22:49IT之家(RSS)75OpenAI 拟投资 200 亿美元在美新建数据中心,2030 年算力支出预期上调至近 7500 亿美元OpenAI 计划在佐治亚州萨凡纳附近建设一座超大规模数据中心,承诺投资 200 亿美元,并已争取到 3.2 吉瓦的能源。该项目预计从 2028 年起部分电力投入使用,满负荷时总成本可能超过 300 亿美元。同时,OpenAI 将截至 2030 年的预计算力支出上调至近 7500 亿美元,高于此前约 6000 亿美元的预期。推荐理由:OpenAI 把未来算力赌注押到了 7500 亿美元,佐治亚数据中心只是冰山一角,做基础设施的同行得重新算账了。
22:25SemiAnalysis76AMD 投资 50 亿,Anthropic 采购 2GW GPUAMD 刚刚宣布与 Anthropic 达成协议,将投资高达 50 亿美元,换取 Anthropic 采购 2GW 的 AMD MI455 UALOE72 及未来 GPU。🚨 这与我们三天前关于 Anthropic 的说法一致。推荐理由:AMD 用 50 亿美金投资换来 Anthropic 的巨量 GPU 订单,这是非 NVIDIA 生态一次真正有分量的突破,做硬件和云服务的值得深挖。
18:10公众号:小红书技术(dots.llm)62小红书开源 BigMac:多模态大模型训练新范式小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它以 LLM 流水线为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。推荐理由:过去多模态训练要么废显存要么慢到崩溃,BigMac 用“嵌套流水线”破掉了这个帕累托前沿,做多模态大模型且被训练效率卡住的团队值得动手试一下。
13:53OpenRouter:Announcements(RSS)72OpenRouter 新增音频转写 API,支持 Whisper 与 token 计价 STT 模型OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。推荐理由:OpenRouter 把语音转录集成进 API,一份 key 搞定聊天和转写,对已经在用的团队省心不少,这篇教程直接可跑。
01:52OpenRouter:Announcements(RSS)69OpenRouter 推出 Prompt Caching + Sticky Routing,降低多轮 Agent 调用成本OpenRouter 通过 Prompt Caching 与 Sticky Routing 降低多轮 Agent 的 token 成本。缓存读取价格仅为正常输入的 0.1x-0.5x,其中 Claude Sonnet 4.6 缓存读取为 $0.30/M(正常 $3.00/M)。推荐理由:Prompt caching 不是新概念,但 OpenRouter 把成本算得明明白白,sticky routing 配合 session_id 解决了缓存漂移的痛点,做 agent 的人该抄作业。

7月21日周二

08:50Hacker News 热门(buzzing.cc 中文翻译)71代理群(Agent Swarm)通过树状分解在构建 SQLite(Rust 版)任务中达到 80% 测试通过率一项实验证明,将任务分解为规划者与执行者的树状结构后,代理群在四小时内用 Grok 4.5 达到 80% 的 SQL 测试通过率,而旧版代理群在第二小时前即失败。新系统峰值提交速度达每秒 1,000 次,为此团队从零构建了专用版本控制系统。该架构已在构建浏览器、修复漏洞及生成数十亿 token 合成数据等任务中验证。推荐理由:Cursor 把多代理协作的工程问题拆解得非常漂亮,从并发冲突到上下文效率都有实战解法,是今年代理工程领域最值得精读的博客之一,开源代码和实验数据也让文章有了可验证的底气。
00:19Replit ⠕65Replit 新统一工具栏集成数据库与双因素认证需要数据库?双因素认证?SEO 扫描器? 你的项目所需的一切现在都可以通过我们新的统一工具栏触手可及。推荐理由:Replit 把数据库、2FA 和 SEO 扫描都塞进一个工具栏,对用它快速出活的开发者是实打实的效率提升,但也就是一次整齐的功能聚合,算不上行业事件。

7月20日周一

16:10公众号:小红书技术(dots.llm)68小红书与北大开源 UltraEP:面向大规模 MoE 训推的实时负载均衡方案小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。推荐理由:MoE 训练推理的负载不均是个老痛点,UltraEP 用实时复制热专家的方式把 GPU 利用率拉到 94% 的理想线,代码和论文都开源了,做大规模分布式训练的团队可以直接参考。
10:07Hacker News 热门(buzzing.cc 中文翻译)73Ollama 获 8800 万美元融资,加速开放模型生态发展Ollama 宣布完成 8800 万美元融资,由 Benchmark、Theory Ventures 和 8VC 等领投。该平台已服务 890 万开发者,并被 85% 的财富 500 强企业使用,其云端 token 用量月均翻倍。资金将用于支持无缝混合推理、新模型发布当日集成,以及让开发者在不牺牲所有权和隐私的前提下使用最强开放模型。推荐理由:Ollama 拿到 8800 万美元融资,同时透露 85% 财富 500 强在用,月 token 量翻倍。开放模型从玩具变成企业标配的信号越来越明显,想本地跑模型的开发者都绕不开它。
08:20公众号:数字生命卡兹克76不会代码也能做产品:一份从0开始的Vibe Coding保姆级教程本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen等)从零开发并上线产品的完整流程。核心步骤包括购买Coding Plan、下载官方Agent编程产品、注册域名与服务器并同步做ICP备案,然后通过Agent的Plan模式描述需求并让AI自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。推荐理由:我觉得这是目前最适合非技术人的中文实操指南,把从买服务器到上线的坑都填平了,独家skill也开源了,跟着做能少走很多弯路。

7月19日周日

11:06Hacker News 热门(buzzing.cc 中文翻译)78transcribe.cpp 发布:基于 ggml 的跨平台语音转录库,支持 16 个 ASR 模型族transcribe.cpp v0.1.0 发布,一个基于 ggml 的语音转录库,支持 16 个 ASR 模型族(60+ 模型),并通过 Vulkan、Metal、CUDA 和 TinyBLAS 实现 GPU 加速。推荐理由:本地语音转录一直缺一个好用的跨平台引擎,transcribe.cpp 不仅支持 60+ 模型、跑在 GPU 上,还带了 Python/JS/Rust/Swift 绑定,想把语音功能嵌进应用的开发者可以直接拿来用。

7月17日周五

09:05Hacker News 热门(buzzing.cc 中文翻译)71生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预测称,平价入门级电脑可能在2028年前消失,内存短缺预计持续数年。推荐理由:大西洋月刊这组调查揭示了AI繁荣的隐藏成本,硬件涨价会直接冲击普通消费者的钱包,这个信号比任何模型发布都更值得关注。
08:00HuggingFace Daily Papers(社区热门论文)81RecGPT-V3 技术报告:状态化混合模态推荐系统在淘宝部署,IPV 提升 1.28%、GPU 成本降低 52.4%淘宝部署的 RecGPT-V3 采用状态化行为建模、混合模态基础模型(融合文本标签与 Semantic IDs)和潜在意图推理,将用户建模计算量降低 55.8%,输出 token 成本下降。在“猜你喜欢”信息流的大规模在线 A/B 测试中,IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,端到端服务资源消耗降低 52.4%。推荐理由:淘宝首页推荐搬上大模型做推理引擎,记忆+混合模态+潜在推理三件套,带来 +1.28% IPV 同时节省 52.4% 算力,推荐系统真的开始重写成本公式了。
01:32Claude:Blog(网页)65Anthropic 用 Claude Code 大规模迁移代码:Bun 百万行 Zig 转 Rust,两周完成Anthropic 工程师用 Claude Code 在两周内将 Bun 的百万行 Zig 代码迁移至 Rust,100% 现有测试通过,合并后出现 19 个回归问题已全部修复。另一工程师用周末将 Python 代码库迁移至 16.5 万行 TypeScript。迁移消耗约 16.5 万美元 API 成本,但编译时间从八分钟降至两秒,二进制启动快 6 倍。推荐理由:Anthropic 用自家 Claude Code 把百万行 Zig 代码迁到 Rust,两周搞定,这不仅是案例展示,更是开发者如何用 AI 重构代码库的实操指南,尤其适合那些被遗留代码拖累的团队。

7月16日周四

20:30公众号:百度智能云(文心)67秒哒 3.5 全球首发 iOS App,无代码开发与多端共享后端能力升级百度智能云在 WAIC2026 发布秒哒 3.5,新增 iOS 打包能力,用户无需 Mac 或 Xcode 即可将应用打包为 IPA 文件或上架 App Store。3.5 版本还内置 SEO Agent 实现搜索优化自动化,支持多应用共享同一后端数据库,并推出数据库多环境隔离与后端资源分级功能。秒哒累计服务超 3500 万用户,已创造 350 万个商业应用。推荐理由:秒哒3.5把无代码开发推到了iOS端,一键打包、多端共享后端这些能力对非技术创业者是真降门槛。但百度生态外的吸引力有限,适合已有秒哒应用的人直接升级。
18:10公众号:小红书技术(dots.llm)77HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。推荐理由:混合注意力模型终于有了可用的位置无关缓存方案,HYPIC 用转移算子缓存和缝合窗口解决了长期兼容难题,对长上下文推理服务的加速意义重大,做推理 infra 的团队可以马上看论文和代码。
16:43IT之家(RSS)78台积电上调2026年资本支出预测至600~640亿美元,A14制程进展顺利台积电在2026Q2财报说明会上将2026年资本支出预测上调至600~640亿美元,此前预测接近560亿美元。董事长魏哲家表示,预计2028年量产的A14制程(1.4nm)开发进展顺利,移动和HPC客户兴趣强烈,将成为比2nm更大、更持久的工艺。台积电预计2026Q3合并营收446~458亿美元,2026全年美元收入增幅将超过40%。推荐理由:台积电这次资本支出上调不是财务数字游戏,而是直接宣告了AI算力在未来三年的供给曲线,做AI硬件的同行和投资人必须正视这轮扩产。
08:21公众号:数字生命卡兹克68远程操控Agent干活方案:Codex主力 + UU远程兜底作者分享了一套远程使用Agent的组合方案:以Codex的远程控制功能作为主力,通过ChatGPT App连接家中24小时开机的Mac Mini,同步所有开发任务、规则和Agent记忆;遇到扫码登录、图形界面操作等Codex难以处理的场景时,用网易UU远程在手机上直接操控电脑完整桌面。UU远程完全免费,支持多设备协同,无需局域网或公网配置。推荐理由:卡兹克这套 Codex 加 UU 远程的组合,从工作流上解决了多设备协同的痛点,远程扫码的兜底用法尤其巧妙,适合不想被绑在办公桌前的 Agent 使用者。

7月15日周三

23:59Hacker News 热门(buzzing.cc 中文翻译)77Telegram 无服务器架构Telegram Serverless 允许开发者直接在 Telegram 基础设施上运行 Bot 和 Mini App 的后端代码,无需配置服务器或容器。开发者编写普通 JavaScript 模块,通过 `npx tgcloud push` 单命令部署,代码在靠近 Bot API 和内建数据库的轻量级 V8 隔离沙箱中执行。推荐理由:Telegram 给机器人开发搭了一套完整的无服务器后端,内置数据库和 CLI,从写代码到部署都在一个文件夹里完成。做 Telegram 机器人的开发者可以彻底扔掉 VPS 和云函数了。
11:59Hacker News 热门(buzzing.cc 中文翻译)72数据中心已使美国公众电费增加230亿美元,回收成本困难重重数据中心对电力的需求已导致美国公众电费增加230亿美元,这一涨价将持续至2028年底。由于电价由州公用事业委员会根据复杂的成本分摊规则设定,数据中心可利用其用电灵活性(如避开系统峰值负荷)规避部分成本分摊,而普通居民难以效仿。监管机构正面临如何公平分配电网基础设施投资成本的挑战。推荐理由:文章拆开了美国电力市场成本分配的规则漏洞,原来数据中心能靠预测高峰期降载来逃掉电费,普通住户根本没法复制,最后账单还是落在我们头上。

7月14日周二

23:33Google AI Developers70Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言、近实时延迟的语音到语音翻译。该模型直接处理原始音频流,保留说话者语调、节奏和音高。东南亚超级应用 Grab 正探索将其用于司机与乘客间的跨语言沟通,其用户每月发起超 1000 万次语音通话。开发者可通过 Gemini Live API 集成 LiveKit、Fishjam、Pipecat 或 Vision Agents 构建应用。LiveKit 已实现虚拟会议室多语言即时理解;Software Mansion 结合 MoQ 协议突破流媒体瓶颈;VisionAgents AI 展示了动态多语言切换能力。开发者可在 Google AI Studio 试用并获取 Cookbook 示例代码。推荐理由:Google把Gemini 3.5的语音翻译做到了近实时、保持语调,这对出海产品是个很实际的升级,实时通话翻译终于从demo走向可用。
17:00公众号:腾讯混元73腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本,支持 vLLM 部署。配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。推荐理由:295B 的旗舰模型压到一张 96G 卡就能跑,1bit 量化在长文理解和代码上居然没崩,对于想本地跑大模型的开发者是个实打实的好消息。

7月13日周一

07:54Hacker News 热门(buzzing.cc 中文翻译)70Ploy 将 AI 智能体默认模型从 Claude Opus 4.8 切换至 GPT-5.6 SolPloy 将其 AI 智能体默认模型从 Claude Opus 4.8 切换至 OpenAI 今晨发布的 GPT-5.6 Sol。在真实营销网站构建测试中,GPT-5.6 Sol 完成页面平均耗时 3 分 42 秒,较 Opus 4.8 的 8 分钟快 2.2 倍;每次构建成本从 3.06 美元降至 2.22 美元,降低 27%;输出 token 从 33.0K 降至 17.1K,视觉评分从 0.936 提升至 0.970。迁移过程发现,GPT-5.6 会为所有 25 个工具参数填充默认值,导致 52%-64% 的文件读取返回空结果;提示词指令和 OpenAI strict 模式均无法修复此行为。此外,评估框架中约三分之一的原始失败源于针对旧模型的假设,而非模型本身问题。推荐理由:这篇 Ploy 的迁移手记把 GPT-5.6 生产中踩的坑都摊开了,工具调用参数膨胀和缓存键设计两个问题,做 agent 的团队不看可能会付昂贵学费。

7月12日周日

10:53Hacker News 热门(buzzing.cc 中文翻译)77Mesh LLM:在 iroh 上进行分布式人工智能计算Mesh LLM 是一个开源项目,能将用户多台机器上的 GPU 和内存池化,对外暴露兼容 OpenAI 的 API。它通过 iroh 网络库实现点对点连接,无需中央服务器。请求可在本地 GPU 运行、路由到已加载模型的节点,或将大模型按层分区(内部称“Skippy”)流水线式拆分到多台机器。系统内置 40 多个模型,从 5 亿参数到 235B MoE 巨模型均可支持。软件体积约 18 MB,启动后以 `localhost:9337/v1` 提供服务。推荐理由:Mesh LLM 把多台机器的 GPU 拼成一个推理集群,让大模型在自建网络上运行。对想省钱且需隐私的开发者来说,这是一个值得尝试的实用工具。

7月11日周六

20:37蚂蚁 inclusionAI:GitHub 新仓库65蚂蚁集团开源 AKernel:面向 AI 智能体的可编程数据中心基础设施蚂蚁集团开源 AKernel(Agent Kernel),一个将整个数据中心视为 AI 智能体可编程扩展的分布式内核。它通过统一 Python SDK 实现计算、网络和存储的编程控制,支持单机、私有 K8s 及多云(阿里云、华为云)一键部署,冷启动仅需 40 毫秒。AKernel 代码由 AI 大量贡献,并内置基于 OpenTelemetry 的全栈可观测性。推荐理由:蚂蚁把数据中心变成 Agent 的可编程扩展,对于需要大规模弹性编排 Agent 的团队来说,比用 Kubernetes 手写 YAML 直接得多,不过目前严重依赖阿里云和华为云,通用性还差一截。
20:35蚂蚁 inclusionAI:GitHub 新仓库60蚂蚁 inclusionAI 开源沙箱生命周期服务 sandboxd蚂蚁集团 inclusionAI 在 GitHub 开源 sandboxd,这是 AKernel 使用的 Linux 沙箱生命周期服务,通过 gRPC API 管理沙箱资源,当前基于 gVisor 运行沙箱,并计划近期开源 Kata Containers 支持。推荐理由:蚂蚁把 AKernel 用的沙箱生命周期管理开源了,对需要安全执行代码的 AI 推理/评测场景有参考价值,但仅限底层基础设施人员,非目标受众不必深究。
01:19LMSYS:Blog(Chatbot Arena 团队)61DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)需 SGLang 进行 rollout 生成、Megatron 进行策略更新,Miles 负责异步循环与权重同步。团队解决了 SGLang 与 Megatron 间模型对齐、量化状态在线更新及多节点并行稳定性三大挑战,最终在四个八 GPU 节点上完成端到端验证:超过 100 个优化器步骤中训练-rollout 对数概率差可控,在线奖励持续提升,离线 AIME-2024 基准分数同步上涨。推荐理由:把 DeepSeek-V4 Flash 的 RL 训练完整搬到 AMD MI355X 上,不是画饼,而是给了实测数据和可跑的配置。想用非 NVIDIA 卡做 RL 训练的,可以照着踩坑。

7月10日周五

18:00公众号:小红书技术(dots.llm)70小红书发布大模型新架构 PIPO小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone,在 AIME 2025 等基准上最高带来 +7.15 pass@4 提升。部署测评中,TTFT 加速约 1.23×,TPOT 加速约 1.86×。训练采用 SFT 和 On-Policy Distillation 两阶段,将 verifier 校验能力蒸馏进轻量 confidence head。推荐理由:PIPO把输入压缩和输出多token预测统一起来,并且用蒸馏把验证成本前置,长推理的场景下这可能是下一代推理引擎的样子,做模型加速的应该认真看看。
15:27IT之家(RSS)75扎克伯格首度回应 Meta"算力过剩":没人会嫌算力太多,但租出去更赚钱Meta CEO 扎克伯格首次正面回应公司筹划云基础设施业务一事,否认“算力过剩”猜测,称内部算力需求依然旺盛、满负荷运转。但他同时表示,当前市场对算力出价极高,将部分 AI 基础设施对外出租在财务上更划算。Meta 正制定代号“Meta Compute”的云计算计划,包括开放模型访问权限和直接出租裸算力两条路线。扎克伯格还提及 SpaceX 以每月 12.5 亿美元将数据中心租给 Anthropic 的模式。Meta 2026 年资本支出指引达 1250 亿至 1450 亿美元,计划 2026 年 9 月量产自研 AI 芯片,目标 2027 年部署算力提升至 14 吉瓦。推荐理由:扎克伯格首次确认 Meta 要做云业务,从‘自用’到‘出租’的转变很关键,这可能是 AI 基础设施从军备竞赛转向平台化的信号,做底层算力和云服务的团队有必要盯着。
12:01公众号:龙猫LongCat(美团)74美团 LongCat-2.0 正式开源,同步开放国产卡推理代码美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。
06:51Hacker News 热门(buzzing.cc 中文翻译)70Show HN: 如何在我的低配置电脑上运行 GLM-5.2colibrì v1.0 引擎以纯 C 实现、零运行时依赖,可在约 25 GB RAM 的消费级电脑上运行 744B 参数的 GLM-5.2 MoE 模型。模型经 int4 量化后磁盘占用约 370 GB,常驻内存仅 9.9 GB,通过流式加载磁盘专家实现推理。冷解码速度约推荐理由:这个单C文件项目让744B的MoE模型在25GB内存的笔记本上跑了起来,虽然慢,但证明了消费级硬件也能把前沿模型‘盘活’,做本地推理的极客值得看看。
06:00TechCrunch:AI(RSS)73AI 能否回答 3 万亿美元的问题?Sequoia 合伙人 David Cahn 更新 AI 基础设施支出估算:2026 年全球投入达 1.5 万亿美元,行业需产生 3 万亿美元收入才能回本。Anthropic 年化收入(ARR)达 600 亿美元,OpenAI 2025 年收入 130 亿美元(11 月称 ARR 200 亿美元),但缺口仍大。Apollo 首席经济学家指出,谷歌、Meta、微软、亚马逊均预测 2028 年自由现金流加速,但风险在于更多组织转向更便宜的开放权重模型(尤其中国模型),且 OpenAI 最新模型编码任务 token 效率提升 54%,导致 token 价格持续下降。若超大规模厂商现金流目标落空,可能引发经济衰退和标普 500 回调。推荐理由:Sequoia和Apollo的经济学家同时拉响警报,AI基建支出今年1.5万亿美元,需要3万亿收入才回本。这不是唱衰,是给产品人一个倒计时,开源模型和掉价的token让这账更难算。
05:44OpenAI Developers68ChatGPT Sites将创意变可发布网站将一个想法变成可发布和分享的实时网站 以下是OpenAI团队的一些成员用Sites构建的示例👇 @prd_008 用Sites将一个想法变成了个人专注应用:推荐理由:ChatGPT Sites 把建站门槛拉到一句话描述,我觉得这是 ChatGPT 从「聊完就忘」到「留下东西」的关键一步,但现阶段模板和分发都太简陋,产品人可以先尝鲜别急着押注。
精选
2026年7月26日星期日 · AI 自动挑选的高价值内容
全部模型产品行业论文技巧

7月25日

星期六 · 1 条
01:25
Claude:Blog(网页)精选
65
Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80%

Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。

智能体Anthropic教程/实践编码
另有 2 家信源报道X:Thariq (@trq212)X:阿易 AI Notes (@AYi_AInotes)
推荐理由:Anthropic 官方首次分享他们为 Claude 5 代模型移除了 Claude Code 80% 系统提示的实践,五条新规则颠覆了旧有的提示工程常识,每个用 Claude Code 或自建 agent 的开发者都该对照看看自己的系统提示是否在「过度约束」模型。

7月24日

星期五 · 3 条
20:54
OpenRouter:Announcements(RSS)精选
62
OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属

OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。

智能体产品更新部署/工程
另有 1 家信源报道X:OpenRouter (@OpenRouter)
推荐理由:OpenRouter推出分类器功能,允许按任务类型、部门等维度对API调用自动打标并归因成本,适合需要审计agent开销的团队。模板和采样率设计让落地门槛很低。
17:54
Hacker News 热门(buzzing.cc 中文翻译)精选
79
Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用

Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。

GitHub开源/仓库编码部署/工程

推荐理由:一个小工具解决了一个被忽视的成本黑洞,Claude Code 的缓存过期,作者自己测了 185 个会话,省下 22% 费用,对于把 Claude 当开发助手的团队来说是个必装工具。
00:55
Satya Nadella@satyanadella精选
65
微软MAI模型:以更低成本实现前沿能力规模化

微软CEO Satya Nadella详解MAI模型家族战略:通过优化成本-效果前沿,MAI模型在GitHub Copilot、Excel等产品中已用更少token超越通用前沿模型。核心是构建独立于模型的评估系统,让模型在产品真实环境中学习并完成用户关心的任务。微软正将这一模板通过Foundry平台开放给企业客户。

智能体Microsoft大佬观点部署/工程
另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:微软CEO详细阐述MAI模型战略,从通用模型转向产品内优化,透露GitHub Copilot和Excel已开始路由流量到MAI,对微软生态开发者和企业是个风向标。

7月23日

星期四 · 3 条
13:20
公众号:数字生命卡兹克精选
66
北京发布智能体新政,首次将Harness Engineering、Token经济、OPC等写入政策

北京市发布《关于加快智能体引领发展的若干措施》,共十条,首次将Harness Engineering(驾驭层工程)、Token经济、OPC(一人公司)等前沿概念写入正式政策。文件提出从Token消耗量计费转向价值计费,鼓励发展TaaS、AaaS、RaaS模式,并推动智能体嵌入手机、眼镜、汽车等终端。

智能体政策/监管部署/工程
另有 2 家信源报道X:卡兹克 (@Khazix0918)IT之家(RSS)
推荐理由:这份政策把 Agent 时代的核心概念全部写进了红头文件,Harness Engineering、Token 经济、OPC 等首次在官方文件中出现,意味着智能体正式进入政策加速期,每个 AI 从业者都该读一遍。
12:10
公众号:小红书技术(dots.llm)精选
77
小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%

小红书引擎架构团队在OSDI 2026提出HELMSMAN,一个面向全闪存服务器的高性能向量近似最近邻搜索系统。该系统通过聚类式索引、定制化存储栈和分层学习式搜索剪枝,用约40台全闪存服务器承载了过去约35,000 CPU Core和约350 TB DRAM的负载,硬件成本节省超过90%。

GitHub开源生态搜索论文/研究

推荐理由:小红书把向量检索从纯内存搬到全闪存,成本省九成还能接近内存吞吐,OSDI 论文加开源代码,做搜索推荐的同仁值得细看。
03:23
Hacker News 热门(buzzing.cc 中文翻译)精选
76
GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers

GigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。

GitHub产品更新开源/仓库数据/训练

推荐理由:GigaToken 把分词速度直接拉到 GB/s 级别,对处理大规模文本的团队是实打实的效率提升,数据集预处理不再是瓶颈。

7月22日

星期三 · 5 条
22:49
IT之家(RSS)精选
75
OpenAI 拟投资 200 亿美元在美新建数据中心,2030 年算力支出预期上调至近 7500 亿美元

OpenAI 计划在佐治亚州萨凡纳附近建设一座超大规模数据中心,承诺投资 200 亿美元,并已争取到 3.2 吉瓦的能源。该项目预计从 2028 年起部分电力投入使用,满负荷时总成本可能超过 300 亿美元。同时,OpenAI 将截至 2030 年的预计算力支出上调至近 7500 亿美元,高于此前约 6000 亿美元的预期。

OpenAI行业动态部署/工程
另有 1 家信源报道TechCrunch:AI(RSS)
推荐理由:OpenAI 把未来算力赌注押到了 7500 亿美元,佐治亚数据中心只是冰山一角,做基础设施的同行得重新算账了。
22:25
SemiAnalysis@SemiAnalysis_精选
76
AMD 刚刚宣布与 Anthropic 达成协议,将投资高达 50 亿美元,换取 Anthropic 采购 2GW 的 AMD MI455 UALOE72 及未来 GPU。🚨 这与我们三天前关于 Anthropic 的说法一致。

SemiAnalysis: ANTHROPIC 将成为 AMD 客户,据 AMD AI 高级总监的公开 GitHub 显示 🚨🚨 我们在下方解释该 GitHub 代码及其细节👇️ 1/4🧵

Anthropic行业动态部署/工程

推荐理由:AMD 用 50 亿美金投资换来 Anthropic 的巨量 GPU 订单,这是非 NVIDIA 生态一次真正有分量的突破,做硬件和云服务的值得深挖。
18:10
公众号:小红书技术(dots.llm)精选
62
小红书开源 BigMac:多模态大模型训练新范式

小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它以 LLM 流水线为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。

arXivGitHub多模态开源/仓库

推荐理由:过去多模态训练要么废显存要么慢到崩溃,BigMac 用“嵌套流水线”破掉了这个帕累托前沿,做多模态大模型且被训练效率卡住的团队值得动手试一下。
13:53
OpenRouter:Announcements(RSS)精选
72
OpenRouter 新增音频转写 API,支持 Whisper 与 token 计价 STT 模型

OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。

产品更新语音部署/工程

推荐理由:OpenRouter 把语音转录集成进 API,一份 key 搞定聊天和转写,对已经在用的团队省心不少,这篇教程直接可跑。
01:52
OpenRouter:Announcements(RSS)精选
69
OpenRouter 推出 Prompt Caching + Sticky Routing,降低多轮 Agent 调用成本

OpenRouter 通过 Prompt Caching 与 Sticky Routing 降低多轮 Agent 的 token 成本。缓存读取价格仅为正常输入的 0.1x-0.5x,其中 Claude Sonnet 4.6 缓存读取为 $0.30/M(正常 $3.00/M)。

教程/实践部署/工程

推荐理由:Prompt caching 不是新概念,但 OpenRouter 把成本算得明明白白,sticky routing 配合 session_id 解决了缓存漂移的痛点,做 agent 的人该抄作业。

7月21日

星期二 · 2 条
08:50
Hacker News 热门(buzzing.cc 中文翻译)精选
71
代理群(Agent Swarm)通过树状分解在构建 SQLite(Rust 版)任务中达到 80% 测试通过率

一项实验证明,将任务分解为规划者与执行者的树状结构后,代理群在四小时内用 Grok 4.5 达到 80% 的 SQL 测试通过率,而旧版代理群在第二小时前即失败。新系统峰值提交速度达每秒 1,000 次,为此团队从零构建了专用版本控制系统。该架构已在构建浏览器、修复漏洞及生成数十亿 token 合成数据等任务中验证。

智能体产品更新编码部署/工程

推荐理由:Cursor 把多代理协作的工程问题拆解得非常漂亮,从并发冲突到上下文效率都有实战解法,是今年代理工程领域最值得精读的博客之一,开源代码和实验数据也让文章有了可验证的底气。
00:19
Replit ⠕@Replit精选
65
需要数据库?双因素认证?SEO 扫描器? 你的项目所需的一切现在都可以通过我们新的统一工具栏触手可及。
产品更新部署/工程

推荐理由:Replit 把数据库、2FA 和 SEO 扫描都塞进一个工具栏,对用它快速出活的开发者是实打实的效率提升,但也就是一次整齐的功能聚合,算不上行业事件。

7月20日

星期一 · 3 条
16:10
公众号:小红书技术(dots.llm)精选
68
小红书与北大开源 UltraEP:面向大规模 MoE 训推的实时负载均衡方案

小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。

arXivGitHub开源/仓库部署/工程

推荐理由:MoE 训练推理的负载不均是个老痛点,UltraEP 用实时复制热专家的方式把 GPU 利用率拉到 94% 的理想线,代码和论文都开源了,做大规模分布式训练的团队可以直接参考。
10:07
Hacker News 热门(buzzing.cc 中文翻译)精选
73
Ollama 获 8800 万美元融资,加速开放模型生态发展

Ollama 宣布完成 8800 万美元融资,由 Benchmark、Theory Ventures 和 8VC 等领投。该平台已服务 890 万开发者,并被 85% 的财富 500 强企业使用,其云端 token 用量月均翻倍。资金将用于支持无缝混合推理、新模型发布当日集成,以及让开发者在不牺牲所有权和隐私的前提下使用最强开放模型。

开源生态行业动态部署/工程

推荐理由:Ollama 拿到 8800 万美元融资,同时透露 85% 财富 500 强在用,月 token 量翻倍。开放模型从玩具变成企业标配的信号越来越明显,想本地跑模型的开发者都绕不开它。
08:20
公众号:数字生命卡兹克精选
76
不会代码也能做产品:一份从0开始的Vibe Coding保姆级教程

本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen等)从零开发并上线产品的完整流程。核心步骤包括购买Coding Plan、下载官方Agent编程产品、注册域名与服务器并同步做ICP备案,然后通过Agent的Plan模式描述需求并让AI自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。

GitHubMCP/工具教程/实践部署/工程
另有 1 家信源报道X:卡兹克 (@Khazix0918)
推荐理由:我觉得这是目前最适合非技术人的中文实操指南,把从买服务器到上线的坑都填平了,独家skill也开源了,跟着做能少走很多弯路。

7月19日

星期日 · 1 条
11:06
Hacker News 热门(buzzing.cc 中文翻译)精选
78
transcribe.cpp 发布:基于 ggml 的跨平台语音转录库,支持 16 个 ASR 模型族

transcribe.cpp v0.1.0 发布,一个基于 ggml 的语音转录库,支持 16 个 ASR 模型族(60+ 模型),并通过 Vulkan、Metal、CUDA 和 TinyBLAS 实现 GPU 加速。

开源/仓库语音部署/工程

推荐理由:本地语音转录一直缺一个好用的跨平台引擎,transcribe.cpp 不仅支持 60+ 模型、跑在 GPU 上,还带了 Python/JS/Rust/Swift 绑定,想把语音功能嵌进应用的开发者可以直接拿来用。

7月17日

星期五 · 3 条
09:05
Hacker News 热门(buzzing.cc 中文翻译)精选
71
生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格

AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预测称,平价入门级电脑可能在2028年前消失,内存短缺预计持续数年。

现象/趋势部署/工程

推荐理由:大西洋月刊这组调查揭示了AI繁荣的隐藏成本,硬件涨价会直接冲击普通消费者的钱包,这个信号比任何模型发布都更值得关注。
08:00
HuggingFace Daily Papers(社区热门论文)精选
81
RecGPT-V3 技术报告:状态化混合模态推荐系统在淘宝部署,IPV 提升 1.28%、GPU 成本降低 52.4%

淘宝部署的 RecGPT-V3 采用状态化行为建模、混合模态基础模型(融合文本标签与 Semantic IDs)和潜在意图推理,将用户建模计算量降低 55.8%,输出 token 成本下降。在“猜你喜欢”信息流的大规模在线 A/B 测试中,IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,端到端服务资源消耗降低 52.4%。

多模态推理论文/研究部署/工程

推荐理由:淘宝首页推荐搬上大模型做推理引擎,记忆+混合模态+潜在推理三件套,带来 +1.28% IPV 同时节省 52.4% 算力,推荐系统真的开始重写成本公式了。
01:32
Claude:Blog(网页)精选
65
Anthropic 用 Claude Code 大规模迁移代码:Bun 百万行 Zig 转 Rust,两周完成

Anthropic 工程师用 Claude Code 在两周内将 Bun 的百万行 Zig 代码迁移至 Rust,100% 现有测试通过,合并后出现 19 个回归问题已全部修复。另一工程师用周末将 Python 代码库迁移至 16.5 万行 TypeScript。迁移消耗约 16.5 万美元 API 成本,但编译时间从八分钟降至两秒,二进制启动快 6 倍。

Anthropic教程/实践编码部署/工程

推荐理由:Anthropic 用自家 Claude Code 把百万行 Zig 代码迁到 Rust,两周搞定,这不仅是案例展示,更是开发者如何用 AI 重构代码库的实操指南,尤其适合那些被遗留代码拖累的团队。

7月16日

星期四 · 4 条
20:30
公众号:百度智能云(文心)精选
67
秒哒 3.5 全球首发 iOS App,无代码开发与多端共享后端能力升级

百度智能云在 WAIC2026 发布秒哒 3.5,新增 iOS 打包能力,用户无需 Mac 或 Xcode 即可将应用打包为 IPA 文件或上架 App Store。3.5 版本还内置 SEO Agent 实现搜索优化自动化,支持多应用共享同一后端数据库,并推出数据库多环境隔离与后端资源分级功能。秒哒累计服务超 3500 万用户,已创造 350 万个商业应用。

智能体产品更新搜索部署/工程
另有 1 家信源报道IT之家(RSS)
推荐理由:秒哒3.5把无代码开发推到了iOS端,一键打包、多端共享后端这些能力对非技术创业者是真降门槛。但百度生态外的吸引力有限,适合已有秒哒应用的人直接升级。
18:10
公众号:小红书技术(dots.llm)精选
77
HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统

HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。

arXivGitHub推理论文/研究

推荐理由:混合注意力模型终于有了可用的位置无关缓存方案,HYPIC 用转移算子缓存和缝合窗口解决了长期兼容难题,对长上下文推理服务的加速意义重大,做推理 infra 的团队可以马上看论文和代码。
16:43
IT之家(RSS)精选
78
台积电上调2026年资本支出预测至600~640亿美元,A14制程进展顺利

台积电在2026Q2财报说明会上将2026年资本支出预测上调至600~640亿美元,此前预测接近560亿美元。董事长魏哲家表示,预计2028年量产的A14制程(1.4nm)开发进展顺利,移动和HPC客户兴趣强烈,将成为比2nm更大、更持久的工艺。台积电预计2026Q3合并营收446~458亿美元,2026全年美元收入增幅将超过40%。

行业动态部署/工程
另有 1 家信源报道X:Kim (@kimmonismus)
推荐理由:台积电这次资本支出上调不是财务数字游戏,而是直接宣告了AI算力在未来三年的供给曲线,做AI硬件的同行和投资人必须正视这轮扩产。
08:21
公众号:数字生命卡兹克精选
68
远程操控Agent干活方案:Codex主力 + UU远程兜底

作者分享了一套远程使用Agent的组合方案:以Codex的远程控制功能作为主力,通过ChatGPT App连接家中24小时开机的Mac Mini,同步所有开发任务、规则和Agent记忆;遇到扫码登录、图形界面操作等Codex难以处理的场景时,用网易UU远程在手机上直接操控电脑完整桌面。UU远程完全免费,支持多设备协同,无需局域网或公网配置。

智能体OpenAI教程/实践部署/工程
另有 1 家信源报道X:卡兹克 (@Khazix0918)
推荐理由:卡兹克这套 Codex 加 UU 远程的组合,从工作流上解决了多设备协同的痛点,远程扫码的兜底用法尤其巧妙,适合不想被绑在办公桌前的 Agent 使用者。

7月15日

星期三 · 2 条
23:59
Hacker News 热门(buzzing.cc 中文翻译)精选
77
Telegram 无服务器架构

Telegram Serverless 允许开发者直接在 Telegram 基础设施上运行 Bot 和 Mini App 的后端代码,无需配置服务器或容器。开发者编写普通 JavaScript 模块,通过 npx tgcloud push 单命令部署,代码在靠近 Bot API 和内建数据库的轻量级 V8 隔离沙箱中执行。

产品更新教程/实践部署/工程

推荐理由:Telegram 给机器人开发搭了一套完整的无服务器后端,内置数据库和 CLI,从写代码到部署都在一个文件夹里完成。做 Telegram 机器人的开发者可以彻底扔掉 VPS 和云函数了。
11:59
Hacker News 热门(buzzing.cc 中文翻译)精选
72
数据中心已使美国公众电费增加230亿美元,回收成本困难重重

数据中心对电力的需求已导致美国公众电费增加230亿美元,这一涨价将持续至2028年底。由于电价由州公用事业委员会根据复杂的成本分摊规则设定,数据中心可利用其用电灵活性(如避开系统峰值负荷)规避部分成本分摊,而普通居民难以效仿。监管机构正面临如何公平分配电网基础设施投资成本的挑战。

政策/监管现象/趋势部署/工程

推荐理由:文章拆开了美国电力市场成本分配的规则漏洞,原来数据中心能靠预测高峰期降载来逃掉电费,普通住户根本没法复制,最后账单还是落在我们头上。

7月14日

星期二 · 2 条
23:33
Google AI Developers@googleaidevs精选
70
Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译

Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言、近实时延迟的语音到语音翻译。该模型直接处理原始音频流,保留说话者语调、节奏和音高。东南亚超级应用 Grab 正探索将其用于司机与乘客间的跨语言沟通,其用户每月发起超 1000 万次语音通话。开发者可通过 Gemini Live API 集成 LiveKit、Fishjam、Pipecat 或 Vision Agents 构建应用。LiveKit 已实现虚拟会议室多语言即时理解;Software Mansion 结合 MoQ 协议突破流媒体瓶颈;VisionAgents AI 展示了动态多语言切换能力。开发者可在 Google AI Studio 试用并获取 Cookbook 示例代码。

Google产品更新语音部署/工程

推荐理由:Google把Gemini 3.5的语音翻译做到了近实时、保持语调,这对出海产品是个很实际的升级,实时通话翻译终于从demo走向可用。
17:00
公众号:腾讯混元精选
73
腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能

腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本,支持 vLLM 部署。配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。

开源生态模型发布部署/工程
另有 6 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:腾讯混元 (@TencentHunyuan)X:Testing Catalog (@testingcatalog)IT之家(RSS)The Decoder:AI News(RSS)X:Rohan Paul (@rohanpaul_ai)
推荐理由:295B 的旗舰模型压到一张 96G 卡就能跑,1bit 量化在长文理解和代码上居然没崩,对于想本地跑大模型的开发者是个实打实的好消息。

7月13日

星期一 · 1 条
07:54
Hacker News 热门(buzzing.cc 中文翻译)精选
70
Ploy 将 AI 智能体默认模型从 Claude Opus 4.8 切换至 GPT-5.6 Sol

Ploy 将其 AI 智能体默认模型从 Claude Opus 4.8 切换至 OpenAI 今晨发布的 GPT-5.6 Sol。在真实营销网站构建测试中,GPT-5.6 Sol 完成页面平均耗时 3 分 42 秒,较 Opus 4.8 的 8 分钟快 2.2 倍;每次构建成本从 3.06 美元降至 2.22 美元,降低 27%;输出 token 从 33.0K 降至 17.1K,视觉评分从 0.936 提升至 0.970。迁移过程发现,GPT-5.6 会为所有 25 个工具参数填充默认值,导致 52%-64% 的文件读取返回空结果;提示词指令和 OpenAI strict 模式均无法修复此行为。此外,评估框架中约三分之一的原始失败源于针对旧模型的假设,而非模型本身问题。

OpenAI教程/实践部署/工程

推荐理由:这篇 Ploy 的迁移手记把 GPT-5.6 生产中踩的坑都摊开了,工具调用参数膨胀和缓存键设计两个问题,做 agent 的团队不看可能会付昂贵学费。

7月12日

星期日 · 1 条
10:53
Hacker News 热门(buzzing.cc 中文翻译)精选
77
Mesh LLM:在 iroh 上进行分布式人工智能计算

Mesh LLM 是一个开源项目,能将用户多台机器上的 GPU 和内存池化,对外暴露兼容 OpenAI 的 API。它通过 iroh 网络库实现点对点连接,无需中央服务器。请求可在本地 GPU 运行、路由到已加载模型的节点,或将大模型按层分区(内部称“Skippy”)流水线式拆分到多台机器。系统内置 40 多个模型,从 5 亿参数到 235B MoE 巨模型均可支持。软件体积约 18 MB,启动后以 localhost:9337/v1 提供服务。

开源/仓库部署/工程

推荐理由:Mesh LLM 把多台机器的 GPU 拼成一个推理集群,让大模型在自建网络上运行。对想省钱且需隐私的开发者来说,这是一个值得尝试的实用工具。

7月11日

星期六 · 3 条
20:37
蚂蚁 inclusionAI:GitHub 新仓库精选
65
蚂蚁集团开源 AKernel:面向 AI 智能体的可编程数据中心基础设施

蚂蚁集团开源 AKernel(Agent Kernel),一个将整个数据中心视为 AI 智能体可编程扩展的分布式内核。它通过统一 Python SDK 实现计算、网络和存储的编程控制,支持单机、私有 K8s 及多云(阿里云、华为云)一键部署,冷启动仅需 40 毫秒。AKernel 代码由 AI 大量贡献,并内置基于 OpenTelemetry 的全栈可观测性。

智能体GitHub开源/仓库部署/工程

推荐理由:蚂蚁把数据中心变成 Agent 的可编程扩展,对于需要大规模弹性编排 Agent 的团队来说,比用 Kubernetes 手写 YAML 直接得多,不过目前严重依赖阿里云和华为云,通用性还差一截。
20:35
蚂蚁 inclusionAI:GitHub 新仓库精选
60
蚂蚁 inclusionAI 开源沙箱生命周期服务 sandboxd

蚂蚁集团 inclusionAI 在 GitHub 开源 sandboxd,这是 AKernel 使用的 Linux 沙箱生命周期服务,通过 gRPC API 管理沙箱资源,当前基于 gVisor 运行沙箱,并计划近期开源 Kata Containers 支持。

开源/仓库部署/工程

推荐理由:蚂蚁把 AKernel 用的沙箱生命周期管理开源了,对需要安全执行代码的 AI 推理/评测场景有参考价值,但仅限底层基础设施人员,非目标受众不必深究。
01:19
LMSYS:Blog(Chatbot Arena 团队)精选
61
DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持

DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)需 SGLang 进行 rollout 生成、Megatron 进行策略更新,Miles 负责异步循环与权重同步。团队解决了 SGLang 与 Megatron 间模型对齐、量化状态在线更新及多节点并行稳定性三大挑战,最终在四个八 GPU 节点上完成端到端验证:超过 100 个优化器步骤中训练-rollout 对数概率差可控,在线奖励持续提升,离线 AIME-2024 基准分数同步上涨。

DeepSeek推理论文/研究部署/工程

推荐理由:把 DeepSeek-V4 Flash 的 RL 训练完整搬到 AMD MI355X 上,不是画饼,而是给了实测数据和可跑的配置。想用非 NVIDIA 卡做 RL 训练的,可以照着踩坑。

7月10日

星期五 · 6 条
18:00
公众号:小红书技术(dots.llm)精选
70
小红书发布大模型新架构 PIPO

小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone,在 AIME 2025 等基准上最高带来 +7.15 pass@4 提升。部署测评中,TTFT 加速约 1.23×,TPOT 加速约 1.86×。训练采用 SFT 和 On-Policy Distillation 两阶段,将 verifier 校验能力蒸馏进轻量 confidence head。

GitHub推理论文/研究部署/工程

推荐理由:PIPO把输入压缩和输出多token预测统一起来,并且用蒸馏把验证成本前置,长推理的场景下这可能是下一代推理引擎的样子,做模型加速的应该认真看看。
15:27
IT之家(RSS)精选
75
扎克伯格首度回应 Meta"算力过剩":没人会嫌算力太多,但租出去更赚钱

Meta CEO 扎克伯格首次正面回应公司筹划云基础设施业务一事,否认“算力过剩”猜测,称内部算力需求依然旺盛、满负荷运转。但他同时表示,当前市场对算力出价极高,将部分 AI 基础设施对外出租在财务上更划算。Meta 正制定代号“Meta Compute”的云计算计划,包括开放模型访问权限和直接出租裸算力两条路线。扎克伯格还提及 SpaceX 以每月 12.5 亿美元将数据中心租给 Anthropic 的模式。Meta 2026 年资本支出指引达 1250 亿至 1450 亿美元,计划 2026 年 9 月量产自研 AI 芯片,目标 2027 年部署算力提升至 14 吉瓦。

Meta行业动态部署/工程

推荐理由:扎克伯格首次确认 Meta 要做云业务,从‘自用’到‘出租’的转变很关键,这可能是 AI 基础设施从军备竞赛转向平台化的信号,做底层算力和云服务的团队有必要盯着。
12:01
公众号:龙猫LongCat(美团)精选
74
美团 LongCat-2.0 正式开源,同步开放国产卡推理代码

美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。

GitHub开源生态推理模型发布

推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。
06:51
Hacker News 热门(buzzing.cc 中文翻译)精选
70
Show HN: 如何在我的低配置电脑上运行 GLM-5.2

colibrì v1.0 引擎以纯 C 实现、零运行时依赖,可在约 25 GB RAM 的消费级电脑上运行 744B 参数的 GLM-5.2 MoE 模型。模型经 int4 量化后磁盘占用约 370 GB,常驻内存仅 9.9 GB,通过流式加载磁盘专家实现推理。冷解码速度约

GitHub产品更新开源生态部署/工程
另有 1 家信源报道X:karminski (@karminski3)
推荐理由:这个单C文件项目让744B的MoE模型在25GB内存的笔记本上跑了起来,虽然慢,但证明了消费级硬件也能把前沿模型‘盘活’,做本地推理的极客值得看看。
06:00
TechCrunch:AI(RSS)精选
73
AI 能否回答 3 万亿美元的问题?

Sequoia 合伙人 David Cahn 更新 AI 基础设施支出估算:2026 年全球投入达 1.5 万亿美元,行业需产生 3 万亿美元收入才能回本。Anthropic 年化收入(ARR)达 600 亿美元,OpenAI 2025 年收入 130 亿美元(11 月称 ARR 200 亿美元),但缺口仍大。Apollo 首席经济学家指出,谷歌、Meta、微软、亚马逊均预测 2028 年自由现金流加速,但风险在于更多组织转向更便宜的开放权重模型(尤其中国模型),且 OpenAI 最新模型编码任务 token 效率提升 54%,导致 token 价格持续下降。若超大规模厂商现金流目标落空,可能引发经济衰退和标普 500 回调。

AnthropicOpenAI开源生态现象/趋势

推荐理由:Sequoia和Apollo的经济学家同时拉响警报,AI基建支出今年1.5万亿美元,需要3万亿收入才回本。这不是唱衰,是给产品人一个倒计时,开源模型和掉价的token让这账更难算。
05:44
OpenAI Developers@OpenAIDevs精选
68
将一个想法变成可发布和分享的实时网站 以下是OpenAI团队的一些成员用Sites构建的示例👇 @prd_008 用Sites将一个想法变成了个人专注应用:

pranav: ChatGPT Sites 现已面向 Plus、Pro、Business 和 Enterprise 用户开放。支持网页端、移动端和桌面端。 我利用新版 ChatGPT 中的 Sites 插件,将一个想法变成了一个个人待办事项应用。 以下是我...

OpenAI产品更新部署/工程
另有 1 家信源报道X:OpenAI Developers (@OpenAIDevs)
推荐理由:ChatGPT Sites 把建站门槛拉到一句话描述,我觉得这是 ChatGPT 从「聊完就忘」到「留下东西」的关键一步,但现阶段模板和分发都太简陋,产品人可以先尝鲜别急着押注。