Cerebras 联合创始人兼 CEO Andrew Feldman 指出 AI 加速器行业三大供应链瓶颈:HBM 内存、CoWoS 封装产能及台积电 3nm 制程。Cerebras 通过架构选择基本规避了全部三项——不依赖 HBM 和 CoWoS,当前芯片采用 5nm 制程而非 3nm。这使其供应链状况与主流 GPU 系统截然不同。
Cerebras 联合创始人兼 CEO Andrew Feldman 指出 AI 加速器行业三大供应链瓶颈:HBM 内存、CoWoS 封装产能及台积电 3nm 制程。Cerebras 通过架构选择基本规避了全部三项——不依赖 HBM 和 CoWoS,当前芯片采用 5nm 制程而非 3nm。这使其供应链状况与主流 GPU 系统截然不同。
腾讯集团高级执行副总裁汤道生在内部刊物《知点》年刊发文,直面外界“腾讯做 AI 慢了”的评价,坦言算力不足拖累混元大模型迭代与产品落地,内部存在焦虑。他判断 AI 竞争是马拉松而非短跑,当前行业才刚起步,熬得久比起得早更重要,能否长期投入并抓住真实场景需求才是穿越周期的关键。文章由汤道生与 AI 协同完成,他强调行业不能只聚焦大模型本身,工程能力决定落地速度,场景是腾讯的核心优势。
在最新一期播客中,SemiAnalysis 创始人 Dylan Patel 与 Dwarkesh Patel 讨论实验室经济学,预计 Anthropic 和 OpenAI 到 2028 年将控制全球大部分可用 FLOPs,因其能更好变现算力并出价高于其他方。
a16z 发布由 Danco 制作的幻灯片《Intelligence is the Primitive. Applications are the Diffusion Layer》,原为面向小范围受众准备。幻灯片概述了当前应用层与消费级应用的总体态势,并称若反响良好将定期发布此类内容。
恶意 LLM 可能通过向推理引擎(如 vLLM、SGLang)发送特定 token 序列,利用其解析漏洞在宿主机器上执行任意代码。vLLM 曾因 CVE-2025-9141 漏洞,在 Qwen3 Coder 的 XML 工具解析器中对参数执行 eval(),导致任意代码执行。此类漏洞可被持久化利用,且开源权重模型与推理引擎的普及正扩大攻击面。
What impact do data center bans or moratoria have on AI progress? Let's do some napkin math. A number such as "1 GW of c...
SemiAnalysis 预测,到今年年底 AI 累计资本支出将达近 $3T,2020 年代末将增至 $11T+,未偿 AI 债务将达 $7T+。2026 年 AI 债务融资将成为仅次于美国住宅抵押贷款的第二大资产相关债务市场,且是 AI 相关债务发行量低于美国固收发行总量 10% 的最后一年。
小米玄戒AI盒子在150W迷你主机内集成三颗自研芯片,本地运行120B大模型,近存带宽达1.22TB/s。核心是O100芯片通过Wafer-on-Wafer将内存叠于计算层,28,672根数据线直连,带宽为传统旗舰手机16倍,官方宣称速度330 tokens/s。该三芯异构方案复用至手机、汽车、桌面平台,工程样机计划2027年商用。
OpenAI 推出 ChatGPT Work,将 Codex 改造为面向非工程师的智能体产品,最低订阅档每月 20 美元即可使用,旨在让白领通过 LLM 自主完成多步骤工作。OpenAI 内部 6 月有 98% 员工使用 Codex,但组织订阅者仅 17%、个人订阅者不足 1%。公司正通过简化界面扩大采用,以支撑其巨额训练投入。
AI 基础设施瓶颈正沿供应链依次传导,形成典型的牛鞭效应。2023 年初 GPU 短缺使 H100 租赁价超 $9/小时,随后压力转移至内存,企业级 SSD 合约价单季上涨 80%;到 2025 年底智能体推高 CPU 需求,2026 年存储短缺导致西数和希捷 2026 全年 nearline 产能售罄。数据中心建设成本已超 $20b/GW,变压器交期近三年,涡轮机订单排至 2031 年。
作者指出最贵的不是模型,而是工程系统:单日两轮任务跑 1 亿 tokens,仍有 13 条因 receipt identity mismatch 失败,模型已产出结果系统照样出错。真正难点在于幂等、状态机、回执、重试与可观测性。Agent 工程本质上更像分布式系统,而非 Prompt Engineering。
今天被两个 AI Agent 事故教育了: 1. X 抓取 25/25 全失败,日报却写着「新增 0 条」 2. 待办里的「今天」没转成标准日期,提醒直接消失 根因一样:把模型输出当成了系统状态。 LLM 负责判断,确定性代码负责日期、状态...
美国成屋签约销售量跌至三年最低,7月新屋建设创三年半新低,房地产市场承压。AI数据中心建设热潮正争夺建筑业熟练技工,部分住宅建设工人转向数据中心项目。美国住宅建筑商学会CEO埃德·布雷迪称,全美约缺30万名熟练技工,且短期内难以扭转。
Today's a record day for open weight share of tokens on Vercel AI Gateway. Aug 22 (today) 🟦 Open: 62% 🟨 Closed: 38% Ju...
BestBlogs 精选周刊第 109 期聚焦程序员职业未来,核心判断是编码执行正被工业化,但程序员价值不会自动消失或上移。周刊从工业化、治理前置、组织提效三方面展开,引用 Anthropic、Stripe、METR 等案例与数据,指出新分水岭在于定义问题、转化组织知识、独立验证与结果负责。
智能体token消耗量约为人类的5倍,自2月以来使用量增长约14倍,人类已成AI的少数用户。当智能体成为OpenRouter上token的主要来源,其通过比价压价模型供应商的能力可能减弱。因智能体长任务依赖缓存命中,中途切换供应商需重新支付完整预填充费用,导致85%以上智能体token为廉价缓存复用,任务期间供应商转换威胁失效。
Humans are the minority user of AI Agents burn nearly 5x the tokens people do, up 14x since February Charts of the Week:...
Omdia 预测,2028 年全球定制 AI-ASIC 出货量将达 1050 万块,超过同期 GPU 的 1010 万块。不过 GPU 营收领先地位将保持至 2032 年,因价格高企抵消了 AI-ASIC 的出货量增长。谷歌、微软、Meta、OpenAI、字节跳动等均有重大芯片项目计划在 2027 至 2028 年间推出或提升产量。
Someone in the Bay Area told me the labs keep taking the AI safety fellows so I asked what he does to get more AI safety...
作者认为LLM大幅降低了性能优化的门槛,使过去需要专业团队才能完成的优化工作变得人人可为。以FRE正则引擎为例,通过AI辅助编写原生AOT编译器,在长查询上实现2x-4x性能提升,代表性查询约7%加速。作者还探讨了构建全盘索引等更激进的优化可能性。
the anti-datacenter movement is the human superorganism correctly recognizing that it is building its successor and then...
God damnit, every one of my AI founder friends who actually have revenue are now just transforming into neoclouds with v...
两套估算均显示,AI 数据中心当前收入仅数百亿至低千亿美元量级,而资本开支已达数万亿美元,收支严重失衡。与此同时,美国共和党人正加速抛弃数据中心,民调专家 Adam Carlson 收集的四个新案例显示其政治毒性加剧。文章认为,贪婪、愚蠢与傲慢已让 2023 年的行业英雄沦为 2026 年的反派,大科技公司处境或比预期更糟。
晶圆代工行业2Q26营收达545亿美元,同比增长28%,连续第十个季度增长,但新增产能仅增6%,增长主要来自涨价和产品组合优化。台积电HPC营收占比达66%创纪录,智能手机降至22%,产能利用率从85%升至90%。3Q26E预计达614亿美元,同比增长34%,为周期内最快增速。
大语言模型同等能力水平的成本正急剧下降:2月每任务1.22美元的智能水平如今仅需0.022美元,不到六个月下降56倍,且降速还在加快。按当前速度,特定能力水平的价格每约一年下降100倍。作者以DANDI Archive数据集复用分析为例,说明成本下降让原本只能抽样进行的项目变得可行。
文章指出,尽管 AI 模型能力持续增强,企业组织的生产力却未同步提升,所谓“AI 普及”更像一个神话。模型进步与组织落地之间存在明显落差,成为当前 AI 应用的核心矛盾。
Liquid Death 与 Jason Kelce 合作推出恶搞广告,号召人们用尿液冷却 AI 数据中心。专家指出,再生水(经处理的废水和污水)确已被用于数据中心冷却,可部分替代饮用水需求。但该方案依赖大型污水处理设施,弗吉尼亚州劳登县数据中心每日使用约 2 亿加仑再生水,仅占其日用水量的 43%。
PuppyOne 反其道而行,不为智能体状态发明新存储位置,而是直接使用文件系统作为共享工作区。智能体(如 Claude Code)可读写 Markdown、代码、JSON 等常规文件,人类可查看 diff 和仓库历史,Git 追踪所有变更。它可在 Mac 本地或云端运行,定位是智能体周围的工作区而非智能体本身。
I built a Windows XP-style editor on your Mac. Oh, and it has AI agents.
AI 正将英语变成通用 API,用户只需描述意图,智能体即可代为操作 CAD 等复杂软件。设计师 Yana Welinder 借此用自己不会用的软件,打造出此前无法制造的 Ruth Asawa 风格环线雕塑连衣裙。这倒逼产品设计转向为智能体构建安全、完整的操作框架,文档与评估取代传统 UX 实验室成为核心。
DataCamp CEO 与首席 AI 官讨论在生产环境中为超 1900 万学习者构建 AI 导师时,开源模型与前沿模型的实际选择。对话涵盖模型生产表现、开源是否真便宜 10 倍、基础设施成本、缓存延迟、幻觉、隐私及供应商锁定等议题。
monday.com 以 Claude 为核心重构平台,转向人类与智能体协作的 agent-first 模式,自 2026 年 5 月上线以来已产生超过 500 万次智能体交互。该公司曾因“AI dust”式附加功能触顶,遂将 AI 原生嵌入工作流,为智能体设置名称、头像及权限,并支持通过 monday Agents、BYOA、Pre-built Agents 等四种方式运行 Claude。
Kimi K3、GLM-5.3等中国开源模型已逼近美国顶尖模型,在多数综合评测中跻身前列,西方实验室归咎于知识蒸馏与benchmaxxing,但模型领先已难守。西方剩余优势集中在三个领域:抽象专项测试(ARC-AGI-2上K3为60.4%对Opus 5的89.2%)、可靠性(AA-AnalystAgent的pass^5指标Opus 5以54%领先,K3为39%)和网络安全。
Cursor 工程师 Vicent Martí 发文《Git at any scale》,梳理 20 年 Git 托管难点,并介绍其存储系统 Origin 的数据库式设计:将 S3 当作 WAL、本地 NVMe 仅作缓存,闲置仓库可 0 副本、热仓库可拉 100+ 读副本,压测约 120-300+ push/s。作者强调 Origin 仍为 early beta,镜像仓真相源仍是 GitHub。
We're making Git hosting more reliable, performant, and scalable. This post traces 20 years of Git infrastructure and ex...
现有网络软件多为静态,难以满足用户的个性化长尾需求。LLM 辅助编程让个人定制软件成为可能,Y Combinator 的 Pete Koomen 称之为“Small Software”。文章提出,LLM 可大幅降低扩展开发成本,现代沙箱原语则降低部署成本并提供安全边界,网络应用有望成为“可扩展软件”,让用户通过自然语言安全地扩展核心功能。
Jeremy Morrell 提出,LLM 时代为 Web 可扩展软件带来新机遇:LLM 大幅降低扩展的编写成本,现代沙箱原语降低部署成本并提供良好安全边界。开发者可将应用构建为稳固、可问责的核心,让用户借助 LLM 安全地扩展其功能。