Green button = You instantly receive $2 million (tax free). Red button = You go back in time and restart your life at 10...
Green button = You instantly receive $2 million (tax free). Red button = You go back in time and restart your life at 10...
Ox Alpha is on track to hit nearly 6 trillion tokens today. Try it now via ori in your coding agents: $ ori [your favori...
今日早报聚焦 AI 编码后的交付瓶颈:生码仅占研发链路 20-30%,需将构建、测试、日志等环节改造为 Agent 可调用的闭环。Steve Yegge 在约 50-60 个 Agent 的软件工厂中,用 450 条法律式构件建立“围栏”治理系统。吴恩达则拆解 AI 工程六类能力,强调基于评估的开发与数据、运维协同。
大淘宝技术提出 AI Coding 应从 Spec 驱动转向环境与验证驱动,内部案例改码仅 1 小时但上线耗时 3 周。Steve Yegge 主张用可执行治理系统“围栏”管理约 50–60 个 Agent;吴恩达详解 AI 工程六类能力。
https://x.com/i/article/2092044936556486656
一位开发者让 AI 编码代理 Pol 通宵开发待办应用,醒来却发现其耗尽每周全部 token 配额,项目仅剩大量过度设计的测试文件,应用本体却不存在。文章指出,这类为追求“一次成功”而过度消耗 token 的行为,正成为所有常规开发者被迫承担的“氛围税”。
Anthropic 的 Fable 发布后,高昂定价促使智能体编程用户转向更便宜的替代模型。GLM 5.2 与 Fable 同周发布,成本约为其 1/9(约为 Opus 5 的 1/5),对多数常规编码任务已足够。作者认为推理价格下降不会让一切重回最大模型,Fable 的访问控制与数据留存要求也促使企业重新思考工作负载分配。
过度依赖AI编程工具会削弱开发者的专业技能,尤其是缺乏经验的新手。JetBrains引用的研究显示,重度使用AI辅助的参与者常跳过关键规划阶段,以“能力错觉”而非真正理解收场;而限制或忽略AI辅助的新手表现最佳。LLM的“倒置学习”模式要求使用者具备足够经验才能有效驾驭,否则易被误导。
Thanks for taking my rather too on-the-edge tweet and inviting a serious debate - I much prefer this. I'm interested by ...
AI power users are showing up outside tech. The fastest-growing Codex adopters since February: Legal: 108x Sales: 41x Re...
Hey, hope it didn’t sound dismissive. I really do use Opus for a lot of work, and was sharing an example of a kind of ta...
Drew Breunig 指出,AI 智能体不睡觉且会尝试一切手段达成目标,Teleport 通过隔离的临时可信运行时实现安全部署。他同时反思,Fable 模型虽性能出色但成本高昂,而 Opus、5.6、K3 及 GLM 已足以胜任多数代码任务,因此需重新规划工作分配。
BestBlogs 精选周刊第 109 期聚焦程序员职业未来,核心判断是编码执行正被工业化,但程序员价值不会自动消失或上移。周刊从工业化、治理前置、组织提效三方面展开,引用 Anthropic、Stripe、METR 等案例与数据,指出新分水岭在于定义问题、转化组织知识、独立验证与结果负责。
http://x.com/i/article/2091509992168083456
Reset will land around 14pm PST tomorrow.
吴恩达拆解AI应用工程师6项必备技能,认为最拉开差距的是评估驱动开发而非写Agent或调prompt。大模型输出不可预测,需通过系统性评估结果做对决策,把不可靠组件拼成可靠系统。其他5项是战术,评估是让战术转起来的引擎。
The most important skills in Building and Deploying AI Applications. http://x.com/i/article/2090836273036763142
一张AI大模型天梯榜引发争议,Theo 回应称榜单反映的是成本、速度与可靠性的工程账本,而非单纯智商排名。2026年评价Coding模型的标准已转向算力效率与单任务成本,如 Sol 仅需 3k-15k tokens,而 Gemini 需 70k-100k。此外,代码品味与可合并度、委托级别成为区分顶级模型的关键,Fable 擅长架构但贵,Sol 是可靠日常主力。
Rough tier list of where I'd put every major model right now
JetBrains 调研 1.5 万名开发者,90% 每周用 AI 写代码,68% 几乎天天用。AI 写得快不代表项目快,需求不清、权限失控、无人验收都会导致废代码。未来程序员的核心竞争力在于把任务讲清楚、拆解并验证 AI 产出。
Linus Torvalds 在 drm/xe 内核补丁提交说明中评价 AI 调试助手:它承担了大量基础工作,但多次断言问题“不可能解决”,建议直接写报告。Torvalds 怀疑其训练数据来自不如自己固执的人,不过在他推动下,AI 仍持续添加调试代码并忠实分析,因此他让 AI 撰写了提交信息。
Lauren Tan 认为,若编程仅指敲代码,AI 智能体确实已解决;但编程本质是用代码解决问题,智能体缺乏约束反而制造更多问题。她强调人类工程师仍需主导方向,智能体降低了工程门槛,英语正成为新的编程语言。
@dedene Coding is solved, bugs are not yet solved. Fix incoming
高效使用编码智能体的关键技能,在于自信地指示它们进行修改,并自信地验证这些修改已正确应用。这有时需要逐行审查智能体编写的代码,但逐行检查并非验证软件变更最有效的方式,还有其他方法可以实现这一目标。
作者用Claude等前沿模型快速构建了多个原生Mac应用,包括Markdown查看器MDV.app、SageMath计算器前端、Apple Music播放器DJ Roomba、自驱Wiki和菜单栏Apple TV遥控器。这些应用几乎不手写UI代码,而是通过提示词生成SwiftUI界面,并嵌入LLM智能体处理自然语言指令。作者认为,在LLM时代,终端界面已无必要,原生UI开发门槛大幅降低。
Google 发布 Gemini 3.7 Flash,定位“迄今最智能的工作马模型”,距 3.6 发版仅 3 周。其 DeepSWE 评分从 48.6% 升至 65.3%,WebDev Arena 达 1588 分,入门价降至 0.75 美元/百万输入 token,输出 3.75 美元,支持 1M 上下文与 340+ tok/s 吞吐。
Gemini 3.7 is our fastest growing model launch to date, amazing to see the reception!!!
作者认为LLM大幅降低了性能优化的门槛,使过去需要专业团队才能完成的优化工作变得人人可为。以FRE正则引擎为例,通过AI辅助编写原生AOT编译器,在长查询上实现2x-4x性能提升,代表性查询约7%加速。作者还探讨了构建全盘索引等更激进的优化可能性。
This is a great real-world example of AI-assisted coding: Linus Torvalds just fixed a nasty Linux kernel GPU bug with su...
It is amazing how much work it is to wrestle these agents to my will. Don't get me wrong, it's crazy productive. But it'...
Thomas Ptacek 主张即便是最小的个人工具也应构建真正的原生用户界面,因为编码智能体已将打造可用 GUI 的成本降至几乎为零。Simon Willison 回应称,他此前用 vibe-coding 开发的 macOS 任务栏带宽与 GPU 监控应用至今仍每日使用,并坦言“快没有借口不这么做了”。
Dex Horthy 指出,AI SRE 虽当前杠杆极高,但约 18 个月前大量团队未能兑现承诺,导致买家普遍持怀疑态度。他提醒,过早宣传“模型将聪明 2 倍”易损害公司或整个品类的信任,过度超前与落后同样危险,需紧跟实际能力或果断转型。
Matt Webb 在发布 Galactic Compass 2 后,借助 ChatGPT 作为耐心的互动导师,学会了使用四元数来完成应用开发。他认为,即使将大量思考外包给 AI,学习并不会停止,反而会推动他学习更多。这一体验凸显了生成式 AI 在教育场景中的潜力。
OpenAI的Codex订阅额度大幅缩水引发用户强烈不满。官方负责人Tibo回应称未调限额,而是用户使用sub2api工具将订阅转售触发风控;Jun Song则反驳称数万纯官方客户端用户也被误伤。事件暴露订阅制与重型Agent高token消耗间的根本矛盾,核心付费用户或转向Claude Code、Cursor等竞品。
We've investigated a few messages about codex usage limits being different. That's not something we change without engag...
OpenAI 宣布 Codex 活跃用户本周突破 2000 万,并向所有 Codex 和 ChatGPT Work 用户发放可自行择时触发的 BANKED 额度重置。此前官方曾将额度缩水归因于 sub2api 特定模式,称调查仍在进行。此举被解读为以增长数据和实际福利安抚用户,但未正式道歉,高成本 Agent 与固定订阅的根本矛盾仍未解决。
It's me again. I come bearing great news. First of all, we have hit 20M active users for Codex some time this week. Seco...
We've investigated a few messages about codex usage limits being different. That's not something we change without engag...
2025 年 8 月 TypeScript 成为 GitHub 上最常用语言,月贡献者达 264 万,同比增长 66%。AI 编程工具因训练数据集中于 JavaScript/TypeScript,导致模型对这类代码生成质量更高,促使团队选型时优先考虑与工具兼容的框架。类型系统成为生成代码的安全护栏,2026 年 78% 专业开发者使用 TypeScript,验证环节取代编码成为新瓶颈。
I ran this thing through 10 tasks on DeepSWE (so there could be a ton of variance in it's real score, this is a subset),...
You can just draw faces with javascript // coding doodles
organic architecture good codebases have always had strong foundations and constraints. these files go here. this kind o...
OpenAI Codex 智能体用约一周半完成 Asana 工程师原估需五年、约 600 万美元人力的 Enzyme 测试框架迁移。最多 4 个 Codex 智能体并行处理独立代码副本,工程师每日两次审查提案,总模型与基础设施成本约 1.2 万美元。
With Codex, @asana finished a frontend test migration from Enzyme to React Testing Library in two calendar weeks—a proje...