Topic · 主题全部主题 →

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

4,692条收录
553条精选

精选归档 · 第 4 页

6180 条 · 共 553

7月23日

星期四 · 1 条
02:20
Cursor Blog精选
AI 评分 70/100
Cursor 发布智能模型路由系统 Cursor Router

Cursor 推出 Cursor Router,可自动将每个编码请求分配给最合适的模型。在线 A/B 测试显示,Auto Intelligence 模式在用户满意度接近 Fable 的同时,成本降低约 60%;Auto Balance 模式满意度超过 Opus 4.8,成本降低约 36%。


推荐理由:Cursor Router 把模型路由从个人选择变成团队策略,实测成本降低 30-50% 且满意度不降,对管理 AI 预算的工程 Leader 来说是个值得立刻试点的新功能。

7月22日

星期三 · 6 条
22:54
Nathan Lambert:Interconnects(RSS)精选
AI 评分 62/100
开源模型季度盘点:Kimi K3、Qwen 3.8、WAIC 演讲、知识蒸馏与开源闭源差距

Nathan Lambert 与 Florian Brand 在播客中盘点开源模型最新动态。Kimi K3 发布后,中美 AI 地缘政治、开源与闭源模型的经济性、前沿安全等问题加速演进。Qwen 宣布下一代大模型将开源权重,中国厂商在开源策略上持续加码。讨论还涉及开源模型与闭源前沿的性能差距、知识蒸馏争议,以及后训练对特定任务的价值。


推荐理由:两个在开源模型圈摸爬滚打的人聊了Kimi K3、GLM 5.2和蒸馏之争,如果你想知道为什么中国模型能追这么紧,以及Ben Thompson的论断哪里不对,这期必听。
02:22
OpenCode@opencode精选
AI 评分 56/100
Laguna S 2.1 免费开源上线 OpenCodeLaguna S 2.1 is now free on OpenCode1M Context · fully open sourcePoolside's most capable model to dateLaguna S 2.1 现已在 OpenCode 上免费提供 1M 上下文窗口 · 完全开源 Poolside 迄今为止最强大的模型另有 3 家信源报道X:OpenRouter (@OpenRouter)Hacker News 热门(buzzing.cc 中文翻译)The Decoder:AI News(RSS)
推荐理由:OpenCode 免费上了 Poolside 的最强模型,1M 上下文且完全开源,对写长代码的开发者是实打实的顺手工具,可以省一笔算力开销。
01:22
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
Claude 不是编译器--它比编译器更好

Claude 等大语言模型能跨越战略、产品、架构、代码到机器码的整个技术栈垂直工作,无需安排会议或请求许可,因此比传统编译器更强大。以 exe.dev 为例,团队用 LLM 研究分布式 DNS 系统设计、历史安全缺陷和替代实现策略,并通过多智能体循环构建了完整系统。LLM 虽在单项任务上不及资深人类,但能同时处理所有层级,实现跨层协作。


推荐理由:一篇值得软件工程师读的观点文章,用真实案例说明 LLM 不是编译器而是垂直跨层工具,vibe-engineering 理念可能重塑开发实践。
00:49
GitHub Blog精选
AI 评分 70/100
GitHub Copilot 推出 canvases 扩展,实现开发者与 AI 智能体实时协作

GitHub Copilot 在应用中推出 canvases 扩展,这是一种共享交互式界面,开发者和 AI 智能体可在其中实时协作。用户通过 /create-canvas 指令创建画布,Copilot 可动态更新内容,用户则通过点击、编辑等操作与同一工作区交互。示例包括快速分类 Issue、生成交互式代码库关系图、管理会话工作树、优化提示词质量以及跨平台搜索知识联系人。


推荐理由:Copilot 的 canvas 把对话变成可拖拽可点击的交互界面,处理 issue、探索代码都变得直观,日常依赖 Copilot 的开发者可以直接用起来。
00:22
Josh Woodward@joshwoodward精选
AI 评分 69/100
Google 发布三款新模型:3.6 Flash、3.5 Flash-Lite 与 3.5 Flash CyberToday’s launches are all about better performance, lower latency, and a smaller bill.• 3.6 Flash cuts token usage by up to 65% on complex coding • 3.5 Flash-Lite reaches speeds of 350 output tokens/secBoth are live in the Gemini app today!Next up: Gemini 3.5 Pro, which has officially entered partner testing.Google 推出三款新模型,旨在提升性能、降低延迟和成本。其中,3.6 Flash 在复杂编码任务上 token 用量最高减少 65%,3.5 Flash-Lite 速度达 350 输出 token/秒。3.6 Flash 和 3.5 Flash-Lite 已在 Gemini 应用上线,3.5 Pro 进入合作伙伴测试。

Google DeepMind: We’re rolling out three new models to make AI agents faster, smarter, and cheaper at scale: 🔵 Gemini 3.6 Flash: It uses...

另有 18 家信源报道X:Google AI for Developers (@googleaidevs)X:Rohan Paul (@rohanpaul_ai)X:Google AI (@GoogleAI)X:Logan Kilpatrick (@OfficialLoganK)X:Artificial Analysis (@ArtificialAnlys)Google DeepMind:Blog(RSS)The Decoder:AI News(RSS)X:Jeff Dean (@JeffDean)X:fofr (@fofrAI)MarkTechPost(RSS)Ars Technica:AI(RSS)The Verge:AI(RSS)X:Gemini (@GeminiApp)Hacker News 热门(buzzing.cc 中文翻译)X:Google DeepMind (@GoogleDeepMind)IT之家(RSS)Artificial Intelligence News(RSS)TechCrunch:AI(RSS)
推荐理由:Google一口气扔出三个Gemini Flash新模型,3.6 Flash把复杂编码token砍了65%,做Agent的成本敏感型选手可以直接收益,Cyber模型专攻漏洞修复是个有意思的细分信号。

7月21日

星期二 · 3 条
21:49
Simon Willison 博客精选
AI 评分 75/100
Anthropic 团队透露 Claude Tag 承担 65% 产品工程 PR,系统提示词缩减 80%

Anthropic 的 Cat Wu 和 Thariq Shihipar 在炉边对话中透露,Claude Tag 现已承担 Claude Code 团队 65% 的产品工程 PR。Claude Code 系统提示词最近缩减了 80%,团队越来越多地依赖自动化代码审查处理产品“外层”变更。Fable 已能一次性完成大量功能实现,Thariq 还用它编辑了自己的产品发布视频。


推荐理由:Anthropic Claude Code团队首次公开内部工作流和评估细节,系统提示精简80%、自动审查取代人工,对每个用编码代理的团队都有直接参考价值。
08:00
Tomer Tunguz 博客(VC 分析)精选
AI 评分 63/100
AI 工程生产力远超常态:从 20% 提升到 3 倍

过去六个月多项数据显示,AI 工程生产力提升远超常态:NVIDIA 报告 3 万开发者提交代码量增加 3 倍且缺陷率持平,Anthropic 内部采用 Claude Code 后人均代码量提升 2.5 倍。多数公司仅分发 AI IDE 时效率提升约 20-30%,而构建智能体编排的前沿公司可实现 3 倍产出,软件工厂模式如 Devin 在 Nubank 带来 8 倍效率提升和 20 倍成本降低。


推荐理由:作者汇总多家公司的公开数据,把 AI 编程提效分成三个梯队,读者可对照自身团队判断所处位置与差距。
02:08
Cursor Blog精选
AI 评分 64/100
Cursor 测试新型 AI 智能体集群:规划者+执行者分工,4小时通过80% SQL测试

Cursor 测试了新型 AI 智能体集群,将任务分解为规划者(使用最强模型)和执行者(使用快速廉价模型)。使用 Grok 4.5 时,新集群在 4 小时内通过了 80% 的 SQL 测试套件,而旧集群在第二小时前失败。该系统已用于构建浏览器、修复漏洞和生成数十亿 token 合成训练数据。


推荐理由:Cursor首次公开agent swarm的内部架构和协调失败模式,把835页规格文档变成可运行的SQLite数据库并开源,对做AI编程工具的团队和agent架构师来说,这些细节是金矿。

7月18日

星期六 · 1 条
00:32
Claude:Blog(网页)精选
AI 评分 64/100
Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。


推荐理由:Cursor 工程师用自家基准和太空模拟器实打实测试了 Claude Fable 5,从全局推理到自主规划路径的能力跃迁很具体,做编码 agent 的可以看看这个‘p99 问题’解法。

7月17日

星期五 · 6 条
17:50
公众号:通义实验室(千问)精选
AI 评分 74/100
首届"小有可为"大赛乡村教育一等奖作品"智绘科普"技术拆解

首届“小有可为”大赛乡村教育赛道一等奖作品“智绘科普”采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。


推荐理由:这是官方出品的实战教程,拆解了一套多Agent协作+门控+自修复的工程流水线,技术思路通用,做AI应用的可以直接抄作业。
13:48
AYi@AYi_AInotes精选
AI 评分 76/100
Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头谁能想到Claude和GPT双头统治的时代,居然就这么被中国模型撕开了口子。Kimi K3登顶Frontend Code Arena总榜第一,1679分同时力压Claude Fable 5与GPT-5.6 Sol。从上一代第18名直冲榜首,整整跃升17个名次,完成了同级模型里绝无仅有的跨越式爆发。7个前端细分赛道拿下6个第一,品牌营销参考设计数据分析消费产品模拟工具内容创建全线领跑,仅游戏赛道暂居第二。这不是刷题库的纸面跑分,是全球开发者匿名盲测投出来的真实战力,代码质量交互体验全维度硬碰硬。更炸裂的是完整模型权重7月27日前就会开放,顶级前端编码能力直接无差别下放给所有开发者。当开放权重的中国模型能在核心开发赛道正面打赢闭源顶流,维持多年的双巨头格局是不是真的要改写了。#KimiK3 #Moonshot #AI大模型 #前端开发 #开源AIKimi K3 在 Frontend Code Arena 以 1679 分登顶,力压 Claude Fable 5 与 GPT-5.6 Sol,7 个前端细分赛道拿下 6 个第一。该模型为 2.8 万亿参数 MoE 架构,百万上下文窗口,7 月 27 日开放权重。K3 的 API 定价为输入每百万 tokens 15 美元,对标前沿闭源模型,放弃低价路线,转向长上下文智能体编码场景的定价策略。

AYi: Kimi K3 今日正式发布,Moonshot 官方官宣,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态能力,7月27日开放模型权重。 网上已有声音称其在多项基准测试中超越 Fable,翻完官方基准数据图后会发现,这是选择性解读的...


推荐理由:K3登顶前端榜只是表象,更值得关注的是Moonshot将价格拉至前沿区间,这是中国模型首次不以低价取胜,而是在长上下文编码赛道与闭源巨头正面叫板,定价逻辑的转变可能重塑竞争格局。
11:11
公众号:月之暗面(Kimi)精选
AI 评分 83/100
Kimi K3:智能的新前沿

月之暗面推出迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,基于 KDA 混合线性注意力机制构建,原生支持视觉理解。它在长程编程、知识工作等场景表现前沿,但整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 等渠道使用,完整权重将于 2026 年 7 月 27 日前发布。


推荐理由:K3 把 2.8 万亿参数开源,并展示了从内核优化到芯片设计的连贯长程能力,为评估开源模型在复杂工程任务中的实际上限提供了参照。
07:44
IT之家(RSS)精选
AI 评分 79/100
Kimi 最强模型 K3 发布,Frontend Code Arena 跑分登顶

月之暗面推出迄今最强模型 Kimi K3,拥有 2.8 万亿参数和 100 万 Tokens 上下文窗口。该模型在 Frontend Code Arena 中以 1679 分超越 Claude Fable 5 位居第一,在 7 个前端领域中的 6 个排名 #1。API 定价为每 100 万 Tokens 输入 2 元(缓存命中)或 20 元(缓存未命中),输出 100 元。


推荐理由:Kimi K3 的 2.8T 参数和 100 万上下文不是数字游戏,前端跑分实打实地压过 Claude Fable 5,七个子领域拿六个第一,这对做前端和长文档处理的人是个明确信号,可以下场试了。
03:11
Moonshot AI:Kimi Blog精选
AI 评分 81/100
Kimi K3 发布:2.8T 参数开源模型,具备原生视觉与百万 token 上下文窗口

月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。


推荐理由:首个开源 3T 级模型,架构上有 KDA 和 AttnRes 创新,在超长程编码和知识工作上比肩闭源。权重两周后放出,所有做 agent 的都该盯紧。
01:32
Claude:Blog(网页)精选
AI 评分 65/100
Anthropic 用 Claude Code 大规模迁移代码:Bun 百万行 Zig 转 Rust,两周完成

Anthropic 工程师用 Claude Code 在两周内将 Bun 的百万行 Zig 代码迁移至 Rust,100% 现有测试通过,合并后出现 19 个回归问题已全部修复。另一工程师用周末将 Python 代码库迁移至 16.5 万行 TypeScript。迁移消耗约 16.5 万美元 API 成本,但编译时间从八分钟降至两秒,二进制启动快 6 倍。


推荐理由:Anthropic 用自家 Claude Code 把百万行 Zig 代码迁到 Rust,两周搞定,这不仅是案例展示,更是开发者如何用 AI 重构代码库的实操指南,尤其适合那些被遗留代码拖累的团队。

7月16日

星期四 · 3 条
09:40
公众号:MiniMax(稀宇科技)精选
AI 评分 66/100
MiniMax Code 2.0 桌面端焕新:底层架构全面升级,金融模块即将上线

MiniMax Code 2.0 桌面端发布,基于 Pi Agent 框架重构底层架构,显著提升会话启动速度与长程复杂任务的执行稳定性。新版本优化了图表加载与文件预览框选编辑功能,并已与恒生金融数据库、企查查 MCP 打通,金融模块即将上线,支持多源数据实时检索与专业报告生成。桌面端现已开放下载,本月还将上线远程控制、浏览器操控等功能。


推荐理由:MiniMax Code 2.0 把底层推倒重来,金融模块直接打通恒生和企查查,从写代码变成能出分析报告,做二级市场的可以认真看看。
07:04
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
开源编程智能体内存方案发布,通过 SSH 同步

一个面向编程 AI 智能体的开源内存项目在 GitHub 发布,支持通过 SSH 同步记忆数据。该项目允许智能体跨会话保留上下文,无需依赖特定云服务,用户可自托管。代码已开源,便于开发者集成与定制。


推荐理由:给Claude Code、Cursor这些编程代理加了个可同步的持久内存,通过SSH就能跨机器共享上下文,做多机协作开发的可以试试。
05:14
Elon Musk@elonmusk精选
AI 评分 76/100
Grok Build 现已开源Grok Build is now open sourceGrok Build 现已开源

SpaceXAI: 我们已开源 Grok Build,并重置了所有用户的使用限制。 开源 Grok Build 让任何人都能参与构建一个可靠且稳健的测试框架。欢迎查看我们的代码,包括 Grok Build CLI 的 Git 仓库。 http://x.ai/o...


推荐理由:xAI 把 Grok Build 直接开源了,虽然还没说明详细功能,但代码已经能看,做 AI 编程的开发者可以提前摸一摸架构。