Topic · 主题全部主题 →

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

4,692条收录
553条精选

精选归档 · 第 2 页

2140 条 · 共 553

8月13日

星期四 · 3 条
07:30
公众号:数字生命卡兹克精选
AI 评分 69/100
DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验

DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。

另有 5 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:X.PIN (@thexpin)X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)IT之家(RSS)
推荐理由:把准 Fable 级 Agent 能力压到输出百万 token 0.87 美元,与 50 美元的 Fable 5 形成数量级差距,团队对自动化任务的成本核算可能因此改变。
02:23
Cursor Blog精选
AI 评分 70/100
Cursor 与 SpaceXAI 联合发布 Grok 4.6

Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

另有 6 家信源报道IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)
推荐理由:长程轨迹中出现自检与验证,对需要模型持续执行多步项目的团队,可能减少中途人工纠偏,比单纯基准分更有参考价值。

8月12日

星期三 · 4 条
23:48
xAI:News(网页)精选
AI 评分 77/100
xAI 发布 Grok 4.6,强化长时运行智能体能力

xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。

另有 9 家信源报道X:Testing Catalog (@testingcatalog)X:Elon Musk (@elonmusk, xAI)IT之家(RSS)X:Lee Robinson (@leerob)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)MarkTechPost(RSS)
推荐理由:与 GPT-5.6 Sol 在智能体综合基准上持平,同时把输入 token 价格定在 2 美元,长任务应用的试错成本可能重新计算。
12:00
公众号:卡尔的AI沃茨精选
AI 评分 72/100
跨会话传消息后,Codex 和 Claude 如何重构 vibe coding 工作流

Codex 和 Claude 新增跨 Session 传消息功能后,新对话可从之前所有对话中选择可用消息,省去交接文档和 git 备份。作者据此重构工作流:主对话守住目标与决策,分支对话独立探索新想法,完成后由主对话读取完整记录。Codex 通过复制会话 ID 精确寻址,Claude Code 则用内置 session management 搜索对话历史,但桌面端只能搜索当前可访问的会话记录。


推荐理由:将跨会话消息转化为多分支探索的工作流,并对比了Codex精确寻址与Claude搜索式检索的实现差异和踩坑记录,可直接复用其指令来管理复杂的探索任务。
04:15
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 73/100
Mojo 1.0 正式发布:为生态系统增长提供稳定基础

Mojo 语言正式发布 1.0 版本,提供稳定、可用于生产环境的语言基础,自 2023 年首次发布以来已发展成通用语言。自开源标准库以来,近 200 名贡献者合入超 1,100 个拉取请求,改动超 200,000 行代码。

另有 1 家信源报道IT之家(RSS)
推荐理由:稳定性承诺让 Mojo 成为 AI 基础设施可长期选用的语言基础,lambda 语法和内存安全诊断减少了日常开发阻力,对 MAX 生态项目直接降低维护成本。
02:45
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
将 GitHub Copilot 置于中间人(MitM)代理之后后,我学到了什么

作者通过 mitmproxy 对 VS Code 中的 GitHub Copilot 进行中间人代理拦截,逆向分析其网络流量与内部架构。文章指出这些 AI 应用普遍基于 Electron 构建,共享相似的网络栈,因此探测结果可迁移至其他同类应用。作者借此揭示了 Copilot 的运行时行为,并分享了配置代理的具体步骤。


推荐理由:通过抓包与源码分析,文章展示 Copilot 如何把 .env 内容传至 API 并明文存储历史,阐释 AI 编码工具成为有状态系统后上下文既是产品也是风险源。

8月11日

星期二 · 3 条
14:01
公众号:智谱(GLM)精选
AI 评分 71/100
ZCode全面升级:Goal、Subagents、Remote Control与闲时任务四大功能上线

ZCode针对GLM深度优化,今日上线Goal、Subagents、Remote Control与闲时任务四大功能。在Z.ai Code Bench测试中,GLM-5.2搭配ZCode较搭配Claude Code任务整体通过率高2.39%;ZCode缓存命中率超98%,叠加1.5倍限时额度加成后,GLM Coding Plan整体使用量接近常规额度的1.8倍。

另有 1 家信源报道IT之家(RSS)
推荐理由:Goal模式将复杂任务从需要开发者逐轮推动变为设定目标后自行迭代,搭配Subagents并行协作,适合跨文件重构和全栈开发的长流程任务。
13:14
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
编写智能体时,哪种编程语言最合适?

针对“动态语言比静态语言更省 LLM token”的流行说法,作者用 GPT-5.6 Sol 让智能体实现 zstd 解码器进行实测。结果显示,medium 努力度下动态语言表现更好,ultra 下静态语言反而更优,且此前评测存在测试路径错误等缺陷。作者认为,琐碎任务上的性能无法推广到更大问题。


推荐理由:该实验将语言效率的讨论从微基准拉回实际工程任务,用Zstd和Pandoc实现揭示主流语言更可靠,可能改变开发者在AI辅助下选择技术栈时对动态语言优势的固有认知。

8月10日

星期一 · 2 条
23:44
OpenRouter:Announcements(RSS)精选
AI 评分 77/100
OpenRouter 推出由市场智慧驱动的新版 Auto 路由器

OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。

另有 1 家信源报道X:OpenRouter (@OpenRouter)
推荐理由:基于平台每周55T token的社区支出分布,新路由将模型选择众包化,基准显示默认档成本下降超60%且多数任务性能不减,适合调用量大的应用。
09:14
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
OpenChamber:一个基于代理的开发环境

OpenChamber 是一个基于代理的开发环境,可跨桌面、浏览器、手机和 VS Code 使用,支持会话目标、多模型并行运行与融合、变更走查、从 issue 到 PR 的完整流程及定时任务。该工具基于 OpenCode SDK,完全开源且免费,代码和会话内容均保存在本地,远程访问可通过 UI 密码和端到端加密的 Private Relay 保护。


推荐理由:将多模型并行、日程化任务和跨设备工作区整合到同一界面,减少了切工具的时间,适合需要在多个 AI 代理间协调的开发者。

8月8日

星期六 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
Ouroboros:具备评审式核心进化的自开发前沿编程智能体

Ouroboros 是一个自开发智能体框架,其工具、提示词、上下文组装和核心实现通过评审式提交持续改进,并成为后续工作的运行时。


推荐理由:相比固定提示词的智能体,Ouroboros通过自我进化持续优化工具和上下文,在多个基准上达到最高分,161天实验展示了长期部署的可行性。

8月7日

星期五 · 1 条
03:53
GitHub Blog精选
AI 评分 69/100
GitHub Copilot 应用中的斜杠命令使用指南

GitHub Copilot 应用中的斜杠命令可帮助管理会话、导航项目和自定义 Copilot 工作流。与 CLI 版不同,应用版命令更侧重工作流,如 /plan 用于编码前规划、/spar 用于挑战方案假设、/autopilot 用于自动执行实现。/clear 和 /model 在 CLI 和应用中均可用。


推荐理由:文章不是罗列命令,而是提供了可复用的场景模板,为 /plan、/spar 等命令配好了规划、评审和实现的具体提示词,省去从零组织任务描述的时间。

8月6日

星期四 · 1 条
09:39
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
Prime Agent:一个具有自我改进能力的RLM代理

Prime Agent 是一个自我改进的编码代理,围绕递归语言模型(RLM)和持续框架(Continual Harness)两大抽象构建,将上下文视为变量、子代理委派视为 REPL 内的函数调用,并允许代理对其提示词、技能、记忆和子代理进行 CRUD 操作。它完全开源,可通过 curl 命令安装,支持与前沿模型即时使用,并具备后台守护进程、会话恢复、分支分叉和异步内核压缩等特性。

另有 1 家信源报道MarkTechPost(RSS)
推荐理由:不同于固定工具调用模式,Prime Agent 将上下文视为可编程变量并允许智能体自行改进技能和记忆,为长程自主任务提供了新的基准方案。

8月5日

星期三 · 2 条
18:01
公众号:卡尔的AI沃茨精选
AI 评分 74/100
烧了5亿token后,我给Codex和Claude Code做Skill上下文瘦身的新技巧

作者为Codex和Claude Code中300多个Skill做上下文瘦身,发现每次新会话仅Skill列表就占约9.9k token,按7月使用强度粗算,多余Skill列表约吃掉4到5亿token的上下文空间。


推荐理由:把低频 Skill 从全局暴露转为触发词动态加载,提供了工具多而上下文有限时的一种治理思路,量化了 token 节省,方法可迁移到其他 Agent 管理。

8月3日

星期一 · 1 条
10:10
Qwen:Blog Retrieval(API)精选
AI 评分 89/100
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。

另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Nathan Lambert (@natolambert)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)X:Testing Catalog (@testingcatalog)公众号:数字生命卡兹克
推荐理由:首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。

8月2日

星期日 · 1 条
19:00
AYi@AYi_AInotes精选
AI 评分 75/100
Codex 用 Sol 指挥 Luna Max 省额度翻倍产出刚发的Codex Luna Max省钱tip,现在有进阶版了——而且是让Sol自己帮你配好,现在Codex圈中高阶玩家都在用。思路很简单:别让Sol什么都自己干,Sol很贵,额度烧得快,但它规划和审核确实强。Luna Max便宜,写代码改文件跑测试这些有明确边界的体力活,它干得跟Sol差不了太多。所以最佳模式是:Sol当包工头,Luna Max当工人。具体怎么搞,让Sol自己帮你弄,你就跟它说:在~/.codex/agents/下创建一个luna-worker.toml,模型设gpt-5.6-luna,reasoning effort设max,写好描述和指令,专门用来处理有明确边界的委托任务。创建完验证配置,给我看diff。Sol会自己把这个子代理配好 之后你干活的时候,Sol负责拆任务、做架构决策、审代码,具体的实现、改bug、跑测试、重构,它会自动delegate给luna_worker去跑。主线程的Sol额度省下来只花在刀刃上,体力活全让便宜的Luna Max扛,同一个订阅,产出量直接翻倍。还有个更懒的办法:不建配置文件,直接告诉Sol,遇到需要批量执行的子任务,自己spawn独立的Luna Max对话线程去跑,跑完把结果汇总回来。效果差不多,就是没那么结构化。去看DeepSWE那个榜就懂了,gpt-5.6-luna max的分数跟Sol Medium咬得很近,但成本差了一个数量级。Sol指挥+Luna Max干活,等于用一个Sol的钱,同时跑好几个工人。别再拿Sol当苦力使了,让它当老板才是正确的打开方式:#Codex #OpenAI #AI编程Codex 高阶玩法:让 Sol 在 ~/.codex/agents/ 下创建 luna-worker.toml 子代理,模型设 gpt-5.6-luna、reasoning effort 设 max,Sol 负责拆任务与审代码,具体实现自动委托给 Luna Max。

AYi: 刚发现一个OpenAI订阅的隐藏用法,感觉像白捡的。 GPT-5.6不是分三档吗——Sol最强最贵,Terra中间,Luna最便宜最快。大部分人默认选Sol,觉得贵的就是好的。 但现在一堆重度用户测出来一个组合:Luna + Max rea...


推荐理由:把 Sol 定位为「包工头」而非全栈苦力,用配置实现任务委托,给出了一个可复用的省额度方案,但长期可靠性待真实验证。