DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。
另有 5 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:X.PIN (@thexpin)X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)IT之家(RSS)AI 编码
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
精选归档 · 第 2 页
第 21–40 条 · 共 553 条
8月13日
Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
另有 6 家信源报道IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)8月12日
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。
另有 9 家信源报道X:Testing Catalog (@testingcatalog)X:Elon Musk (@elonmusk, xAI)IT之家(RSS)X:Lee Robinson (@leerob)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)MarkTechPost(RSS)Codex 和 Claude 新增跨 Session 传消息功能后,新对话可从之前所有对话中选择可用消息,省去交接文档和 git 备份。作者据此重构工作流:主对话守住目标与决策,分支对话独立探索新想法,完成后由主对话读取完整记录。Codex 通过复制会话 ID 精确寻址,Claude Code 则用内置 session management 搜索对话历史,但桌面端只能搜索当前可访问的会话记录。
Mojo 语言正式发布 1.0 版本,提供稳定、可用于生产环境的语言基础,自 2023 年首次发布以来已发展成通用语言。自开源标准库以来,近 200 名贡献者合入超 1,100 个拉取请求,改动超 200,000 行代码。
另有 1 家信源报道IT之家(RSS)作者通过 mitmproxy 对 VS Code 中的 GitHub Copilot 进行中间人代理拦截,逆向分析其网络流量与内部架构。文章指出这些 AI 应用普遍基于 Electron 构建,共享相似的网络栈,因此探测结果可迁移至其他同类应用。作者借此揭示了 Copilot 的运行时行为,并分享了配置代理的具体步骤。
8月11日
ZCode针对GLM深度优化,今日上线Goal、Subagents、Remote Control与闲时任务四大功能。在Z.ai Code Bench测试中,GLM-5.2搭配ZCode较搭配Claude Code任务整体通过率高2.39%;ZCode缓存命中率超98%,叠加1.5倍限时额度加成后,GLM Coding Plan整体使用量接近常规额度的1.8倍。
另有 1 家信源报道IT之家(RSS)针对“动态语言比静态语言更省 LLM token”的流行说法,作者用 GPT-5.6 Sol 让智能体实现 zstd 解码器进行实测。结果显示,medium 努力度下动态语言表现更好,ultra 下静态语言反而更优,且此前评测存在测试路径错误等缺陷。作者认为,琐碎任务上的性能无法推广到更大问题。
8月10日
OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。
另有 1 家信源报道X:OpenRouter (@OpenRouter)OpenChamber 是一个基于代理的开发环境,可跨桌面、浏览器、手机和 VS Code 使用,支持会话目标、多模型并行运行与融合、变更走查、从 issue 到 PR 的完整流程及定时任务。该工具基于 OpenCode SDK,完全开源且免费,代码和会话内容均保存在本地,远程访问可通过 UI 密码和端到端加密的 Private Relay 保护。
8月8日
Ouroboros 是一个自开发智能体框架,其工具、提示词、上下文组装和核心实现通过评审式提交持续改进,并成为后续工作的运行时。
8月7日
GitHub Copilot 应用中的斜杠命令可帮助管理会话、导航项目和自定义 Copilot 工作流。与 CLI 版不同,应用版命令更侧重工作流,如 /plan 用于编码前规划、/spar 用于挑战方案假设、/autopilot 用于自动执行实现。/clear 和 /model 在 CLI 和应用中均可用。
8月6日
Prime Agent 是一个自我改进的编码代理,围绕递归语言模型(RLM)和持续框架(Continual Harness)两大抽象构建,将上下文视为变量、子代理委派视为 REPL 内的函数调用,并允许代理对其提示词、技能、记忆和子代理进行 CRUD 操作。它完全开源,可通过 curl 命令安装,支持与前沿模型即时使用,并具备后台守护进程、会话恢复、分支分叉和异步内核压缩等特性。
另有 1 家信源报道MarkTechPost(RSS)8月5日
作者为Codex和Claude Code中300多个Skill做上下文瘦身,发现每次新会话仅Skill列表就占约9.9k token,按7月使用强度粗算,多余Skill列表约吃掉4到5亿token的上下文空间。
8月3日
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。
另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Nathan Lambert (@natolambert)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)X:Testing Catalog (@testingcatalog)公众号:数字生命卡兹克8月2日
刚发现一个OpenAI订阅的隐藏用法,感觉像白捡的。 GPT-5.6不是分三档吗——Sol最强最贵,Terra中间,Luna最便宜最快。大部分人默认选Sol,觉得贵的就是好的。 但现在一堆重度用户测出来一个组合:Luna + Max rea...