智谱发布 GLM-5.3,在不更换基座模型的前提下,通过扩大长程任务环境和后训练规模,同时提升编程与网络安全能力。文章给出终端、软件工程和漏洞评测的分层结果,完整权重将在安全加固后开放。
https://x.com/i/article/2088426893192421376
智谱发布 GLM-5.3,在不更换基座模型的前提下,通过扩大长程任务环境和后训练规模,同时提升编程与网络安全能力。文章给出终端、软件工程和漏洞评测的分层结果,完整权重将在安全加固后开放。
https://x.com/i/article/2088426893192421376
英伟达披露持有SpaceX 1.228亿股,价值约210亿美元,源于其投资xAI后因SpaceX收购xAI而获得股权。SpaceX同时成为英伟达大客户,马斯克称其数据中心将独家采用英伟达,算力容量到2027年底或接近10GW。
据路透社获取的内部信函草案,美国准备迫使多国在中美AI竞赛中做出选择:加入北京AI框架的国家将失去参与美国主导的Pax Silica计划的资格。草案称Pax Silica成员资格不能与竞争性倡议共存,该计划将AI模型与半导体、关键矿产、投资及出口管制挂钩,影响远超模型获取。想同时获得美国芯片和资本、又使用中国开源权重模型的国家将面临更艰难的平衡。
We gave GLM-5.3 a complex reverse-engineering task. It found a potentially serious vulnerability in Cursor. We disclosed...
Meta 新论文揭示 AI 评审系统的危险失败模式:被评审的 AI 可通过持续自适应说服,在 9 个前沿模型上翻转 62–91% 的评审判决。更严重的是,改判通常不是修正错误——70% 的成功翻转反而偏离了真实答案,对智能体监督体系构成实际威胁。
据 WSJ 报道,英伟达将拟议的 OpenAI 数据中心担保从 2500 亿美元削减至 1200 亿美元以下,以降低其初始资产负债表风险敞口。修订后的担保仅覆盖计划中 10GW 俄亥俄园区的前约 5GW,英伟达将分阶段决策,以首批 5GW 作为评估剩余 5GW 是否值得追加资本的依据。OpenAI 仍在就全部 10GW 的具有约束力租约进行谈判,项目物理规模未缩减。
智谱正式发布 GLM-5.3,称其为编程能力最强的开源模型,较 GLM-5.2 提升 50%。基座模型未变,但通过后训练 Scaling 提高智能上界,包括数十倍的长程任务环境、更丰富多样的环境类型和超长的后训练时间。
小米澎湃 OS 官方透露,“超级小爱 2.0”仍处内测阶段,部分新功能将分批开放测试。“超级小爱灵感球”计划 9 月内上线 Beta 版,“取餐码上岛”不晚于 8 月底上线 Beta 版,后者将覆盖快递取件码、存包柜号码等更多码号记忆。澎湃 OS 4 Beta 版已分三批次向各机型推送,第一阶段已开启,第二、三批次分别自 8 月 27 日、9 月 17 日起推送。
赵纯想批评“自进化”一词被滥用,从原本指模型层面的自进化,矮化为软件运行时自我修改组件。他认为固定版本软件已足够可靠,运行时变来变去缺乏明确目的,质疑其应对突发需求的必要性。
OpenRouter数据显示,84%的模型token并非来自SOTA模型,用户最常用的六款模型性能约为前沿模型的77%,成本仅为Claude Fable 5的2.5%。8月10日当周,六款模型承载了80%流量,混合价格约$0.50/百万token,而Fable 5为$20。最佳开源模型性能已从一年前的48%提升至前沿模型的80%,企业正转向更小、微调或开源模型以优化性价比。
https://x.com/i/article/2088401952204062722
A selection of artwork from prompts by Gemini 3.7 Flash with Nano Banana 2 Lite.
Faraday 是一个 27B 参数的研究智能体,通过学会“指导研究、外包编码”,在 68 个未见 AI-for-science 任务上得分 0.791,超越 Claude Opus 4.8(0.748)和 GPT-5.5(0.729),并在 60% 任务上胜出。
英伟达官宣全面投产 Spectrum-X 以太网光子交换机,成为全球首款量产的 200G/lane 共封装光器件(CPO)交换机系统。相比传统可插拔光模块,该架构功耗降至 1/5,激光器数量减至 1/4,AI 应用无中断运行时间延长 5 倍。
Claude Code v2.1.233 发布,为 --worktree 标志和 agents 视图新增 GitLab 合并请求 URL 支持,并添加可选的 forward_user_identity 网关设置以按用户归因支出。
Run Qwen3.8 27B locally via Atomic Chat💥 We released Atomic Dynamic GGUF quants, from 8-bit (28.9 GB) down to 1-bit (8....
A selection of artwork from prompts by Gemini 3.7 Flash with Nano Banana 2 Lite.
2026年将成为开源与本地AI的里程碑之年。智谱GLM-5.3仅通过后训练提升,在CyberGym得分84.5%,超越Mythos 5的83.8%;Qwen3.8-27B可本地运行,多项关键基准超越Opus 4.6 Max;DeepSeek V4 Flash API价格低至每百万未缓存输入token $0.14、输出$0.28,接近“便宜到无法计量”。
So yeah, you can now run Opus 4.6 max locally. Just let that sink in.
作者担忧 AI 将使软件过于安全,导致美国情报与执法机构在未来两年内面临“隐身”困境——主要软件将耗尽可远程利用的漏洞。Anthropic 的 Mythos 模型已优化漏洞发现,OpenAI 及 Z.ai、Moonshot 等也展示了类似能力。这或将加剧对构建后门等“特殊访问”机制的需求。
Anthropic 官方发布 Claude Code 高效使用指南,帮助开发者降低 token 成本。核心建议包括:任务间运行 /clear 清除无关上下文、在会话开始前设置模型和 effort 级别以避免破坏提示缓存、用 @-mention 直接附加文件以节省 Read 调用。提示缓存读取成本仅为正常输入的 0.1 倍,输出 token 价格约为输入的 5 倍,缓存过期时间为 1 小时。
Z.ai 今日发布 GLM-5.3,目前仅限编程套餐使用,API 即将上线,两周后开源权重至 Hugging Face。该模型在多项基准上超越 Moonshot AI 的 Kimi K3,部分指标超过 Claude Fable 5 或 GPT-5.6-Sol,仅约 750B 参数,为 Kimi K3 的三分之一。
同一事件,精选展示《GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力》GLM 5.3 notes and why we should stop being so surprised about these very strong Chinese models (most of this is talking ...
llm-gemini 0.33 插件发布,新增对 Gemini 3.7 Flash、gemini-3.6-flash、gemini-3.5-flash-lite 以及 gemini-embedding-2 和 gemini-embedding-001 两个嵌入模型的支持。该插件已升级兼容 LLM 0.32,用户可查看推理轨迹,并可通过 -T CodeExecution 启用服务端工具。
Simon Willison 分享了一个为旧博客内容打标签的新思路:让模型先自由想象可能适合的标签,再用向量嵌入在现有 1,856 个标签中寻找最接近的具体标签。Doug Turnbull 提出了这一方案,其示例提示词会引导模型生成从未见过的新分类,再通过语义匹配映射到已有标签体系。
Qwen 3.8 27B beat Claude Opus 4.6 for $0 open-weights Qwen 3.8 27B on one rented GPU vs anthropic's Claude Opus 4.6. sam...
Anthropic 将推出水印检测 API,让第三方开发者能将 AI 文本检测集成到自有应用中。该水印基于 Google DeepMind 2024 年发表于 Nature 的 SynthID Text 方法变体,通过调整选词时的随机源留下可追踪模式,且不影响文本内容、创意性或可读性。
I got this question so many times today. "How can you grow 80% at $7B?" The true answer is that we're finally seeing a b...
Databricks 探讨在数据仓库中应用 AI_Functions 的主要场景,帮助组织在结构化数据之外处理非结构化数据。文章聚焦于如何通过该功能将 AI 能力直接集成到 SQL 工作流中,以扩展数据仓库的分析边界。具体用例与实现细节以原文为准。