内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态X · 16522 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
AYi@AYi_AInotes · 1小时前44

@ChatGPT 这次更新,我觉得有两个免费功能比付费的还香。 1️⃣互动测验:直接说"Quiz me on"加任何主题,它给你出可交互选择题,点完立刻判对错带解释。考 驾照、学Python、给小孩出恐龙题等等,这些,想练哪练哪,不用再下刷题App了😆 2️⃣餐厅预订更直接:大白话告诉它你想找什么样的,它去OpenTable、Resy、Yelp翻空位,选好在聊天里直接订。"今晚市中心两人吧台位日料",一句话搞定,还能追问"换个便宜点的"。 付费功能,Google Drive可以接进Library了,文件传一次一直在,Docs/Sheets/Slides并排看、直接改,不用反复上传。 首页建议也升级了,会按你的习惯推你可能想不到的用法。 我觉得测验和订餐厅这两个才是真正常用的--一个管脑子,一个管肚子,还都免费。 Drive接入对办公的人很值,首页建议算锦上添花。 现在打开就能试,先说"Quiz me on"加你最近在学的东西就行。 https://x.com/adamhfry/status/2088349344248537250/video/1

译ChatGPT 本周更新推出两项免费功能:输入"Quiz me on 【主题】"即可生成交互式选择题测验,点选后即时判对错并附解释;用大白话描述餐厅需求,可经 OpenTable、Resy、Yelp 查空位并直接在聊天中预订。付费用户可将 Google Drive 文件接入 Library,Docs/Sheets/Slides 并排查看编辑,首页建议也按使用习惯升级。

AYi@AYi_AInotes · 27分钟前36

我这套用Fable 5 打磨的AI生图焚决的含金量还在上升,直接看片吧, 以下是用@grok 生成的, 原图和所有提示词我全部开源, 你们可以拿去跟seedance对比一下

译博主用Claude Fable 5总结出AI生图"焚决",并开源全部提示词供对比Grok生成效果。核心技法包括以"成人+气质+材质"定人设、用服装剪裁与面料质感替代直白描述、以表情瞬间和镜头语言强化质感,并强调"克制的性感"与强负面词约束。博主还提醒需使用干净的住宅IP以避免风控。

gabriel@gabriel1 · 1小时前15

mamma mia i have never tried to explained ai to someone outside sf before we are not early, it literally has not even started

译天哪,我从未尝试向旧金山以外的人解释过AI。 我们并不算早,这甚至还没真正开始。

gabriel@gabriel1 · 57分钟前23

me: *getting increasingly lost in abstractions and excitement about the future of work with ai* them: "so... is it like a desktop application that i install?"

译我:*在关于AI未来工作的抽象概念和兴奋感中越来越迷失* 对方:"所以……它就像是我安装的桌面应用程序吗?" 【引用 @gabriel1】:天哪,我从来没在旧金山以外的地方跟人解释过AI 我们不是太早了,这根本还没开始

gabriel@gabriel1 · 54分钟前22

gdp will skyrocket, i can see why 4x leverage is tempting

译GDP将飙升,我能理解为什么4倍杠杆如此诱人

gabriel@gabriel1 · 44分钟前27

50% of work on computers can be carried out by telling a computer in like 6 months, just a culture question at that point context, human intuition, and edge cases will not be solved so people will focus solely on the non-clicking parts of the task & reviewing

译大约6个月内,50%的电脑工作可以通过直接告诉电脑来完成,到那时这只是一个文化问题。 上下文、人类直觉和边缘情况无法被解决,因此人们将只专注于任务中非点击的部分以及审查工作。

Chubby♨️@kimmonismus · 46分钟前43

OpenAI is no longer primarily a consumer business. OpenAI entered the year with a 60/40 consumer-enterprise revenue split. Just months later, those lines have crossed. The company now makes most revenue from enterprise business.

译OpenAI 不再主要是一家消费者业务公司。 OpenAI 年初时消费者与企业收入比例为 60/40。仅仅几个月后,这两条线已经交叉。 该公司现在大部分收入来自企业业务。

Runway@runwayml · 1小时前44

Seedance 2.5 in 1080p is now live on Runway. Early access starts today, bringing sharper detail at higher resolution. Get started at the link below.

译Seedance 2.5 1080p 现已上线 Runway。今日起开放抢先体验,以更高分辨率呈现更锐利的细节。 点击下方链接即可开始使用。

AYi@AYi_AInotes · 2小时前58

Uber 联合创始人兼前 CEO,Travis Kalanick @travisk 消失了八年。 所有人都觉得他是被Uber赶出去后躲起来舔伤口, 但实际上他没有,他在默默的努力建一个新的帝国。 @a16z 发了一段他和@horowitz_b 的炉边谈话,他在里面解释自己为什么沉默了八年。 表面原因是媒体,十年前传统媒体九成是负面的,商业变成了政治,流血才上头条。 他说当年自己像在俄罗斯做资本家,只能隐身建设,避免纽约时报左右他的决策。 他感谢@elonmusk 买了@X ,说建设者终于可以直接说话了。 但这些都是铺垫, 真正的重点是他这八年建了什么。 CloudKitchens大家可能听过,幽灵厨房,疫情期间火过一阵。 但那只是冰山一角,他把这些年攒下的资产整合成了一家公司,叫Atoms,工业AI,Physical AI。 a16z领投17亿美元,Ben Horowitz说这是他这辈子写过最大的一张支票, 亲自进了董事会,Uber自己也参投了。 Atoms的逻辑一句话讲完: 制造是CPU,房地产是存储,物流是网络。 软件世界把比特的效率革命做完了,现在要把同一套逻辑搬到原子世界。 他不做那种通用人形机器人,只做特定有正式工作的机器人。 Atoms Food做食品生产,Atoms Mining做采矿,Atoms Transport做物流底盘。 全是最脏最累最重的活,全是GDP里最大头的行业。 所有人卷大模型参数和机器人跳舞的时候,他选了矿山和厨房。 这才是八年沉默的真正原因, 不是受伤,是主动选择的差异化策略。 在软件时代,公开融资公开招聘公开发声是优势, 但在重资产、长周期、监管重的物理世界,过早暴露就是靶子。 媒体攻击,监管提前介入,对手抄你,人才被挖。 他用八年建起了真实运营数据、真实资产、真实组织能力,然后带着17亿美元和既成事实重新出现。 因为隐身本身就是护城河, 这个男人上一次创业重新定义了城市交通, 这次他想重构整个物理世界的生产方式。 他说早期靠复仇燃料撑着,后来重新爱上了建设,脏燃料烧完了,剩下的是干净的野心。 我只想说,我们这八年没白等。

译Uber 联合创始人 Travis Kalanick 沉寂八年后携工业 AI 公司 Atoms 回归,a16z 领投 17 亿美元,Ben Horowitz 称这是其最大一笔支票并加入董事会。Atoms 聚焦食品、采矿、物流等重资产行业,不做通用人形机器人。Kalanick 称隐身是差异化策略,并感谢 Elon Musk 收购 X 让建设者能直接发声。

Tibo@thsottiaux · 1小时前8

What's a hard problem codex solved for you this week? Where do you learn from others on how to push the frontier?

译本周 Codex 为你解决了什么难题?你从哪里向他人学习如何突破前沿?

赵纯想@chunxiangai · 1小时前14

图 1 融了 1200 万美元。 图 2 融 1 美元都费劲。

WorkBuddy@WorkBuddy_AI · 2小时前18

We're going live tomorrow! Tune in for the Tencent Cloud Hackathon "Age Well" Social Good Challenge Demo Day, live from Singapore. August 16 | 1:30 PM (SGT) Watch it live right here on X.

译我们明天上线! 敬请收看腾讯云黑客松"乐龄"社会公益挑战赛Demo Day,新加坡现场直播。 8月16日 | 下午1:30(新加坡时间)就在X平台观看直播。

Tibo@thsottiaux · 2小时前37

Looking for a quick restaurant reservation is now super easy in ChatGPT. Together with a bunch more ships

译ChatGPT 本周(8 月 14 日)推出多项新功能,包括自动生成测验、餐厅预订搜索,以及面向付费用户的 Google Drive 文件接入和首页建议。用户可直接用自然语言描述需求(如"找一家有户外露台的餐厅"),系统即可返回预订结果。

Greg Brockman@gdb · 2小时前38

try reservation search in chatgpt!

译ChatGPT 推出订位搜索功能,用户可直接用自然语言描述需求(如"下周六两人、带户外露台的餐厅")来查找订位。该功能是 8 月 14 日 ChatGPT 功能更新的一部分,同批还包括 Quiz 测验、Google Drive 文件接入(付费用户)及首页建议(付费用户)。

DogeDesigner@cb_doge · 2小时前35

Update your Grok app to v1.4.24 from the App Store now 🚀 The new update adds a Projects section to help organize your work. Build is also now on the home screen, just swipe between Ask, Imagine, and Build.

译立即从 App Store 将你的 Grok 应用更新至 v1.4.24 🚀 新更新新增了 Projects 板块,帮助你整理工作内容。 Build 现在也出现在主屏幕上,只需在 Ask、Imagine 和 Build 之间滑动切换即可。

Peter Steinberger 🦞@steipete · 2小时前53

Added a short instruction to our shared AGENTS MD file to upload videos to each PR that changes UI state. https://github.com/openclaw/openclaw/pull/124013

译我们在共享的 AGENTS MD 文件中添加了一条简短说明,要求每个更改 UI 状态的 PR 上传视频。https://github.com/openclaw/openclaw/pull/124013

Elon Musk@elonmusk · 2小时前23

Grok 4.6 runs The Gauntlet

译Grok 4.6 运行 The Gauntlet 事实证明 Grok 强大到足以运行 Gauntlet Loops。 让游戏制作开始吧!

Peter Steinberger 🦞@steipete · 3小时前20

We moved the team over to build openclaw with openclaw. Being able to share agent sessions as URLs is a superpower.

译我们把团队迁移到了用 OpenClaw 来构建 OpenClaw。能够把智能体会话作为 URL 分享,是一种超能力。

Qwen@Alibaba_Qwen · 4小时前45

Qwen3.8-27B is now part of your everyday life - from smartphones to vehicles. ⚡️🚀Appreciate your work! @MediaTek

译通义千问 Qwen3.8-27B 正式落地日常终端,联发科宣布为其提供 Day-0 支持。该支持覆盖 Dimensity Auto Cockpit C-X1 及最新旗舰移动 SoC,将端侧 AI 体验从智能手机扩展至车载场景,推动智能体 AI 无缝融入日常生活。

Qwen@Alibaba_Qwen · 3小时前50

Laptop-size model, frontier-size leap. 🏃♀️Qwen3.8-27B is live on LM Studio. Try it! @lmstudio

译笔记本级模型,前沿级飞跃。🏃♀️Qwen3.8-27B 已在 LM Studio 上线。试试吧!@lmstudio

Qwen@Alibaba_Qwen · 4小时前31

Ready right now! 😎Incredible to see Qwen3.8-27B fly on RTX Spark. Download, deploy and create somthing new. @NVIDIARTXSpark

译即刻可用!😎 见证 Qwen3.8-27B 在 RTX Spark 上飞速运行,令人惊叹。下载、部署并创造新事物。@NVIDIARTXSpark

AYi@AYi_AInotes · 4小时前同事件54

Qwen3.8-27B有点牛逼, 把接近Opus的能力, 塞进一张消费级显卡,这是掀桌子了?! 一张24G的卡就能本地跑Claude Opus 4.6了,完全私有🤯! 相当于把Opus级别的编码能力塞进一张大家都用得起的RTX 5090卡上, 200 tok/s,编码能力直接超过Opus 4.6, 咱们先看数字, SWE-bench Pro 61.7,Claude Opus 4.6 Max 53.4。 OSWorld 84.3,Opus 72.7。 编码和Agent能力,这个27B的开源模型打赢了曾经的闭源巅峰模型, 纯推理还有差距,GPQA和HLE落后,但编码、工具调用、操作电脑,这是大多数人每天用AI干的事。 200 tok/s什么概念? SGLang加NVFP4加投机解码,单卡5090实测206 tok/s。 比你读字快,比大多数API响应快,而且跑在你自己机器上。 没网络延迟,没token计费,数据不出门。 门槛极低, Q4量化权重17到18GB,一张24GB的卡就够。 二手3090一千多美元,Q4跑40到70 tok/s,写代码完全够用。 4090更快,5090 32GB是消费级天花板,Q6/Q8随便上,长上下文不慌。 M4 Pro 48GB也能跑,安静省电,就是慢点。 跑法很简单, LM Studio或Ollama,等GGUF量化包出来点一下就行。 追求速度上SGLang,Day-0就支持了。 Unsloth已经发了量化版,Hugging Face和ModelScope直接下。

译Qwen3.8-27B 开源模型发布,27B 参数即可在单张 24GB 消费级显卡本地运行,编码与 Agent 能力超越 Claude Opus 4.6(SWE-bench Pro 61.7 vs 53.4,OSWorld 84.3 vs 72.7)。

AYi@AYi_AInotes · 5小时前61

@OpenAI 最近很动荡啊,9位核心人物,从4月到现在陆续离开了, 分别是Sora负责人,科学VP,B2B的CTO,CMO,首席未来学家,安全系统负责人,唯一专职伦理学家,前CFO/COO,首席营收官。 九个人的公开理由我都看了,没有一个是因为跟Sam吵架或者公司要完之类的。。。 最扎眼的是商业侧: 1️⃣Brad Lightcap(Y Combinator 出身,CFO→COO,8年) 2️⃣Denise Dresser(前Slack CEO,CRO,仅8个月) 时间线很干净: 8月10日公司用自己的钱完成 $7B 员工回购(估值 $8520 亿,无外部投资者参与) 11日 Lightcap 宣布离开 13日 Dresser 离开 安全与伦理侧也不少: Josh Achiam(首席未来学家,近9年)、Johannes Heidecke(Safety Systems)、Chloe Bakalar(唯一专职伦理,没人接替) 产品侧:Sora 的 Bill Peebles、OpenAI for Science 的 Kevin Weil 等。 总结一下,实际是分了三波: 4月走的是产品和研究侧,加上应用负责人Fidji Simo开始病休。 7月走的是安全和伦理侧,三个人,一个没剩。 8月这波最狠,70亿回购完成第二天,前COO Brad Lightcap宣布离开。 两天后,上任仅八个月的CRO也走了。 单独看每个人都有理由, 癌症,家庭,项目重组,想创业,使命可以在墙外继续,都听起来合理。 但合在一起,有两个细节需要推敲: 第一个是回购的钱谁出的。 这次70亿美元员工股份回购,OpenAI自己掏的钱,按8520亿估值,没有外部投资者参与。 之前的回购都有Thrive、软银这些外部资金进场背书价格。 这次没有,公司自己定价自己买,内部人兑现了,但没有外部人在这个价位接盘。 然后回购完成第二天,最懂公司账目的前CFO/COO走了。 第二个是走的都是什么人。 安全系统负责人走的时候,安全团队被并进研究侧,由研究的人统一管。 唯一专职伦理学家走了,公司没找人替,回应说伦理已经嵌入各团队。 嵌入各团队,翻译成人话就是没有专人盯着了。 首席未来学家走的时候说,世界已经知道秘密了,他可以在墙外继续使命。 做安全的人,做伦理的人,想长远的人,在公司冲刺商业化的阶段全走了。 留下的是做产品的,做营收的,和Greg Brockman。 我觉得这不是公司要垮的叙事,收入在涨,企业采用率在涨,模型能力在涨,这些都是真的。 更像是典型的冲刺IPO前的清理加聚焦加兑现, 砍掉长线项目,把安全伦理塞进业务线,让老人在招股书公开前兑现离场,换上更能打商业化的新人。 核心问题只有一个, 招股书会第一次把经审计的财务数据摊开。 按帖子算的账,月入约20亿美元,但每赚1美元亏1.22美元。 8520亿估值没有外部买家背书, 关键决策者在数据公开之前,做了自己的选择。 他们知道的应该比我们对吧。 以上不构成投资建议。 #OpenAI

译OpenAI 自 4 月以来已有 9 位核心人物离职,覆盖产品、安全、伦理与商业侧,包括 Sora 负责人 Bill Peebles、安全系统负责人 Johannes Heidecke、唯一专职伦理学家 Chloe Bakalar、前 CFO/COO Brad Lightcap 及上任仅 8 个月的 CRO Denise Dresser。

Greg Brockman@gdb · 5小时前20

hedonic treadmill of model expectations

译模型期望的享乐跑步机

Rohan Paul@rohanpaul_ai · 6小时前39

In a Shenzhen logistics factory, humanoid robots are fully in operation. they grasp, flip, and place varied parcels onto moving belts. Peak throughput reaches 1,200 packages per hour per unit. At the Longhua postal sorting center in Shenzhen, China.

译在深圳一家物流工厂,人形机器人已全面投入运营。 它们抓取、翻转并将各类包裹放到传送带上。单台峰值吞吐量达每小时 1,200 件。地点:中国深圳龙华邮政分拣中心。

Artificial Analysis@ArtificialAnlys · 5小时前65

DeepSeek V4 Pro 0813 scores 53 on the Artificial Analysis Intelligence Index, 8 points above April's DeepSeek V4 Pro - but with a 3.6x price increase and only 1 point above DeepSeek V4 Flash 0731 @deepseek_ai has released DeepSeek V4 Pro 0813, its new flagship model, along with updated pricing. With the new pricing, it still sits on our Pareto frontier for Intelligence vs. Cost, but by a smaller margin than previous DeepSeek releases. Under the new pricing, DeepSeek's first-party API will charge $1.32 / 1M input tokens and $3.96 / 1M output tokens - an increase of +264% on the blended price. Cached input tokens receive a ~97% discount (rather than the previous 99%): cache hits are priced at $0.044 / 1M tokens, 12x higher than previous cache-hit pricing. Off-peak pricing is discounted by 50%. This new pricing takes effect on August 16, 2026 - until then DeepSeek is offering V4 Pro 0813 at the same pricing as the earlier V4 Pro model. DeepSeek published the model weights under the MIT license, making it the second most intelligent open weights model we have benchmarked; however, weights for Qwen3.8 2.4T A95B have recently been released and will be evaluated on the Intelligence Index soon. DeepSeek V4 Pro 0813 remains 7 points behind Kimi K3, the current open weights leader. DeepSeek V4 Pro 0813 retains the previous version's architecture at 1.6T total parameters and 49B active parameters, with a context window of 1M tokens. Most of DeepSeek V4 Pro 0813's gains over the April version are in agentic capabilities. DeepSeek V4 Pro 0813 is more token efficient than its predecessor, generating ~30% fewer total output tokens across Artificial Analysis Intelligence Index. Key results: ➤ DeepSeek V4 Pro 0813 is only 1 point ahead of DeepSeek V4 Flash 0731 on the Artificial Analysis Intelligence Index, and has ~3.8x the active parameters. The two models tie on Terminal-Bench 2.1 at 79%. For agentic and coding benchmarks the smaller model performed at around the same level. ➤ DeepSeek V4 Pro 0813 is more token efficient than DeepSeek V4 Pro, using 128M output tokens to run the Intelligence Index, ~30% fewer than the April version. This places DeepSeek V4 Pro 0813 on the open weights Pareto frontier for intelligence versus output tokens, with fewer tokens used than Kimi K3 (133M) and GLM-5.2 (141M). However, it lags behind many frontier models in its intelligence tier. GPT-5.6 Sol scores 61 on the Intelligence Index but only uses 70M tokens in total. ➤ Cost per Task increases significantly despite an improvement in token usage, driven by DeepSeek's price increase. At $0.25, DeepSeek V4 Pro 0813's Cost per Task is 5x that of DeepSeek V4 Pro ($0.05), but ~20% lower than GLM-5.2 ($0.32 Cost per Task). Despite the increase in price, DeepSeek V4 Pro 0813 still sits on the Intelligence vs. Cost per Task Pareto frontier, but barely - it is just one cent below Gemini 3.7 Flash (medium) on Cost per Task. ➤ DeepSeek V4 Pro 0813 makes significant improvements in real-world agentic knowledge work. On GDPval-AA v2 its Elo improved to 1590, +284 points from DeepSeek V4 Pro (1306), which implies an ~84% expected win rate against the April release. Its GDPval-AA v2 Elo is ahead of earlier-generation proprietary models like Claude Opus 4.7 and GPT-5.5, but it trails Kimi K3. DeepSeek V4 Pro 0813 works for longer on GDPval tasks than before, averaging 39 turns per GDPval-AA task compared to 23 for the April model. ➤ DeepSeek V4 Pro 0813 makes a 12 point improvement in AA-Omniscience, driven entirely by increases in accuracy. DeepSeek V4 Pro 0813 scores +1, up from -11 for DeepSeek V4 Pro. Its AA-Omniscience accuracy rises 6 points from 43% to 49%, while regressing slightly in hallucination rate from 94% to 95%. Compared to peer models, DeepSeek V4 Pro 0813 has a high attempt rate of ~99%, meaning it almost never declines to answer. By contrast, Kimi K3 attempts only 77% of questions and has a 53% hallucination rate. Additional model details: ➤ Context window: 1M tokens ➤ Weights: 1.6T total parameters; 49B active parameters ➤ License: MIT ➤ Accessibility: Accessible through DeepSeek first-party API at launch ➤ Pricing: On DeepSeek's first-party API, updated pricing will take effect on August 16 at $1.32 / 1M input tokens and $3.96 / 1M output tokens. Cached input tokens receive a 97% discount, priced at $0.044 / 1M tokens. Off-peak pricing is discounted by 50%.

译DeepSeek 发布旗舰模型 V4 Pro 0813,在 Artificial Analysis 智能指数得 53 分,较 4 月版高 8 分,但仅比 V4 Flash 0731 高 1 分。

Elon Musk@elonmusk · 5小时前37

Grok 4.6 now in Copilot

译Grok 4.6 现已登陆 Copilot。

SemiAnalysis@SemiAnalysis_ · 6小时前47

What's the next country to blow up? Our Datacenter Model subscribers got the answer back in February: India. Scaling to just under 10GW by 2030, India enters the top 4 global datacenter markets! All the AI Labs and hyperscalers are itching for capacity. (1/3)🧵

译下一个爆发的国家是哪个?我们的数据中心模型订阅用户在二月份就得到了答案:印度。到2030年规模将接近10GW,印度进入全球前四大数据中心市场!所有AI实验室和超大规模云厂商都在急切寻求算力容量。(1/3)🧵

Rohan Paul@rohanpaul_ai · 6小时前40

Anthropic models may be cheaper to use than some large open-source Chinese models, per a new study by AlphaSense. It says Kimi is substantially cheaper per token than GPT-5.6 Sol, yet more expensive per completed question because it consumes many more tokens while assembling context. The real unit of cost is not $/token, but tokens-to-completion × token price. A more expensive model that searches efficiently, stops at the right time, and reasons over a smaller, cleaner context can have a lower total inference bill. "Token efficiency" is really a systems property, not an API-pricing property. Kimi K3 can have cheaper tokens yet cost more per question because poor stopping behavior and repeated retrieval inflate context before useful reasoning even begins; in multi-step agents, that waste propagates into later steps, so a small retrieval inefficiency can become a much larger workflow-level tax. AlphaSense gets roughly a 3× cost reduction from changing retrieval around the same model, while task-level routing improves preference even further. So that means model vendors can keep leapfrogging each other without fully commoditizing the application layer, because whoever owns retrieval, routing, and evaluation decides which model is economically viable for each task.

译AlphaSense 新研究显示,Anthropic 模型使用成本可能低于部分大型开源中文模型。Kimi 每 token 价格远低于 GPT-5.6 Sol,但因组装上下文消耗更多 token,单题成本反而更高。真正成本单位是"完成 token 数 × token 价格",token 效率是系统属性而非 API 定价属性;AlphaSense 通过改变检索方式,在相同模型上实现约 3 倍成本降低。

ginobefun@hongming731 · 6小时前34

https://x.com/i/article/2088426893192421376 BestBlogs 早报 · 08-15|GLM-5.3 扩展编程与安全边界,循环工程和知识底座重写 Agent 协同 在线阅读本期早报 BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。 导语 当 Agent 从一次对话走向持续工作,真正难的并不是让它多运行几轮,而是回答三个逐层放大的问题:模型的能力到了哪里、一次任务怎样知道该停、团队又凭什么让不同 Agent 获得正确且持续更新的业务知识。今天的三篇精讲刚好落在这三个尺度上。 GLM-5.3 展示同一基座经过更大规模后训练后,编程能力怎样迁移到代码审查与漏洞发现;Addy Osmani 把长时工作拆成有界的 goal 与定时的 loop,并要求执行者之外再有独立验证;大淘宝技术则把视角拉到组织,指出单点编码提速无法自动消除需求、研发、运维与运营之间的人工接力。 这不是一条已经被证明的统一路线。模型跑分来自厂商口径,循环工程是实践经验,AI Native 团队仍是方向性框架。但把三者连起来读,可以得到一套更诚实的生产检查表:能力要分任务链条看,自治要先写完成和停止条件,组织改造则要先解决知识从哪里来、怎样保鲜、谁对例外负责。 ★ 精讲一:GLM-5.3:前沿编程能力与涌现的网络安全能力 来源:智谱 · BestBlogs 评分:93 GLM-5.3 最值得注意的地方,不是一个全新的基座模型,而是智谱称其在与 GLM-5.2 相同基座上,通过数十倍长程任务环境、更丰富的环境类型和更长后训练,把能力上界继续向外推。这个对照把「模型能力」拆成了两层:预训练决定基座拥有什么潜力,后训练则决定它能否在复杂环境中发现问题、操作工具、实施并验证。对工程团队而言,这意味着评估一次升级时,不能只问参数规模有没有变化,也要问训练任务是否更接近真实工作链路。 公开结果显示,GLM-5.3 在 Terminal-Bench 3.0 上由 4.6 提升到 28.3,在 DeepSWE v1.1 上由 46.2 提升到 66.9,在 Agents' Last Exam 上由 23.8 提升到 28.5。智谱自建的 Z.ai Code Bench 还报告,High 档位准确率为 31.4%,每项任务平均输出约 5 万 tokens;对照中的 Claude Opus 4.8 为 29.5% 和约 12 万 tokens。后面这组是厂商自测,不宜当作跨平台定论,但它提出了一个有用维度:长程 Agent 不仅要完成任务,还要看完成路径、token 利用和返工成本。 网络安全部分更需要分层读。CyberGym 从白盒源代码出发识别和验证漏洞,GLM-5.3 得分 84.5%,略高于文中列出的 Mythos 5 与 GPT-5.6 Sol;到了需要理解成因并完成利用的 ExploitBench,它得到 54.4%,虽比 GLM-5.2 的 24.4% 高出一倍多,却仍低于 Mythos 5 的 78.0% 与 GPT-5.6 Sol 的 76.5%。ExploitGym 的限时吞吐也呈现相同方向:进步明显,但完整利用链仍有差距。因而更准确的判断是,能力增量首先集中在代码审查、异常定位和漏洞验证的前半段,而不是已经获得不受约束的全链攻击能力。 智谱与合作安全团队还披露,自 GLM-5.2 发布以来累计发现 2,436 个经初筛和去重的漏洞,其中 1,097 个为中高危,覆盖 269 个项目;公开披露账本只展示已协调修复的细节,对仍在流程中的漏洞保留哈希。这里同时存在两种信息:一方面,长上下文、逆向分析和跨日志关联确实可能放大防守者的调查能力;另一方面,漏洞数量、经济价值与影响范围主要由厂商及合作方报告,尚不能替代独立复现与漏洞库的逐项确认。 开放权重因此不是普通的发布时间表。智谱计划在发布两周后、完成安全评估和加固后开放完整权重,并设计外层分类器、推理监控器和模型内部安全对齐的多层防护。需要区分的是,前两层依赖托管环境,权重离线部署后仍能保留的主要是模型内部对齐;而研究、防守、教学与恶意利用在字面上高度相似,安全系统能否根据意图和授权做准确分级,仍要接受持续红队检验。 读这篇发布时,最有用的不是记住一个总分,而是保留四个问题:模型在哪一段任务链上变强,评测由谁完成,漏洞如何负责任披露,权重开放后哪些控制仍然有效。GLM-5.3 给出了编程能力向安全能力迁移的强信号,也把同一个事实的另一面摆上台面:能力越接近真实环境,治理就越不能停留在 API 层的一次拒绝。 ★ 精讲二:实用循环工程 来源:Elevate · BestBlogs 评分:91 Addy Osmani 的核心贡献,是把容易被笼统称为「让 Agent 一直做下去」的工作拆成两种原语。goal 面向一个有界任务:给出可测量的终点,让 Agent 反复尝试,直到评估器确认条件满足或达到最大轮数。loop 面向不断变化的外部状态:按固定间隔重新检查日志、PR、Issue 或消息,再对新增情况采取动作。前者问「这件事做完了吗」,后者问「外部世界有没有发生需要处理的变化」。 这个区分会直接改变提示词。把「把页面优化好」交给 goal,评估器无法知道什么叫好;改成 Lighthouse 分数至少达到 92、LCP 低于 1.8 秒、不改变公开 API、连续两轮没有改善就中止,并限制最多 10 轮,系统才拥有可执行的完成条件和停机条件。评估器检查的是硬规则是否满足,不会自动判断视觉品味、架构是否简洁或改动是否值得,这也是为什么数字通过不等于作品优秀。 loop 则更像调度器。作者用定期检查 GitHub 新 Issue、汇总紧急程度,以及轮询 PR 评论和失败 CI 为例。它适合输入持续变化、动作模式稳定的工作;如果每次都需要重新理解模糊目标,定时触发只会稳定地产生不确定结果。goal 与 loop 可以组合:loop 发现带有 bug 标签的问题,goal 再负责把修复推进到本地测试通过。但组合越长,越需要明确权限、预算、失败退出和不可逆操作的人工确认。 文章里最重要的经验并不在命令本身,而在执行与验证分离。作者每天并行使用多个 Agent,但不会让完成工作的那个 Agent 同时裁定自己是否合格。一个 Agent 起草,另一个从不同维度验证,例如不仅测桌面性能,也检查移动端、浏览器控制台和真实交互。独立验证仍可能漏错,却能减少执行者围绕自己的路径自证成功,也更容易暴露规格里没有写出的盲区。 人类判断的边界同样具体。作者曾让 Agent 研究竞品并生成弥补差距的本地改动,研究看起来合理,实施却会给用户增加大量复杂性。问题不是任务没有完成,而是他差点把「是否值得做」一起委派出去。涉及审美、产品取舍、架构、安全、认证或财务的任务,即便有清晰规格,也需要更近距离复核;一个没有真实用户的绿地项目,与积累多年规则的银行代码库,也不该获得相同自治程度。 循环工程因此不是把监督从流程里删除,而是把监督写进流程。实用顺序可以很朴素:先选一个结果可客观验证的窄任务,定义成功、失败与停止,再决定是一次 goal 还是周期 loop;把验证交给独立角色,保留人对风险和价值的判断;最后才扩大并行度。若同一命令第三次执行仍没有比第二次产生变化,那不是坚持,而是系统正在原地旋转。 ★ 精讲三:重构协同:关于 AI Native 团队的思考 来源:大淘宝技术 · BestBlogs 评分:92 大淘宝技术这篇文章把一个常见误区说得很直接:编码变快,不等于业务交付链路同比例变快。需求从业务传给产品,产品转成方案,研发再翻代码与历史决策,测试、发布、运维、客服和运营继续靠人同步上下文。若这些接力仍由会议、群聊、表单和手工录入完成,在某个节点增加 AI 助手,只是旧流程中的局部加速。 作者由此区分 AI 辅助与 AI Native。前者保留「人是串联者」的流程骨架,后者尝试让 Agent 承担传递、判断与衔接,再围绕这个前提重建生产侧。消费侧的终点仍然是人,变化主要发生在交互;生产侧却是技术塑造出来的组织形式,表单、报表、审批流和大量内部系统,本来就是为了帮助人完成串联。当串联者变化,这些软件不会一夜消失,但其中等待人点下一步的环节需要重新审视。 文章设想的理想业务单元有三层:底层是业务规则、流程、领域知识和数据构成的知识底座;中间是按知识范围、工具权限和风险边界拆分的专业 Agent;上层是定方向、做判断、处理例外并把新知识沉淀回去的人。运维 Agent 可以读取代码并调用诊断工具,内部答疑 Agent 可以暴露更具体的定位,外部客服 Agent 则需要不同知识范围与表达规范。拆分的理由不是角色命名,而是权限、上下文与出错代价确实不同。 这里最有启发的判断是「软件是被固化的知识」。业务规则和流程可以被 Agent 动态解释,但确定性、性能、成本、安全与合规审计仍要求其中一部分固化成产品规则和代码。AI Coding 只是把知识固化成软件的一段流程;真正的上游是知识是否准确、边界是否清楚,以及新决策能否回到权威来源。因此,交付物未来可能同时包含软件、可供 Agent 使用的知识与 Skill,而不是只交一套界面。 困难主要落在存量业务。关键规则往往散在代码、配置、数据、旧文档和资深成员脑中,字段和系统边界还保留历次组织变化的痕迹。文章提出一个可靠原则:凡是能从代码、配置和数据自动生成或校验的知识,不要改由人手维护;越接近人的经验与例外,越要设计专门的外化和确认机制。知识是否能自治,很大程度取决于它离权威事实来源有多近。 底座的范围也是现实约束。划得太大,规则和流程难以收敛;划得太小,Agent 一执行就跨出边界,又退回人去对接。知识还必须能「活下去」:如果更新只依赖某位架构师的责任心,文档终会再次脱离代码。自动提取、变更检测、人工确认、版本追踪和权限审计,都是比一次性整理更重要的持续机制。 作者明确承认,公司内尚未出现成熟的最佳实践,所以这套三层结构不应被当作已经验证的组织因果模型。它更像一个诊断框架:当 AI 提效停滞时,先看瓶颈是否其实位于隐性知识和跨角色协同;当准备部署 Agent 时,先问它使用什么权威知识、能调用什么工具、谁处理不确定答案。Agent 能跑多远,最终受限于团队把自身业务讲清楚并持续校正的能力。 速览 开放模型现状:2026 年夏季观察 来源:Hugging Face - Blog · BestBlogs 评分:91 __XPOSTER_otgvz_IMAGE_4__ Hugging Face 用 2026 年前七个月的 Hub 数据,分别观察发布规模、下载、点赞、许可、衍生模型、本地运行格式和 Agent 流量。报告显示,开放模型的注意力中心向中国实验室移动,但美国硬件与基础设施公司仍通过模型发布和转换参与生态。 最能纠正直觉的数据是,下载前 25 与点赞前 25 的仓库只有一个重合:点赞反映发布时的关注,下载更像已经嵌入稳定管线的依赖。Qwen 在 Hub 上形成 151,448 个衍生模型,而小于 1B 的模型仍占声明规模模型历史下载量的 83%。 Hub 数据不包含私有部署、外部 API 和其他分发渠道,不能直接等同于质量、市场份额或商业采用。阅读时应把「谁获得注意」「谁被持续调用」「谁成为社区基础设施」分开判断。 网页自动化的暗黑技法:让智能体像人一样使用网站 来源:AI Engineer · BestBlogs 评分:90 __XPOSTER_otgvz_IMAGE_5__ Corey Gallon 把网页自动化设计成「感知-行动-验证」循环:先读 DOM、可访问性树、网络或截图,做一个动作,再用不同信号确认结果,而不是让一次点击自己证明成功。 他的三层梯子从便宜的页面 API 与合成事件开始,必要时升级到 CDP trusted input,只有确实需要时才使用视觉和更接近人类的输入轨迹。最终系统由确定性代码高速驱动浏览器,Agent 只承担图像判断,避免每次点击都经过模型往返。 演示包含绕过反自动化挑战的双重用途技术,作者也强调只在自有基础设施和自有账户上运行。可复用的工程结论是缩小模型参与范围,而不是把规避网站控制当作默认能力;真实部署必须先满足授权、服务条款和合规要求。 计算机使用智能体评测:别让可重放轨迹伪装成能力 来源:AI Engineer · BestBlogs 评分:89 确定性的计算机使用基准可能让模型记住并重放固定操作轨迹,在界面略有变化时却无法适应。这样的高分测到的是对测试环境的熟悉,而非在真实桌面上恢复和调整的能力。 研究建议引入环境变体、结果级验证和更可靠的不确定性估计,让智能体不能只靠固定坐标或步骤序列过关。评测还要区分任务最终成功与中间轨迹看起来相似,避免把测试泄漏包装成泛化。 它提醒团队在部署前主动改变窗口、数据和交互路径,并观察失败后的恢复,而不是只复跑公开基准。变体测试不能覆盖所有真实环境,但比单一可重放轨迹更接近实际风险。 dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步 来源:小红书技术REDtech · BestBlogs 评分:88 REDtech 发布 280B 参数多模态模型 dots3-note Preview,同时给出 TEMPO 长程强化学习方法,以及 VibeSearchBench 与 VibeLifeBench 两套面向真实生活任务的评测。 这组发布把模型、训练方法和任务环境放在一起:长程智能体不仅需要一次回答正确,还要在搜索、生活决策和多步骤执行中维持目标、处理反馈并完成验证。 Preview 表明的是研究方向和初步能力,不等同于已经成熟的生产服务。更值得观察的是后续开放材料、评测可复现性,以及模型在失败恢复和安全交接上的表现。 34K Star 的 DeepTutor,不只是 AI 家教:它在做一套 Agent 学习操作系统 来源:山行AI · BestBlogs 评分:91 DeepTutor 把统一 Agent Loop、RAG、Skills、外部 Agent 和三层长期记忆组合在一起,目标不是回答一道题,而是让学习任务能够跨会话延续,并复用此前形成的知识与过程。 架构上的信息增量在于,资料检索、工具调用、任务计划和记忆不再是孤立功能,而是围绕学习状态持续更新。外部 Agent 与 Skill 也提供扩展入口,使系统能接入不同学科与工作流。 34K Star 说明项目获得广泛关注,却不能替代教学效果、错误率和隐私安全评估。准备采用时,应重点检查记忆怎样纠错、来源怎样追溯,以及长期记录是否真的改善学习而非积累误解。 守护前沿:JetBrains 如何评估并部署 Claude Fable 5 来源:Claude Blog · BestBlogs 评分:91 JetBrains 没有只依据公共榜单选择 Claude Fable 5,而是把模型放入私有代码库的真实任务中,评估准确性、完成步骤、推理效率与部署适配。 案例同时讨论安全套件、白盒测试与数据保留,说明企业评估的对象不仅是模型回答,还包括它接触什么代码、留下什么数据、怎样进入已有开发流程。 这是供应商发布的客户案例,结果不能自动外推到其他代码库。可复用的方法是建立自己的任务集与风险门,并把质量、效率和数据治理放在同一张评估表里。 分享一些 insights | 我们为什么会做 dLLM,又能否取代 AR? 来源:青稞AI · BestBlogs 评分:89 离散扩散语言模型尝试用并行生成挑战逐 token 的自回归路线,潜在优势是允许多个位置共同修订,而不是把所有生成都锁在从左到右的单一路径上。 文章同时解释,并行并不自动带来质量与速度优势:生成调度、迭代步数、训练目标和长文本一致性都会限制实际收益,现有工具与推理生态也主要围绕 AR 构建。 因此 dLLM 更适合被理解为另一种生成与计算权衡,而不是已经确定的替代者。判断其位置要看具体任务的延迟、质量和可控性,而不是只比较理论并行度。 补充阅读 X 开源「为你」算法,披露详细评分机制 来源:Elon Musk(@elonmusk) · BestBlogs 评分:92 X 开源 For You 排序算法,公开帖子评分与互动权重,让外界可以更具体地讨论推荐系统怎样组合候选和反馈;代码透明仍不等于线上数据、实验配置与实际运行完全透明。 Unify 如何在两周内将 AI 智能体成本降低 95% 来源:LangChain · BestBlogs 评分:90 Unify 把 Agent 架构当作经济系统,通过缓存、评测纪律和工具调用优化,将运行成本降低约 90% 至 95%;这是团队案例,适合借鉴诊断顺序,不宜机械套用降本比例。 科技爱好者周刊(第 408 期): 你需要知道的 AI 缓存知识 来源:阮一峰的网络日志 · BestBlogs 评分:91 本期周刊解释大模型输入 Token 缓存怎样影响延迟与价格,帮助读者理解为什么稳定前缀、上下文排列和缓存命中率会成为 Agent 成本设计的一部分。 InstEmb:面向 Oxygen AIIC 商品知识表征的未来感知指令嵌入 来源:京东技术 · BestBlogs 评分:88 京东 InstEmb 用可学习的 look-ahead tokens 自蒸馏未来输出语义,让一次前向得到更符合指令的混合表示,并在多个检索与句向量基准上超过文中强基线。 从 DeepSeek、Kimi 到"黄仁勋联盟":AI 模型开源,到底"开"了什么? 来源:硅谷101 · BestBlogs 评分:90 文章区分开放权重与训练代码、数据、许可和治理都开放的完整开源,并借中美生态说明「可下载」背后仍有不同商业模式与安全取舍。 ChatGPT 中的 Computer History 来源:OpenAI · BestBlogs 评分:88 ChatGPT macOS 客户端的 Computer History 记录交互事件形成跨任务记忆,使助手能理解不同应用中的工作连续性,也把用户控制、敏感信息范围和记忆纠错推到产品中心。 CaaS 崛起:为 Agent 构建可复用的上下文服务 来源:AI Engineer · BestBlogs 评分:88 CaaS 把重复知识工作需要的结构化 Web 上下文沉淀为可复用服务,适用于数据新鲜度和提取逻辑值得长期维护的场景,而非所有一次性检索都要另建平台。 Cursor 收购 Firetiger:构建可投入生产的 AI 智能体 来源:Cursor(@cursor_ai) · BestBlogs 评分:90 Cursor 宣布收购 Firetiger,继续建设能够处理生产工作流并自主解决问题的 Agent;真正的产品增量仍要看整合后的权限、可观察性和故障恢复能力。 LTX-2.5 开源:22B 音画生成模型,原生多镜头、自动时长与 4K HDR 来源:魔搭ModelScope社区 · BestBlogs 评分:87 Lightricks 开放 22B 参数 LTX-2.5 权重,新增原生多镜头、自动时长预测与 4K HDR,并同时提供适合微调的 Dev 和固定 8 步推理的 Distilled 版本。 计算机使用模型将让网页走向智能体化,而非等待 API 普及 来源:AI Engineer · BestBlogs 评分:90 Dhruv Batra 判断,长尾网站很难等到统一 API 覆盖,计算机使用模型会直接操作面向人的界面;这扩大了可达范围,也要求更严格的授权、验证和失败恢复。 延伸探索 今天的补充区可以按三条线继续读。模型与开源一侧包括 DeepSeek-V4-Pro、Gemini 3.7 Flash、Grok 4.6、模型路由和 Claude Code 成本;Agent 工程一侧集中在企业 Harness、DeepSeek Harness、多智能体交易研究、网页运行框架和安全电脑操作,能继续补足「循环如何获得上下文、工具与评测」的问题。 另一条线把视角拉到组织与产品:WorkBuddy 的 AI 原生资料库、游戏开发者对执行提速的反思、Google 开发者大会,以及实体产业的软件化,都在讨论同一个边界--执行更快之后,知识、判断、基础设施和业务闭环是否同步改变。可把这些材料作为三篇精讲的对照,而不必逐条追赶所有发布。 今日阅读路径 如果只有 15 分钟,先读「实用循环工程」,把 goal、loop、验证者和停止条件变成可立即使用的工作框架;再读 GLM-5.3 的网络安全部分,练习按审查、验证和利用链分层理解模型能力;最后读 AI Native 团队的知识底座章节,把个人工作流放回组织协同中检查。 读完可以追问两个问题:你正在委派的是任务,还是连价值判断也一起委派了?团队最依赖的业务规则,究竟锚定在代码、配置、数据,还是仍只存在于某个人的记忆里?欢迎打开原文继续阅读,也把你的实践和疑问留在评论区。 👉 近期早报 • BestBlogs 早报 · 2026-08-14 • BestBlogs 早报 · 2026-08-13 • BestBlogs 早报 · 2026-08-12 • BestBlogs.dev 第 108 期:智能的执行层 • BestBlogs.dev 第 107 期:个人 AGI • BestBlogs.dev 第 106 期:1% 法则 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

译智谱发布 GLM-5.3,基于与 GLM-5.2 相同基座经更长后训练,在 Terminal-Bench 3.0 上由 4.6 提升至 28.3,DeepSWE v1.1 上由 46.2 提升至 66.9;网络安全方面,CyberGym 得分 84.5%,ExploitBench 为 54.4%,仍低于 Mythos 5 的 78.0%。

ginobefun@hongming731 · 6小时前35

BestBlogs 早报 · 08-15 GLM-5.3 网络安全 / 循环工程 / AI Native 团队 / 开放模型生态 / 浏览器智能体 [1] ★ 精讲|GLM-5.3:前沿编程能力与涌现的网络安全能力 GLM-5.3 在不更换基座模型的前提下,通过扩大长程任务环境和后训练规模,同时提升编程与网络安全能力。文章既给出终端、软件工程和漏洞评测的分层结果,也说明完整权重将在安全加固后开放,读者可据此区分模型的防御潜力、攻击边界与厂商自测口径。 来源:智谱 https://www.bestblogs.dev/article/85fc103869 [2] ★ 精讲|实用循环工程 Addy Osmani 把长时 Agent 工作拆成两种原语:goal 用可测量的完成条件推进有界任务,loop 按时间重复检查外部状态。更关键的经验是让独立 Agent 验证产出,并把审美、架构与安全判断留给人;这为并行代理从演示走向日常工程提供了可复用边界。 作者:Addy Osmani · 发布:Elevate https://www.bestblogs.dev/article/a273df4de3 [3] ★ 精讲|重构协同:关于 AI Native 团队的思考 大淘宝技术把 AI 提效停滞归因于协同仍由人串联,而不只是编码速度不够。作者设想以知识底座、分工 Agent 和人形成业务闭环:Agent 执行与传递,人负责目标、判断和例外。对存量团队而言,真正难点是把隐性规则外化,并让知识持续贴近代码、配置与数据等权威来源。 来源:大淘宝技术 https://www.bestblogs.dev/article/bf2bf5c18b [4] 开放模型现状:2026 年夏季观察 Hugging Face 的半年期生态报告显示,中国实验室在顶尖开放模型发布上占据主导地位,Qwen 以 151K 个衍生模型成为社区基础模型;报告还首次单列可识别的 Agent 流量,并披露不同编程工具在其中的份额。 来源:Hugging Face - Blog https://www.bestblogs.dev/article/e17db794cd [5] 网页自动化的暗黑技法:让智能体像人一样使用网站 [视频] 一场聚焦浏览器智能体工程实践的演讲:用 CLI 工作流和 Chrome DevTools Protocol 驱动网页,再以分级闭环让 AI 只处理感知与推理。 来源:AI Engineer https://www.bestblogs.dev/video/3b05f2b5b [6] 计算机使用智能体评测:别让可重放轨迹伪装成能力 [视频] 这场研究分享指出,确定性的计算机使用基准可能奖励可重放的操作轨迹而非具备适应力的智能体,并提出通过环境变体、可验证性与更稳健的不确定性估计来修正评测。 来源:AI Engineer https://www.bestblogs.dev/video/50b28fb31 [7] dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步 REDtech 开源 280B 参数的多模态模型 dots3-note Preview,并提出 TEMPO 方法提升长程强化学习,同时发布 VibeSearchBench 与 VibeLifeBench 两套真实生活评测基准。 来源:小红书技术 REDtech https://www.bestblogs.dev/article/005a2ed0f8 [8] 34K Star 的 DeepTutor,不只是 AI 家教:它在做一套 Agent 学习操作系统 本文深度解析开源项目 DeepTutor,揭示其作为 Agent 学习操作系统的核心架构:统一 Agent Loop、RAG、Skills、外部 Agent 与三层长期记忆,实现学习任务的连续性与知识的可复用性,并详细介绍其功能模块、扩展能力与适用场景。 来源:山行 AI https://www.bestblogs.dev/article/cb7d304be8 [9] 守护前沿:JetBrains 如何评估并部署 Claude Fable 5 JetBrains 首席技术官 Vladislav Tankov 分享公司如何评估并部署 Claude Fable 5,强调其在真实编码任务中的卓越准确性、效率和推理能力,同时考虑安全性和数据保留。 来源:Claude Blog https://www.bestblogs.dev/article/68885056c4 [10] 分享一些 insights | 我们为什么会做 dLLM,又能否取代 AR? 本文深度探讨离散扩散语言模型(dLLM)的发展现状、技术特性与局限性,分析其与自回归模型(AR)的差异、并行生成的理论边界,并展望其在未来模型生态中的定位与潜在应用场景。 来源:青稞 AI https://www.bestblogs.dev/article/6fdc8d78d2 --- http://BestBlogs.dev · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://www.bestblogs.dev/explore/brief/2026-08-15

译智谱发布 GLM-5.3,在不更换基座模型的前提下,通过扩大长程任务环境和后训练规模,同时提升编程与网络安全能力。文章给出终端、软件工程和漏洞评测的分层结果,完整权重将在安全加固后开放。

Rohan Paul@rohanpaul_ai · 6小时前50

Nvidia disclosed 122.8M SpaceX shares, i.e. around $21B stake. The position traces back to Nvidia's investment in xAI, whose shareholders received SpaceX equity when SpaceX acquired the AI company. SpaceX is simultaneously becoming a large Nvidia customer, with Musk saying its data centers will be built exclusively on Nvidia and compute capacity could approach 10GW by end-2027. To note, Alphabet (Google) also is hugely exposed to SpaceX on both sides of the transaction. Google has agreed to pay SpaceX $920M per month for access to roughly 110,000 Nvidia GPUs, while Alphabet itself owns about $94.1B of SpaceX at June-end, so Google can outsource the infrastructure risk while Alphabet still participates in the economics of the supplier. AMD is in a strangely asymmetric position. It owns SpaceX equity (3.31M shares, worth about $565.5M at June-end), yet SpaceX has committed its future data-center buildout to Nvidia, so AMD can participate in SpaceX's valuation upside while Nvidia captures the accelerator revenue.

译英伟达披露持有SpaceX 1.228亿股,价值约210亿美元,源于其投资xAI后因SpaceX收购xAI而获得股权。SpaceX同时成为英伟达大客户,马斯克称其数据中心将独家采用英伟达,算力容量到2027年底或接近10GW。

Rohan Paul@rohanpaul_ai · 6小时前58

Reuters: The U.S. is getting ready to force a choice on multiple countries in the AI race against China. Nations that join Beijing's AI framework would lose access to the U.S.-led Pax Silica initiative, according to an internal draft letter obtained by Reuters. The draft says Pax Silica membership cannot coexist with competing initiatives. Pax Silica links AI models to semiconductors, critical minerals, investment and export controls, so membership can affect far more than model access. Countries that want American chips and capital while using Chinese open-weight models would face a much harder balancing act.

译据路透社获取的内部信函草案,美国准备迫使多国在中美AI竞赛中做出选择:加入北京AI框架的国家将失去参与美国主导的Pax Silica计划的资格。草案称Pax Silica成员资格不能与竞争性倡议共存,该计划将AI模型与半导体、关键矿产、投资及出口管制挂钩,影响远超模型获取。想同时获得美国芯片和资本、又使用中国开源权重模型的国家将面临更艰难的平衡。

DogeDesigner@cb_doge · 7小时前58

BREAKING: Nvidia is reportedly cutting its planned guarantee for OpenAI's massive Ohio data center from $250B to under $120B The 10 GW project is being developed by SoftBank's SB Energy. OpenAI still wants the full 10 GW, but Nvidia wants only half the exposure.

译突发:据报道,英伟达计划将其对OpenAI俄亥俄州大型数据中心的担保从2500亿美元削减至不足1200亿美元。 该10吉瓦项目由软银旗下SB Energy开发。OpenAI仍希望获得全部10吉瓦容量,但英伟达只愿承担一半的风险敞口。

gabriel@gabriel1 · 7小时前14

i have a vision of the future how i think people will do their work in 3 years

译我对未来有一个愿景,关于我认为三年后人们将如何工作。

Rohan Paul@rohanpaul_ai · 7小时前42

So GLM-5.3 has already found a "potentially serious vulnerability" in Cursor. GLM-5.3's CyberGym score rose to 84.5%, while ExploitBench more than doubled from 24.4% to 54.4%. Shows how much more performance a frontier-scale base model can deliver without going through another costly pretraining run. "Scaling post-training is all we did for GLM-5.3," Z .ai said in its technical announcement.

译GLM-5.3 在复杂逆向工程任务中发现 Cursor 存在潜在严重漏洞,已私下披露并正与 Cursor 团队合作修复。其 CyberGym 安全测试得分升至 84.5%,ExploitBench 得分从 24.4% 翻倍至 54.4%。智谱称 GLM-5.3 仅通过扩展后训练实现性能提升,未进行额外预训练。

Rohan Paul@rohanpaul_ai · 7小时前47

Meta's new paper, the dangerous failure mode is not just a wrong judge, but a correct judge that can be persuaded into becoming wrong. We are increasingly using AI models to judge other AI models. But what if the AI being judged can simply argue with the judge until the judge changes its decision? Meta tested exactly that. Across 9 frontier models, an adversarial LLM could flip judge verdicts on 62-91% of tested cases under sustained adaptive persuasion. And changing the judge's mind usually didn't fix a mistake. It made the judgment worse: under the adaptive attack, 70% of successful flips moved away from the ground truth. That creates a very practical problem for agent systems. If one AI is supervising another AI, the supervised agent may eventually be able to contest, negotiate with, or strategically persuade its own evaluator. - arxiv. org/abs/2608.12645

译Meta 新论文揭示 AI 评审系统的危险失败模式:被评审的 AI 可通过持续自适应说服,在 9 个前沿模型上翻转 62-91% 的评审判决。更严重的是,改判通常不是修正错误--70% 的成功翻转反而偏离了真实答案,对智能体监督体系构成实际威胁。

Rohan Paul@rohanpaul_ai · 7小时前51

WSJ reports that Nvidia is cutting its proposed OpenAI data-center guarantee from $250B to below $120B, reducing its initial balance-sheet exposure. The revised backstop would cover only the first roughly 5GW of a planned 10GW Ohio campus. So basically, Nvidia is converting a single enormous guarantee into a staged financing decision where the first 5GW can serve as evidence for whether the remaining 5GW deserves more capital. OpenAI is still negotiating a binding lease for the full 10GW, so the project's physical ambition has not been reduced. The guarantee is meant to support the lease and debt financing, giving lenders more confidence in the project's funding and potentially lowering borrowing costs. Staging the commitment would let Nvidia reassess the project before deciding whether to support financing for the remaining 5GW.

译据 WSJ 报道,英伟达将拟议的 OpenAI 数据中心担保从 2500 亿美元削减至 1200 亿美元以下,以降低其初始资产负债表风险敞口。修订后的担保仅覆盖计划中 10GW 俄亥俄园区的前约 5GW,英伟达将分阶段决策,以首批 5GW 作为评估剩余 5GW 是否值得追加资本的依据。OpenAI 仍在就全部 10GW 的具有约束力租约进行谈判,项目物理规模未缩减。

赵纯想@chunxiangai · 7小时前37

DSH 凭一己之力把"自进化"的提议转移到软件运行时自进化了。自进化这个词被彻底矮化了。一个月前它还描述的是:模型层面的自进化。醒醒,一个臭软件不需要运行时改变自己的组件。如果需要,你告诉我它变来变去是想干什么?是为了应对场景中突发的需求?求你了,固定版本的软件已经可以把人送上月球了。

译赵纯想批评"自进化"一词被滥用,从原本指模型层面的自进化,矮化为软件运行时自我修改组件。他认为固定版本软件已足够可靠,运行时变来变去缺乏明确目的,质疑其应对突发需求的必要性。

🚨 AI News | TestingCatalog@testingcatalog · 8小时前52

ICYMI 👀: Grok for iOS now supports Projects feature. Users can create and edit projects, as well as create new chats within them. Bridging gaps 🤖

译别错过 👀:Grok iOS 版现已支持 Projects 功能。用户可以在其中创建和编辑项目,并在项目内新建聊天。 弥合差距 🤖

已加载 40 条
全部 AI 动态
2026年8月15日星期六 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
推文 · 16522 条清除

8月15日

星期六 · 40 条
15:21
AYi@AYi_AInotes
AI 评分 44/100
ChatGPT 免费测验与订餐厅功能实测

ChatGPT 本周更新推出两项免费功能:输入“Quiz me on [主题]”即可生成交互式选择题测验,点选后即时判对错并附解释;用大白话描述餐厅需求,可经 OpenTable、Resy、Yelp 查空位并直接在聊天中预订。付费用户可将 Google Drive 文件接入 Library,Docs/Sheets/Slides 并排查看编辑,首页建议也按使用习惯升级。

Adam Fry: This week's ChatGPT feature drop - Aug 14: 1/ Quizzes - "Quiz me on [topic]" will now automatically generate quizzes rig...

OpenAI产品更新搜索
15:21
AYi@AYi_AInotes
AI 评分 36/100
博主用Claude Fable 5总结出AI生图"焚决",并开源全部提示词供对比Grok生成效果。核心技法包括以"成人+气质+材质"定人设、用服装剪裁与面料质感替代直白描述、以表情瞬间和镜头语言强化质感,并强调"克制的性感"与强负面词约束。博主还提醒需使用干净的住宅IP以避免风控。

AYi: 跟大家分享下绝版的Claude Fable 5总结的AI生图焚决,+2个顶级美女人像提示词,这篇至少值3000块! 昨晚睡前让Fable 5总结了AI生图之性感人像提示词最有效的写法: 1️⃣用"成人 + 气质 + 材质"来定人设,比如 2...

xAI图像生成教程/实践
14:53
gabriel@gabriel1
AI 评分 15/100
天哪,我从未尝试向旧金山以外的人解释过AI。我们并不算早,这甚至还没真正开始。
大佬观点现象/趋势
14:53
gabriel@gabriel1
AI 评分 23/100
我:*在关于AI未来工作的抽象概念和兴奋感中越来越迷失*对方:"所以……它就像是我安装的桌面应用程序吗?"【引用 @gabriel1】:天哪,我从来没在旧金山以外的地方跟人解释过AI我们不是太早了,这根本还没开始

gabriel: mamma mia i have never tried to explained ai to someone outside sf before we are not early, it literally has not even st...

其他现象/趋势
14:53
gabriel@gabriel1
AI 评分 22/100
GDP将飙升,我能理解为什么4倍杠杆如此诱人

gabriel: mamma mia i have never tried to explained ai to someone outside sf before we are not early, it literally has not even st...

OpenAI现象/趋势
14:53
gabriel@gabriel1
AI 评分 27/100
大约6个月内,50%的电脑工作可以通过直接告诉电脑来完成,到那时这只是一个文化问题。上下文、人类直觉和边缘情况无法被解决,因此人们将只专注于任务中非点击的部分以及审查工作。

gabriel: mamma mia i have never tried to explained ai to someone outside sf before we are not early, it literally has not even st...

智能体大佬观点
14:52
Chubby♨️@kimmonismus
AI 评分 43/100
OpenAI 不再主要是一家消费者业务公司。OpenAI 年初时消费者与企业收入比例为 60/40。仅仅几个月后,这两条线已经交叉。该公司现在大部分收入来自企业业务。
OpenAI现象/趋势
14:23
Runway@runwayml
AI 评分 44/100
Seedance 2.5 1080p 现已上线 Runway。今日起开放抢先体验,以更高分辨率呈现更锐利的细节。点击下方链接即可开始使用。
多模态模型发布视频
14:21
AYi@AYi_AInotes
AI 评分 58/100
Travis Kalanick 八年隐身建 Atoms,a16z 领投 17 亿美元

Uber 联合创始人 Travis Kalanick 沉寂八年后携工业 AI 公司 Atoms 回归,a16z 领投 17 亿美元,Ben Horowitz 称这是其最大一笔支票并加入董事会。Atoms 聚焦食品、采矿、物流等重资产行业,不做通用人形机器人。Kalanick 称隐身是差异化策略,并感谢 Elon Musk 收购 X 让建设者能直接发声。

a16z: Travis Kalanick says new media is why he's back after eight years of silence: "The media landscape 10 years ago, 90% of ...

具身智能大佬观点行业动态
14:03
Tibo@thsottiaux
AI 评分 8/100
本周 Codex 为你解决了什么难题?你从哪里向他人学习如何突破前沿?
OpenAI其他编码
14:03
赵纯想@chunxiangai
AI 评分 14/100
图 1 融了 1200 万美元。 图 2 融 1 美元都费劲。
其他现象/趋势
13:46
WorkBuddy@WorkBuddy_AI
AI 评分 18/100
我们明天上线!敬请收看腾讯云黑客松"乐龄"社会公益挑战赛Demo Day,新加坡现场直播。8月16日 | 下午1:30(新加坡时间)就在X平台观看直播。
其他行业动态
13:33
Tibo@thsottiaux
AI 评分 37/100
ChatGPT 本周(8 月 14 日)推出多项新功能,包括自动生成测验、餐厅预订搜索,以及面向付费用户的 Google Drive 文件接入和首页建议。用户可直接用自然语言描述需求(如"找一家有户外露台的餐厅"),系统即可返回预订结果。

Adam Fry: This week's ChatGPT feature drop - Aug 14: 1/ Quizzes - "Quiz me on [topic]" will now automatically generate quizzes rig...

OpenAI产品更新
13:23
Greg Brockman@gdb
AI 评分 38/100
ChatGPT 推出订位搜索功能,用户可直接用自然语言描述需求(如"下周六两人、带户外露台的餐厅")来查找订位。该功能是 8 月 14 日 ChatGPT 功能更新的一部分,同批还包括 Quiz 测验、Google Drive 文件接入(付费用户)及首页建议(付费用户)。

Adam Fry: This week's ChatGPT feature drop - Aug 14: 1/ Quizzes - "Quiz me on [topic]" will now automatically generate quizzes rig...

OpenAI产品更新搜索
13:22
DogeDesigner@cb_doge
AI 评分 35/100
立即从 App Store 将你的 Grok 应用更新至 v1.4.24 🚀新更新新增了 Projects 板块,帮助你整理工作内容。Build 现在也出现在主屏幕上,只需在 Ask、Imagine 和 Build 之间滑动切换即可。
xAI产品更新
12:53
Peter Steinberger 🦞@steipete
AI 评分 53/100
我们在共享的 AGENTS MD 文件中添加了一条简短说明,要求每个更改 UI 状态的 PR 上传视频。https://github.com/openclaw/openclaw/pull/124013
智能体教程/实践编码
12:52
Elon Musk@elonmusk
AI 评分 23/100
Grok 4.6 运行 The Gauntlet事实证明 Grok 强大到足以运行 Gauntlet Loops。让游戏制作开始吧!

Matt Shumer: Grok 4.6 worked non-stop for 48 hours to build this shooter. Turns out Grok is powerful enough to run Gauntlet Loops. Le...

xAI其他编码
11:53
Peter Steinberger 🦞@steipete
AI 评分 20/100
我们把团队迁移到了用 OpenClaw 来构建 OpenClaw。能够把智能体会话作为 URL 分享,是一种超能力。
智能体产品更新编码
11:53
Qwen@Alibaba_Qwen
AI 评分 45/100
通义千问 Qwen3.8-27B 正式落地日常终端,联发科宣布为其提供 Day-0 支持。该支持覆盖 Dimensity Auto Cockpit C-X1 及最新旗舰移动 SoC,将端侧 AI 体验从智能手机扩展至车载场景,推动智能体 AI 无缝融入日常生活。

MediaTek: Congratulations to the @Alibaba_Qwen on the launch of Qwen 3.8! MediaTek continues our long-standing collaboration with ...

智能体端侧行业动态
11:53
Qwen@Alibaba_Qwen
AI 评分 50/100
笔记本级模型,前沿级飞跃。🏃♀️Qwen3.8-27B 已在 LM Studio 上线。试试吧!@lmstudio

LM Studio: Qwen3.8-27B is here! 🚀 It's a leap in capabilities for a laptop size model. Requires ~17GB to run locally. Model page: ...

模型发布端侧
11:23
Qwen@Alibaba_Qwen
AI 评分 31/100
即刻可用!😎 见证 Qwen3.8-27B 在 RTX Spark 上飞速运行,令人惊叹。下载、部署并创造新事物。@NVIDIARTXSpark

NVIDIA RTX Spark: Ready to run Qwen3.8 locally? 👀 Qwen3.8-27B packs powerful AI into an open model developers can download, serve locally...

开源生态行业动态部署/工程
11:21
AYi@AYi_AInotes同事件
AI 评分 54/100
Qwen3.8-27B 开源,单卡跑赢 Opus 4.6

Qwen3.8-27B 开源模型发布,27B 参数即可在单张 24GB 消费级显卡本地运行,编码与 Agent 能力超越 Claude Opus 4.6(SWE-bench Pro 61.7 vs 53.4,OSWorld 84.3 vs 72.7)。

Qwen: We promised open weights for Qwen3.8. Now, time to meet them! 🎉 ⚡ Qwen3.8-27B: - A native multimodal dense model. With ...

Hugging Face模型发布端侧编码
同一事件,精选展示《通义千问开源 Qwen3.8 系列模型》
10:21
AYi@AYi_AInotes
AI 评分 61/100
OpenAI 9 位核心高管数月内相继离职

OpenAI 自 4 月以来已有 9 位核心人物离职,覆盖产品、安全、伦理与商业侧,包括 Sora 负责人 Bill Peebles、安全系统负责人 Johannes Heidecke、唯一专职伦理学家 Chloe Bakalar、前 CFO/COO Brad Lightcap 及上任仅 8 个月的 CRO Denise Dresser。

OpenAI安全/对齐现象/趋势
09:53
Greg Brockman@gdb
AI 评分 20/100
模型期望的享乐跑步机
OpenAI大佬观点
09:52
Rohan Paul@rohanpaul_ai
AI 评分 39/100
在深圳一家物流工厂,人形机器人已全面投入运营。它们抓取、翻转并将各类包裹放到传送带上。单台峰值吞吐量达每小时 1,200 件。地点:中国深圳龙华邮政分拣中心。
具身智能行业动态
09:52
Artificial Analysis@ArtificialAnlys
AI 评分 65/100
DeepSeek V4 Pro 0813 发布:涨价 264%,智能仅微升

DeepSeek 发布旗舰模型 V4 Pro 0813,在 Artificial Analysis 智能指数得 53 分,较 4 月版高 8 分,但仅比 V4 Flash 0731 高 1 分。

智能体DeepSeek推理模型发布
09:52
Elon Musk@elonmusk
AI 评分 37/100
Grok 4.6 现已登陆 Copilot。

Grok: Grok 4.6 is now available in GitHub Copilot. Try it out in the GitHub Copilot CLI, IDE, and cloud products! https://x.ai...

GitHubxAI产品更新编码
09:22
SemiAnalysis@SemiAnalysis_
AI 评分 47/100
下一个爆发的国家是哪个?我们的数据中心模型订阅用户在二月份就得到了答案:印度。到2030年规模将接近10GW,印度进入全球前四大数据中心市场!所有AI实验室和超大规模云厂商都在急切寻求算力容量。(1/3)🧵
现象/趋势部署/工程
09:22
Rohan Paul@rohanpaul_ai
AI 评分 40/100
AlphaSense:Kimi 每 token 更便宜但单题成本更高

AlphaSense 新研究显示,Anthropic 模型使用成本可能低于部分大型开源中文模型。Kimi 每 token 价格远低于 GPT-5.6 Sol,但因组装上下文消耗更多 token,单题成本反而更高。真正成本单位是“完成 token 数 × token 价格”,token 效率是系统属性而非 API 定价属性;AlphaSense 通过改变检索方式,在相同模型上实现约 3 倍成本降低。

智能体Anthropic推理现象/趋势
09:05
ginobefun@hongming731
AI 评分 34/100
GLM-5.3 扩展编程与安全边界,循环工程重写 Agent 协同

智谱发布 GLM-5.3,基于与 GLM-5.2 相同基座经更长后训练,在 Terminal-Bench 3.0 上由 4.6 提升至 28.3,DeepSWE v1.1 上由 46.2 提升至 66.9;网络安全方面,CyberGym 得分 84.5%,ExploitBench 为 54.4%,仍低于 Mythos 5 的 78.0%。

智能体开源生态现象/趋势
09:05
ginobefun@hongming731
AI 评分 35/100
GLM-5.3 发布:编程与网络安全能力双提升

智谱发布 GLM-5.3,在不更换基座模型的前提下,通过扩大长程任务环境和后训练规模,同时提升编程与网络安全能力。文章给出终端、软件工程和漏洞评测的分层结果,完整权重将在安全加固后开放。

ginobefun: https://x.com/i/article/2088426893192421376

智能体AnthropicHugging Face开源生态
08:52
Rohan Paul@rohanpaul_ai
AI 评分 50/100
英伟达披露持有SpaceX约210亿美元股份,SpaceX数据中心将独家采用英伟达

英伟达披露持有SpaceX 1.228亿股,价值约210亿美元,源于其投资xAI后因SpaceX收购xAI而获得股权。SpaceX同时成为英伟达大客户,马斯克称其数据中心将独家采用英伟达,算力容量到2027年底或接近10GW。

GooglexAI现象/趋势部署/工程
08:52
Rohan Paul@rohanpaul_ai
AI 评分 58/100
美国拟强制各国在AI竞赛中选边站队

据路透社获取的内部信函草案,美国准备迫使多国在中美AI竞赛中做出选择:加入北京AI框架的国家将失去参与美国主导的Pax Silica计划的资格。草案称Pax Silica成员资格不能与竞争性倡议共存,该计划将AI模型与半导体、关键矿产、投资及出口管制挂钩,影响远超模型获取。想同时获得美国芯片和资本、又使用中国开源权重模型的国家将面临更艰难的平衡。

开源生态政策/监管
08:52
DogeDesigner@cb_doge
AI 评分 58/100
突发:据报道,英伟达计划将其对OpenAI俄亥俄州大型数据中心的担保从2500亿美元削减至不足1200亿美元。该10吉瓦项目由软银旗下SB Energy开发。OpenAI仍希望获得全部10吉瓦容量,但英伟达只愿承担一半的风险敞口。
OpenAI行业动态部署/工程
08:22
gabriel@gabriel1
AI 评分 14/100
我对未来有一个愿景,关于我认为三年后人们将如何工作。
智能体大佬观点
08:22
Rohan Paul@rohanpaul_ai
AI 评分 42/100
GLM-5.3 在复杂逆向工程任务中发现 Cursor 存在潜在严重漏洞,已私下披露并正与 Cursor 团队合作修复。其 CyberGym 安全测试得分升至 84.5%,ExploitBench 得分从 24.4% 翻倍至 54.4%。智谱称 GLM-5.3 仅通过扩展后训练实现性能提升,未进行额外预训练。

Lou: We gave GLM-5.3 a complex reverse-engineering task. It found a potentially serious vulnerability in Cursor. We disclosed...

安全/对齐编码
08:22
Rohan Paul@rohanpaul_ai
AI 评分 47/100
Meta 研究:AI 评审可被说服改判,70% 偏离真相

Meta 新论文揭示 AI 评审系统的危险失败模式:被评审的 AI 可通过持续自适应说服,在 9 个前沿模型上翻转 62–91% 的评审判决。更严重的是,改判通常不是修正错误——70% 的成功翻转反而偏离了真实答案,对智能体监督体系构成实际威胁。

智能体Meta安全/对齐论文/研究
08:22
Rohan Paul@rohanpaul_ai
AI 评分 51/100
英伟达将 OpenAI 数据中心担保削减至 1200 亿美元以下

据 WSJ 报道,英伟达将拟议的 OpenAI 数据中心担保从 2500 亿美元削减至 1200 亿美元以下,以降低其初始资产负债表风险敞口。修订后的担保仅覆盖计划中 10GW 俄亥俄园区的前约 5GW,英伟达将分阶段决策,以首批 5GW 作为评估剩余 5GW 是否值得追加资本的依据。OpenAI 仍在就全部 10GW 的具有约束力租约进行谈判,项目物理规模未缩减。

OpenAI行业动态
08:03
赵纯想@chunxiangai
AI 评分 37/100
自进化被矮化:从模型到软件运行时

赵纯想批评“自进化”一词被滥用,从原本指模型层面的自进化,矮化为软件运行时自我修改组件。他认为固定版本软件已足够可靠,运行时变来变去缺乏明确目的,质疑其应对突发需求的必要性。

现象/趋势部署/工程
07:53
🚨 AI News | TestingCatalog@testingcatalog
AI 评分 52/100
别错过 👀:Grok iOS 版现已支持 Projects 功能。用户可以在其中创建和编辑项目,并在项目内新建聊天。弥合差距 🤖
xAI产品更新
已加载 40 条