https://x.com/i/article/2089145885611655168
BestBlogs 早报 · 08-17|设计师焦虑源于期望不清,RAG 需要持久知识层,Kalanick 谈实体自动化方法论
在线阅读本期早报
BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。
导语
Lenny 连续两年做科技行业情绪调研,最新一期结果里,设计师和用户研究员在每个维度上都垫底:最焦虑、最疲惫、最不乐观、也最不可能把入行推荐给别人。OpenAI 产品设计负责人 Ian Silber 在这期播客里给出的不是一个安慰,而是一个具体诊断——焦虑来自角色期望不清,而不是机会消失。
今天三条精讲彼此独立。除了 Silber 的诊断与 OpenAI 的双速节奏,一篇长文为 RAG 系统设计持久化的知识层,把文档矛盾建成显式对象;David Senra 的长访谈则把 Travis Kalanick 的方法论讲成可复述的框架,从与滴滴的补贴战一直谈到做专用机器人。三篇的受众与背景各不相同,各自成立。
精讲之外,Qwen 3.8 27B 的默认设置、Claude 文本水印、API 成本五策略等七条速览与十条快讯可按需选读。前几期连续跟踪的 DeepSeek Harness 与 GLM-5.3,今天在快讯和补充阅读里仍有后续,30 条补充内容则按主题簇放在延伸探索里。
★ 精讲一:AI 时代,设计师为何焦虑却拥有更大行动空间
来源:Lenny's Podcast · BestBlogs 评分:92
这期播客的起点是一份让设计师群体很难舒服的数据。Lenny 的职场情绪调研显示,设计师与用研在每个维度上都最不快乐:最焦虑、最疲惫、最不乐观、最不可能推荐入行。Silber 的回应没有停留在情绪层面,他把问题拆到了机制层面。
他的诊断是角色期望不清。逐字稿里他说得很直接:「we're unclear right now what is expected of a designer」。他引用 OpenAI 的内部调研:「engineers have 10 or sometimes like 100x their productivity, but our design team hasn't」——工程师的生产力提升了 10 倍乃至 100 倍,设计团队没有。
不对称的机制值得展开。编码 Agent 的产出越来越接近二元成功,写完、跑通、合并;而设计工作的试错、用户反馈与跨团队对齐仍然要人花时间,AI 暂时压缩不掉这部分成本。节奏的落差让「设计师该做什么」失去焦点,焦虑由此而来。
OpenAI 的双速节奏是这条诊断的参照系。Silber 透露,有的功能「we try 100 things, we throw out 99」,上线前要试 100 个方案、扔掉 99 个;另一些项目从想法到上线只要约 4 小时。他把它归结为打磨与公开学习之间的平衡——不同性质的功能适用不同的节奏。他的应对之一是把公司当研究实验室,奖励好奇心与探索,而不是给团队规定一套新的工作流程。
另一个策略是 do less:能用既有系统组件就不新设计,把稀缺的设计投入集中在不会因技术变化而作废的耐久处。Lenny 在访谈里补充了调研的另一面:约一半受访者认为自己正处职业最佳期,与之相关性最强的因素是 feel amplified by AI——被 AI 放大的人,状态明显更好。
把这两个策略放回他的总判断——这是做设计师的最好时代。理由不是需求变少,而是探索变便宜:AI 扩大了创意上的行动空间,好奇心比一套规定好的新流程更值得奖励。访谈后半段谈到 AI 产品的设计原则时,他把落点放在交互模型、信任与用户控制上——模型在变,界面的责任没有变。
两位同行的判断可以对照着听。嘉宾 Jenny Wen 在另一期里说,传统的原型、视觉稿、测试、调研、迭代流程已经没有时间走完,角色要转向大方向规划;Anthropic 设计负责人 Joel Loenstein 的问题是如何在 ChatGPT 现有十亿月活与创新冲动之间找平衡,Silber 用 capability overhang 回答——多数用户只取到产品真实价值的一小角。在他看来,这恰恰说明界面工作没有贬值:真实价值还没有被用户取用完。
访谈还覆盖了团队与品味:招聘时看什么、设计手艺如何与工程和研究协作、团队在强力工具下如何形成判断。谈到设计工具的未来,他的判断是原型与生产的边界在消失,但品味、实验精神与对人的理解仍是设计的中心。
边界也要交代清楚。情绪调研是 Lenny 自办调查,样本口径与方法在访谈中没有展开;10 倍、100 倍来自 OpenAI 内部感受而非系统测量;他的乐观基于 OpenAI 的实验文化,不宜外推为行业普遍的工作方式。按 Silber 的判断,反馈与对齐能力反而让今天才入行的人占先机——旧流程的惯性更少。
★ 精讲二:设计一种持久化的知识层,拒绝随意猜测
来源:Towards Data Science · BestBlogs 评分:91
作者长期运营一套 RAG 系统,发现一个被普遍忽视的架构事实:每次问答之后,推理成果即被丢弃。第二天有人问相关的问题,系统从零开始做同样的检索与推理,成本照付,却不保证得到同样的结论。语义缓存能省一部分钱,但他给它的定义很清醒:「It caches answers, not understanding」——缓存的是答案,不是理解。
在他看来这是架构问题而不是检索问题:标准 RAG 系统里没有一个让理解积累的地方。文章据此提出证据、知识、编排三层架构,知识层把三类东西建成持久化对象——带理由与适用范围的决策、矛盾、开放问题。
矛盾对象的设计最有辨识度:遇到文档互相矛盾,正确行为是显式记录冲突并拒绝作答,而不是让模型悄悄选最近的那份文档。理由可以压缩成一句话:「Recency is not applicability」——更新的文档未必更适用。
治理机制同样具体。原始文档始终是引用、争议与新上传的最强证据,知识页永远不是源、必须可追溯到源;写入知识按风险分级,模型只提案补丁,重大变更需要人批准;来源不可追溯的对象应当删除而非修正。编排层先做生效日期检查再检索,出口处的矛盾检查是一道闸门。
值得强调的是这套设计不绑定厂商。作者把第一部分明确写成 vendor-neutral:换成 AWS、GCP,或者用 Postgres 加 pgvector 配本地模型,层次与对象模型照样成立;Azure 实现只是他给出的可克隆版本,失败模式与治理要求才是这个模式的本体。
全部设计在 21 份合成保险文档(虚拟保险公司 Ostermere Mutual)上以 Azure 加 gpt-5-mini 实测。成本模型按 50 份文档、1,000 次提问计:编译预付 501,000 tokens,查询期节省 4,275,000 tokens,约 117 次提问回本。实测全量摄取约 0.20-0.30 美元;wiki 上下文约 500 tokens,对证据上下文约 1,750 tokens,3.5 倍。
一个反直觉的中间结论来自实体归一:不做归一时机器抽出 149 个概念对象,人工整理只有 19 个,约 7 倍碎片化。机器读得快,但收敛世界这件事仍然需要人。演示部分给了三个走查场景,作者挑的都是纯检索系统真正做不到的事,而不是常见的问答对照。
边界与适用范围作者自己写得很清楚:语料是合成的且只有 21 份;语料小且查询稀少、用户只要精确查原文、文档翻新快于综合的保鲜期、没有跨会话知识值得沉淀——这四种场景不该建这套架构。回本点依赖 4.4 倍上下文比的模型假设,实测 3.5 倍更保守、会把回本推后。
这个设计接近 Karpathy 草拟的 LLM Wiki 模式,与经典 RAG 是补位而非替代。与速览里「模型故意变得更笨」一篇对照着看更有意思:模型侧在把世界知识移出权重,架构侧在重建持久知识层,一减一增,指向的都是知识存放位置的选择。动手之前先算自己的账:提问规模能不能撑过属于你的回本点。
★ 精讲三:Travis Kalanick:从难题到组织能力的实体自动化之路
来源:David Senra · BestBlogs 评分:91
Kalanick 在这期访谈里把创业的元问题写成一个不等式:问题解决速度对时间的导数,必须不小于问题产生速度的导数。失衡时的正确动作是暂停制造新问题,而不是加速解题。他把管理容量称为想象力的唯一约束——扩张决策等价于预判新问题性质与自身解题容量的方程。
新公司因此没有走人形机器人的热闹路线。Atoms(冻结标题里的 Adams 是同一名字的转写变体)做专用机器人,一次改造一个行业,切入点是他在云厨房业务里看见的物流、仓储、配送与叉车等实体劳动成本。
中国市场的回忆是全篇信息量最高的部分。按单量计算,Uber 当时的前十城市一度全在中国,他的原话是「probably our top 10 cities were all Chinese cities」。他特意强调口径是单量而非收入——中国单均两三美元,美国十三到十五美元。进入中国也不只是搬运营手册:地图、基础设施、竞争与运营条件都要求团队在当地重新学习和建设业务。补贴战的强度则是「we were spending, let's say, tens of millions of dollars a month fighting DD」,每月数千万美元对耗滴滴。
结局同样具体:「instead of giving up 50% we gave up I think it was 7%」——让出约 7% 的股权换来本地伙伴,而不是外界想象的对半让步。他自己的措辞里带着 I think,这是记忆性口述的诚实标记。
补贴战的胜负手在他看来是网络效应带来的单位效率:规模更大则系统更高效,对手必须补贴更多才能维持。因此比的是注册、完单、司机引导的全链路效率,而不是补贴总额——判断成本优势、避免被规模化补贴拖垮,靠的是这条链路上的效率信号。
融资是另一套可复述的方法论:「Five rooms, 12 hours, one week」。五个房间按支票规模分层——2.5 亿美元以上、1 亿、5,000 万、2,500 万——并行拍卖做价格发现;先出低价让市场向上发现价格,执着于过程设计而非心理价位。
访谈里对监管的观察是理解这些决策的上下文:他认为西方民主下的进步只在政客受到威胁时发生,而中国的进步必须与稳定协调。这套判断直接关系到他与中国伙伴的相处方式,也是 7% 换信任的底层逻辑。
访谈的另一条线是扩张的代价。他反思快速扩张期的组织文化与董事会关系,也谈到创业者要在速度、后果与内在平静之间校准;他对卓越的定义很朴素——承受痛苦、持续解决困难问题的能力。这些内容与元问题不等式互为表里:知道何时暂停制造新问题,本身就是组织能力。
边界必须交代:全篇是访谈自述,中国市场的数字没有第三方财报或文献佐证;能找到的外部来源是第三方转载的转写与 AI 生成的单集摘要,都不能当作逐字稿核验——Signalcast 记录了这期单集 2026-08-16 发布,并提炼出同一个元问题框架,可作发布时间与主题的旁证;方法论本身属于幸存者叙事,没有失败对照。补充阅读里 a16z 领投 17 亿美元给 Atoms 的报道,正好补上同一战略的外部视角。
速览
Qwen 3.8 27B 表现出色,但默认设置下存在严重的过度思考问题
来源:Simon Willison's Weblog · BestBlogs 评分:91
Simon Willison 的实测从一张 SVG 开始:让 Qwen 3.8 27B 画一只骑自行车的鹈鹕,默认设置下模型花了 21 分钟、消耗 22,276 个推理 token,最终输出只有 3,223 个 token。这款 Apache 2 许可的 27B 视觉模型能力本身出色,问题出在出厂默认的 reasoning_effort 为 xhigh,带来严重的过度思考。
对照数据同样来自原文:同一提示词关闭推理后,3,715 个 token、137 秒完成,但图形质量明显下降;官方自报基准超过 Qwen 3.6 27B 与闭源的 Qwen 3.7-Plus,他也提示这类自报数字值得等独立基准检验。他用 128GB MacBook 与 DGX Spark 跑 17GB 量化版验证日常可用性。
27B 是笔记本可以本地跑的体量,默认档位直接决定大量普通用户的第一印象。他的建议是先用 low 档或干脆关闭推理,再按任务需要上调——推理强度已经成为一个需要手动管理的参数。
AI Agent 优化陷阱:BaoCut 从输出结构里省 token
来源:宝玉(@dotey) · BestBlogs 评分:89
API 调用从 33 次降到 12 次、耗时从 31 分钟降到 18 分钟,这组数字来自宝玉对 BaoCut 转录功能的优化复盘。起初他让 Fable 5 在既定框架内自主优化,收到的是多 worker、预热一类的常规方案,效果有限,最初用 /goal 让模型自主优化的提示词与过程也一并贴了出来。
转机来自人工抓包:真正的瓶颈是模型输出的冗长 JSON,生成与校验都在消耗 token。改成模型出简单文本、代码负责复杂解析后,7 小时长视频的完整润色只需 42 分钟;按 DeepSeek v4 Flash 估算,1 小时视频的双语字幕翻译校对成本约 0.4 元,原文附 4 张对比图表。
他把教训概括为:Agent 会在给定的输出格式内优化到极致,却很难跳出这个框架。token 成本由输出结构决定,程序复杂度与 token 开销的取舍可以迁移到任何 Agent 管线。
模型故意变得更笨:推理能力正在置换世界知识
来源:Hacker News · BestBlogs 评分:90
一组基准的对比值得并排看:GLM-5.2 用约 400 亿活跃参数在 AIME 2026 拿到 99.2%,同一张推理榜单上,Qwen3.5 用约 170 亿活跃参数拿到 91.3%、DeepSeek V4-Flash 约 130 亿;而在纯事实召回的 SimpleQA 上,最好的 Gemini 2.5 Pro 也只有 53%。Walter van der Giessen 的判断是:模型变笨不是退化,是刻意设计。
佐证还有两层:Artificial Analysis 测得 Qwen3.5 4B/9B 的知识基准幻觉率 80-82%;知识容量研究给出每参数约 2 比特事实的量级。实验室正用推理能力置换世界知识,深度事实改由检索与工具在运行时供给。
这解释了小模型数学代码变强、冷门事实却自信编造的日常体感。当事实外置,错误就从不可查的权重变成有地址的数据 bug,幻觉治理的思路也随之改变。
如何将 AI API 支出削减 95%:一份数据驱动的分析
来源:DEV Community: machinelearning · BestBlogs 评分:87
47 个项目的真实账单,是这篇文章五种降本策略的数据底座:模型分层映射、级联路由、响应缓存、提示词压缩、请求批处理。文章开头是一次自曝:三年前他把所有调用都路由给 GPT-4o,一个周末烧掉约 1,800 美元,从那以后他开始记录每一笔调用。分层映射实测把加权成本从每百万 10 美元压到约 0.41 美元,降幅 95.9%。
分布数据更能说明问题:5,200 次混合请求里,38% 是琐碎任务、47% 简单、9% 代码、6% 推理;以开放式对话为例,GPT-4o 与 DeepSeek V4 Flash 每百万输出 token 的价差是 10 美元对 0.25 美元。级联路由把一个客服机器人的月支出从 420 美元降到 28 美元;他还测得任务复杂度与实际所需模型档位的相关系数只有 r=0.31。
结论指向路由层而非模型单价才是成本主杠杆。质量阈值需要按业务校准,作者建议先用约 200 条提示词做双评标注,再定路由规则。
Claude 文本水印的工作原理与影响
来源:宝玉(@dotey) · BestBlogs 评分:89
为满足欧盟 AI 法案,Anthropic 在 Claude 输出中引入基于 SynthID-Text 的文本水印:用密钥改变模型选词时的随机数来源,留下统计痕迹,且不影响输出质量。宝玉的解读把机制与影响两面都梳理了出来。
几个关键口径值得记住:方案源自 Google DeepMind 的 SynthID-Text,全球统一上线而非仅限欧盟区域;水印不携带用户身份信息;代码类文本水印密度较低,短文本检测存在局限;检测 API 即将推出。
这是头部模型厂商首次把可检测水印推向全体用户,内容发布、API 转售等场景的合规与风控判断都会受到影响。与快讯里 Sean Goedecke 的冷静文对照阅读,可以看到同一事件的两种纵深。
江小涓:AI 替代就业,关注「出局者」而非「赢家」
来源:腾讯研究院 · BestBlogs 评分:91
在中国数字经济发展和治理学术年会上,江小涓提出人文社科研究 AI 应区分已然、或然、应然三类问题。已成共识的技术事实无需反复研究,公共政策的注意力应该放在技术进步的「出局者」而不是「赢家」上。她还把平台灵活就业与制造业稳定就业哪个更符合就业者意愿,列为典型的或然问题。
她列出的议题相当具体:AI 替代就业的专项税费与补偿、是否征收机器人税、UBI 在国内尚不具备全面推开条件但有条件推进值得研究。分布式合作的案例里,渐冻症患者蔡磊搭建的平台连接超 1.8 万名患者,把临床试验受试者招募从 18 个月压缩到最快 24 小时。
这份议程的分量来自身份——国家数据专家咨询委员会主任。她强调劳动是独立的基本权利而非收入的派生品,社会保障解决不了能力剥夺与尊严损失。
LittleLearner:预训练数据设定了有效能力上限
来源:Hacker News · BestBlogs 评分:85
LittleLearner 做了一个少见的受控实验:用仅含美国 K-5 课程内容的 88B token 语料(五阶段过滤、对齐 Common Core)从头训练 0.6B/1.3B/5B 三个模型,并配上同架构、同 token 量的未过滤对照。
实验结果是 scaling、SFT+GRPO 后训练与上下文学习都只能放大课程内能力,无法实质性提升课程外表现;即使用课程外数据做 GRPO 后训练,也没能恢复课程外能力。项目页还放出了可以直接在浏览器里对话的 5B 托管模型,读者可以自己验证这个边界。
在「新能力是学到的还是被激发的」这个难题上,这组实验给出了受控证据:预训练过滤设定了有效能力上限,对后训练能否补齐预训练数据缺陷的常见工程预期是直接降温。它也和「模型故意变得更笨」一篇互相印证——能力边界由预训练阶段暴露的数据决定。
补充阅读
开源模型生态观察:规模上限与采用度是两个经济体
来源:AIHOT — 精选 · BestBlogs 评分:86
Hugging Face Hub 2026 年前七个月的数据显示,中国实验室开源模型的月度规模上限在 754B 到 2.78 万亿参数之间,美国实验室七个月中有五个月低于 130B,Qwen 衍生模型达 151,448 个、约为 Llama 仓库数的 4.7 倍。下载与点赞像两个经济体:低于 1B 的模型占历史下载量的 83%,点赞榜与下载榜前 25 名只有一个仓库重合。报告同时指出,AI 智能体正在成为 Hub 的首要用户群体。
GLM-5.3:靠扩展后训练追平前沿编码模型
来源:Interconnects AI · BestBlogs 评分:90
智谱的 GLM-5.3 与 GLM-5.2 同底座,靠扩展后训练把智能体编码基准推到与 Kimi K3、Claude Fable 5、GPT-5.6-Sol 相当的水平,参数约 750B、仅为 Kimi K3 的三分之一,权重两周后开放。Z.ai 自述「Scaling post-training is all we did for GLM-5.3」,作者判断中国实验室保持同步的最大因素是发布周期以天计,而非蒸馏。
AI 文本水印并非大事
来源:Sean Goedecke · BestBlogs 评分:91
Sean Goedecke 逐条反驳围绕 Claude 水印的恐慌:水印只是替换采样时的伪随机源、不降低文本质量,AI 输出本就带着可被分类器识别的行文习惯,零比特水印也带不走用户隐私。由于欧盟 AI Act 第 50 条,放弃水印等于放弃欧洲市场,他的判断是所有实验室都会跟进。
DeepSeek Harness 发布 45 小时的 8 种社区声音
来源:十字路口Crossing · BestBlogs 评分:88
发布 45 小时收获 10.50 万 Star。程序员鱼皮实测 4 个任务总费用不到 5 元、缓存命中率最高近 100%——同一条提示词此前用 DeepSeek V4 Pro 加 Codex 跑出的旧版本,在连线、动画与测验上都明显不如这次——但网站要约 20 分钟、3D 游戏近 40 分钟,小红书热评是「一个 Bug 能给你修一个小时」。社区 8 种声音指向同一个判断:Agent 的有效能力是 Model 加 Harness,模型之外谁来定义工作方式才是关键。
Mole 的 Mac 付费版与 AI 留下的三类垃圾
来源:Tw93 Blog · BestBlogs 评分:89
Tw93 复盘 Mole 从开源 CLI(一年 60K Star、121 位贡献者)到 Mac 付费版的路线:直到 README 上的两张图把 Vercel 账单跑超、欠了 80 刀,他才意识到该做桌面端,而 CLI 照旧开源免费,付费的只有桌面版。AI 给 Mac 留下三类垃圾:编译产物(他一次清出 86G)、不自动删除的 AI 工具旧版本(每个约 250MB)、动不得的模型文件;方法论是把可删项分成可再生、重建代价高、不可替代三档,宁可漏删也不误删。
双臂夹爪一小时分拣 1816 件快递包裹
来源:AI科技评论 · BestBlogs 评分:86
自变量机器人 8 月 12 日直播,用双臂加普通夹爪、依托自研 WALL-B 具身大模型,一小时分拣 1816 件随机上料的快递包裹、成功率 98%,折算下来约两秒一件;此前公认标杆是 Figure AI 人形加灵巧手的平均 1248 件/小时。作者提醒被忽略的 2%(约 36 件)才是能否进产线的命门;这次速度提升 45% 的同时成本整体下降约 70%。
《洛克王国:世界》的 AI 助手斯嘉丽
来源:游戏葡萄 · BestBlogs 评分:86
腾讯 Q2 游戏收入 659 亿元,《洛克王国:世界》被马化腾称为今年新手游平均日活与流水双第一。其内置 AI 助手斯嘉丽为 400 多只精灵推荐 PvP 阵容,有玩家一天对话超一千轮,上线后 PVP 激活率提升 20%;因游戏知识太新、不在任何预训练语料里,团队最终自研多模块协同的 Coach Agent 架构。
DeepSeek V4-Pro 撤回疑云:配置与后端错位
来源:AI前线 · BestBlogs 评分:85
DeepSeek-V4-Pro-0813 上线不到 24 小时口碑两极并遭官网撤回,社区从 Hugging Face 提交记录找到线索:初始配置的 hidden_size 4096、256 个路由专家与 V4-Flash-0731 完全一致,官方随后改为 7168、384 个专家并两次重传大文件。疑似模型配置与推理后端错位导致的发布混乱,可以解释部分用户实测甚至不如小模型的体感。
DeepAgents 把智能体循环与后端分离
来源:Harrison Chase(@hwchase17) · BestBlogs 评分:88
针对智能体编码工具不应以终端为先的批评,Harrison Chase 回应 DeepAgents 的做法:把智能体循环与暴露文件系统操作的后端分离运行,后端可选带执行能力的沙箱。同一智能体由此既能提供本地 TUI 编码,也能跑在云端、Slack/Web 界面乃至非编码场景,架构基于 LangGraph 并可经 MCP、A2A 端点提供服务。
Anthropic 的「信仰」反噬
来源:机器之心 · BestBlogs 评分:87
机器之心梳理 Anthropic 的「信仰」反噬:匿名投资人爆料员工士气降至低谷、内部出现私下宣泄渠道,Dario 每两周的全员会 DVQ 被部分前员工形容为「听祭司布道」,他自述约三到四成时间花在维护公司文化上。《时代》杂志披露过其文化面试的示例问题:如果公司因无法保证模型安全而决定不发布产品,你是否愿意承受所持股票价值归零。报道同时强调爆料未经 Anthropic 证实,但使命凝聚力与思想多元的拉扯有公开信息支撑。
延伸探索
工程与 Agent 是补充清单里最厚的一簇。DeepSeek Harness 一项占三篇:山行 AI 把它拆解为「一切皆插件」的 Agent 运行时,数字生命卡兹克给出安装与插件上手指南,十字路口Crossing 的第二篇把它解读为争夺 Agent 时代演化权的战略布局。一手实践同样密集:Claude 之父 Boris Cherny 让 Claude 接管自家 App 维护,388 个 PR 合并了 180 个;ChatGPT Pro 直接克隆仓库提交 PR;一条写在 AGENTS.md 里的指令让 UI 变更的 PR 自动录屏。再加上 AgentShield 安全扫描、Docker 沙箱跑 ESP32 固件、MathCode 数学编码智能体、AML 记忆榜单、PGSimCity 把 PostgreSQL 内核可视化成虚拟城市、GCC 嵌套函数改进,合起来构成 Agent 如何被构建与治理的横截面。
模型与产业两侧,MiniMax H3 团队在 Reddit AMA 回应了 2K 权重、图像模型与 Apache-2.0 的计划,Qwen3.8 系列开源、GLM-5.3 与 Gemini 3.7 Flash 及 V4 Pro 的权重汇总、小红书 280B 三模态 512K 上下文的 dots3-note、15 岁独立研究员的 TUPOI O(1) 内存架构各有进展。产业与人的一侧,a16z 领投 17 亿美元给 Kalanick 的 Atoms 与精讲三直接呼应,机器人算力两年涨 10 倍、德塔智能与舞肌科技规范数据采集延续具身智能线索,SHEIN 转向时尚基础设施、寻明生科主张 AI 制药做高价值分子、北航何静回应 B 站走红,加上 Anthropic 私藏更强内部模型与多智能体红队两篇安全报道,读者可按兴趣自取。
今日阅读路径
如果只读三篇,建议按这个顺序:先读精讲一,Silber 对角色期望的诊断不只适用于设计师,任何职责正被 AI 改写的岗位都能拿来自查;再读精讲三里 Uber 中国的段落,补贴战比的是单位效率、7% 股权换本地伙伴,是出海团队少见的具象案例;第三篇留给精讲二,如果你的系统也在反复回答同一领域的问题,117 次提问回本的成本模型可以套用自己的账单算一遍。
有余力再看两条:Qwen 3.8 27B 的实测提醒你检查常用模型的默认推理档位;江小涓的演讲把镜头从个体转向分配,与精讲一互为两面。
读完欢迎到评论区聊聊你的看法:你的角色期望在过去一年变得更清楚还是更模糊?另外两个值得跟踪的问题也建议先写下判断——Qwen 3.8 的默认档位在独立基准下是否同样成立,GLM-5.3 权重两周后开放时第三方实测会给出什么答案。
👉 近期早报
• BestBlogs 早报 · 2026-08-16
• BestBlogs 早报 · 2026-08-15
• BestBlogs 早报 · 2026-08-14
• BestBlogs.dev 第 108 期:智能的执行层
• BestBlogs.dev 第 107 期:个人 AGI
• BestBlogs.dev 第 106 期:1% 法则
BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。