MiniMax H3 技术团队在 Reddit AMA 和 ComfyUI 直播中回应开发者提问:模型不使用 MSA,稀疏注意力策略更接近 MoBA,默认仅对视频 token 做 3D sparsification,近期将发布保守版本。
MiniMax H3 技术团队在 Reddit AMA 和 ComfyUI 直播中回应开发者提问:模型不使用 MSA,稀疏注意力策略更接近 MoBA,默认仅对视频 token 做 3D sparsification,近期将发布保守版本。
Barret 李靖认为 AI 完全有机会在验收测试上测得比人更完善,关键在于两点:完整理解需求(偏向 BDD 或 Goal Driven Verification,而非 TDD)和具备足够的手脚眼(编写 E2E 用例,通过 OCR、模拟点击、截图等丰富界面认知)。其团队实践为每次迭代让 AI 分析代码 diff、编写并自修正 E2E 测试,全程记录操作生成测试报告,再回头判断是否达成最初目标。
BestBlogs 8 月 8 日早报精选 10 条 AI 动态:贾扬清官宣第二家创业公司 Intent Lab,其上一家 Lepton AI 被英伟达收购;田渊栋联合创立的 Recursive Superintelligence 估值超 46 亿美元。
http://x.com/i/article/2085881794776518656
本教程演示如何用 NVIDIA NeMo Retriever 构建多模态 RAG 流水线:先以 PDFium 离线提取 PDF 文本,再通过托管 NIM 端点检测页面元素、抽取表格/图表/信息图并生成稠密向量存入 LanceDB。随后实现稠密检索、视觉-语言重排序、元数据过滤搜索及带内联引用的 grounded 生成,并用 recall-at-k 评估检索质量。
Databricks 通过迁移至更高效模型、动态路由及元 harness 等策略,将 AI 编码支出降低 70%,同时保持每用户成本大致固定。该公司已开源其关键基础设施组件 Omnigent 与 Unity AI Gateway。Stripe 等企业发现 Opus 4.7 较 4.6 质量无提升且成本更高,因此未内部部署。
Databricks 分享了规模化管控 AI 编程成本的方法,其智能体编程已带来可衡量的价值提升。文章重点探讨了在团队规模扩大时,如何通过成本追踪、工具选型与使用策略,在维持代码质量与开发效率的同时,控制 AI 编程工具带来的支出增长。
Nathan Lambert 完成其夏季项目:一套 20 个视频的免费后训练课程,约 12 小时内容,配套幻灯片可修改复用。课程覆盖核心基础及他认为重要性将上升的研究方向,并附有代码练习。为庆祝发布,其书籍在 Manning 平台使用代码 PBLambert 可享 50% 折扣。
vLLM 的 LLM 引擎是其核心构建块,支持离线高吞吐量推理,包含调度器、KV 缓存管理器(分页注意力核心)等组件。文章基于 commit 42172ad(2025 年 8 月 9 日),聚焦 V1 引擎,从单 GPU 离线场景逐步扩展到多 GPU、分布式及服务层,并涵盖分块预填充、前缀缓存、引导与推测解码等高级特性。
阿易 AI Notes 用豆包制作了一支 15 秒治愈故事短片《逃亡的文件》:被清空回收站的小文件在键盘狂奔、躲进咖啡杯变小鱼、化纸鹤飞逃,最终钻进笔记本变成手写字被永久保存。视频将昏暗实拍与粗糙发光手绘帧动画融合,全程第一人称手持抖动视角,并附完整分镜提示词。
创意玩法视频,非常有趣好玩😄 晚安,玛卡巴卡🌙 prompt 👇 15 秒,16:9 横屏视频。将昏暗室内的实拍画面与粗糙、发光的手绘帧动画融合。整体气质可爱、荒诞、轻快、治愈,表现一枚电脑光标突然决定提前下班,并在真实房间里完成一场...
独立开发者叶小叔用面壁智能开源的VoxCPM声音克隆模型,成功让AI克隆网红声音并实现实时对话,视频在抖音获100万播放、X上5.9万人围观。此前他尝试本地开源模型(TTS合成需14-40秒)和云端Cartesia Pro(中文效果不佳)均失败,最终租用RunPod L4 GPU($0.4/小时)部署VoxCPM,TTS首包延迟不到1秒,端到端体感2-3秒。
独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM(TTS)三段式实时对话管道,TTS 首包延迟不到 1 秒,端到端体感 2 到 3 秒。
BestBlogs 08-07 早报精选 10 条 AI 内容:Garry Tan 详解个人 AGI 基础设施;Cognition、NVIDIA 与 OpenRouter 探讨多模型路由生产级控制层。
http://x.com/i/article/2085515679424507904
OpenRouter 提供 6 项控制措施来管理团队 AI 支出,涵盖预算、每密钥限额、模型/供应商白名单、Guardrails、工作区预算和 Activity 仪表盘。
Tool calling 是 AI 模型调用外部工具和 API 的能力,让模型能突破自身局限、执行实时数据获取或具体操作。该机制通常涉及模型生成结构化请求、系统调度执行并将结果返回模型,从而完成更复杂的任务。Databricks 从概念、工作原理到应用场景对这一能力进行了系统说明。
智能体工作流正成为企业从单次提示词交互迈向多步骤自动化任务的关键范式。这类工作流让 AI 系统能够自主规划、调用工具并迭代执行复杂任务,而非仅生成单一回答。Databricks 从架构、应用场景与工程实践角度解析了智能体工作流的定义与落地路径。
GitHub Copilot 应用中的斜杠命令可帮助管理会话、导航项目和自定义 Copilot 工作流。与 CLI 版不同,应用版命令更侧重工作流,如 /plan 用于编码前规划、/spar 用于挑战方案假设、/autopilot 用于自动执行实现。/clear 和 /model 在 CLI 和应用中均可用。
3 months ago i resigned from @OpenAI. today we are launching Energy everyone will soon use AI for all work on their comp...
LangChain 官方对比了 Deep Agents、LangChain 与 LangGraph 三种构建智能体的不同路径。文章梳理了三个开源框架的核心差异,并给出各自适用场景:LangChain 适合快速上手,LangGraph 适合精细控制,Deep Agents 则面向更自主的智能体设计。
本教程演示如何用 Meta 的 Ax 现代 Client API 进行自适应实验,在合成分类数据集上调优 RandomForest 模型,同时平衡预测准确率与模型体积。工作流从定义包含整数、浮点、对数缩放和类别参数的混合搜索空间开始,逐步展示完整调优流程。
Nathan Lambert 在其课程最后一讲发布“性格训练”导论,称该主题已深耕约 18 个月,具备高现实影响力且被前沿实验室广泛使用,但相关实证文献几乎空白。讲座涵盖性格训练定义、模型规范与宪章差异、现实动机、推荐论文及开放问题,旨在吸引更多研究者进入该领域。
面壁智能 OpenBMB 在 #BuildSmall 黑客松推出 AMNESIAC,一款反向图灵测试交互游戏:玩家需说服 AI 审讯官 A.M.N. 自己是人类。该游戏由 MiniCPM-o 4.5 驱动实时对话与推理,VoxCPM 生成审讯官语音,并结合摄像头面部表情、脉搏信号与响应计时进行多模态审讯。项目已开源至 HuggingFace。
阿里发布 Qwen3.8 Max,在 Artificial Analysis 智能指数上得 56 分,较前代提升 10 分,落后开源权重领先者 Kimi K3(57 分)1 分,但每任务成本 $1.14 高于后者的 $0.86。
另有 5 家信源报道X:阿易 AI Notes (@AYi_AInotes)X:Testing Catalog (@testingcatalog)X:Artificial Analysis (@ArtificialAnlys)X:Kim (@kimmonismus)The Decoder:AI News(RSS)作者整理了10个提升vibe coding体验的开源App,涵盖Mac刘海屏改造(Atoll)、窗口预览(DockDoor)、极速启动器(Raycast)、彻底卸载(Pearcleaner)、菜单栏折叠(Thaw)等工具。这些工具均为免费开源,可将重复操作压缩为快捷指令,降低试错成本。作者还提到可用Codex随时为这些开源App添加自定义功能。
美团图灵Agent评测团队公开内部博客,系统讲解Agent评测方法论。评测核心是回答“Agent好不好”,需覆盖结果、过程、效率、风险四层,并以观测为基石。团队提出“人人一致、人机一致”对齐法,通过指标下钻与Rubric二元化,使数字站长人机一致率达99%,Beam从62%提升至92%。文章还探讨了长程Agent(如Claude Code)对观测评测带来的演进。
OpenAI 将安全插件 Codex Security 开源,外部 Agent 均可调用,并已支持通过 OpenRouter 和 Fireworks 接入第三方模型。
文章介绍如何构建一个先进的代理式测试框架(Agentic Harness),用于系统化评估和测试AI智能体。框架设计聚焦于可重复、可扩展的测试流程,以验证智能体在复杂任务中的表现。文中讨论了框架的核心架构、关键组件以及实际应用中的考量,为开发者提供了一套完整的测试解决方案参考。
Chime 执行制片人 Shayla Love 透露,团队用 Runway 将原本需约 30 万美元、涉及 80 多名真实会员的电视广告尾卡制作压缩至 3 万美元以内,且几乎无制作开销。Runway 的定制工作流将质量参差的 UGC 照片转化为稳定、达到电视播出标准的动态画面。团队还计划用 Runway 制作概念故事板,以加速广告审批流程。
本教程使用 Google Meridian 构建完整的贝叶斯营销组合建模工作流,涵盖数据加载、ROI 先验配置、NUTS 采样拟合及收敛性评估。通过 Analyzer API 提取渠道贡献、ROI、边际 ROI、adstock 与饱和曲线等后验指标,并计算渠道间 ROI 比较概率。最后用 BudgetOptimizer 优化固定与灵活预算,生成可分享的 HTML 报告并保存模型复用。
Nathan Lambert 发布评测讲座,梳理其亲历的评测时代变迁:从 GPT-3 提示词式“高级自动补全”,到如今复杂的智能体沙盒环境。讲座重点剖析智能体评测(借鉴 @xeophon 观点),并探讨评测如何被操纵及其真实用途,涵盖后训练评测时代、智能体评测入门及“数字能否可信”等章节。
一个4B开源模型经Castform后训练后,在检索任务中达到与GPT-5.6 Sol相当的准确率,而每次请求成本仅为后者的百分之一。典型多轮搜索请求调用gpt-5.6-sol耗时超10秒、端到端成本约0.03美元,而小规模开源权重模型便宜100倍。Castform通过RL后训练弥合差距,并利用Neon的Lakebase Search实现训练与推理。
另有 1 家信源报道IT之家(RSS)Simon Willison 将 2022 年 GPT-3 和 DALL-E 生成的游戏概念与截图输入 Claude Fable 5(运行于 Claude Code for web),成功构建出可玩的 3D 浏览器游戏。
Totally jamming with Codex voice mode. Talk in one chat, it's where you riffa and when you land on a solid outcome it wi...
Jeff Dean 在访谈中回顾 TPU 的起源:2010 年代初他估算,若 1 亿人每天用语音识别 3 分钟且全跑在 CPU 上,谷歌需为此增加约一倍服务器,成本与功耗不可接受。他因此力排众议,放弃 FPGA,推动定制 ASIC 芯片 TPUv1(PCIe 卡上的推理芯片),并说服 CFO 在用例完全明确前先部署约 5000 万美元的该芯片。
Google's chief scientist is leaving after 27 years to build AI that can run its own research cycle with little human hel...
知识蒸馏通过让一个较小的学生模型模仿大型教师模型的输出,训练出独立的新模型,而非像量化和剪枝那样压缩原模型。教师输出的软标签(如猫0.70、狗0.25、狐狸0.05)比单一硬标签携带更多类别关系信息,即“暗知识”,这是蒸馏效果优于直接学习原始标签的核心原因。Google的Gemma模型即在训练中利用Gemini家族的更大模型进行蒸馏,蒸馏后还可再量化以进一步缩小模型。