Databricks 探讨在数据仓库中应用 AI_Functions 的主要场景,帮助组织在结构化数据之外处理非结构化数据。文章聚焦于如何通过该功能将 AI 能力直接集成到 SQL 工作流中,以扩展数据仓库的分析边界。具体用例与实现细节以原文为准。
Databricks 探讨在数据仓库中应用 AI_Functions 的主要场景,帮助组织在结构化数据之外处理非结构化数据。文章聚焦于如何通过该功能将 AI 能力直接集成到 SQL 工作流中,以扩展数据仓库的分析边界。具体用例与实现细节以原文为准。
OpenRouter 发布视觉指南,详解通过 Chat Completions API 向多模态模型发送图像的方法。请求体采用 messages 数组,用户消息的 content 包含 text 和 image_url 两部分,支持公开 URL 或 base64 数据 URL 两种格式,兼容 PNG、JPEG、WebP 和 GIF。
GitHub 介绍四款 Agent Apps,帮助用户在 SDLC 全流程中完成功能的范围界定、安全加固、逐步推出与发布,全程无需离开 GitHub。文章展示了这些智能体应用如何将软件交付工作流直接嵌入平台。
Claude Code 的 token 成本由模型、输入/输出 token 和提示缓存三因素决定,输出 token 价格约为输入的 5 倍。任务间运行 /clear 可减少无关上下文回传,降低 token 用量;会话中途切换模型或 effort 级别会破坏提示缓存,增加成本。
四位博主本周给千问发来“Offer”,把重复琐事交给它处理。@无情狗明让千问当摄影助理,负责素材分类、备份、生成Excel清单和在线案例库;@Hello我是路人用「办公助理」打通Todo List、苹果日历和提醒事项,每半小时检查日程并自动顺延任务。
蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。
Anthropic 数据团队将 Claude Tag(公开测试版)作为 Slack 中数据分析智能体的基础,让非分析师也能用受治理的语义层提问并获得答案。团队分享了五项关键经验:将技能文件视为持续刷新的内容、为智能体配备预测/留存/漏斗等分析技能、接入内部知识索引而非仅连接数仓,并强调权限、数据新鲜度与可观测性的设计。
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
AWS 开源的 Strands Robots(Apache 2.0)通过单一智能体循环,将机器人演示记录、基于 Hub 数据流的策略训练及硬件部署整合在一起,全程保持 LeRobot 磁盘格式不变。
HeyGen 将 18B+ 参数的 Avatar IV 视频生成模型移植到 Google Cloud Trillium (v6e) TPU,通过 torchax 和 XLA 实现,并采用 FSDP 与 Ulysses 序列并行。
GitHub Secure Open Source Fund 第四期 50 个开源项目结合 AI 辅助工作流、维护者经验、GitHub 安全工具、专家指导与资金支持,系统性提升项目安全性。该计划展示了开源生态在 AI 时代应对安全挑战的实践路径,为维护者提供了可复用的安全加固模式。
95后厂二代全子安接班家中经营23年的注塑配件厂后,用千问搭建客户管理工作台,并创建客户管理Skill,将300多个老客户资料自动整理、归类、联网查询并打分排序。开发信发送量从每天最多十封提升到三五十封,回复率从一季度一两个提升到一个月两三个。
inclusionAI 在 GitHub 开源 Ling Cookbook,为 Ling 系列大语言模型提供部署与开发指南,目前仍在开发中。仓库包含已验证的硬件部署方案,如 Ling-3.0-flash 在单台 NVIDIA DGX Spark 上通过 SGLang(MXFP4/INT4)、vLLM(INT4)及 llama.cpp(GGUF)等框架的推理示例,并附有各方案的量化配置与部署文档。
OpenRouter 发布工具调用指南,展示如何用同一套代码在 Claude、GPT 和开源权重模型间切换,仅需更改模型字符串。指南涵盖定义工具、发送请求、读取 tool_calls 响应、执行函数并返回结果的完整循环,支持 OpenAI 兼容的 JSON schema,并提供 cURL、Python 和 JavaScript/TypeScript 示例。
Amtrak 正为 50 多年来最大规模转型构建数据骨干,将每列新列车组视为数据生成资产。该智能平台连接列车运营与维护数据,支撑其现代化改造。具体技术架构与部署细节未在原文中展开。
Databricks 的 serverless 平台每天启动数千万台 VM,其网络配置交付机制面临规模挑战。文章介绍了该平台如何高效完成这一交付过程,确保大规模基础设施的稳定运行。
GitHub Copilot 应用发布入门指南,教用户写出第一条提示词,并学会选择合适的上下文与模型,从而自信地开启首个任务。该指南面向 Copilot 应用的新手用户,帮助其快速上手提示词编写。
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从“不可用”转变为“可用但不符合路线图”。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的“人类探测器”。
AI 智能体是在大语言模型循环中自主运行的系统,通过反复调用模型、观察结果并调整下一步行动来完成复杂任务。工作流(workflow)则是对固定步骤的预编排,两者互补:工作流保证确定性,智能体提供灵活性。理解二者差异是构建可靠、可投入生产的自主系统的关键。
Databricks 介绍如何让 Genie Agents 同时基于结构化数据与文档运行,且不牺牲治理能力。文章探讨了构建自动化简单业务任务的智能体虽易,但要在统一治理框架下融合两类数据源、确保安全合规地执行查询,仍需解决数据权限、血缘追踪与策略管控等关键问题。
CMU 研究团队正式定义并系统评测了 forking-sequences 训练范式:它无需新增参数,在一次前向传播中跨所有预测创建日期编码解码整条序列。
Linear Agent 的价值在于完成未预设的工作,因此团队未为其编写固定路径,而是通过系统提示词、工具设计、产品模型、运行范围及底层自定义 harness 划定边界。系统提示词聚焦沟通风格、硬性边界与产品概念解释;工具设计将约束编码进参数,使无效操作难以执行。团队还引入系统技能作为组合单元,按需渐进加载,避免一次性暴露过多上下文。
MiniMax H3 技术团队在 Reddit AMA 和 ComfyUI 直播中回应开发者提问:模型不使用 MSA,稀疏注意力策略更接近 MoBA,默认仅对视频 token 做 3D sparsification,近期将发布保守版本。
Databricks 分享了规模化管控 AI 编程成本的方法,其智能体编程已带来可衡量的价值提升。文章重点探讨了在团队规模扩大时,如何通过成本追踪、工具选型与使用策略,在维持代码质量与开发效率的同时,控制 AI 编程工具带来的支出增长。
独立开发者叶小叔用面壁智能开源的VoxCPM声音克隆模型,成功让AI克隆网红声音并实现实时对话,视频在抖音获100万播放、X上5.9万人围观。此前他尝试本地开源模型(TTS合成需14-40秒)和云端Cartesia Pro(中文效果不佳)均失败,最终租用RunPod L4 GPU($0.4/小时)部署VoxCPM,TTS首包延迟不到1秒,端到端体感2-3秒。
独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM(TTS)三段式实时对话管道,TTS 首包延迟不到 1 秒,端到端体感 2 到 3 秒。
OpenRouter 提供 6 项控制措施来管理团队 AI 支出,涵盖预算、每密钥限额、模型/供应商白名单、Guardrails、工作区预算和 Activity 仪表盘。
OpenRouter 推出五项团队 AI 支出控制功能:组织共享信用池、预设模型范围、每密钥限额、护栏(成员预算和模型白名单)及活动仪表盘。本指南按顺序介绍设置流程,包括创建组织、配置预设、通过 Management API 密钥设置每日/每周/每月限额。组织默认支持最多 10 名成员,标准按需付费账户购买信用时收取 5.5% 平台费。
Tool calling 是 AI 模型调用外部工具和 API 的能力,让模型能突破自身局限、执行实时数据获取或具体操作。该机制通常涉及模型生成结构化请求、系统调度执行并将结果返回模型,从而完成更复杂的任务。Databricks 从概念、工作原理到应用场景对这一能力进行了系统说明。
智能体工作流正成为企业从单次提示词交互迈向多步骤自动化任务的关键范式。这类工作流让 AI 系统能够自主规划、调用工具并迭代执行复杂任务,而非仅生成单一回答。Databricks 从架构、应用场景与工程实践角度解析了智能体工作流的定义与落地路径。
GitHub Copilot 应用中的斜杠命令可帮助管理会话、导航项目和自定义 Copilot 工作流。与 CLI 版不同,应用版命令更侧重工作流,如 /plan 用于编码前规划、/spar 用于挑战方案假设、/autopilot 用于自动执行实现。/clear 和 /model 在 CLI 和应用中均可用。
LangChain 官方对比了 Deep Agents、LangChain 与 LangGraph 三种构建智能体的不同路径。文章梳理了三个开源框架的核心差异,并给出各自适用场景:LangChain 适合快速上手,LangGraph 适合精细控制,Deep Agents 则面向更自主的智能体设计。
美团图灵Agent评测团队公开内部博客,系统讲解Agent评测方法论。评测核心是回答“Agent好不好”,需覆盖结果、过程、效率、风险四层,并以观测为基石。团队提出“人人一致、人机一致”对齐法,通过指标下钻与Rubric二元化,使数字站长人机一致率达99%,Beam从62%提升至92%。文章还探讨了长程Agent(如Claude Code)对观测评测带来的演进。
Chime 执行制片人 Shayla Love 透露,团队用 Runway 将原本需约 30 万美元、涉及 80 多名真实会员的电视广告尾卡制作压缩至 3 万美元以内,且几乎无制作开销。Runway 的定制工作流将质量参差的 UGC 照片转化为稳定、达到电视播出标准的动态画面。团队还计划用 Runway 制作概念故事板,以加速广告审批流程。
LangChain 基于 Deep Agents 为 Kubernetes 部署构建了自主 SRE 智能体,可自动执行运维任务,并对变更操作引入人工审批机制。该智能体使用 LangSmith 进行全链路追踪,并通过 evals 评估系统性能,兼顾自动化效率与运维安全。
小红书针对“问一问”多图场景,从 Prefill 与 Decode 两端优化多模态推理:动态 Vision Token 压缩减少冗余视觉输入,SERE 专家重路由配合关键专家保护降低 Decode 阶段专家计算与权重搬运。
Claude 发布企业版成本控制指南,帮助 IT 管理员通过访问门控、模型权限、硬性支出上限等工具管理 Claude Enterprise 支出。指南建议以成本/成果而非 token 消耗衡量价值,并介绍了用量分析、数据导出、Analytics API 及分析聊天等监控功能。API 用户可通过提示词缓存(缓存命中成本为正常输入费率 10%)、批处理(半价)和 effort 参数等杠杆降低成本。
GitHub 法务团队的非工程师成员(律师、项目经理、业务人员)用 Copilot CLI 构建了内部工具。产品法律顾问 Ngandu Kasuku 创建了合同起草工具 terms-ai,将审查和起草时间缩短约一半;在线安全法律顾问 Jesse Geraci 构建了法律工作流桌面应用,涵盖合同审查、NDA 分类、风险评估等。工具核心指令以纯语言 Markdown 编写,便于非技术人员定制。
LangChain 官方博客介绍如何用 LangSmith 评估语音智能体,覆盖执行、结果与来电者体验三个层面。评估手段包括 LangSmith traces、代码评估器、LLM judges 和人工审查,帮助开发者系统化验证语音智能体的实际表现。