Topic · 主题全部主题 →

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

4,732条收录
527条精选

精选归档 · 第 26 页

501520 条 · 共 527

11月25日

星期二 · 1 条
00:08
Hugging Face:Blog(RSS)精选
AI 评分 73/100
OVHcloud 成为 Hugging Face 官方推理服务提供商

OVHcloud 现已正式加入 Hugging Face Hub 的推理服务提供商生态。用户可直接在模型页面使用其全托管、无服务器化的 AI 端点服务,便捷调用 gpt-oss、Qwen3 等热门开源模型。该服务基于欧洲数据中心,保障数据主权与低延迟,首 token 响应时间低于 200 毫秒,并支持结构化输出等高级功能。定价为每百万 token 0.04 欧元起,用户可选择使用自定义 API 密钥或通过 Hugging Face 账户路由请求并计费。


推荐理由:欧洲开发者可低成本合规访问前沿AI模型,推理选项更丰富。

11月21日

星期五 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 80/100
RapidFire AI 实现20倍更快的 TRL 微调

RapidFire AI 发布了一套加速 TRL 微调的工具,通过自适应分块调度方案,允许在单个或多个 GPU 上并发启动多个训练配置并实时比较。内部基准测试显示,实验吞吐量比顺序执行高出约 16 至 24 倍。该工具提供即插即用的 TRL 配置包装器、分块并发训练、支持实时停止/恢复/克隆修改的交互式控制操作、自动多 GPU 编排以及 MLflow 仪表板,使用户能快速筛选最优配置,极大提升微调效率。


推荐理由:开发者可并发测试多个微调配置,大幅提升实验效率。

11月20日

星期四 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 83/100
介绍 AnyLanguageModel:为苹果平台提供本地与云端大语言模型的统一 API

AnyLanguageModel 是一个 Swift 包,旨在为苹果平台上的大语言模型集成提供统一解决方案。它作为苹果原生 Foundation Models 框架的替代品,允许开发者通过相同的 API 接口,灵活调用本地模型(如通过 Core ML、MLX、llama.cpp 运行)与云端服务(如 OpenAI、Anthropic)。该方案复用苹果精心设计的 API 作为基础,大幅降低了在不同模型提供商之间切换的代码修改成本,并利用 Swift 的包特性功能避免依赖膨胀,从而简化开发流程,鼓励对本地开源模型的探索。


推荐理由:Apple开发者可一键切换本地与云端模型,大幅降低AI应用开发门槛。

11月19日

星期三 · 1 条
08:00
xAI:News(网页)精选
Grok 与沙特阿拉伯达成全国性部署合作

xAI 与沙特阿拉伯及 PIF 旗下 HUMAIN 签署框架协议,将在沙特建设超大规模 GPU 数据中心,并全国范围内部署 Grok 至 HUMAIN ONE 平台,为政府和企业提供实时智能与自主工作流。这是 Grok 首次在国家层面全面落地。


推荐理由:xAI与沙特达成国家级合作,将全国部署Grok并建设超大规模AI算力基础设施

11月17日

星期一 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 73/100
使用Hugging Face轻松构建和共享ROCm内核

Hugging Face的kernels库简化了高性能深度学习内核的构建与共享,支持CUDA、ROCm等多种后端。本文以ROCm兼容内核为例,展示如何利用kernel-builder工具构建、测试并共享内核。以RadeonFlow的GEMM内核为具体案例,该内核是针对AMD Instinct MI300X GPU优化的FP8块状矩阵乘法实现,采用e4m3fnuz浮点格式和每块缩放因子以保持低精度计算准确性,并在2025年AMD开发者挑战赛中获最高奖。指南涵盖项目设置、构建配置及通过kernels社区分享的完整步骤。


推荐理由:AMD GPU开发者可快速上手构建高性能AI内核,提升部署效率。

11月13日

星期四 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 88/100
共建开放未来:Hugging Face与Google Cloud达成新合作

Hugging Face与Google Cloud宣布建立深度战略合作,旨在将Google Cloud打造为使用开放模型的最佳平台。双方将合作构建CDN网关,把Hugging Face上的模型和数据集直接缓存在Google Cloud上,显著提升下载速度并增强供应链稳定性。Google Cloud客户在Vertex AI、GKE等服务中部署模型时将获得更快的首次响应。同时,Hugging Face的1000万开发者将受益于更多新型计算实例、价格下降以及通过Google安全技术强化的模型安全性。此次合作还将推动TPU在开放模型开发中的普及应用。


推荐理由:开发者将享受更快的模型下载、TPU 原生支持和增强安全,简化 AI 部署流程。

11月4日

星期二 · 1 条
00:00
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选
AI 评分 74/100
通过代码执行提升MCP智能体效率

随着AI智能体通过模型上下文协议(MCP)连接的工具数量激增,传统预先加载所有工具定义并通过上下文传递中间结果的方法,导致处理速度变慢、成本增加。问题核心在于工具定义占用大量上下文空间,且中间结果(如完整会议记录)在多次工具调用间重复传递,额外消耗数万令牌。文章提出解决方案:将MCP服务器呈现为代码API,使智能体能按需加载工具,并在执行环境中处理数据,仅将精简结果传回模型,从而显著减少令牌消耗、提升效率并降低成本。


推荐理由:Anthropic 官方把 MCP 从「能连」推进到「连多了怎么办」,用代码执行替代直接工具调用,token 省 98.7% 这个数字不是吹的。做 Agent 工程的人如果还在暴力塞 tool definition,这篇是必读的架构升级指南。

10月23日

星期四 · 1 条
01:58
Dwarkesh Patel:Podcast & Blog(RSS)精选
AI基建扩张观察

AI基础设施建设正面临晶圆厂资本支出过剩的风险,同时算力扩张带来每周1吉瓦的能源消耗压力。文章指出,在长周期基础设施竞赛中,中国凭借产业链整合优势占据有利地位。分析涵盖了AI基建中的产能过剩隐忧、电力瓶颈挑战,以及地缘政治背景下的技术长跑格局,揭示了算力军备竞赛背后的资本与能源约束。


推荐理由:AI基建泡沫与地缘博弈的冷思考,长期格局研判必读

10月21日

星期二 · 1 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 68/100
Provider Variance: Introducing Exacto

同一AI模型在不同服务提供商上的性能表现可能存在显著差异。为了量化这种“提供商方差”,研究团队推出了Exacto评估平台。该平台通过标准化测试揭示,即使是相同的模型(如GPT-4、Claude或LLaMA),在不同云服务或API提供商处运行时,其输出质量、响应速度和稳定性都可能产生高达30%的波动。这一发现对企业和开发者的模型部署策略具有直接影响,强调在选择服务商时需进行针对性性能基准测试。


推荐理由:OpenRouter 推出 Exacto,直接回答了开发者最头疼的问题:同一个模型换家供应商跑出来的结果到底差多少。做 Agent 或多模型路由的产品人,这个工具能帮你少踩很多坑。

10月20日

星期一 · 1 条
22:34
LangChain:Blog(RSS)精选
AI 评分 64/100
LangChain 三年回顾:从开源到 12.5 亿美元公司,发布 LangChain 1.0 与 LangSmith 扩展

LangChain 创始人 Harrison Chase 回顾项目三年历程,公司估值达 12.5 亿美元,并宣布 LangChain 1.0 发布、LangSmith 扩展及 1.25 亿美元融资。


推荐理由:三周年反思同时宣布 1.0 和 1.25 亿美元融资,LangChain 从实验框架转向企业级基础设施,影响开发者在兼容性与长期维护上的判断。

10月15日

星期三 · 1 条
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 64/100
Claude Haiku 4.5 发布:最快最智能的 Haiku 模型,性能接近前沿

Anthropic 推出 Claude Haiku 4.5,定位为最快且最智能的 Haiku 系列模型,性能接近前沿水平。该模型专为实时应用、高吞吐量处理以及对推理能力要求较高的成本敏感型部署场景设计。


推荐理由:这是Haiku系列首次拥有接近前沿的性能,高速低成本让它在实时应用和高吞吐场景里很有竞争力,做成本敏感AI产品的值得认真考虑。

10月1日

星期三 · 2 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 58/100
OpenRouter 推出每月100万免费BYOK请求

OpenRouter 向每位客户每月提供100万次“Bring Your Own Key”(BYOK)请求,完全免费。


推荐理由:这个公告虽然旧了,但 OpenRouter 的 BYOK 免费额度至今仍在,对想低成本折腾模型的个人开发者来说,每月 100 万次请求比很多付费计划都香。
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 60/100
每月 100 万次免费 BYOK 请求

所有客户每月可免费获得 100 万次“自带密钥”(BYOK)请求。这一政策将 BYOK 功能从付费服务转变为免费提供的基础配额,大幅降低了企业使用自有密钥管理数据安全的技术与成本门槛。免费额度覆盖了绝大多数中小规模企业的典型月请求量。


推荐理由:OpenRouter 给 BYOK 用户每月免 100 万次请求,对用自己 API key 跑 Agent 的开发者来说是实打实的成本减免,值得顺手薅。

9月29日

星期一 · 1 条
16:07
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 58/100
inclusionAI/dInfer

inclusionAI团队发布了dInfer,一个专为扩散语言模型设计的高效推理框架。该框架旨在解决扩散模型在文本生成领域推理速度慢、资源消耗大的核心挑战。dInfer通过一系列底层优化技术,显著提升了推理效率,能够更快地生成文本,同时降低计算成本,为扩散模型在更广泛的实际应用场景中部署提供了关键技术支持。


推荐理由:蚂蚁把扩散语言模型的推理框架开源了,这类模型的推理效率一直是落地瓶颈,做端侧或低成本部署的团队值得看看能不能接上。

9月23日

星期二 · 2 条
21:42
Sam Altman@sama精选
感谢 Jensen 近十年的合作!Grateful to Jensen for the almost-decade of partnership!OpenAI 与 NVIDIA 宣布合作建设 gigascale AI 工厂,将部署数百万 NVIDIA GPU,提供 10 gigawatts 算力支持 OpenAI 数据中心扩张。双方合作关系已持续近十年。

NVIDIA: We're proud to announce a landmark partnership with @OpenAI to build new gigascale AI factories using millions of NVIDIA...


推荐理由:OpenAI 与 NVIDIA 达成里程碑合作,部署百万级 GPU 建设 10 吉瓦 AI 工厂
21:41
Sam Altman:Blog(RSS)精选
充裕的智能

计划打造每周可新增1吉瓦算力的AI基础设施工厂,通过芯片、电力到机器人的全栈创新,支撑治愈癌症、全球个性化教育等宏大应用。项目将主要落地美国,未来数月公布合作伙伴,年底披露融资方案。


推荐理由:Sam Altman阐述OpenAI基础设施扩张愿景,计划每周新建1吉瓦算力

9月17日

星期三 · 1 条
00:00
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选
AI 评分 73/100
近期三次基础设施故障的事后分析

八月初至九月中旬,Anthropic的三次基础设施漏洞间歇性导致Claude响应质量下降。8月5日,上下文窗口路由错误致使部分Sonnet 4请求被误导向百万token服务器,8月31日高峰时影响16%请求。8月25日,TPU服务器错误配置引发输出损坏,可能在英文回复中生成泰文或中文字符,影响Opus和Sonnet模型。同日部署的代码还触发了编译器漏洞,主要影响Haiku 3.5。所有问题均非需求或负载所致,纯属基础设施漏洞。公司通过回滚部署和修复逻辑于9月18日前全部解决。


推荐理由:Anthropic 主动公开三个基础设施 bug 的完整复盘,这种坦诚在大厂里极少见。做 AI 产品的人都该读一下,它把「模型质量下降」从玄学拉回了工程现实,尤其是 XLA 编译器那层的坑,踩过才知道多深。

9月10日

星期三 · 1 条
15:01
Thinking Machines Lab:官方博客(RSS)精选
AI 评分 60/100
破解LLM推理中的非确定性

LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的“并发+浮点非结合性”假设并不完整——GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LLM推理输出。


推荐理由:Horace He 把 LLM 推理非确定性的锅从并发浮点转向 batch-size,并给出了可落地的 batch-invariant 内核实现,做推理部署和 RL 的工程师都该看看。

9月3日

星期三 · 1 条
22:03
Linear:Now(RSS)精选
AI 评分 61/100
Linear 发布 Triage Intelligence:用搜索与 LLM 推理自动整理工单

Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。


推荐理由:Linear 的 Triage Intelligence 用 agentic 方案把 issue 自动分类和去重做得很实用,透明可解释的交互设计让 AI 建议不再像个黑箱,做工具类产品的值得看一看。

9月2日

星期二 · 1 条
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 64/100
Claude Platform 发布 Code Execution Tool v2 公测版,支持 Bash 命令与文件操作

Claude Platform 推出 Code Execution Tool v2 公测版,取代原先仅支持 Python 的工具,新增 Bash 命令执行和直接文件操作能力,包括用其他语言编写代码。


推荐理由:Anthropic把代码执行工具从Python解放到了Bash和任意语言,这不再是玩具,而是能在沙箱里跑真实脚本的实用功能,做自动化的开发者可以直接拿来用了。