Topic · 主题全部主题 →

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

4,732条收录
527条精选

精选归档 · 第 15 页

281300 条 · 共 527

6月5日

星期五 · 2 条
06:45
Sam Altman@sama精选
AI 评分 80/100
用ChatGPT构建并发布网页应用build and publish web apps with chatgpt!i really wish i had this when i was a kid, but i do miss hypercard.用ChatGPT构建并发布网页应用! 我真希望我小时候就有这个,但我确实怀念HyperCard。

OpenAI: Building apps has never been easier. With Sites, Codex can turn your work, ideas, and plans into an interactive website ...

另有 4 家信源报道IT之家(RSS)X:OpenAI Developers (@OpenAIDevs)X:OpenAI (@OpenAI)X:Rohan Paul (@rohanpaul_ai)
推荐理由:Sam Altman 说希望小时候有这玩意,但企业版首发普通人还得等。把聊天直接变成可发布的网页 app,这方向让非开发者也能造工具。
00:53
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 77/100
Boson AI 与 LMSYS 发布基于 SGLang-Omni 的 Higgs Audio v3 TTS 端到端服务

Boson AI 与 LMSYS 联合推出基于 SGLang-Omni 推理框架的 Higgs Audio v3 TTS 端到端服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持 100 种语言(内部评测覆盖 111 种),在 Seed-TTS、CV3、MiniMax-Multilingual 及 Higgs-Multilingual 零样本语音克隆任务中达到单字级 WER/CER。开发者可通过文本内控制标签实时调整情感(20+种)、风格、韵律(语速/音高/停顿)及音效。模型支持流式合成,文本未完整时即可开始生成语音并保持一致性。SGLang-Omni 专为多阶段生成模型设计,统一调度 AR 解码与轻量计算,实现低延迟推理。


推荐理由:Higgs v3 把多语言和实时可控制整合进一个流式 TTS 模型,SGLang-Omni 为它搭好了多阶段推理的底座,做语音 Agent 的可以直接抄作业,这比多数论文落地快半拍。

6月4日

星期四 · 5 条
23:42
Hugging Face:Blog(RSS)精选
AI 评分 66/100
Hugging Face 为编码智能体重塑 hf CLI 输出格式

Hugging Face 重新设计 hf CLI,使其同时服务人类用户和编码智能体(Claude Code、Codex 等)。CLI 通过环境变量自动检测智能体驱动,输出紧凑无截断的 TSV 格式,避免 ANSI 和交互提示,大幅降低 token 消耗。复杂多步任务中,不使用 CLI 的智能体 token 消耗最高达 hf CLI 的 6 倍。2026 年 4 月起,Hugging Face 追踪 Hub 智能体流量,Claude Code 约 4 万用户、近 4900 万次请求,Codex 紧随其后。


推荐理由:HF CLI 现在会自动检测 agent 并切换输出,复杂任务上 token 消耗比 curl/SDK 节省 2-6 倍。如果你在用 Claude Code 或 Codex 操作 Hugging Face Hub,这是必读的升级指南。
09:10
IT之家(RSS)精选
AI 评分 75/100
联合国报告:2030年AI数据中心水电消耗将翻倍

联合国大学水、环境与健康研究所报告指出,受AI需求驱动,去年全球数据中心耗电448太瓦时(AI占五分之一),耗水4.5万亿升,碳排放1.89亿吨。预计到2030年,年耗电量将翻倍至945太瓦时(AI占40%),耗水增至9.3万亿升,碳排放升至3.99亿吨,占地面积从6900平方公里扩展至14500平方公里。报告警告若忽视环境成本,AI落地还将加剧土地紧张与电子废弃物问题。


推荐理由:这份联合国报告把算力繁荣的隐性账单摊开了,2030年数据中心要喝掉9.3万亿升水,做AI基建的人该看看,别光比参数。
06:09
xAI@xai精选
AI 评分 69/100
Grok模型登陆Cloudflare AI GatewayTry Grok models on @Cloudflare's AI Gateway!在 @Cloudflare 的 AI Gateway 上尝试 Grok 模型!

Cloudflare Developers: We're partnering with @xai to bring Grok to @Cloudflare AI Gateway. • Grok LLMs, audio, image, and video models are now ...

另有 1 家信源报道X:Elon Musk (@elonmusk, xAI)
推荐理由:xAI把Grok全模态模型塞进了Cloudflare AI Gateway,开发者不用再单独搞定API Key和计费,想试grok-imagine-video的可以直接开跑。
00:42
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 76/100
Ultralytics YOLO26:统一实时端到端视觉模型

Ultralytics YOLO26 采用双头设计实现原生无 NMS 的端到端推理,彻底移除 DFL,获得更轻检测头与无约束回归范围。训练结合混合 Muon-SGD 优化器 MuSGD、转向推理头的 Progressive Loss 及保证小物体正样本的 STAL 标签分配。支持检测、实例分割、姿态估计、定向检测和分类,提供 5 种尺度(n/s/m/l/x)及开放词汇扩展 YOLOE-26。全部尺度在 COCO 上达 40.9–57.5 mAP,T4 TensorRT 延迟 1.7–11.8 ms;YOLOE-26x 在 LVIS minival 文本提示下达 40.6 AP。代码已开源。


推荐理由:这次YOLO26把NMS和DFL都拿掉了,还把大模型训练的Muon优化器改成MuSGD,在COCO上的速度精度平衡比上一代强不少,做实时检测的应该拿来跑一跑。

6月3日

星期三 · 11 条
21:30
Anthropic:Newsroom(网页)精选
AI 评分 59/100
介绍 Claude Partner Network 的 Services Track 和 Partner Hub

Anthropic 扩展 Claude Partner Network,推出 Services Track 分级体系和 Partner Hub 门户。Services Track 设 Select、Preferred、Global Premier 三级,按认证人数、投产客户数及客户推荐信量化评定。Partner Hub 提供每日更新仪表盘和公开目录,方便合作伙伴查看进展、客户寻找供应商。该网络三月启动以来已有超 4 万家公司申请,逾 1 万顾问获认证;Accenture 训练 3 万人,Cognizant 部署约 35 万员工,Deloitte 惠及 47 万人,KPMG 覆盖 27.6 万,Infosys 构建行业智能体,PwC 先在美推广再扩至全球。


推荐理由:Anthropic 给合作伙伴画了一条明确的爬升阶梯,从 Select 到 Global Premier,企业客户终于有个公开透明的渠道找靠谱的实施团队,做 AI 咨询的可以认真评估入局了。
10:02
公众号:数字生命卡兹克精选
AI 评分 66/100
Claude Code团队工程总监分享5条AI原生工作原则

Claude Code团队工程总监Fiona Fung提出,AI时代软件工程瓶颈从“写代码太贵”转移至验证、评审与安全。团队采用JIT规划,先做原型再补文档;遇到重复工作追问“能否自动化”,形成肌肉记忆。代码评审中Claude承担60-70%风格检查与漏洞捕捉,人类聚焦法律、安全与产品判断。角色边界模糊,PM写代码、工程师用Claude起草文案,招聘看重品味与判断力而非代码产出速度。


推荐理由:瓶颈从写代码转移到验证,这判断太准了。更实际的是自动化那些重复三次以上的事,这套逻辑正在Claude Code团队验证,值得每个带团队的人照抄。
03:00
Microsoft:Official Blog(RSS)精选
AI 评分 66/100
微软:企业成功的关键在于围绕AI构建集成智能体平台

微软认为,企业成功的关键在于围绕AI构建一个集成的智能体平台,而非仅拥有强大模型。该平台需遵循三大原则:单一集成系统、安全与治理内建、持续改进。微软正构建一个支持多种模型、以开发者为中心的开放平台,让智能体在软件交付、支持、财务等职能中执行长期工作。


推荐理由:微软把agent平台从散装工具升级成统一系统,这个「企业AI操作系统」的思路让治理和持续进化成为内置能力,而不只是模型和算力。
00:45
Claude:Blog(网页)精选
AI 评分 74/100
Claude Code团队实践:智能体编程如何重塑工程组织与流程

在Code w/ Claude SF 2026活动上,Claude Code工程团队分享了将智能体编程设为默认工作方式后带来的流程与结构变革。核心变化包括:规划转向即时(JIT)模式,强调快速原型与反馈;上下文收集变为“先问Claude”;代码审查中Claude处理风格与测试,人工专注于法律、安全等专业判断。新范式下,工程瓶颈从编写代码转向验证、审查与安全维护。


推荐理由:Anthropic 工程总监把 Claude Code 团队流程全晒了出来,从抛弃半年路线图到代码审查只留专家复审,每一步都反直觉但实战有效,工程领导者直接抄作业。
00:13
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 70/100
Codex 赋能每一种角色、工具和工作流

OpenAI 的 Codex 新增了插件、站点和注释等功能。这些新功能旨在帮助分析师、营销人员、设计师、投资者等各类团队,利用 AI 完成更多工作。Codex 进一步拓展其作为 AI 编码工具的应用场景,以支持更广泛的角色、集成更多工具并优化现有工作流。

另有 4 家信源报道IT之家(RSS)X:OpenAI Developers (@OpenAIDevs)X:OpenAI (@OpenAI)X:Rohan Paul (@rohanpaul_ai)
推荐理由:Codex不再只是开发者工具,六个角色插件和Sites功能把AI带进了营销、销售、投资等日常流,非技术团队可以直接上手,这是大企业AI落地的实用一步。

6月2日

星期二 · 2 条
12:19
OpenRouter:Announcements(RSS)精选
AI 评分 77/100
OpenRouter 5月发布亮点

OpenRouter 发布5月更新,推出语音与转录API、模型融合(Model Fusion)功能,并为平台添加了私有模型和企业工作区管控能力。此次更新共上线20个新模型,其中包括 Gemini 3.5 Flash 和 Claude Opus 4.8。

另有 1 家信源报道OpenRouter:Announcements(RSS)
推荐理由:OpenRouter 五月交付了一整套平台级能力,从安全护栏到语音 API 再到模型融合,Pareto Code Router 按质量阈值选廉价模型这个思路,对 coding agent 的成本控制很实用。如果你重度依赖 OpenRouter,这次更新值得细读。