内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 321 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「部署/工程」清除

8月25日周二

23:48elvis37阿里智能体记忆新法:上下文当编程任务
21:48elvis36AutoSaddler:自动优化智能体框架的微软新论文
13:07HuggingFace Daily Papers(社区热门论文)48Task-CoEvolve:通过自适应验证任务选择实现高效 Harness 优化

8月24日周一

10:24IT之家(RSS)40摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,破解长上下文推理成本瓶颈
09:24IT之家(RSS)51SK 海力士披露下一代 HBM 内存先进封装技术,引入英特尔 EMIB
09:18elvis36Netflix 如何用 LLM 评判器优化推荐解释
08:48SemiAnalysis64AgentX 推理基准:CUDA 护城河能否守住智能体推理

8月23日周日

08:18Rohan Paul35清华康奈尔研究:ACID-Agent 防记忆污染

8月22日周六

23:18Rohan Paul30DeepMind 潘多拉路由器:按需付费的模型路由新思路
15:58The Decoder:AI News(RSS)47Netflix 测试语言模型 GenRec,替代手工构建的推荐逻辑
09:56Hacker News 热门(buzzing.cc 中文翻译)56当 GPU 读取内存时会发生什么:RTX 4090 全局加载路径逆向工程
03:48Rohan Paul37阿里字节新论文:AI智能体服务需新架构
01:56LMSYS:Blog(Chatbot Arena 团队)63精选Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

8月21日周五

22:44DAIR.AI41DeepMind 将模型路由形式化为潘多拉之盒
13:06HuggingFace Daily Papers(社区热门论文)56FlashPrefill V2:面向长上下文 LLM 服务的块稀疏预填充注意力
08:00HuggingFace Daily Papers(社区热门论文)52量化感知修复:恢复压缩 4 位 LLM 的实用方案
08:00HuggingFace Daily Papers(社区热门论文)47Llama-Mobile:面向 VLM 的 2.7 位高效量化框架

8月20日周四

08:00HuggingFace Daily Papers(社区热门论文)53Daedalus-150M:为 CPU 推理设计的卷积-注意力混合小模型
01:56LMSYS:Blog(Chatbot Arena 团队)73精选突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法
00:44DAIR.AI37生产级智能体成本剖析:非LLM组件主导延迟
00:05HuggingFace Daily Papers(社区热门论文)43PTXBench:用架构特定 PTX 评测与适配 LLM 的 GPU 内核优化

8月19日周三

03:05Hugging Face:Blog(RSS)66精选智能体记忆并非越多越好:八款模型评测显示剂量需按能力校准

8月18日周二

12:24Rohan Paul36哈佛芝加哥研究:LLM 服务一年负载分析
11:05HuggingFace Daily Papers(社区热门论文)54Ventor-QTest:面向第三方托管大模型 API 的威胁模型驱动审计
08:00HuggingFace Daily Papers(社区热门论文)53TileMix:面向 LLM 推理加速的以 Tile 为中心的混合精度注意力机制
00:53Hacker News 热门(buzzing.cc 中文翻译)59AI 生成的 GitHub Copilot"自动修复"功能导致 Snowflake 的 Jira 系统遭到入侵

8月16日周日

08:00HuggingFace Daily Papers(社区热门论文)44TinyCast:用计算周期实现概率零样本预测

8月14日周五

22:22Rohan Paul36MIT 新框架统一描述深度学习架构
08:00HuggingFace Daily Papers(社区热门论文)49Nanbeige4.2-3B 在 Apple Silicon 上的修复:解决部署缺陷并降低 Looped Transformer 内存开销
03:52Rohan Paul35Zero-Mem:零 token 的 LLM 智能体记忆方案

8月13日周四

18:02HuggingFace Daily Papers(社区热门论文)47Ready Cohorts:为LLM智能体控制划定GPU执行机会边界并避免主机往返

8月12日周三

12:01公众号:百度智能云(文心)39百度智能云虚拟交换机BvS新数据面Sonata论文入选NSDI'27
03:47Rohan Paul48Google 新论文:用智能体将 LLM 基础设施优化从穷举搜索转为瓶颈定向搜索
01:15Hacker News 热门(buzzing.cc 中文翻译)73精选Apple Silicon 与 macOS 虚拟机:借助 Llama.cpp 实现 11-16 倍的 LLM 推理加速

8月11日周二

21:51LMSYS:Blog(Chatbot Arena 团队)72精选统一 Radix 缓存:为混合模型前缀缓存构建单一树结构
20:01HuggingFace Daily Papers(社区热门论文)51UniProbe:面向大型视觉语言模型的可学习 token 级幻觉检测器
08:00HuggingFace Daily Papers(社区热门论文)60智能体安全应是运行时契约

8月10日周一

07:42Sakana AI:Blog(网页)0ベースモデルに依存しないオーケストレーションに向けて:Gemma 4版 Sakana Fuguの検証

8月9日周日

19:44Rohan Paul46Meta 研究:量化让推理模型过度自我怀疑
15:44Rohan Paul50微软论文:编码智能体不应按聊天请求调度
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「部署/工程」 · 321 条清除

8月25日

星期二 · 3 条
23:48
elvis@omarsar0
AI 评分 37/100
阿里智能体记忆新法:上下文当编程任务

阿里提出将智能体上下文管理视为编程任务的新方法:以追加式事件日志和沙盒持久 Python 内核为基座,工具输出与检索历史绑定为类型化变量,由模型编写代码检索和转换状态。配合逐出索引实现精确回溯,Qwen3.8-Max 在 LongMemEval_S 达 94.8%,BEAM_10M 达 73.1%(超最佳系统 5.1 分),LOCA_256K 达 86.7%。

智能体arXiv论文/研究部署/工程
21:48
elvis@omarsar0
AI 评分 36/100
AutoSaddler:自动优化智能体框架的微软新论文

微软等机构提出 AutoSaddler,将智能体框架视为代码,通过失败轨迹离线自动生成补丁,优化提示词、工具配置和控制逻辑。在 GAIA2、SWE-Bench Pro、Terminal-Bench 2.0 上分别提升 9.0、9.6、10.0 分。研究显示深度调试优于浅层反思,定向编辑优于无约束编辑。

智能体Microsoft论文/研究部署/工程
13:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 48/100
Task-CoEvolve:通过自适应验证任务选择实现高效 Harness 优化

Task-CoEvolve 提出一种高效的大语言模型 harness 优化方法,通过让验证任务与 harness 共同演化,解决固定验证集评估成本高的问题。该方法利用方差加权采样聚焦能力边界附近的任务,并基于采样概率估计全量集分数。在在线文本分类和 Terminal-Bench 2.1 上,Task-CoEvolve 匹配全量集搜索的最终性能,同时将优化过程中的评估次数减少 80%。

论文/研究部署/工程

8月24日

星期一 · 4 条
10:24
IT之家(RSS)
AI 评分 40/100
摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,破解长上下文推理成本瓶颈

摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,基于旗舰级AI训推一体智算卡MTT S5000构建“Prefill As a Service”新范式,面向AI Agent、代码生成、超长文档分析等长上下文推理场景。

推理论文/研究部署/工程
09:24
IT之家(RSS)
AI 评分 51/100
SK 海力士披露下一代 HBM 内存先进封装技术,引入英特尔 EMIB

SK 海力士在 Hot Chips 2026 大会上披露下一代 HBM 封装路线图,计划借助英特尔 EMIB 等先进封装技术,未来进入 3D 封装阶段。其 HBM4 带宽超 2TB/s,功耗效率较 HBM3E 提升 40% 以上,容量最高 48GB,并正研发混合键合与 I-HBM 局部热点缓解技术以应对散热挑战。

论文/研究部署/工程
09:18
elvis@omarsar0
AI 评分 36/100
Netflix 如何用 LLM 评判器优化推荐解释

Netflix 每周运行数十万次节目级推荐解释的 LLM 评判器,服务数百万移动端会员,并将其视为包含诞生、训练、部署、监控四阶段的完整生命周期。训练阶段采用推理对齐的规则调优,以元评判器输出为学习信号;部署时同一评判器承担质量门控与反思生成双重角色。五周 A/B 测试显示,相比无解释对照组,浏览到播放的转化率提升,且未出现质量相关问题。

数据/训练论文/研究部署/工程
08:48
SemiAnalysis@SemiAnalysis_
AI 评分 64/100
AgentX - InferenceXv3:CUDA 护城河在智能体推理中能否守住?开源 300 万美元数据集,100 万+上下文长度,多轮对话,子智能体 95%+ KVCache 命中率,GB300 NVL72,MI355,B200https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat
开源生态推理评测/基准部署/工程

8月23日

星期日 · 1 条
08:18
Rohan Paul@rohanpaul_ai
AI 评分 35/100
清华康奈尔研究:ACID-Agent 防记忆污染

清华与康奈尔新研究指出,智能体记忆可能将可恢复错误固化为持续错误。论文借鉴数据库事务思想提出 ACID-Agent,将探索-执行-验证循环视为事务,仅提交验证通过的结果,失败尝试不进入记忆与工作区。验证失败时智能体重试且不携带失败状态,长期运行可靠性更取决于控制提交与重试而非单纯提升推理能力。

智能体arXiv论文/研究部署/工程

8月22日

星期六 · 5 条
23:18
Rohan Paul@rohanpaul_ai
AI 评分 30/100
DeepMind 潘多拉路由器:按需付费的模型路由新思路

Google DeepMind 提出 Pandora's Router,将模型路由决策建模为潘多拉魔盒问题:先给每个专家模型一个廉价粗略评分,仅当额外信息的预期价值高于成本时,才付费运行更强评估器。在 MATH、RAG 和 EmbedLLM 基准上,其综合路由遗憾与检查成本最低或并列最低;EmbedLLM 上平均检查成本从 1.986 降至 0.075,路由遗憾从 0.370 降至 0.311。

DeepMind论文/研究部署/工程
15:58
The Decoder:AI News(RSS)
AI 评分 47/100
Netflix 测试语言模型 GenRec,替代手工构建的推荐逻辑

Netflix 自研的基于语言模型的推荐系统 GenRec 在离线测试和约 10% 流量的四周 A/B 实验中均优于现有生产系统,排名质量离线提升约 1.6%,第二阶段训练所需标注数据减少约 40 倍。

数据/训练论文/研究部署/工程
09:56
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 56/100
当 GPU 读取内存时会发生什么:RTX 4090 全局加载路径逆向工程

本文通过时序实验逆向工程 RTX 4090 上全局加载指令的硬件路径,揭示 L1/L2 缓存的切片函数与组索引均为地址位奇偶校验函数,并包含非线性 (a >> 15) mod 9 项。L2 为 16 路组相联,按物理地址索引和标记;L1 则使用虚拟地址。作者还给出了 36 切片(4090)与 48 切片(L40S)的切片预测函数代码。

论文/研究部署/工程
03:48
Rohan Paul@rohanpaul_ai
AI 评分 37/100
阿里字节新论文:AI智能体服务需新架构

阿里与字节新论文指出,AI智能体性能瓶颈已从模型推理转向工具、内存、环境与模型的协同。基于10个智能体应用的AgentSysBench测试显示,任务感知调度降低延迟29–40%,通信感知放置提速4.5倍,状态卸载节省内存4.6倍,缓存消除35.2%冗余搜索调用。单纯优化token/秒已不够,需将模型、工具、内存与通信统一调度。

智能体论文/研究部署/工程
01:56
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 63/100
Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。

推理论文/研究部署/工程

推荐理由:对做单请求低延迟推理的团队,可迁移的是先把主机从 GPU 进度上解绑再优化 GPU 关键路径,否则主机的同步等待会变成每步的 GPU 气泡,这与具体模型无关。

8月21日

星期五 · 4 条
22:44
DAIR.AI@dair_ai
AI 评分 41/100
DeepMind 将模型路由形式化为潘多拉之盒

Google DeepMind 新论文将模型路由形式化为潘多拉之盒问题,即检查成本高昂时的最优搜索问题。在高斯信号模型下策略有闭式解,可判断每个专家和输入是否值得细化估计。在多 LLM 基准、检索增强专家和可变推理时长的 LLM 上,Pandora's Router 以远低于昂贵估计器的调用频率达到穷举估计质量。

DeepMind推理论文/研究部署/工程
13:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 56/100
FlashPrefill V2:面向长上下文 LLM 服务的块稀疏预填充注意力

FlashPrefill V2 将稀疏注意力从算法原型推进到实用化长上下文服务,通过均值校正项抑制近似误差,并采用 PackGQA 内存访问、warp 特化和 pingpong 流水线,对齐 FlashAttention-3/4 并支持 FP8 推理。

推理论文/研究部署/工程
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
量化感知修复:恢复压缩 4 位 LLM 的实用方案

研究团队提出量化感知修复(QAH)替代量化感知训练(QAT),以恢复压缩并量化至 4 位的 LLM。在 GPT-OSS 120B 压缩至 60B 并量化为 MXFP4 的流程中,QAH 学生模型在 9 项基准的 7 项上匹敌或超越其 bfloat16 来源,权重内存减少约 4 倍,并以 Hypernova-60B 开源发布。

数据/训练论文/研究部署/工程
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 47/100
Llama-Mobile:面向 VLM 的 2.7 位高效量化框架

Llama-Mobile 提出一种面向视觉语言模型(VLM)的量化框架,无需访问训练设置,利用模型自身生成训练数据,并采用新颖的 2.7 位/参数格式,支持在 Arm CPU 上高效推理。该框架将 Llama 3.2 11B Vision Instruct 模型压缩至 3.7 GB(8 位激活),在标准视觉问答任务上保持强劲性能。

Meta端侧论文/研究部署/工程

8月20日

星期四 · 4 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
Daedalus-150M:为 CPU 推理设计的卷积-注意力混合小模型

Daedalus-150M 是一款专为 CPU 推理设计的小语言模型,18 层中仅 6 层使用全注意力,其余 12 层采用短卷积以固定内存占用。该模型在 59.9B tokens 上从头训练,五任务基准得分 47.31,超越 GPT-2 124M、Pythia-160M 等更大模型,4-bit 文件小 6.3%,2048 tokens 上下文解码快 1.76 倍。

arXiv端侧论文/研究部署/工程
01:56
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 73/100
突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法

LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×。

DeepSeek推理论文/研究部署/工程

推荐理由:文章提出按上下文长度与并发需求分场景选择 prefill/decode 配置,并用 Humming 压缩和 Online C128 释放 HBM,使 H20 也能服务 1M 上下文,为受限硬件上的大规模推理提供了可复用的工程思路。
00:44
DAIR.AI@dair_ai
AI 评分 37/100
生产级智能体成本剖析:非LLM组件主导延迟

DAIR.AI 推荐一篇关于生产级智能体成本分析的重要论文。研究发现,在十个被观测的智能体应用中,非 LLM 组件在五个应用中主导了延迟。论文提出任务感知服务可将延迟降低 29-40%,状态卸载可减少 4.6 倍内存,工具结果缓存可消除 35.2% 的冗余搜索调用。

智能体论文/研究部署/工程
00:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 43/100
PTXBench:用架构特定 PTX 评测与适配 LLM 的 GPU 内核优化

PTXBench 基准在 H100 和 B200 GPU 上评测 LLM 使用架构特定 PTX 优化 GPU 内核的能力,覆盖 GEMM 与注意力负载的功能正确性、目标指令执行及相对前沿库的加速比。评测显示各模型在复杂注意力反向负载上成功率大幅下降,且无一能持续匹配前沿库性能。研究团队用监督微调适配 Qwen3.6-27B,修复条件训练改善部分任务但泛化仍不均衡。

arXiv数据/训练论文/研究部署/工程

8月19日

星期三 · 1 条
03:05
Hugging Face:Blog(RSS)精选
AI 评分 66/100
智能体记忆并非越多越好:八款模型评测显示剂量需按能力校准

智能体记忆并非可随意开启的功能,而是需按模型能力校准的剂量。强模型适合注入完整指南集,DeepSeek-V3.2(671B MoE)任务完成率提升+9.5个百分点;较弱模型采用精选检索效果最佳,gpt-oss-120b(117B MoE)提升+16.1pp且仅增加+5% token。该方法无需更新权重或人工标注,通过从智能体过往轨迹中蒸馏指南并在推理时注入实现。

智能体论文/研究部署/工程

推荐理由:把智能体记忆的配置从越多越好修正为按模型能力校准,弱模型用检索核心比全量更准且成本更低,为上下文预算提供量化依据。

8月18日

星期二 · 4 条
12:24
Rohan Paul@rohanpaul_ai
AI 评分 36/100
哈佛芝加哥研究:LLM 服务一年负载分析

哈佛与芝加哥团队分析 9,174 个模型、6.12B 次请求的一年生产数据,发现高效 LLM 服务更依赖理解流量变化与重复模式,而非单一调度器。99% 的缓存复用来自 15 分钟内的重复请求,均匀负载均衡会削弱该优势。研究建议路由、缓存与容量规划应基于真实流量历史,而非短时或合成基准。

arXiv论文/研究部署/工程
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
Ventor-QTest:面向第三方托管大模型 API 的威胁模型驱动审计

Ventor-QTest 提出一种无需目标 API 概率信息的复合黑盒审计方法,通过重复请求与长序列组件分别报告平均保真度损失(AFL)和极端保真度损失(EFL)。在七组路由快照中,EFL 随任务暴露增加与 Terminal-Bench 通过率下降同步出现,提示审计长程智能体任务时应联合报告 AFL 与 EFL。实现已开源。

智能体arXiv安全/对齐论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
TileMix:面向 LLM 推理加速的以 Tile 为中心的混合精度注意力机制

TileMix 提出一种以 tile 为中心的精度路由内核,将注意力矩阵划分为硬件对齐的 score tile,通过紧凑位掩码将每个 tile 组分配给 FP16 或 INT8 计算,同时共享在线 softmax 状态。

推理论文/研究部署/工程
00:53
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 59/100
AI 生成的 GitHub Copilot"自动修复"功能导致 Snowflake 的 Jira 系统遭到入侵

一个由 AI 生成的修复方案在 Snowflake 公共仓库中引入了工作流注入漏洞,并在数天内被 Wiz Red Agent 发现。该漏洞导致 Snowflake 的 Jira 系统遭到入侵。Wiz Red Agent 已发布完整研究分析。

GitHub编码论文/研究部署/工程

8月16日

星期日 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 44/100
TinyCast:用计算周期实现概率零样本预测

TinyCast 是一个无注意力机制的零样本预测器,仅用 146,505 个参数即可输出预测分布,其核心思路是在该规模下,上下文的周期结构值得计算而非学习。它比 GIFT-Eval 榜单上所有参数可查的零样本模型都小,在概率准确度上定义了规模-准确度前沿。

端侧论文/研究部署/工程

8月14日

星期五 · 3 条
22:22
Rohan Paul@rohanpaul_ai
AI 评分 36/100
MIT 新框架统一描述深度学习架构

MIT 新论文提出一种数学框架,用于表示、操作和编译深度学习架构,为模型提供统一的描述语言,精确涵盖张量操作的连接与行为。该表示可一键转换为图表、机器可读图或可运行的 PyTorch 代码,旨在最终让软件自动分析和优化模型架构,减少人工操作。论文见 arxiv.org/abs/2604.07242。

arXiv论文/研究部署/工程
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
Nanbeige4.2-3B 在 Apple Silicon 上的修复:解决部署缺陷并降低 Looped Transformer 内存开销

Nanbeige4.2-3B 是 3B 参数智能体模型,采用 Looped Transformer 架构复用单层堆栈进行第二次前向传播以增加有效深度。研究者在 Apple Silicon(MPS)上发现五个独立 bug 阻碍其开箱运行,并引入 chunked-prefill 策略将可用上下文宽度扩展 2.7 倍。

开源生态端侧论文/研究部署/工程
03:52
Rohan Paul@rohanpaul_ai
AI 评分 35/100
Zero-Mem:零 token 的 LLM 智能体记忆方案

Zero-Mem 提出一种无需 LLM 参与的记忆管理方法,其记忆操作使用零 LLM token,相比最快基线延迟降低 57.6%。该方法保留原始交互历史,构建实体上下文图和时间层级两种非生成视图,查询时通过确定性路由检索证据并校准结果,使最终问答外的所有记忆操作均不消耗 LLM 调用或 token。

智能体论文/研究部署/工程

8月13日

星期四 · 1 条
18:02
HuggingFace Daily Papers(社区热门论文)
AI 评分 47/100
Ready Cohorts:为LLM智能体控制划定GPU执行机会边界并避免主机往返

研究为LLM智能体控制路径提出“ready-cohort”边界以量化GPU执行机会。在851会话轨迹回放中,固定分区份额F=30.19%,精确离线份额P*=43.00%,精确打包可恢复固定窗口边界损失的81.83%。将GPU决策保留在设备端,在全部36种配置中均更快,行中位数比率介于1.19x至2.39x。

智能体论文/研究部署/工程

8月12日

星期三 · 3 条
12:01
公众号:百度智能云(文心)
AI 评分 39/100
百度智能云虚拟交换机BvS新数据面Sonata论文入选NSDI'27

百度智能云网络团队与中国科学院计算机网络信息中心合作的论文被计算机网络顶会NSDI'27录用,该届投稿355篇、录用60篇。论文提出BvS虚拟交换机的新一代数据面Sonata,采用软件为中心路线,以标准化接口卸载稳定流量、软件处理复杂流量。生产环境中Sonata将软件CPS提升2.13至2.51倍,开启硬件卸载后提升4.3至11.5倍,热升级抖动控制在数百微秒,已部署于数十万台服务器。

论文/研究部署/工程
03:47
Rohan Paul@rohanpaul_ai
AI 评分 48/100
Google 新论文:用智能体将 LLM 基础设施优化从穷举搜索转为瓶颈定向搜索

Google 新论文提出 PROMPTS,用智能体将 LLM 基础设施优化从穷举搜索转为先理解瓶颈再定向搜索。其 Analyzer Agent 将瓶颈分为计算、内存或通信三类,Proposal Agent 生成三种 TPU 并行映射方案。在 8 个生产负载中,人工验证配置每次都出现在首批方案里,7/8 情况下是首个被测试的配置。

Google数据/训练论文/研究部署/工程
01:15
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 73/100
Apple Silicon 与 macOS 虚拟机:借助 Llama.cpp 实现 11-16 倍的 LLM 推理加速

研究团队为 macOS 虚拟机中的 Metal 能力查询构建进程级兼容层,使 llama.cpp 能选用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍、token 生成提升 16.36 倍,接近裸机性能的 98%;Gemma 4 12B 的提示处理与生成速度分别提升 7.20 倍和 14.54 倍。

推理论文/研究部署/工程

推荐理由:通过进程级 Metal 能力注入,macOS 虚拟机中 llm 推理速度提升一个数量级,为在隔离环境运行大模型提供了此前缺失的算力基础。

8月11日

星期二 · 3 条
21:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
统一 Radix 缓存:为混合模型前缀缓存构建单一树结构

LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。

推理论文/研究部署/工程

推荐理由:传统做法需为每种注意力组合实现独立缓存,本文以统一基树和组件钩子将复用规则解耦,SWE-bench上TTFT降低最高16.6%。
20:01
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
UniProbe:面向大型视觉语言模型的可学习 token 级幻觉检测器

UniProbe 提出一种轻量级、统一的可学习检测器,通过单次前向传播对冻结 LVLM 的异构计算轨迹建模,利用 GNN、ViT 和 GRU 交替处理空间、关系与序列证据,实现 token 级幻觉定位。在多种 LVLM 主干上达到 SOTA 检测性能,解码时可将物体幻觉降低最多 55%,延迟仅为标准生成的 1.06 倍。

多模态论文/研究部署/工程
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 60/100
智能体安全应是运行时契约

论文主张智能体安全不应依赖训练阶段对齐,而应由系统运行时强制执行的契约保障,涵盖预防与证据两个层面。作者基于52起安全事故、31个虚假完成案例、12个系统轨迹审计及28,560篇论文分析,指出训练与部署研究存在8–12倍失衡,并提出Agent Trajectory Schema与Evidence Chain作为研究方向。

智能体论文/研究部署/工程

8月10日

星期一 · 1 条
07:42
Sakana AI:Blog(网页)
AI 评分 0/100
ベースモデルに依存しないオーケストレーションに向けて:Gemma 4版 Sakana Fuguの検証
论文/研究部署/工程

8月9日

星期日 · 2 条
19:44
Rohan Paul@rohanpaul_ai
AI 评分 46/100
Meta 研究:量化让推理模型过度自我怀疑

Meta 新论文发现,强量化会让推理模型在已得出正确答案后反复自我怀疑,过度思考失败率最高升至 52%。研究在数学、编程和科学任务上测试了 5 个推理模型(1.5B 至 32B),对 50 个犹豫词施加小幅惩罚即可将推理长度缩短 12% 至 23%,且常能保持或提升准确率。

Meta推理论文/研究部署/工程
15:44
Rohan Paul@rohanpaul_ai
AI 评分 50/100
微软论文:编码智能体不应按聊天请求调度

微软对 13.5M 次 GitHub Copilot 会话的生产轨迹分析显示,87% 的 LLM 调用来自智能体自身而非用户。KV 缓存命中率在单轮内从首次调用的约 45% 升至第三次起的 92–94%,模型切换时骤降至 8%。论文提出基于轮次和会话级特征的轻量预测器,可捕获 86–90% 的总空闲时间,表明编码智能体基础设施应按轮次调度工作流状态,而非请求级策略。

智能体arXivMicrosoft论文/研究
已加载 40 条