内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 188 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「开源生态」清除

今天8月26日 周三

12:07HuggingFace Daily Papers(社区热门论文)54LAION-BVD:面向多模态预训练的千万小时级开放视频数据集
11:07HuggingFace Daily Papers(社区热门论文)53Meta^n:通过涌现深度实现递归自我改进
11:07HuggingFace Daily Papers(社区热门论文)66Recuris:面向长时程智能体的递归经验-工作记忆演化架构

8月24日周一

08:48SemiAnalysis64AgentX 推理基准:CUDA 护城河能否守住智能体推理

8月21日周五

08:00HuggingFace Daily Papers(社区热门论文)43Graph Engineering:从个体智能到系统智能的智能体系统新范式

8月20日周四

11:06HuggingFace Daily Papers(社区热门论文)53SemaPLC:面向PLC代码生成的项目级验证门控智能体框架
08:00HuggingFace Daily Papers(社区热门论文)51FlowEvo:通过工作流与可执行技能协同进化实现自我进化的智能体

8月19日周三

21:25The Decoder:AI News(RSS)62Anthropic 让 Claude 智能体运行完整蛋白质设计流程,药物发现命中率超行业水平

8月18日周二

16:54The Decoder:AI News(RSS)52宾州州立大学研究:AI 上下文压缩平均仅保留 17% 用户指令,Qwen3.5-9B 插件可修复
14:05HuggingFace Daily Papers(社区热门论文)53HiFi-BRep:面向鲁棒 B-Rep 生成的高保真潜在表示
05:23elvis37GitSkills:380万智能体技能数据集发布
05:00DAIR.AI51GitSkills:GitHub 上 380 万份智能体技能数据集

8月14日周五

08:00HuggingFace Daily Papers(社区热门论文)49Nanbeige4.2-3B 在 Apple Silicon 上的修复:解决部署缺陷并降低 Looped Transformer 内存开销
08:00HuggingFace Daily Papers(社区热门论文)45PRM-as-a-Judge 1.5:面向机器人过程评估的工具包

8月13日周四

08:00HuggingFace Daily Papers(社区热门论文)53嵌入模型的两难:LLM 更强,但成本几何?

8月11日周二

08:00HuggingFace Daily Papers(社区热门论文)40SKILLER:面向小语言模型的可复用技能提取语言级强化学习框架
08:00HuggingFace Daily Papers(社区热门论文)53GazeAnywhere:首个支持概念提示的通用注视目标估计模型

8月8日周六

08:00HuggingFace Daily Papers(社区热门论文)44TSDS-Toolbox:用于度量时间序列数据集相似度的统一工具箱
08:00HuggingFace Daily Papers(社区热门论文)78精选Ego-OSCAR:开源低成本头戴式立体惯性采集系统

8月7日周五

22:11Nathan Lambert27线性注意力模型实现零训练推理偏差
18:00公众号:小红书技术(dots.llm)65精选小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026
08:00HuggingFace Daily Papers(社区热门论文)51LLMRouter:构建、评估与部署LLM路由器的统一基础设施

8月5日周三

07:04Hacker News 热门(buzzing.cc 中文翻译)67MirrorCode:AI 能独立完成的最大规模软件项目基准测试

8月4日周二

08:00HuggingFace Daily Papers(社区热门论文)53Omega-S:面向 LLM 微调的功能韧性指数
08:00HuggingFace Daily Papers(社区热门论文)47TriGlue:受生物学启发的分子胶诱导三元复合物生成模型

8月1日周六

00:57elvis47OpenMLE 开源机器学习工程递归自我改进全栈系统

7月31日周五

12:10公众号:腾讯混元89精选腾讯混元 Hyra 攻克加法组合学 50 年未解难题
10:52HuggingFace Daily Papers(社区热门论文)68ReToken:一个token提升视觉语言模型的视觉检索能力
10:52HuggingFace Daily Papers(社区热门论文)54Frontis-MA1(35B)发布:面向机器学习工程递归自我改进的 AI4AI 模型
10:52HuggingFace Daily Papers(社区热门论文)53Echoverse:为大规模训练计算机操作智能体而构建的深度演化环境
08:00HuggingFace Daily Papers(社区热门论文)80精选DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型
08:00HuggingFace Daily Papers(社区热门论文)49面向暗光环境的鲁棒 3D 感知 RGB-NIR 成像新方法

7月30日周四

10:52HuggingFace Daily Papers(社区热门论文)72精选AI 智能体能否进行开放式 AI 研究?两项案例的早期证据

7月29日周三

22:56elvis40Kernel Forge:用MCTS优化CUDA内核的开源智能体框架
16:52HuggingFace Daily Papers(社区热门论文)53Modus:纯解码器架构实现任意模态间任意映射
10:51HuggingFace Daily Papers(社区热门论文)45Wonder:实时、可控制摄像头的视频世界模型
10:51HuggingFace Daily Papers(社区热门论文)67HiFi-UMI:仅凭高保真UMI数据即可学习可部署操作策略
08:00HuggingFace Daily Papers(社区热门论文)49重新审视投机解码中的有损验证:机制、权衡与失败模式
08:00HuggingFace Daily Papers(社区热门论文)50Metis:首个记忆基础模型,将原生记忆能力内化进大模型

7月28日周二

23:26Hacker News 热门(buzzing.cc 中文翻译)76精选Kimi Linear:一种表现力强且高效的注意力架构
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「开源生态」 · 188 条清除

8月26日

星期三 · 3 条
12:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
LAION-BVD:面向多模态预训练的千万小时级开放视频数据集

LAION 团队发布 LAION-BVD,一个包含 1.3B 条平台视频 URL、下载 80M 段视频、总时长 1000 万小时的大规模开放视频数据集,面向视频、音频和图像多模态预训练。基于该数据训练的模型在视频-文本和音频-文本基准上表现具竞争力,且性能随训练或模型规模提升而持续增长。数据集已向研究社区开放。

多模态开源生态数据/训练视频
11:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
Meta^n:通过涌现深度实现递归自我改进

Meta^n 提出一种固定元操作 Ω 并对其输入递归的自我改进方法,将元深度从约两层扩展至由收敛决定的动态深度。在两种骨干模型上,Meta^n 在全部八个基准家族上超越此前自我改进智能体,其中在 ARC-AGI-2 上唯一取得非零分数。消融实验显示,递归收益主要来自各层传递给下一层的条件,且深度增加时会涌现出不同层角色。

智能体arXiv开源生态推理
11:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 66/100
Recuris:面向长时程智能体的递归经验-工作记忆演化架构

Recuris 提出递归经验-工作记忆架构,让工作记忆跟踪任务进度并引导技能选择,将执行转化为结构化证据,由固定元智能体对技能记忆进行局部验证更新,形成有界递归演化循环。

智能体开源生态推理论文/研究

8月24日

星期一 · 1 条
08:48
SemiAnalysis@SemiAnalysis_
AI 评分 64/100
AgentX - InferenceXv3:CUDA 护城河在智能体推理中能否守住?开源 300 万美元数据集,100 万+上下文长度,多轮对话,子智能体 95%+ KVCache 命中率,GB300 NVL72,MI355,B200https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat
开源生态推理评测/基准部署/工程

8月21日

星期五 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 43/100
Graph Engineering:从个体智能到系统智能的智能体系统新范式

随着大语言模型从语言生成器进化为可执行复杂长程任务的自主智能体,个体智能面临组织能力上限。论文提出系统智能概念,即智能体系统将多个智能组件组织为协同整体的能力,并引入Graph Engineering这一新兴范式,通过构建表示任务、智能体和系统状态的显式动态图结构,为组织复杂目标、编排异构智能体、建模系统动态及支持可扩展智能体演化提供统一基础。

智能体arXiv开源生态论文/研究

8月20日

星期四 · 2 条
11:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
SemaPLC:面向PLC代码生成的项目级验证门控智能体框架

SemaPLC是一个项目级、验证门控的智能体框架,仅在外部检查确认规范、编译及实时运行行为均通过后才宣告任务完成。在117个独立POU任务上,其于全部七款模型中取得最高严格验证通过率(均值72.6%);在65个需在真实项目中编译运行的任务上,其动态行为得分52.2,远超基线模型的22.4至31.4。该框架已开源。

智能体开源生态编码论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
FlowEvo:通过工作流与可执行技能协同进化实现自我进化的智能体

FlowEvo 提出一种免训练框架,让工作流与技能在推理时协同进化:将成功工作流编译为可调用技能存入持久库,并抑制引发负迁移的技能。

智能体开源生态论文/研究

8月19日

星期三 · 1 条
21:25
The Decoder:AI News(RSS)
AI 评分 62/100
Anthropic 让 Claude 智能体运行完整蛋白质设计流程,药物发现命中率超行业水平

Anthropic 发布两项实验,让 Claude 模型(Mythos Preview 和 Opus 4.8)参与早期药物发现。针对 16 个靶蛋白,Claude 在 15 个中成功 14 个,1,320 个设计中 354 个实际结合靶点,命中率 26.8%,高于行业通常的 10%-15%。

智能体Anthropic开源生态论文/研究

8月18日

星期二 · 4 条
16:54
The Decoder:AI News(RSS)
AI 评分 52/100
宾州州立大学研究:AI 上下文压缩平均仅保留 17% 用户指令,Qwen3.5-9B 插件可修复

宾州州立大学研究显示,AI 系统压缩上下文时平均仅 17% 的会话约束指令能幸存,压缩后规则遵从率大幅下降,多数压缩方案甚至不如不压缩。研究推出 COMPINT 评测套件,并发现基于 Qwen3.5-9B 的附加模块无需训练即可将指令保留率提升至 90% 以上,该模块与评测套件已开源至 GitHub。

智能体GitHub开源生态论文/研究
14:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
HiFi-BRep:面向鲁棒 B-Rep 生成的高保真潜在表示

HiFi-BRep 提出一种新型框架,通过拓扑感知编码器消除填充噪声与特征污染,并以单阶段解码器并行预测几何与拓扑,将流形约束嵌入可微学习目标。实验表明,该方法在结构有效性与几何保真度上显著优于现有最先进方法,代码与模型已公开。

arXiv开源生态论文/研究
05:23
elvis@omarsar0
AI 评分 37/100
GitSkills 数据集收录了 GitHub 上 282,200 个公共仓库中的约 380 万份 SKILL.md 文件,归并为 1,877,981 个不同技能内容,以单个 SQLite 文件提供。该数据集基于 Anthropic 发布技能格式九个月后的全量挖掘,可用于提取智能体设计模式与灵感。

DAIR.AI: How many agent skills are actually out there? There are ~3.8M SKILL.md files across 282,200 public GitHub repositories, ...

智能体AnthropicarXiv开源生态
05:00
DAIR.AI@dair_ai
AI 评分 51/100
GitSkills:GitHub 上 380 万份智能体技能数据集

Anthropic 将 SKILL.md 格式发布为开放规范九个月后,GitHub 上已有约 380 万份 SKILL.md 文件,分布于 28.22 万个公共仓库。研究将其全部挖掘为数据集 GitSkills,按内容去重后得到 187.8 万条不同技能,并以单个 SQLite 文件发布,包含 front matter、文件夹内容和提交历史。

智能体AnthropicGitHub开源生态

8月14日

星期五 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
Nanbeige4.2-3B 在 Apple Silicon 上的修复:解决部署缺陷并降低 Looped Transformer 内存开销

Nanbeige4.2-3B 是 3B 参数智能体模型,采用 Looped Transformer 架构复用单层堆栈进行第二次前向传播以增加有效深度。研究者在 Apple Silicon(MPS)上发现五个独立 bug 阻碍其开箱运行,并引入 chunked-prefill 策略将可用上下文宽度扩展 2.7 倍。

开源生态端侧论文/研究部署/工程
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
PRM-as-a-Judge 1.5:面向机器人过程评估的工具包

PRM-as-a-Judge 1.5 发布,将 rollout 视频转化为密集进度曲线并派生多项细粒度指标,在 1.0 基础上新增三个指标,分别刻画失败侧进展、回撤后恢复与成功侧执行质量。基于基准测试的 rollout 视频,该工具包对具身模型进行了综合评估,并推出 RoboPulse++ 以检验过程奖励模型(PRM)的可靠性,同时开源了包含基准、指标实现与可视化工具的评估套件。

具身智能开源生态论文/研究

8月13日

星期四 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
嵌入模型的两难:LLM 更强,但成本几何?

一项研究对比了十款 LLM 与 26 款嵌入模型在 37 项任务上的表现,两者综合性能几乎持平(最佳 LLM 77.6 分 vs. 最佳嵌入模型 77.2 分)。但 LLM 成本高昂,单次基准测试最高贵 1,431 倍,且推理 token 占其推理成本的 28% 至 81%。研究建议:相似度、分类和聚类用嵌入模型,推理密集型检索用 LLM。

检索增强开源生态论文/研究

8月11日

星期二 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 40/100
SKILLER:面向小语言模型的可复用技能提取语言级强化学习框架

SKILLER 提出一种自然语言驱动的强化学习框架,自动为小模型生成执行器专属技能,以降低 Codex、OpenClaw 等智能体框架部署真实任务时的高推理成本。

智能体开源生态数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
GazeAnywhere:首个支持概念提示的通用注视目标估计模型

研究团队提出提示式注视目标估计(PGE)任务,并发布配套数据集 Gaze-Co 与首个专为该任务设计的模型 GazeAnywhere。GazeAnywhere 通过文本或视觉提示(如“穿红衣服的男孩”)指定分析对象,将主体定位与注视估计整合为端到端流程,在多个 PGE 基准上达到最优性能,并已在 GitHub 开源。

多模态开源生态论文/研究

8月8日

星期六 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 44/100
TSDS-Toolbox:用于度量时间序列数据集相似度的统一工具箱

TSDS-Toolbox 发布,这是一个用于度量时间序列数据集相似度的统一框架,旨在解决现有实现碎片化、难以扩展的问题。该工具箱支持系统化、可复现的相似度方法比较,并允许用户灵活添加自定义数据集、相似度方法和下游时间序列任务。其有效性已在多种实验设置下得到验证,工具箱现已公开可用。

arXiv开源生态数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 78/100
Ego-OSCAR:开源低成本头戴式立体惯性采集系统

Ego-OSCAR 是一款开源硬件、低成本的头戴式立体惯性采集设备,单台物料成本低于 200 美元,仅使用商用组件和 3D 打印部件。设备搭配硬件同步全局快门立体相机、6 轴 IMU 和嵌入式 Linux SBC,并开源完整软件栈及约 550 小时带同步 IMU 的日常室内环境第一视角立体视频。数据集提供开放词汇动作标注和逐帧 3D 手部重建,旨在降低大规模众包第一视角数据采集门槛。

具身智能开源生态数据/训练论文/研究

推荐理由:Ego-OSCAR 把以我为中心的数据采集成本从数万美元压到200美元以下,附带标注的550小时数据集让分布式众包采集变得可行,小团队也能启动规模实验。

8月7日

星期五 · 3 条
22:11
Nathan Lambert@natolambert
AI 评分 27/100
研究团队在TorchTitan RL + vLLM上为Gated DeltaNet(Qwen3.5-9B/35B-A3B)实现训练/生成逐位一致,logprob差为0,为开源首个线性注意力模型达成此目标。异步RL下,offpolicy=32时标准栈偏差超0.065,新方法保持约0.035。代价是训练吞吐量降低2-3倍,团队建议将其作为调试工具而非生产默认。

Yichuan Wang: Zero Train–Inference Mismatch — now for linear attention, and under async RL 🎯 We got bitwise-exact trainer/generator p...

开源生态推理数据/训练论文/研究
18:00
公众号:小红书技术(dots.llm)精选
AI 评分 65/100
小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026

小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。

arXivHugging Face开源生态数据/训练

推荐理由:CULTURE-MT将翻译评测从字面准确拉到文化传递,自动评估模型与开放榜单提供了可复现的评测-训练闭环,让改进不再凭感觉。
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
LLMRouter:构建、评估与部署LLM路由器的统一基础设施

LLMRouter将LLM路由统一表述为包含上下文编码器、模型编码器、评分函数、决策规则和学习信号的序列决策过程,并构建自动化监督构建与评估管线。其推出的xRouteBench基准覆盖通用、记忆增强、视觉、时间序列及个性化路由任务,开源基础设施集成16种以上代表性路由器。实验显示,学习型路由器相对最强固定模型基线提升14.6%。

开源生态论文/研究部署/工程

8月5日

星期三 · 1 条
07:04
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 67/100
MirrorCode:AI 能独立完成的最大规模软件项目基准测试

Anthropic 与 METR 联合推出 MirrorCode 基准,要求 AI 在无源码、无联网条件下端到端重写完整程序。Claude Opus 4.7 用 14 小时、$251 重写了约 16,000 行 Go 代码的生物信息学工具 gotree,而人类工程师预计需 2–17 周。该基准单次运行最高花费 $2,600,AI 连续工作 19 天,目前 22/25 个目标程序已开源。

开源生态论文/研究评测/基准

8月4日

星期二 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
Omega-S:面向 LLM 微调的功能韧性指数

Omega-S 是一种仅基于权重矩阵的即插即用惩罚项,无需先前任务数据、Fisher 矩阵或旧权重副本,在现有训练循环中仅需三行代码,且每步开销增加不到 4%。

arXiv开源生态数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 47/100
TriGlue:受生物学启发的分子胶诱导三元复合物生成模型

TriGlue将分子胶设计建模为三元复合物生成问题,提出受生物学启发的生成框架,分两阶段完成:SE(3)-等变界面估计模块预测几何约束的蛋白-蛋白界面,界面条件三元流匹配网络联合生成分子胶并预测组装三元复合物的刚体变换。实验表明TriGlue能生成化学有效分子和合理三元复合物,代码已开源。

开源生态数据/训练论文/研究

8月1日

星期六 · 1 条
00:57
elvis@omarsar0
AI 评分 47/100
OpenMLE 开源了面向机器学习工程递归自我改进的全栈系统,并后训练出 35B 元进化智能体 Frontis-MA1。在 MLE-Bench Lite 上,Medal Average 从 39.39% 提升至 60.61%,配合异步搜索和经验先验达 71.21%,超过 GPT-5.5 with Codex。

DAIR.AI: Very interesting paper on recursive self-improvement. The whole stack is released. Machine learning engineering gives re...

智能体开源生态论文/研究

7月31日

星期五 · 6 条
12:10
公众号:腾讯混元精选
AI 评分 89/100
腾讯混元 Hyra 攻克加法组合学 50 年未解难题

腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。

开源生态推理论文/研究

推荐理由:构造不再依赖暴力搜索,而是从数学结构入手自主推理,同时给出可形式化证明,让AI在定理型科学问题上从辅助工具转向共同研究者。
10:52
HuggingFace Daily Papers(社区热门论文)
AI 评分 68/100
ReToken:一个token提升视觉语言模型的视觉检索能力

ReToken通过一个可学习的嵌入token作为检索目标,从预填充的视觉KV缓存中筛选与查询相关的稀疏视觉token。在Visual Haystacks基准上,ReToken使Qwen3VL-8B提升13.4分、InternVL3.5提升12.4分;在LVBench上零样本迁移至长视频任务,为Qwen3VL-8B带来8.0分提升。

arXiv多模态开源生态视频
10:52
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
Frontis-MA1(35B)发布:面向机器学习工程递归自我改进的 AI4AI 模型

研究团队推出 OpenMLE 开源全栈系统,并基于其训练出 35B 参数的元进化智能体 Frontis-MA1。

智能体arXiv开源生态论文/研究
10:52
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
Echoverse:为大规模训练计算机操作智能体而构建的深度演化环境

Echoverse 将环境、任务与验证器绑定为“世界”,通过共演化循环让每次分级运行同时用于修复环境和训练模型。在十二个环境中训练的 9B 模型在十四个评估分项上提升显著,与指导它的更大前沿模型差距在十四分以内。同一世界可直接用作强化学习环境,结合接地验证器与密集逐步评判器的奖励将留出集评分从提升至;研究还发布了四个环境作为基准,含应用、种子数据与评分器。

智能体Microsoft开源生态论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 80/100
DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。

Google开源生态推理论文/研究

推荐理由:扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
面向暗光环境的鲁棒 3D 感知 RGB-NIR 成像新方法

东京大学等机构提出一种无需干净 RGB 监督的 3D 感知神经隐式融合模型,可在暗光下将极噪 RGB 观测与近红外(NIR)线索在 3D 空间中隐式融合,恢复干净 RGB 图像。该方法引入 NIR 调制的位置编码和 Color Code MLP,解决噪声过拟合与 NIR-RGB 映射不适定问题,在合成与真实多视图数据集上优于现有方法,并能泛化至不同噪声水平。代码与数据将公开。

arXivGitHub多模态开源生态

7月30日

星期四 · 1 条
10:52
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
AI 智能体能否进行开放式 AI 研究?两项案例的早期证据

一项新研究通过“影子评估”测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。

智能体arXivHugging Face开源生态

推荐理由:这篇论文给「AI即将自我进化」的说法泼了盆冷水,虽然代理能跑通工程,但在解决开放性研究问题上全线溃败,对打算用AI做科研的团队是个重要的现实检验。

7月29日

星期三 · 6 条
22:56
elvis@omarsar0
AI 评分 40/100
Kernel Forge:用MCTS优化CUDA内核的开源智能体框架

Kernel Forge 是一个开源智能体框架,能直接改写未修改 PyTorch 模型的 CUDA 内核,覆盖视觉、扩散和 LLM 任务。它用蒙特卡洛树搜索(MCTS)替代线性生成-修复流程,在 NVIDIA DGX Spark(GB10 GPU)上以每内核 50 次迭代优化了 4 个模型的 14 个内核,使其超越 PyTorch 基线。性能提升主要来自框架结构和原位集成,而非更强的模型。

arXiv开源生态编码论文/研究
16:52
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
Modus:纯解码器架构实现任意模态间任意映射

研究者提出 Modus,一种纯解码器架构的任意模态映射模型,无需特定模态的头部、损失函数或任务管线即可对称处理所有模态的输入与输出。Modus 支持通过中间模态进行链式生成,以及利用另一生成模态对自身输出进行交叉模态自验证。该模型在多项基准测试中与专用模型和多任务基线表现相当,所有材料已开源。

arXiv多模态开源生态论文/研究
10:51
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
Wonder:实时、可控制摄像头的视频世界模型

Wonder 是一个通用视频世界模型,支持用户通过移动摄像头实时、交互式地探索由图像或条件视频构建的可玩世界。该模型通过系统级协同设计控制方法、记忆机制和训练策略,引入密集坐标场的摄像头条件化方法,以及基于稀疏注意力的高效记忆机制,实现了对未观测区域的发现和已观测区域的回访。Wonder 能以 16 FPS 合成多样化的分钟级视频,并在长序列生成中保持连贯的几何、外观与动态。

arXiv开源生态论文/研究
10:51
HuggingFace Daily Papers(社区热门论文)
AI 评分 67/100
HiFi-UMI:仅凭高保真UMI数据即可学习可部署操作策略

HiFi-UMI提出一套软硬件协同设计的便携式数据采集系统,在无外部追踪基础设施下达到毫米级末端执行器精度。基于该系统采集的数据,策略在零机器人后训练下直接部署于真实机器人,在三个骨干网络上与域内遥操作成功率差异不超过3个百分点,最强策略在精密插入任务上达到100%成功率。研究团队开源了HiFi-UMI-2K数据集,包含微秒同步、超宽视场演示数据。

具身智能开源生态数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
重新审视投机解码中的有损验证:机制、权衡与失败模式

投机解码通过轻量草稿模型并行提议并由目标模型验证,以加速大语言模型推理。新研究对有损验证方法引发的分布改写进行原理性分析,将其归为截断式与协作式两类,并构建诊断评估框架。结果显示截断式方法因分布失真可能显著劣于真实截断采样基线,协作式验证则需控制草稿概率超调以防止低质量输出。

开源生态推理论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
Metis:首个记忆基础模型,将原生记忆能力内化进大模型

Metis 提出“记忆基础模型”概念,将持久且动态演化的记忆状态直接内置于模型骨干,通过前向计算自主完成信息的存储与利用,无需外部模块。其在线记忆维护无需梯度,仅需一次前向传播即可更新,推理时所有权重保持冻结。实验显示 Metis 具备原生记忆能力,项目与模型权重已开源。

智能体arXiv开源生态论文/研究

7月28日

星期二 · 1 条
23:26
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
Kimi Linear:一种表现力强且高效的注意力架构

月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。

arXivGitHub开源生态论文/研究

推荐理由:Kimi Linear首次在公平对比中证明了线性注意力可以全面超越full attention,KV缓存降低75%,解码吞吐量提升6倍,所有做长上下文和RL团队的必读论文。
已加载 40 条