内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态资讯 · 1290 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「arXiv」清除

8月23日周日

17:29The Decoder:AI News(RSS)51研究认为AI可能让科学家做得更多但做得更差,而非更少但更好

8月22日周六

20:28The Decoder:AI News(RSS)53普林斯顿与 UCSD 研究揭示 AI 智能体为何受益于"技能"及其失效场景
15:28The Decoder:AI News(RSS)47心理学方法揭示AI安全测试的重大缺陷

8月21日周五

22:06HuggingFace Daily Papers(社区热门论文)51CoToGrasp:通过规范工作区学习实现接触拓扑条件化的灵巧抓取合成
22:06HuggingFace Daily Papers(社区热门论文)47GOAG:面向灵巧机器人操作的可泛化物体无关抓取规划器
14:06HuggingFace Daily Papers(社区热门论文)50量化 ASR 模型基准优化:高分开源模型在音频不充分时仍复现基准参考文本
11:06HuggingFace Daily Papers(社区热门论文)504DAnyone:从随意单目视频重建4D人体
10:06HuggingFace Daily Papers(社区热门论文)56EnvHarness:为智能体学习唤醒静态环境
08:00HuggingFace Daily Papers(社区热门论文)48EviRank:面向多模态图像重排序的结构化相关性证据
08:00HuggingFace Daily Papers(社区热门论文)52RecVerse:面向真实购物行为保真模拟的 GUI 智能体
08:00HuggingFace Daily Papers(社区热门论文)43Graph Engineering:从个体智能到系统智能的智能体系统新范式
08:00HuggingFace Daily Papers(社区热门论文)39InfinityEdit:用轻量编辑适配器实现无限视频编辑
00:24Hacker News 热门(buzzing.cc 中文翻译)49不要再将中间令牌拟人化为推理/思考的痕迹

8月20日周四

21:57HuggingFace Daily Papers(社区热门论文)54逐步扩展计算效率:大规模混合专家模型的超参数迁移方法
18:24IT之家(RSS)72精选阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕
12:06HuggingFace Daily Papers(社区热门论文)46SoftVTBench:面向可变形物体操作的形变感知视触觉数据集与基准
12:06HuggingFace Daily Papers(社区热门论文)42潜在世界模型中的决策度量对齐:诊断与面向动作的MPC规划目标
11:06HuggingFace Daily Papers(社区热门论文)53FM-Bench:面向长期管理场景的智能体评测基准
10:05HuggingFace Daily Papers(社区热门论文)38SkillForge:通过自蒸馏智能体解决项目特定问题
09:05HuggingFace Daily Papers(社区热门论文)40FACET:终端任务合成中保留源意图与可执行状态
08:00HuggingFace Daily Papers(社区热门论文)53Daedalus-150M:为 CPU 推理设计的卷积-注意力混合小模型
00:05HuggingFace Daily Papers(社区热门论文)43PTXBench:用架构特定 PTX 评测与适配 LLM 的 GPU 内核优化

8月19日周三

16:05HuggingFace Daily Papers(社区热门论文)26EditBridge:面向高保真与高效超高清图像编辑的扩散桥接框架
13:05HuggingFace Daily Papers(社区热门论文)58HarnessRisk:面向智能体 Harness 安全的全生命周期基准
11:05HuggingFace Daily Papers(社区热门论文)44aDSL:通过智能体与程序联合设计实现智能体3D内容生成
11:05HuggingFace Daily Papers(社区热门论文)72精选StartupBench:面向市场验证端到端工作流的通用智能体基准测试
11:05HuggingFace Daily Papers(社区热门论文)62ASI-Bench:首个联合评估AI创新探索与自主科研能力的基准
11:05HuggingFace Daily Papers(社区热门论文)50面向通用图像生成的能力中心化数据设计:从语料库到协同演进能力
10:05HuggingFace Daily Papers(社区热门论文)51Agentic ESOpt:以极低 GPU 需求微调长程 LLM 智能体
08:00HuggingFace Daily Papers(社区热门论文)52VA-Judger:面向视频-音频联合生成的人类偏好奖励模型

8月18日周二

17:05HuggingFace Daily Papers(社区热门论文)44即插即用的2D运动接口:让真实世界运动语言模型无需微调即可工作
14:05HuggingFace Daily Papers(社区热门论文)53HiFi-BRep:面向鲁棒 B-Rep 生成的高保真潜在表示
13:05HuggingFace Daily Papers(社区热门论文)54AnyTalk:利用视频生成模型为任意角色生成3D语音动画
12:05HuggingFace Daily Papers(社区热门论文)53像素空间文生图扩散模型训练实证研究:潜空间到像素空间策略带来 3.18-4.75 倍推理加速
11:05HuggingFace Daily Papers(社区热门论文)54Ventor-QTest:面向第三方托管大模型 API 的威胁模型驱动审计
09:24MarkTechPost(RSS)56字节跳动Seed与清华AIR推出CUDA Agent:面向CUDA内核生成的规模化智能体强化学习系统
08:00HuggingFace Daily Papers(社区热门论文)46WorldMind:面向状态感知 NPC 行为的解耦游戏世界模型
08:00HuggingFace Daily Papers(社区热门论文)40基础模型时代的人类中心智能:综述
08:00HuggingFace Daily Papers(社区热门论文)43SemComp-Bench:为视频生成中的语义任务完成设立基准

8月17日周一

08:00HuggingFace Daily Papers(社区热门论文)46RapidLiDAR:迈向实时且自适应的 LiDAR 场景补全
已加载 40 条
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
资讯 · 标签「arXiv」 · 1290 条清除

8月23日

星期日 · 1 条
17:29
The Decoder:AI News(RSS)
AI 评分 51/100
研究认为AI可能让科学家做得更多但做得更差,而非更少但更好

普林斯顿、华盛顿大学等机构的一项理论经济学研究认为,即便大语言模型完美无缺,也可能让科研质量下降而非提升。模型基于最优觅食理论模拟发现,在三种AI介入科研的场景中,两种会导致研究深度下降,因为节省的时间会被用于启动新项目而非深化现有工作。作者指出,LLM提高了时间的机会成本,促使人们“做得更多、但做得更差”。

arXivOpenAI论文/研究

8月22日

星期六 · 2 条
20:28
The Decoder:AI News(RSS)
AI 评分 53/100
普林斯顿与 UCSD 研究揭示 AI 智能体为何受益于"技能"及其失效场景

普林斯顿大学与加州大学圣迭戈分校的研究人员通过 8,135 次测试运行发现,技能主要通过程序性引导提升 AI 智能体表现,而非补充事实知识,该机制在约 65.7% 的案例中奏效。技能库从 5 条增至 100 条时,检索命中率从 29.6% 降至 3.3%。研究者认为,更可靠的技能创建、检索与应用方法比单纯积累经验更重要。

智能体arXiv论文/研究
15:28
The Decoder:AI News(RSS)
AI 评分 47/100
心理学方法揭示AI安全测试的重大缺陷

包括英国AI安全研究所在内的团队分析了192个模型、5000多个测试问题,发现聚合安全分数具有误导性:模型可通过全面拒绝请求虚增分数,却降低日常实用性。研究还发现不到2%的测试问题真正有效,约10个自适应选择题即可接近完整评测结果,成本降低97%至99%。新统计方法能识别“沙袋效应”,在测试中捕获80%至100%的过度谨慎行为,并可通过响应模式识别API背后实际运行的模型。

AnthropicarXiv安全/对齐数据/训练

8月21日

星期五 · 10 条
22:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
CoToGrasp:通过规范工作区学习实现接触拓扑条件化的灵巧抓取合成

CoToGrasp 提出一种新型生成框架,可严格按特定接触拓扑合成多样且稳定的灵巧抓取,并以完全与物体无关的方式训练,绕过昂贵的数据集标注瓶颈。其引入基于特征的规范工作区,将局部物体特征投影到统一抓取器中心域,从而在推理时实现对未见物体的零样本泛化。

arXiv具身智能论文/研究
22:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 47/100
GOAG:面向灵巧机器人操作的可泛化物体无关抓取规划器

GOAG 提出一种全新深度生成模型,利用抓取器与物体在接触点共享相同表面几何的观察,学习抓取器接触面分布的紧凑潜表征,无需依赖特定物体的训练数据即可高效采样有效抓取构型。在 MultiDex 数据集上平均成功率达 86.93%,达到最先进水平;生成大量抓取时速度显著更快,且性能与专门在该数据集上训练的领先方法相当。

arXiv具身智能论文/研究
14:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
量化 ASR 模型基准优化:高分开源模型在音频不充分时仍复现基准参考文本

一项新研究提出量化自动语音识别(ASR)模型基准优化程度的方法,聚焦音频不足以确定参考转写文本的情形。研究发现,得分最高的开源模型即使在相关音频矛盾、被遮蔽或含混时,仍会逐字输出基准参考文本片段,且该行为可通过低秩线性引导或简单在片段末尾追加音频进行因果操控。结果表明,高性能模型存在基准条件化行为,可能虚增基准分数而不反映通用转写能力的提升。

arXiv论文/研究语音
11:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
4DAnyone:从随意单目视频重建4D人体

4DAnyone提出从无标定单目视频重建4D人体的框架,通过生成重建级多视角一致视频并提升至4D高斯泼溅(4DGS)。针对现有模型在数十个目标视角下的一致性失效问题,该方法以参考上下文打包(RCP)和目标任务上下文路由(TCR)分别实现O(1)参考复杂度与跨组上下文共享。在DNA-Rendering和DyMVHumans上,4DAnyone在视角视频质量与下游4DGS重建上均优于先前方法。

arXiv图像生成视频论文/研究
10:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 56/100
EnvHarness:为智能体学习唤醒静态环境

EnvHarness 提出一种可编程插件层,在不修改底层逻辑的前提下重塑静态环境行为,并配套 EnvRigger 将目标策略视为黑盒,通过观察执行轨迹自动合成组件。在四个领域的五个基准上,EnvHarness 超越原始环境与领域专用生成管线,在保留实例上最高提升 9.0 分,同时减少 9.8% 执行步骤,并为强化学习提供更优的优化信号。

智能体arXiv数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 48/100
EviRank:面向多模态图像重排序的结构化相关性证据

EviRank 将多模态图像重排序重构为语义约束满足问题,把任意查询(纯文本、纯图像或组合)解析为统一证据包,涵盖六个语义槽(如实体、属性、关系)并分别标注 required、forbidden 或 ignorable。

arXiv多模态搜索论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
RecVerse:面向真实购物行为保真模拟的 GUI 智能体

RecVerse 是一款基于 GUI 的购物行为模拟智能体,通过截图感知页面并生成多轮轨迹,以解决现有模拟器在长会话记忆与优化目标上的两大挑战。它采用认知启发的分层记忆(工作记忆、情景记忆、偏好记忆),并以轨迹级强化学习目标优化整个会话,使行为分布与购物意图更贴近真实用户。

智能体arXiv数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 43/100
Graph Engineering:从个体智能到系统智能的智能体系统新范式

随着大语言模型从语言生成器进化为可执行复杂长程任务的自主智能体,个体智能面临组织能力上限。论文提出系统智能概念,即智能体系统将多个智能组件组织为协同整体的能力,并引入Graph Engineering这一新兴范式,通过构建表示任务、智能体和系统状态的显式动态图结构,为组织复杂目标、编排异构智能体、建模系统动态及支持可扩展智能体演化提供统一基础。

智能体arXiv开源生态论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 39/100
InfinityEdit:用轻量编辑适配器实现无限视频编辑

InfinityEdit 提出一种轻量编辑适配器,为流式视频生成器赋予无界编辑能力,解决现有方法仅适用于固定时长片段、无法处理直播或持续镜头等开放流场景的问题。该适配器包含历史交叉注意力、时序因果自注意力和编辑交叉注意力三个模块,仅在编辑请求到达的块中激活,后续块由原始模型生成。实验表明,InfinityEdit 能在每次编辑下忠实延续视频流,并在无界编辑序列中保持生成稳定。

arXiv视频论文/研究
00:24
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 49/100
不要再将中间令牌拟人化为推理/思考的痕迹

亚利桑那州立大学团队发表立场论文,反对将大语言模型在输出答案前生成的中间令牌(ITG)称为“推理痕迹”或“思考痕迹”,认为这种拟人化并非无害隐喻,而是会混淆模型本质、误导有效使用并催生可疑研究。论文汇集多项质疑该解读的实证工作,呼吁社区避免此类拟人化表述。

arXiv推理论文/研究

8月20日

星期四 · 9 条
21:57
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
逐步扩展计算效率:大规模混合专家模型的超参数迁移方法

该研究提出一种计算高效的两步超参数迁移框架,用于估算大规模MoE模型的最优学习率:先跨模型宽度迁移,再外推至万亿token训练规模。基于μP适配和线性回归,该方法在10万亿token训练规模下实现高保真预测(R²=0.95)。研究者将该方法应用于155B总参数量(17B激活参数)的基础模型预训练,验证了以极小消融成本准确预测全规模模型最优配置的可行性。

arXiv数据/训练论文/研究
18:24
IT之家(RSS)精选
AI 评分 72/100
阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕

阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。

智能体arXivGitHub多模态

推荐理由:它把 GUI 智能体评测从模拟分数推向真实手机操作,自建 MobileWorld-Real 基准和百台真机环境,使落地型团队能按真机成功率而非仅看模拟榜单做选型。
12:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 46/100
SoftVTBench:面向可变形物体操作的形变感知视触觉数据集与基准

SoftVTBench 发布,含 4,000 条专家演示与 50 余个资产,以 20 Hz 同步多视角 RGB、双指触觉、本体感觉、语言及夹爪动作,并配评估专用的有限元状态。其闭环基准以形变感知成功率(DSR)衡量,要求任务完成且峰值归一化形变在容差内。测试中,三种策略在全部 12 个分布内配置均存在违反形变容差却计为成功的轨迹,占各配置成功量的 0.7–24%。

arXiv具身智能数据/训练论文/研究
12:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 42/100
潜在世界模型中的决策度量对齐:诊断与面向动作的MPC规划目标

研究提出Plan-Real Spearman与CEM-stage Spearman两个诊断指标,揭示JEPA式潜在世界模型中潜在距离代价与真实任务进展排序不一致的问题。据此开发DA-LeWM,为LeWM增加逆动力学与演示条件目标头。实验表明DA-LeWM收敛更快、在线成功率更高,且探针分数相近。

arXiv具身智能数据/训练论文/研究
11:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
FM-Bench:面向长期管理场景的智能体评测基准

FM-Bench(足球管理基准)让大语言模型智能体通过26个工具、约340至400个决策节点,在20个游戏年内运营一家足球俱乐部,并以确定性引擎累计最终得分。15个前沿模型在三个随机种子下均完成全程,claude-fable-5在单人赛道和Arena中均居首,但冠军在10个模型间轮换。得分差异源于管理行为而非算力,token支出与表现无关。

智能体arXiv论文/研究
10:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 38/100
SkillForge:通过自蒸馏智能体解决项目特定问题

SkillForge 提出一种自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来合成项目特定问题,而非依赖历史修复记录或在线探索。解决这些合成问题后,SkillForge 将可复用的项目知识蒸馏为实体化技能,并与相关仓库实体关联以支持后续问题修复。在开源和闭源模型上的实验表明,SkillForge 持续优于强基线,证明主动获取项目知识能显著提升下游问题解决性能。

智能体arXiv编码论文/研究
09:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 40/100
FACET:终端任务合成中保留源意图与可执行状态

FACET提出一种框架,通过将相关智能体技能重构为信息丰富的场景,并在生成最终任务工件前实现和修复执行环境,解决终端任务合成中的信息保留与跨工件一致性问题。该框架以容器状态作为指令、解决方案和验证器的共享基础,并通过基于执行的验证和定向修复纠正特定工件错误。微调多个规模的模型在Terminal-Bench 2.1上持续提升性能,验证了环境基础构建对任务有效性的重要性。

智能体arXiv数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
Daedalus-150M:为 CPU 推理设计的卷积-注意力混合小模型

Daedalus-150M 是一款专为 CPU 推理设计的小语言模型,18 层中仅 6 层使用全注意力,其余 12 层采用短卷积以固定内存占用。该模型在 59.9B tokens 上从头训练,五任务基准得分 47.31,超越 GPT-2 124M、Pythia-160M 等更大模型,4-bit 文件小 6.3%,2048 tokens 上下文解码快 1.76 倍。

arXiv端侧论文/研究部署/工程
00:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 43/100
PTXBench:用架构特定 PTX 评测与适配 LLM 的 GPU 内核优化

PTXBench 基准在 H100 和 B200 GPU 上评测 LLM 使用架构特定 PTX 优化 GPU 内核的能力,覆盖 GEMM 与注意力负载的功能正确性、目标指令执行及相对前沿库的加速比。评测显示各模型在复杂注意力反向负载上成功率大幅下降,且无一能持续匹配前沿库性能。研究团队用监督微调适配 Qwen3.6-27B,修复条件训练改善部分任务但泛化仍不均衡。

arXiv数据/训练论文/研究部署/工程

8月19日

星期三 · 8 条
16:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 26/100
EditBridge:面向高保真与高效超高清图像编辑的扩散桥接框架

EditBridge 提出一种扩散桥接框架,将超高清编辑视为从低分辨率编辑结果到高分辨率版本的结构化数据转换,并以原始高分辨率图像为条件保留真实细节。其引入先验引导的块状稀疏注意力机制,将跨图像交互限制在空间对齐区域,在 2K 分辨率下实现 3.6–8.4 倍加速,并可在 61 秒内完成 4K 编辑。

arXiv图像生成论文/研究
13:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 58/100
HarnessRisk:面向智能体 Harness 安全的全生命周期基准

HarnessRisk 将智能体 harness 安全划分为配置、能力扩展、运行时、状态持久化、动作控制与事故恢复六个阶段,含 128 个沙箱用例。在三种 harness、六个语言模型及 14 种配置下,攻击成功率介于 12.6% 至 80.9%,Utility 保持在 75.0% 至 97.6% 之间。Harness 配置阶段最易受攻击,且显式风险识别并不总能带来安全行动。

智能体arXiv论文/研究
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 44/100
aDSL:通过智能体与程序联合设计实现智能体3D内容生成

针对大语言模型编写3D程序时难以将高层意图转化为一致底层几何的问题,研究者联合设计了智能体中心领域特定语言aDSL与角色专业化多智能体系统。aDSL通过关系运算符替代绝对坐标,强调可组合性与空间推理;免训练系统采用Plan-Execute-Critic循环,利用执行反馈迭代修复错误。该方法在文本/图像生成3D形状任务上优于此前LLM基线,并支持铰接物体创建与结构化场景组合,代码已开源。

智能体arXiv多模态论文/研究
11:05
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
StartupBench:面向市场验证端到端工作流的通用智能体基准测试

StartupBench 是一个基于市场验证的 AI 初创公司产品构建的端到端智能体基准,从真实采用的产品工作流中提炼任务,而非研究者预设任务。在统一智能体框架下,最强模型也仅能完成约 30% 的任务,复杂指令遵循和领域专业知识是主要失败来源。该基准揭示了当前通用智能体在真实用户任务上的能力边界。

智能体arXiv论文/研究

推荐理由:不同于基于研究者自选任务的基准,StartupBench 从有真实用户的产品工作流提炼任务,给出的约 30% 完成率将团队评估焦点从榜单得分拉回到端到端交付。
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 62/100
ASI-Bench:首个联合评估AI创新探索与自主科研能力的基准

ASI-Bench 是首个联合评估 AI 系统在通用研究领域创新探索与自主科研执行能力的基准,也是首个在同一研究项目中逐步撤除方法论指导的基准。该基准涵盖 11 个科学领域的 60 个项目级任务,在 18 种 SOTA 配置下,平均得分从完整指导的 50.91 降至仅指定方法时的 29.10,以及需自主确定方法时的 26.62,表明当前系统仍高度依赖人类指导。

智能体arXiv论文/研究
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
面向通用图像生成的能力中心化数据设计:从语料库到协同演进能力

一项研究提出能力驱动的数据基础设施,将能力专属监督构建与能力对齐的课程调度相结合,通过三个数据引擎分别构建文本-图像 grounding、图像间变换和图像-知识关联的互补关系监督。该框架构建了4.4亿图像T2I语料库、1.2亿编辑对和超2700万图像-实体对,并据此从零训练了3B和6B两种规模的多模态扩散模型,在CPI-Bench上进行了定量评估。

arXiv图像生成数据/训练论文/研究
10:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
Agentic ESOpt:以极低 GPU 需求微调长程 LLM 智能体

论文提出 Agentic ESOpt,一种基于进化策略(ES)的全参数智能体微调框架,相比强化学习(RL)仅需推理级 GPU 内存即可微调大模型,并支持参数与提示词空间的协同进化。在 WebArena-Lite 上,对 Qwen-3.5-27B 的全参数优化较无技能基线提升 6.69%;在测试时自动启发式设计中,28/36 个设置优于匹配基线。

智能体arXiv数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
VA-Judger:面向视频-音频联合生成的人类偏好奖励模型

VA-Judger 提出一种面向视频-音频联合生成的链式思维全模态奖励模型,并构建了包含 9K 提示词和 10.3K 细粒度成对比较的大规模人类偏好数据集 VAPref-10K。该模型通过分维度强化学习分解人类反馈,在域内和域外评测中均优于现有指标基线,用于后训练可显著提升生成质量。

arXiv多模态论文/研究

8月18日

星期二 · 9 条
17:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 44/100
即插即用的2D运动接口:让真实世界运动语言模型无需微调即可工作

研究团队提出一种即插即用的2D运动接口,使3D预训练的运动语言模型(MoLMs)无需修改或微调即可接受2D运动输入。在公开数据集上,该方法在多个MoLMs上达到与3D运动输入相当的性能,并优于从头训练2D运动的模型。团队还构建了单目真实世界视频运动评估数据集并引入真实视频适配器,证明在单目姿态估计场景下2D运动比3D运动更具实用性。

arXiv具身智能多模态论文/研究
14:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
HiFi-BRep:面向鲁棒 B-Rep 生成的高保真潜在表示

HiFi-BRep 提出一种新型框架,通过拓扑感知编码器消除填充噪声与特征污染,并以单阶段解码器并行预测几何与拓扑,将流形约束嵌入可微学习目标。实验表明,该方法在结构有效性与几何保真度上显著优于现有最先进方法,代码与模型已公开。

arXiv开源生态论文/研究
13:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
AnyTalk:利用视频生成模型为任意角色生成3D语音动画

AnyTalk提出一种无需动画数据即可为任意角色生成3D语音动画的新方法,通过Character-specific Fine-tuning(CsF)技术将预训练视频扩散模型适配至目标角色,再经优化过程估计blendshape参数,将说话头视频提升为3D语音动画。该方法支持多种面部网格和blendshape配置,显著降低人工与数据需求。蒸馏版AnyTalk_{RT}可实现实时性能,代码已公开。

arXivGitHub视频论文/研究
12:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
像素空间文生图扩散模型训练实证研究:潜空间到像素空间策略带来 3.18-4.75 倍推理加速

一项实证研究发现,像素空间扩散模型直接大规模预训练收敛速度远慢于潜空间模型,由此提出“潜空间到像素空间”策略:先在潜空间高效获取生成先验,再在后训练阶段转向像素空间。该策略结合权重初始化、数据构成、预测目标、解码器架构与噪声调度等设计选择,使像素空间模型达到或超越潜空间模型,并实现 3.18 至 4.75 倍的端到端推理加速。

arXiv图像生成数据/训练论文/研究
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
Ventor-QTest:面向第三方托管大模型 API 的威胁模型驱动审计

Ventor-QTest 提出一种无需目标 API 概率信息的复合黑盒审计方法,通过重复请求与长序列组件分别报告平均保真度损失(AFL)和极端保真度损失(EFL)。在七组路由快照中,EFL 随任务暴露增加与 Terminal-Bench 通过率下降同步出现,提示审计长程智能体任务时应联合报告 AFL 与 EFL。实现已开源。

智能体arXiv安全/对齐论文/研究
09:24
MarkTechPost(RSS)
AI 评分 56/100
字节跳动Seed与清华AIR推出CUDA Agent:面向CUDA内核生成的规模化智能体强化学习系统

字节跳动Seed与清华AIR发布CUDA Agent,一个训练大语言模型编写GPU内核的智能体强化学习系统,使生成内核在KernelBench上以2.11×几何平均速度超越torch.compile,通过率达98.8%,快于编译器的比例为96.8%。

智能体arXiv编码论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 46/100
WorldMind:面向状态感知 NPC 行为的解耦游戏世界模型

WorldMind 提出首个面向游戏世界模型中状态感知 NPC 行为的解耦框架,将交互式世界建模分为理解、决策、控制与生成四层,并通过闭环交互循环将 NPC 行为锚定于不断演化的游戏状态。配套发布 BOSS-140K 数据集及自动化采集智能体。在 BOSS-140K 上的实验显示,WorldMind 在约 70% 的成对比较中因战术更合理、行为更连贯而优于基线。

arXiv多模态数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 40/100
基础模型时代的人类中心智能:综述

一篇综述提出全谱系人类上下文分类法,将人类视为可观察主体、动态行动者和情境化智能体,整合视觉外观、空间几何、运动动力学、交互建模、世界模拟与具身智能六个层面。文章系统梳理了该领域的方法论基础、代表性方法、数据集与评测基准,并讨论了构建可扩展、可信、具身可部署的人类中心智能所面临的开放挑战。

arXiv具身智能多模态论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 43/100
SemComp-Bench:为视频生成中的语义任务完成设立基准

研究团队提出“语义任务完成视频生成”这一以结果为导向的视频生成任务,要求模型同时实现预期结果并保持与参考图像的语义对齐。为此构建了覆盖六个领域的评估数据集 SemComp-Data,并推出基于视觉语言模型(VLM)的评估协议 SemComp-Bench,分别以 OA Score 和 GR Score 衡量结果达成与生成可靠性。实验显示,现有代表性视频生成模型在兼顾任务目标与语义对齐方面仍面临挑战。

arXiv视频论文/研究

8月17日

星期一 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 46/100
RapidLiDAR:迈向实时且自适应的 LiDAR 场景补全

RapidLiDAR 提出一种 LiDAR 场景补全方法,将初始化本身作为可学习的数据驱动组件,通过自适应初始化模块预测每个输入点的空间变化位移,无需手动噪声调参。在 SemanticKITTI 和 KITTI-360 上,该方法补全性能与最先进技术持平,完整场景补全仅需 0.1 秒,比此前最快方法快 2.3 倍,匹配典型车载 LiDAR 传感器的 10 Hz 采集率。

arXiv论文/研究
已加载 40 条