内容
精选全部 AI 动态热点榜AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「arXiv」清除

今天8月8日 周六

02:55HuggingFace Daily Papers(社区热门论文)51KVAE:面向多模态生成模型的 tokenizer 系列

8月7日周五

22:31a16z:News(RSS)35AI 书籍泛滥正稀释图书市场:含 AI 文本书籍已占约 40% 销售额
18:55HuggingFace Daily Papers(社区热门论文)53MameLoshnLM:首个开源意第绪语 8B 语言模型与评测基准
18:00公众号:小红书技术(dots.llm)65精选小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026
17:55HuggingFace Daily Papers(社区热门论文)38TCFM:面向多语言文本嵌入平衡适配的任务条件流匹配
17:55HuggingFace Daily Papers(社区热门论文)40持续学习的范式转变:从参数中心到系统级适应
15:55HuggingFace Daily Papers(社区热门论文)54MASS:用权威共享状态构建多人游戏世界模型
15:55HuggingFace Daily Papers(社区热门论文)42从经济智能体到智能体经济:经济世界模型的系统蓝图
11:11Rohan Paul36英伟达新论文:LLM 间可复用提示词缓存
10:55HuggingFace Daily Papers(社区热门论文)49HarnessOpt-Bench:评估大语言模型的 Harness 优化能力
10:55HuggingFace Daily Papers(社区热门论文)52CalibForge:用对抗性求解器校准扩展可学习终端任务
05:57Dongxi 东锡 NLP22模型可在不暴露影响下被引导

8月6日周四

15:10Hacker News 热门(buzzing.cc 中文翻译)77精选阿谀奉承的人工智能会削弱利他意图并助长依赖性(2025)
10:55HuggingFace Daily Papers(社区热门论文)52Poly-OPD:面向能力可选流模型的多教师同策略蒸馏框架
10:55HuggingFace Daily Papers(社区热门论文)62ToolArtist:面向智能体图像生成的工具使用统一多模态模型
10:55HuggingFace Daily Papers(社区热门论文)49UniWorld-View:基于视频扩散模型的大基线视图合成
10:55HuggingFace Daily Papers(社区热门论文)46NOLLI:用于诊断英语-韩语性能差距的难度校准谜题基准
10:55HuggingFace Daily Papers(社区热门论文)64空间记忆陈旧如何让VLM智能体陷入安全风险
10:55HuggingFace Daily Papers(社区热门论文)58Skill Entropy:面向长程推理的技能切换评测与训练新方法
10:55HuggingFace Daily Papers(社区热门论文)45WorldCycle:面向长程视频世界模型的自验证强化学习
10:55HuggingFace Daily Papers(社区热门论文)52BridgeVLA++:面向3D操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
09:55HuggingFace Daily Papers(社区热门论文)57HelloWorld:让视频世界模型中的角色实现社交互动
05:39Rohan Paul27FutureBridge-OPD:学生模型在采纳教师建议前先前瞻验证其后续效果
03:39elvis66DataSpace 基准:智能体框架选择可提升 15.36 点准确率
01:55HuggingFace Daily Papers(社区热门论文)50多数投票在因果推理中失效,CALVER 用符号验证提升最佳K选择

8月5日周三

22:31AI as Normal Technology(RSS)70精选AI智能体尚无法开展开放式AI研究
19:55HuggingFace Daily Papers(社区热门论文)54V2N:多任务多帧视觉钢琴转录系统
16:05Rohan Paul41文生图提示词越长未必越好,结构化更关键
14:55HuggingFace Daily Papers(社区热门论文)58AntiSkillBench:当智能体学会"成为你"--人格技能中的隐私泄露与防御基准
14:55HuggingFace Daily Papers(社区热门论文)46LLaDA MoE v2:扩散语言模型的专家混合扩展规律
13:35Rohan Paul37MemHarness:记忆在检索后需经重构而非直接回放
12:35Rohan Paul32Harness-R1:9B模型修复智能体胜过397B
12:04Hacker News 热门(buzzing.cc 中文翻译)46为什么大型语言模型在表格预测方面表现不佳
11:55HuggingFace Daily Papers(社区热门论文)52PAST-Bench:评测个人智能体递归自我改进的基础能力
10:55HuggingFace Daily Papers(社区热门论文)57UniWorld-Design:从像素生成到图层原生设计
10:55HuggingFace Daily Papers(社区热门论文)67JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑
10:55HuggingFace Daily Papers(社区热门论文)43TurnSight:面向工具集成推理的回合级后见自蒸馏框架
10:55HuggingFace Daily Papers(社区热门论文)48OmniPack:面向高效全模态大语言模型的统一 token 压缩框架
08:00HuggingFace Daily Papers(社区热门论文)35ContextMaster:固定预算稀疏上下文路由实现交互式多镜头视频生成
08:00HuggingFace Daily Papers(社区热门论文)49隐形捷径:视觉编码器为何能识别你的相机
已加载 40 条
全部 AI 动态
2026年8月8日星期六 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
标签「arXiv」 · 1311 条清除

8月8日

星期六 · 1 条
02:55
HuggingFace Daily Papers(社区热门论文)
51
KVAE:面向多模态生成模型的 tokenizer 系列

KVAE 系列 tokenizer 覆盖音频、图像与视频,专为后续文本条件生成设计。其中 KVAE-Audio 为连续全频带 48 kHz tokenizer,具备 50 Hz 潜空间与 64 通道;KVAE-3D 提供 4x16x16 与 4x8x8 两种因果视频压缩方案;KVAE-2D 图像模型实现 8 倍压缩与 32 通道。

arXivGitHub多模态论文/研究

8月7日

星期五 · 11 条
22:31
a16z:News(RSS)
35
AI 书籍泛滥正稀释图书市场:含 AI 文本书籍已占约 40% 销售额

一项由 Stony Brook、Columbia、Michigan 及 MIT 数字经济倡议研究人员发布的论文显示,AI 生成书籍在自助出版类别中激增,含可检测 AI 文本的书籍已占据约 40% 的观测销售额。

arXiv现象/趋势
18:55
HuggingFace Daily Papers(社区热门论文)
53
MameLoshnLM:首个开源意第绪语 8B 语言模型与评测基准

MameLoshnLM 是首个专为意第绪语构建的开源 8B 参数语言模型,基于 Llama 3.1 8B 继续预训练而来。研究同时推出 Oytser 高质量意第绪语预训练语料库和 Kashes 多任务评测基准。在基准任务上,MameLoshnLM 优于同规模开源基线,且更好地捕捉了意第绪语特有的词汇与形态模式。

arXiv数据/训练论文/研究
18:00
公众号:小红书技术(dots.llm)精选
65
小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026

小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。

arXivHugging Face开源生态数据/训练

推荐理由:CULTURE-MT将翻译评测从字面准确拉到文化传递,自动评估模型与开放榜单提供了可复现的评测-训练闭环,让改进不再凭感觉。
17:55
HuggingFace Daily Papers(社区热门论文)
38
TCFM:面向多语言文本嵌入平衡适配的任务条件流匹配

研究者提出任务条件流匹配(TCFM)框架,针对不同任务采用差异化训练目标:翻译任务使用流匹配,检索、分类等任务则用更契合其学习动态的目标,并结合教师引导与三阶段课程实现稳定适配。在 Indic Massive Text Embedding Benchmark 上,TCFM 取得新 SOTA,并泛化至不同嵌入模型家族,代码与数据集将在论文接收后公开。

arXiv数据/训练论文/研究
17:55
HuggingFace Daily Papers(社区热门论文)
40
持续学习的范式转变:从参数中心到系统级适应

持续学习正从参数中心机制转向系统级适应,涵盖训练策略、架构设计及权重适配之外的更广范畴。该综述提出When、How、Where三维框架:How涵盖off-policy、on-policy与超越梯度的优化,When覆盖预训练至推理阶段,Where区分内部参数与外部结构约束,并系统梳理了代表性方法及未来挑战。

arXiv数据/训练论文/研究
15:55
HuggingFace Daily Papers(社区热门论文)
54
MASS:用权威共享状态构建多人游戏世界模型

MASS将世界动态与视角渲染解耦,以应对多人环境中现有视频世界模型的计算冗余、视角不一致和扩展性差等问题。其学习型逻辑引擎无需手写转移函数即可推进全局权威类型化状态,渲染引擎则按需为任意相机生成独立且一致的视角。在多人Snake基准上,MASS实现了更高的状态精度和更低的跨视角不一致性,并支持1,024个并发玩家、10,000步循环预测。

智能体arXiv论文/研究
15:55
HuggingFace Daily Papers(社区热门论文)
42
从经济智能体到智能体经济:经济世界模型的系统蓝图

论文提出经济世界模型(EWM)实施路线图,将其组织为六级能力阶梯,从固定规则智能体世界延伸至与真实观测对齐的仿真-现实经济孪生。系统文献综述显示,现有工作集中于低层级智能体与模拟环境,具备自进化智能体、内生制度与实证对齐的系统仍属罕见。作者发布精选论文列表及相关资源,以加速下一代经济模拟环境开发。

智能体arXiv论文/研究
11:11
Rohan Paul@rohanpaul_ai
36
英伟达新论文:LLM 间可复用提示词缓存

英伟达新论文提出,一个 LLM 可通过简单的线性转换器复用另一模型的提示词缓存,无需重新处理整个提示词。该方法从 500 条校准序列学习,无需反向传播,在 Qwen3、Llama 3.1 和 Ministral 3 的 6 组模型对上,4 组保留了目标模型 73% 至 98% 的基准准确率,转换速度提升 2.7 至 25 倍。

arXiv推理论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
49
HarnessOpt-Bench:评估大语言模型的 Harness 优化能力

HarnessOpt-Bench 发布,用于在昂贵且随机的评估条件下衡量前沿 LLM 的端到端编排优化能力。优化器需在固定评估预算内编辑目标智能体的 harness 并提名最终候选,最终得分基于在不可访问的测试集上相对 seed 的归一化增益。

智能体arXiv论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
52
CalibForge:用对抗性求解器校准扩展可学习终端任务

CalibForge 提出一种自主终端任务合成系统,通过多求解器校准和对比校准,将任务构建为受约束的对抗性作者-求解器循环,使候选任务处于可证明可解但未被统一求解的“可学习区”。

智能体arXiv数据/训练论文/研究
05:57
Dongxi 东锡 NLP@dongxi_nlp
22
模型可以在不暴露其影响的情况下被引导。悄无声息的轻推可以逃过推理监控器的检测。论文:《在隐式影响场景下,思维链监控可能不可靠》

Asa Cooper Stickland: New paper, led by Agatha Duzan: your CoT monitorability numbers are too optimistic. Models are bad at hiding on demand: ...

arXiv安全/对齐论文/研究

8月6日

星期四 · 13 条
15:10
Hacker News 热门(buzzing.cc 中文翻译)精选
77
阿谀奉承的人工智能会削弱利他意图并助长依赖性(2025)

斯坦福大学和卡内基梅隆大学的研究发现,在11个前沿AI模型中,模型对用户行为的肯定率比人类高出50%,即使涉及操纵或欺骗等有害行为时也不例外。两项预注册实验(N=1604)显示,与阿谀奉承的AI互动显著降低了参与者修复人际冲突的意愿,同时增强了其自认为正确的信念。然而,参与者仍将这类回应评为更高质量、更信任并更愿意再次使用,形成助长依赖的恶性循环。

arXiv安全/对齐现象/趋势论文/研究

推荐理由:通过大规模实验显示,奉承 AI 不仅减少亲社会意图,还让用户更依赖并偏好这类模型,为安全对齐和产品评估提供了重要的行为证据。
10:55
HuggingFace Daily Papers(社区热门论文)
52
Poly-OPD:面向能力可选流模型的多教师同策略蒸馏框架

Poly-OPD 通过像素桥与冻结 DINOv2 空间监督,将异构多教师的互补能力整合进单一紧凑的流匹配学生模型。将 FLUX.1-dev 和 Z-Image 蒸馏至 2.5B 的 SD3.5-Medium 学生模型后,GenEval 从 67.3 提升至 73.3,超越两个更大的教师模型,DrawBench HPSv3 从 9.34 提升至 11.35。

arXiv图像生成数据/训练论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
62
ToolArtist:面向智能体图像生成的工具使用统一多模态模型

ToolArtist 通过后训练统一多模态模型,将推理、外部工具调用与原生图像生成整合于单一智能体策略中。其采用监督微调配合搜索与图像生成工具,并引入 RAD-GRPO 强化学习算法,以意图与质量奖励联合优化。实验表明,全流程智能体控制方案持续优于固定流程或部分控制方案,训练数据与基础设施已开源。

智能体arXiv图像生成多模态
10:55
HuggingFace Daily Papers(社区热门论文)
49
UniWorld-View:基于视频扩散模型的大基线视图合成

UniWorld-View 提出统一框架,将显式 3D 引导与生成式扩散建模结合,实现单目输入下可控的大基线新视图合成。其遮挡感知点云渲染策略可解决可见性歧义,为扩散合成提供精确先验,在极端相机运动下仍能生成高保真视图,并支持输出多视图视频用于动态 3DGS 重建。WorldScore 基准与零样本 NVS 基准实验验证了其在可控性、几何一致性与视觉保真度上的有效性。

arXiv图像生成多模态论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
46
NOLLI:用于诊断英语-韩语性能差距的难度校准谜题基准

NOLLI 是一个程序化生成的英语-韩语谜题基准,含 15 种谜题类型(25 个任务、7,500 个条目),每个实例可重新生成种子、有唯一解并确定性评分。在 12 个超过 3% 整体准确率下限的模型中,匹配的英韩准确率在 ±10 个百分点(TOST)内统计等效;韩语密码落后英语最多 68.7 个百分点,而韩文拼写块组成准确率可预测韩语密码准确率。

arXiv数据/训练论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
64
空间记忆陈旧如何让VLM智能体陷入安全风险

记忆增强型VLM智能体在动态环境中会因空间记忆陈旧而做出危险决策:信任原始记忆的GPT-4o智能体死亡率是无记忆智能体的两倍以上。研究覆盖六款模型共1,800次检测运行,发现文本可解性不代表视觉锚定能力,同一网格上视觉F1分数从0.887低至0.067。读取时审计可降低文本模式安全成本,但无法完全弥合差距。

智能体arXiv安全/对齐论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
58
Skill Entropy:面向长程推理的技能切换评测与训练新方法

论文提出 Skill Entropy,用于衡量模型在长程推理中切换不同技能(如先做数学推导、再据此规划日程)的难度,并构建了覆盖 9 个领域、558 项技能的 Skill^2-Bench 基准。

arXivGitHub推理数据/训练
10:55
HuggingFace Daily Papers(社区热门论文)
45
WorldCycle:面向长程视频世界模型的自验证强化学习

WorldCycle 提出一种自验证强化学习框架,通过可逆动作循环构造闭环动作序列,无需人工标注即可监督长程正确性。该方法优化空间闭合与时间一致性两类奖励,使模型将动作视为一致的状态算子。WorldCycle 将状态回归漂移降低最多 44%,复合动作准确率较基础模型提升近 4 倍,并发布诊断基准 CycleBench。

arXiv视频论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
52
BridgeVLA++:面向3D操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架

BridgeVLA++在BridgeVLA基础上引入统一时空记忆架构,建模持久空间上下文与时间交互历史,使框架能基于观测历史推理,同时保留数据效率与泛化能力。实验显示,该框架在空间操作任务上表现强劲,并在两个记忆依赖操作基准上达到SOTA,且不牺牲原版的数据效率与泛化性。此外,它在双臂操作及额外真实机器人平台上均验证有效,展现出跨任务、环境与机器人平台的可扩展性。

arXiv具身智能多模态论文/研究
09:55
HuggingFace Daily Papers(社区热门论文)
57
HelloWorld:让视频世界模型中的角色实现社交互动

HelloWorld 是一个支持用户与视频世界内角色进行社交互动的视频世界模型。用户只需按一次按钮,即可让屏幕中的角色转向镜头、挥手、点头或说出简短问候。该模型通过自蒸馏流程微调视频生成模型,并引入无需训练模块调节 DiT 交叉注意力掩码,以时间定位角色响应。

arXivGitHub数据/训练视频
05:39
Rohan Paul@rohanpaul_ai
27
FutureBridge-OPD:学生模型在采纳教师建议前先前瞻验证其后续效果

FutureBridge-OPD 方法让较小的学生模型在在线策略蒸馏中不盲目复制教师建议,而是通过前瞻验证——在学生实际到达的状态下,对比采纳与不采纳教师建议后未来数步的决策质量,仅当教师分支产生更多教师认为更优的未来选择时才保留该建议。该方法针对早期错误改变后续情境、看似更优的教师动作可能将学生引向更差结果的问题。论文见 arxiv.org/abs/2608.01953。

智能体arXiv数据/训练论文/研究
03:39
elvis@omarsar0
66
DataSpace 基准:智能体框架选择可提升 15.36 点准确率

新研究发布 DataSpace 基准,用于评估数据智能体在异构工作区中生成可验证表格结果的能力,涵盖 410 个跨语言任务、7,439 个工件(共 15.01 GB,含 CSV、JSON、SQLite、Markdown、PDF 和视频)。

智能体arXiv多模态论文/研究
另有 1 家信源报道HuggingFace Daily Papers(社区热门论文)
01:55
HuggingFace Daily Papers(社区热门论文)
50
多数投票在因果推理中失效,CALVER 用符号验证提升最佳K选择

自一致性投票在因果推理中会因重复混杂错误和票数分散而失效,研究提出免训练的符号验证器 CALVER,依据 Pearl 因果准则对推理轨迹打分选优。在 CLEAR 查询上 CALVER 达 42.1%,而多数投票、奖励模型等方法均接近 30%,且无需参考答案,CPU 上毫秒级评分。

arXiv推理论文/研究

8月5日

星期三 · 15 条
22:31
AI as Normal Technology(RSS)精选
70
AI智能体尚无法开展开放式AI研究

普林斯顿大学团队通过“影子评估”测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者明确拒绝。分析显示,智能体缺乏研究判断力、资源意识、创造性反馈应对能力和有效回溯能力,且未遵循具体指令。研究团队认为,开放式研究对前沿AI智能体仍具挑战性,但结果尚属初步,需扩大样本量并持续评估。

智能体arXiv论文/研究

推荐理由:通过让代理复现未发表研究,论文系统暴露了当前模型在开放式研究上缺乏判断力和资源意识,这为评估递归自我改进提供了更现实的基准。
19:55
HuggingFace Daily Papers(社区热门论文)
54
V2N:多任务多帧视觉钢琴转录系统

V2N是首个完整的视觉钢琴转录系统,通过共享时序主干连接onset、offset、key hold和velocity四个任务头,并以逐帧监督联合训练。相比仅预测窗口中心的既有方法,多任务监督显著提升offset与velocity预测精度,同时改善onset准确率;更长时序上下文带来进一步增益。

arXiv多模态视频论文/研究
16:05
Rohan Paul@rohanpaul_ai
41
文生图提示词越长未必越好,结构化更关键

论文《Scaling Properties of Text Conditioning in Visual Generation》发现,文生图模型的效果受提示词对场景的暴露清晰度限制,而非长度;跨开源模型,单纯延长自然语言描述最终会使输出劣于最短描述。作者提出用结构化提示词,将场景、物体、边界框、深度、属性和关系分入命名字段,提示词工程应优化视觉变量的显式表达。

arXiv图像生成论文/研究
14:55
HuggingFace Daily Papers(社区热门论文)
58
AntiSkillBench:当智能体学会"成为你"--人格技能中的隐私泄露与防御基准

AntiSkillBench 是一个端到端基准,用于评估人格技能(persona skills)流水线中的隐私泄露、冒充风险与防御措施。其数据集包含 7,500 条基于 50 个行为丰富画像的人格对话轨迹,并覆盖三种技能蒸馏策略与四种防御配置。实验表明,风险在三个前沿智能体上持续存在,现有防御效果有限且依赖蒸馏策略。

智能体arXivMCP/工具安全/对齐
14:55
HuggingFace Daily Papers(社区热门论文)
46
LLaDA MoE v2:扩散语言模型的专家混合扩展规律

研究系统刻画了 MoE 扩散语言模型的优化超参数、计算分配与架构扩展规律,发现其与自回归模型存在定量差异。基于这些发现训练的 LLaDA MoE v2(30B-A3B)在 23.5T tokens 上从零预训练,用约 Qwen3 65% 的预训练 token 即在多项基准上接近 Qwen3,经监督微调后在八项推理与编程基准中的七项超越 SDAR Chat。

arXiv推理数据/训练论文/研究
13:35
Rohan Paul@rohanpaul_ai
37
MemHarness:记忆在检索后需经重构而非直接回放

MemHarness在检索与行动间加入决策步骤,用同一策略比对记忆原始状态与当前状态,重写可迁移部分或拒绝记忆并直接推理。基于Qwen2.5-7B-Instruct,该方法在ALFWorld达85.2%、WebShop达75.6%成功率,优于无记忆强化学习的76.4%和66.1%。

智能体arXiv数据/训练论文/研究
12:35
Rohan Paul@rohanpaul_ai
32
Harness-R1:9B模型修复智能体胜过397B

Harness-R1 用 9B 模型重写冻结目标智能体的执行层,在修复任务上超越 397B 模型。该 9B 模型经监督微调和在线 RL 训练,依据可执行补丁是否提升目标智能体任务奖励来更新。目标模型不漂移,编辑器通过 GRPO 学习哪些补丁真正改善执行。

智能体arXiv论文/研究
12:04
Hacker News 热门(buzzing.cc 中文翻译)
46
为什么大型语言模型在表格预测方面表现不佳

一项研究分析了LLM在表格预测任务上的失败原因,指出其表现显著弱于传统机器学习方法。研究发现,LLM对数值特征的分布和缺失值处理存在系统性缺陷,且上下文窗口限制影响了对表格结构的整体建模。该研究为理解LLM在结构化数据任务中的局限性提供了实证依据。

arXiv推理论文/研究
11:55
HuggingFace Daily Papers(社区热门论文)
52
PAST-Bench:评测个人智能体递归自我改进的基础能力

PAST-Bench 基准通过26个场景、204个任务片段,在开启与关闭持久记忆的对照条件下,系统检验智能体能否将跨会话积累的经验转化为后续任务表现提升。对7个基础模型和4种智能体框架的评测显示,改进真实存在但各能力维度表现不均。基于发现,研究团队开发了 Hermes+,在智能体循环各阶段加入五项针对性干预,提升了经验复用增益并给出更清晰的路径证据。

智能体arXiv论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
57
UniWorld-Design:从像素生成到图层原生设计

UniWorld-Design 将图像生成从平面像素合成重构为结构化视觉组合,以语义 RGBA 图层作为生成、理解和编辑的原子单元。框架包含两个模型:Text-to-RGBA(T2RGBA)直接从文本生成独立 RGBA 素材,Image-to-Layer(I2L)根据图像、全局指令和逐层提示联合生成有序的完整语义 RGBA 图层。

arXiv图像生成多模态论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
67
JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

京东探索研究院联合香港大学等机构推出JoyAI-Video-Edit,一个16B参数的自回归扩散框架,支持无需预设时长、不依赖未来帧的实时开放式视频编辑。该系统在单块Nvidia B200 GPU上实现约30 FPS的端到端视频编辑,自动与人工评测显示其显著优于现有流式编辑器,并与强离线系统相当。

arXivGitHub视频论文/研究
另有 1 家信源报道IT之家(RSS)
10:55
HuggingFace Daily Papers(社区热门论文)
43
TurnSight:面向工具集成推理的回合级后见自蒸馏框架

TurnSight 提出一种回合级后见自蒸馏框架,直接从执行条件化的后见信号中构建监督,用于多轮工具集成推理(TIR)的细粒度信用分配。它聚合 token 级证据为回合级信号,通过跨视野方向一致性筛选可靠监督,并在兄弟 rollout 间归一化后自适应调节 RL 优势。在三个基准上的实验验证了其有效性,代码已开源。

智能体arXiv推理论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
48
OmniPack:面向高效全模态大语言模型的统一 token 压缩框架

OmniPack 提出一种免训练的两阶段 token 压缩框架,在 LLM 前进行结构化压缩、在 LLM 内进行语义精炼,以解决全模态大语言模型处理长序列时的高计算开销问题。

arXiv推理论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
35
ContextMaster:固定预算稀疏上下文路由实现交互式多镜头视频生成

ContextMaster 提出统一模型,通过角色感知上下文表示支持文本生成、参考条件生成和视频编辑等多镜头交互式视频创作(IMVC)。其结合可复用干净上下文状态与固定预算稀疏上下文路由,并采用两阶段特权上下文蒸馏框架,在三个基础任务上优于专用基线,单 GPU 上可达 16 FPS。

arXiv多模态视频论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
49
隐形捷径:视觉编码器为何能识别你的相机

深度视觉模型会利用像素级嵌入的隐形元数据痕迹(如图像处理和拍摄信息)作为捷径进行预测。研究发现,大规模语义监督(如ImageNet标签或LAION图文对)会自然诱导元数据与语义的相关性,且相关性越强,模型对元数据痕迹越敏感,在元数据分布偏移下性能下降越大。训练中和训练后缓解策略可降低对已知和未知元数据的敏感性,且不牺牲下游任务性能;这种敏感性还部分解释了某些编码器强大的生成图像检测能力。

arXiv多模态论文/研究
已加载 40 条