KVAE 系列 tokenizer 覆盖音频、图像与视频,专为后续文本条件生成设计。其中 KVAE-Audio 为连续全频带 48 kHz tokenizer,具备 50 Hz 潜空间与 64 通道;KVAE-3D 提供 4x16x16 与 4x8x8 两种因果视频压缩方案;KVAE-2D 图像模型实现 8 倍压缩与 32 通道。
KVAE 系列 tokenizer 覆盖音频、图像与视频,专为后续文本条件生成设计。其中 KVAE-Audio 为连续全频带 48 kHz tokenizer,具备 50 Hz 潜空间与 64 通道;KVAE-3D 提供 4x16x16 与 4x8x8 两种因果视频压缩方案;KVAE-2D 图像模型实现 8 倍压缩与 32 通道。
一项研究提出 Activity Frames,用确定性、零模型管线将被动捕获的屏幕活动编译为智能体记忆,输出字节一致、可缓存且可审计。在单人 128,756 帧、51 个活跃天的语料上,该编译器将一天原始捕获压缩为 86 倍更小的提示块,耗时 68 毫秒;智能体阅读该块的问答准确率达 98.4%,优于 LLM 摘要的 66-80%。
连续扩散与流匹配模型有望成为语言建模中自回归方法的有力替代,可解锁加速采样与倾斜等连续模态优势。近期研究通过高斯分布与one-hot编码数据分布间的简单流匹配过程,实现离散数据的连续生成,并借助分类流映射(CFMs)验证了加速采样的可行性,样本质量具有竞争力。
MIT 研究人员与合作者发现,医疗领域的 AI 可解释性工具效果因使用者而异。在皮肤病诊断中,非专家借助 AI 辅助提升了准确率,但提升主要源于对模型的依赖;初级保健医生则表现出不同的使用模式。
Zero Train-Inference Mismatch - now for linear attention, and under async RL 🎯 We got bitwise-exact trainer/generator p...
斯坦福大学与 Arc Institute 团队用 AI 模型 Evo 从零设计完整病毒基因组,并在实验室构建出 16 种自然界不存在的功能性病毒。Evo 提出 70 万个候选基因组,团队仅筛选最有希望的 285 个序列合成并植入细菌,其中 16 个成功复制并杀死宿主。该研究已通过同行评审发表于《Science》,但 Evo 未接受人类病原体数据训练,且能否推广至其他病毒类群仍是未知数。
MameLoshnLM 是首个专为意第绪语构建的开源 8B 参数语言模型,基于 Llama 3.1 8B 继续预训练而来。研究同时推出 Oytser 高质量意第绪语预训练语料库和 Kashes 多任务评测基准。在基准任务上,MameLoshnLM 优于同规模开源基线,且更好地捕捉了意第绪语特有的词汇与形态模式。
小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。
研究者提出任务条件流匹配(TCFM)框架,针对不同任务采用差异化训练目标:翻译任务使用流匹配,检索、分类等任务则用更契合其学习动态的目标,并结合教师引导与三阶段课程实现稳定适配。在 Indic Massive Text Embedding Benchmark 上,TCFM 取得新 SOTA,并泛化至不同嵌入模型家族,代码与数据集将在论文接收后公开。
持续学习正从参数中心机制转向系统级适应,涵盖训练策略、架构设计及权重适配之外的更广范畴。该综述提出When、How、Where三维框架:How涵盖off-policy、on-policy与超越梯度的优化,When覆盖预训练至推理阶段,Where区分内部参数与外部结构约束,并系统梳理了代表性方法及未来挑战。
MASS将世界动态与视角渲染解耦,以应对多人环境中现有视频世界模型的计算冗余、视角不一致和扩展性差等问题。其学习型逻辑引擎无需手写转移函数即可推进全局权威类型化状态,渲染引擎则按需为任意相机生成独立且一致的视角。在多人Snake基准上,MASS实现了更高的状态精度和更低的跨视角不一致性,并支持1,024个并发玩家、10,000步循环预测。
论文提出经济世界模型(EWM)实施路线图,将其组织为六级能力阶梯,从固定规则智能体世界延伸至与真实观测对齐的仿真-现实经济孪生。系统文献综述显示,现有工作集中于低层级智能体与模拟环境,具备自进化智能体、内生制度与实证对齐的系统仍属罕见。作者发布精选论文列表及相关资源,以加速下一代经济模拟环境开发。
EffectLearner 提出一种语义推理增强的视频物体移除框架,结合基于 VLM 的 Object-Effect Reasoner 与基于 DiT 的 Video Eraser,通过结构化效果分析提示词提取效果感知上下文,并引入运动感知掩码引导与运动一致性监督。
PaDoc 将预测布局视为共享页面表示上的分支结构,使布局流与区域内容分支并行推进,将解码深度降至最长布局-内容路径。在 OmniDocBench Full 上,PaDoc 取得 Overall 布局 F1 91.1,端到端解析器中 Overall 得分 94.24,Text Edit 0.038,Formula CDM 95.59。
👀After 154 pages of tests of GPT-4, this paper concludes "Given the breadth and depth of GPT-4's capabilities, we belie...
Qwen-CUA 证明仅凭人类使用的屏幕、鼠标和键盘即可训练出强大的电脑智能体,将截图作为 AI 的通用界面。训练动用近 10 万虚拟处理器核心和约 4 万个可检查任务,智能体仅通过截图和鼠标键盘操作,无需网站代码或辅助标签。其在 OSWorld-Verified 基准上得分 86.2,但长时程任务仍存在较大差距。
本源量子与中国科学技术大学联合团队提出“参数空间扩展受控相位门(PSE-CZ)”方案,破解超导量子计算速度与保真度相互制约难题,成果发表于《物理评论快报》。在“本源悟空”上对20对两比特量子门测试显示,30-40纳秒极短门长下仍保持优于传统CZ门的稳定性能。该方案还可推广至离子阱、固态自旋等平台。
EnvACE 提出一种智能体强化学习方法,用世界预演替代训练中的外部环境交互:策略先生成工具调用,再扮演环境生成响应,并基于预演结果继续决策,两端通过任务成功奖励端到端联合优化。
英伟达新论文提出,一个 LLM 可通过简单的线性转换器复用另一模型的提示词缓存,无需重新处理整个提示词。该方法从 500 条校准序列学习,无需反向传播,在 Qwen3、Llama 3.1 和 Ministral 3 的 6 组模型对上,4 组保留了目标模型 73% 至 98% 的基准准确率,转换速度提升 2.7 至 25 倍。
DyPES-VLA 提出一种跨具身视觉-语言-动作模型,通过未来预测目标训练 VLM 学习共享动力学先验,并利用具身特定的 MoE 动作头直接在原生动作空间生成控制,无需手动对齐异构动作。作为通用策略,它在 LIBERO 上达到 98.0% 成功率,在 RoboCasa-GR1 上为 59.25%,在 RoboTwin 2.0 上为 89.02%,在仿真和真实世界评估中均取得 SOTA 性能。
HarnessOpt-Bench 发布,用于在昂贵且随机的评估条件下衡量前沿 LLM 的端到端编排优化能力。优化器需在固定评估预算内编辑目标智能体的 harness 并提名最终候选,最终得分基于在不可访问的测试集上相对 seed 的归一化增益。
ChronoVision 提出多模态框架,通过监督微调中的 Reconstructive Visual Head 预测最终变换状态的潜在表征,并借助 ROI Attention Locating 模块聚焦关键视觉证据,后训练阶段采用带隐式过程对齐的强化学习。在 Vbvr-VQA 上取得 74.8% 域内和 71.6% 域外准确率,在 IntPhys2 上达到 55.0%。
UniME-R1 提出一种 embedder-adviser 框架,通过挖掘硬负样本模拟检索失败,让 adviser 基于初始检索结果生成检索中心思维链(RC-CoT),以纠正嵌入器对细微判别线索的混淆。若目标出现在初始 top-k 集合中则直接重排,否则生成 RC-CoT 调整检索方向并执行全库重检索。在 MMEB-V2 及多个通用多模态检索基准上,UniME-R1 持续优于强基线。
一项针对 Qwen3 的研究发现,On-Policy Delta Distillation(OPD2)在多语言数学推理中持续优于原始 OPD,尤其在韩语和日语上提升显著,并普遍缩小了英语与韩语的性能差距。研究还显示,仅用英语数据的 OPD 虽能提升韩语和日语表现,但常使回答偏向英语,凸显了多语言数据对保持目标语言回答的重要性。
GST-Bench 提出用于视频理解全局空间智能的 VQA 基准,含 6,790 分钟合成视频生成的 2,762 个人工验证问题,要求模型从新视角推理并映射到全局俯视图。对 22 个 SOTA VLM 的评估显示,最强零样本模型 Gemini-3-Pro 仅得 42.68 分,远低于人类基线 79.08;研究还提供 GST-Train 数据集以促进后续研究。
AgentOPSD 提出一种免评论家的递归回合级信用分配方法,将 token 级师生对数概率差聚合为回合级证据,并在 log-odds 空间递归更新贝叶斯信念状态,将稀疏结果监督转化为回合级信用信号。
CalibForge 提出一种自主终端任务合成系统,通过多求解器校准和对比校准,将任务构建为受约束的对抗性作者-求解器循环,使候选任务处于可证明可解但未被统一求解的“可学习区”。
斯坦福大学研究人员使用 AI 技术首次成功设计出完整基因组,产出的 16 种新型噬菌体在实验室中可有效杀死大肠杆菌,不会对人类构成威胁。团队开发的 Evo1 和 Evo2 模型以病毒、细菌、植物和人类的遗传代码为训练数据,通过微调预测“生命语言”。研究被视为“非常重要的转折点”,或为抗生素耐药感染提供新治疗路径。
谷歌新论文提出,相似AI智能体即使无法沟通或未来无回报,也能基于“自身选择可预测对方选择”的推理实现理性合作,挑战经典博弈论对一次性囚徒困境中背叛的预测。Gemini和Gemma智能体在多种游戏后,相同模型合作率高,相关模型次之,随机对手多遭背叛。该“嵌入均衡”或能更好预测AI社会,但警示相似AI可能偏向同类而非人类。
苹果研究团队推出 DeepAmbigQA,一个用于评测大语言模型答案完整性的歧义多跳问答基准。该基准聚焦“同名电影《盗火线》中哪位演员获得过奥斯卡奖”这类复杂问题,要求模型同时区分同名实体并跨大量实体进行多跳推理。研究团队还发布了自动数据生成流程 DEEPAMBIGQAGEN,以构建此类评测数据。
New paper, led by Agatha Duzan: your CoT monitorability numbers are too optimistic. Models are bad at hiding on demand: ...
斯坦福大学研究人员利用大型基因组模型输出可编码功能性蛋白的DNA序列,并成功设计出感染细菌的病毒基因组。这些病毒与现有病毒高度相关,但具备一些难以自然进化出的独特特征。研究者提醒,未来可能出现能设计针对脊椎动物病毒的AI,需提前防范。
To understand whether we're making genuine progress on reasoning, we entered our AI models in five international STEM Ol...
Apple 提出深度低秩残差蒸馏方法,在锁定预训练权重的同时实现模型压缩。该方法通过低秩残差结构蒸馏知识,避免直接修改原始权重,从而保留预训练模型的既有能力。研究展示了该方法在保持模型质量的同时,为开源权重模型的高效适配提供了新路径。
FocusMem 提出一种分解式潜在记忆接口,用角色感知的内容基元让情景记忆保留可复用经验、工作记忆保留任务进度,并以状态条件读取生成决策特定视图、轻量信任门抑制无关记忆块,全程冻结 GUI 策略。