研究用AI-Infra-Guard(A.I.G)对DeepSeek Harness(DSH)开展间接提示注入评估,覆盖14,560次受控执行、16个间接内容渠道、35个载荷目标及12种攻击方法。最强攻击成功率分别为:文本模式伪造完成17.0%、文件模式隐藏Unicode 25.5%、文件模式技能渠道16.0%。语义LLM评判器比规则评判器更常判定部分合规(7.3%对2.0%)。
研究用AI-Infra-Guard(A.I.G)对DeepSeek Harness(DSH)开展间接提示注入评估,覆盖14,560次受控执行、16个间接内容渠道、35个载荷目标及12种攻击方法。最强攻击成功率分别为:文本模式伪造完成17.0%、文件模式隐藏Unicode 25.5%、文件模式技能渠道16.0%。语义LLM评判器比规则评判器更常判定部分合规(7.3%对2.0%)。
宾州州立大学研究显示,AI 系统压缩上下文时平均仅 17% 的会话约束指令能幸存,压缩后规则遵从率大幅下降,多数压缩方案甚至不如不压缩。研究推出 COMPINT 评测套件,并发现基于 Qwen3.5-9B 的附加模块无需训练即可将指令保留率提升至 90% 以上,该模块与评测套件已开源至 GitHub。
AnyTalk提出一种无需动画数据即可为任意角色生成3D语音动画的新方法,通过Character-specific Fine-tuning(CsF)技术将预训练视频扩散模型适配至目标角色,再经优化过程估计blendshape参数,将说话头视频提升为3D语音动画。该方法支持多种面部网格和blendshape配置,显著降低人工与数据需求。蒸馏版AnyTalk_{RT}可实现实时性能,代码已公开。
Anthropic 将 SKILL.md 格式发布为开放规范九个月后,GitHub 上已有约 380 万份 SKILL.md 文件,分布于 28.22 万个公共仓库。研究将其全部挖掘为数据集 GitSkills,按内容去重后得到 187.8 万条不同技能,并以单个 SQLite 文件发布,包含 front matter、文件夹内容和提交历史。
一个由 AI 生成的修复方案在 Snowflake 公共仓库中引入了工作流注入漏洞,并在数天内被 Wiz Red Agent 发现。该漏洞导致 Snowflake 的 Jira 系统遭到入侵。Wiz Red Agent 已发布完整研究分析。
面壁智能(OpenBMB)联合清华NLP、南京大学等发布 SciDC,将科学知识转化为解码约束,使本地部署的领域模型只能在专家规则定义的可行域内生成。该方法无需微调,在工业配方设计、临床诊断等任务上平均准确率提升 +11.6(Qwen3-4B 42.5→54.1,Qwen3-14B 51.4→63.0),真实医疗记录上 Qwen3-14B 精确匹配从 33.5% 提升至 45.1%。
Alaya Lab 等机构提出交互式世界模型 Evoke,通过外部相机索引世界状态库保持有界上下文,并重新设计教师模型以支持长时程监督。其稀疏注意力机制实现激活内存和计算量线性增长,30 秒长时程分布匹配目标使三步学生模型无需 CFG 即可抵抗内容漂移。
KVAE 系列 tokenizer 覆盖音频、图像与视频,专为后续文本条件生成设计。其中 KVAE-Audio 为连续全频带 48 kHz tokenizer,具备 50 Hz 潜空间与 64 通道;KVAE-3D 提供 4x16x16 与 4x8x8 两种因果视频压缩方案;KVAE-2D 图像模型实现 8 倍压缩与 32 通道。
AgentOPSD 提出一种免评论家的递归回合级信用分配方法,将 token 级师生对数概率差聚合为回合级证据,并在 log-odds 空间递归更新贝叶斯信念状态,将稀疏结果监督转化为回合级信用信号。
论文提出 Skill Entropy,用于衡量模型在长程推理中切换不同技能(如先做数学推导、再据此规划日程)的难度,并构建了覆盖 9 个领域、558 项技能的 Skill^2-Bench 基准。
HelloWorld 是一个支持用户与视频世界内角色进行社交互动的视频世界模型。用户只需按一次按钮,即可让屏幕中的角色转向镜头、挥手、点头或说出简短问候。该模型通过自蒸馏流程微调视频生成模型,并引入无需训练模块调节 DiT 交叉注意力掩码,以时间定位角色响应。
京东探索研究院联合香港大学等机构推出JoyAI-Video-Edit,一个16B参数的自回归扩散框架,支持无需预设时长、不依赖未来帧的实时开放式视频编辑。该系统在单块Nvidia B200 GPU上实现约30 FPS的端到端视频编辑,自动与人工评测显示其显著优于现有流式编辑器,并与强离线系统相当。
另有 1 家信源报道IT之家(RSS)DualIFM 通过 BagNet 骨干网络实现设计上的可解释性,其小感受野生成的类别证据图忠实反映模型决策过程,并在预训练中加入 2D 投影层以直接可视化表征空间。该模型在超过 80 万张彩色眼底照片上训练,性能与参数多 16 倍的 RETFound 相当,且在分布外数据上提供可解释预测。代码与预训练模型已开源。
PosterMELD 提出一种模板条件化的多智能体流水线,先通过容量感知槽位引导写作,再用确定性门控与 VLM 审查将失败路由至有界修复,每个通过请求导出可编辑 PPTX 与 PNG。
Shopee 提出知识-几何解耦(KGD)框架,解决流式推荐中预训练-迁移范式的两大问题:用行为多 token 预测(BMTP)过滤无关会话噪声,并通过可刷新编码器与任务学习器的参数解耦,避免任务梯度干扰预训练知识。KGD 在八个公开基准上较基线提升 4–12%,在 Shopee 首页搜索的线上 A/B 测试中使单用户 GMV 提升 1.75%、广告收入提升 1.53%,已全面部署。
面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。
快手团队提出 RecHarness,一种用于自动化推荐模型优化的 Bandit 路由智能体框架。它将优化过程分为两步:bandit 路由器根据历史验证反馈选择修改方向,LLM 在选定方向内生成具体优化假设和可执行代码编辑,并通过 jump-basin 机制在局部编辑停滞时激活结构跳跃。
东京大学等机构提出一种无需干净 RGB 监督的 3D 感知神经隐式融合模型,可在暗光下将极噪 RGB 观测与近红外(NIR)线索在 3D 空间中隐式融合,恢复干净 RGB 图像。该方法引入 NIR 调制的位置编码和 Color Code MLP,解决噪声过拟合与 NIR-RGB 映射不适定问题,在合成与真实多视图数据集上优于现有方法,并能泛化至不同噪声水平。代码与数据将公开。
EMBL AI Librarian是一个知识层,将Europe PMC接口升级为面向AI智能体的自然语言问答形式,由单个LLM规划互补子查询并阅读论文定位证据。在ScholarQABench上,其Citation F1比近期强基线提升超16个百分点;在LitQA2基准上,接入Librarian的GPT-5.4智能体比使用网页搜索得分高约8分。代码已公开。
SkillRise 提出统一强化学习框架,让大语言模型智能体在解决一系列相关任务时自动提取、精炼并复用可迁移技能。在 ALFWorld、WebShop 和 ScienceWorld 上,其 Pass@1 性能超过最强基线 2.3 至 8.5 个百分点,且测试时随任务序列长度增加而持续提升。代码已开源。
月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
月之暗面发布 Kimi-K3 技术报告,详细介绍了新一代大语言模型的架构与训练方法。报告未公开具体参数规模与 benchmark 分数,但强调了模型在长上下文处理与推理效率上的改进。Kimi-K3 目前通过 API 提供服务,具体版本号与上下文窗口长度未在报告中明确列出。
DriveDNA 是一个包含 465 名驾驶员、4121 次行程、115 种车型、总计 975 小时自然驾驶数据(10Hz 采样,含前视视频)的大规模多模态数据集与基准。它通过少样本驾驶员重识别、个性化行为预测和条件匹配比较三项核心任务评估驾驶风格表征。实验表明,学习表征在未见驾驶员上显著优于经典描述符(AUROC .935 对比 .707),而纯视频模型虽重识别精度相当但存在严重路线泄露问题。
美团与复旦大学等机构推出 ICAE-Bench,用于评估编程智能体在交互式项目构建场景下的表现。该基准包含 480 个任务,覆盖 12 种编程语言,通过自动化 User Agent 模拟需求澄清过程。实验表明,智能体在复现可见行为上表现尚可,但在处理隐藏约束、边界情况和长周期集成时仍面临挑战。
Netflix 与 Eyeline Labs 提出 ID-V2V,将面部身份保持建模为视频重光照问题,通过重光照面部区域、法线图、编辑关键帧与深度序列等控制信号,在保留表情、视线与唇形同步的前提下,将编辑关键帧的风格变化传播至整段源视频。实验表明,该方法在面部相似度与细粒度表现保持上显著优于现有方法,支持单人与多人场景,代码已开源。
小红书引擎架构团队在OSDI 2026提出HELMSMAN,一个面向全闪存服务器的高性能向量近似最近邻搜索系统。该系统通过聚类式索引、定制化存储栈和分层学习式搜索剪枝,用约40台全闪存服务器承载了过去约35,000 CPU Core和约350 TB DRAM的负载,硬件成本节省超过90%。
同一事件,精选展示《小红书引擎架构团队 OSDI 2026 新成果:HELMSMAN 重塑大规模向量检索基础设施》SkewAdam针对MoE模型提出分层优化器状态分配:为密集骨干网络保留float32动量与分解二阶矩,为专家层仅保留分解二阶矩,为路由器保留精确二阶矩。在6.78B参数MoE上,优化器状态仅占1.29 GB(AdamW的2.6%),峰值训练内存从81.4 GB降至31.3 GB,可装入40 GB加速器。
AlayaWorld 是一个交互式长程视频世界模型,基于15B视频扩散Transformer架构,可生成540p和720p分辨率、24fps的视频。该模型通过自回归生成短潜变量块,结合持久锚定帧、压缩时序历史、几何对齐空间记忆和近期帧条件化来维持长程一致性,并将推理从约30步蒸馏至每块4步。在iWorld-Bench基准上,AlayaWorld取得长程生成最佳性能,项目以全栈开源形式发布。
VIABench 是一个专门用视障人士第一人称视频评估多模态大语言模型(MLLM)的基准,定义了主动提醒、视觉问答和视觉引导交互三项核心任务。实验表明,当前 MLLM 在主动提醒任务上表现最差,难以准确预判导航事件并实时响应。该基准支持在线与离线两种评测模式,代码与数据将开源。
HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。
Chat2Scenic提出首个迭代检索增强框架,将法规描述自动转化为自动驾驶测试场景的可执行脚本。在包含123个场景的开放基准上,该框架实现76.42%编译成功率和58.17%框架准确率,显著超越现有方法。代码已开源。
一篇由 METR 与多所高校联合发表的论文,系统建模了递归式自我改进(RSI)的经济学原理。作者构建了一系列逐步丰富的有向图模型,以刻画 AI 能力进步中的反馈循环,并区分了“窄”与“宽”AI 能力——前者仅优化 AI 研发基准,后者涵盖更广泛的经济价值任务。论文整理了关键参数的现有估计,并提出了 AI 公司可公开测量的实证数据清单。基于现有数据的粗略校准表明,当前反馈循环的强度尚不足以产生自我维持的加速,但正在增强。
元认知是智能的基础组成部分,对学习、问题解决、决策与沟通至关重要,近年被视为构建透明AI系统的关键。然而,LLM能否以及如何展现或具备有效的元认知能力尚不明确。该论文首次系统梳理了LLM元认知的现状,分类总结了该新兴领域的技术进展,包括评估LLM元认知能力的基准与方法、激发与提升元认知的技术,以及相关研究发现与启示。论文还讨论了应用、开放问题与未来方向。
现有AI渗透测试智能体基准(如夺旗、远程代码执行)在简化环境中评估,无法反映真实渗透测试的复杂性与战略决策。新提出的评估协议将重点从任务完成转向已验证漏洞发现,结合结构化真实数据与LLM语义匹配识别漏洞、二分图解析处理歧义,并支持重复累积评估与效率指标。该协议已开源专家标注的真实数据与评估代码,旨在实现更真实、可操作的AI渗透测试智能体对比。
PalmClaw 是一个开源智能体框架,原生运行在移动设备上,直接在手机上管理会话、记忆、技能、工具和智能体循环。它将设备能力封装为带显式参数、结构化结果和清晰执行边界的设备工具,使智能体可直接调用手机功能。实验显示,相比最强基线,PalmClaw 任务成功率相对提升 11.5%,完成时间减少 94.9%。
小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone,在 AIME 2025 等基准上最高带来 +7.15 pass@4 提升。部署测评中,TTFT 加速约 1.23×,TPOT 加速约 1.86×。训练采用 SFT 和 On-Policy Distillation 两阶段,将 verifier 校验能力蒸馏进轻量 confidence head。
提示注入已成为AI安全的首要威胁——大语言模型无法区分合法指令与恶意指令。此前推送式和拉取式攻击规模均有限。研究人员提出一种名为HalluSquatting的新型拉取式提示注入攻击,首次能组装大规模僵尸网络、执行分布式拒绝服务攻击(DDoS)并大规模感染设备。该攻击可作用于AI编码工具,标志着提示注入攻击从单点突破转向规模化利用。
一项研究分析了134个真实世界任务中约38,000小时的智能体交互数据,首次发现环境学习整体性能遵循对数Sigmoid缩放定律(R²=0.998),智能体学习速度约每三个月翻一番。该研究基于EdgeBench任务套件,涵盖科学发现、软件工程、组合优化、专业知识工作、形式数学和交互式游戏,每项任务要求至少12小时连续操作。目前已公开发布51个任务及完整评估框架。
预训练视频生成模型在视觉运动控制中前景广阔,但其想象的未来常偏离任务意图且不可靠地以动作为条件。RoboTALES 提出单阶段框架,学习任务对齐的模拟未来并用于训练机器人策略。两项核心创新:基于 LLM 的分层规划器将复杂任务分解为子目标序列以引导模型想象;基于 VLM 的评判器评估“想象”的未来,通过奖励反馈使模型内部表征聚焦于目标。在 RoboCasa 和 LIBERO10 的多样化操作任务中,RoboTALES 持续优于现有方法,尤其在长时域任务上表现突出。代码和模型已公开。
标注分歧可源于操作失败、政策模糊或价值多元。Annotator Policy Models(APMs)是一种可解释模型,仅从标注行为学习标注者内在的安全策略,无需额外负担。验证表明模型准确率超过80%,能忠实预测反事实编辑并恢复已知差异。将APMs应用于LLM和人类标注者,可揭示不同标注者对安全指令解释的差异(政策模糊)以及不同人口群体在安全优先级上的系统性差异(价值多元),支持更具针对性、透明和包容的安全策略设计。