斯坦福大学一项研究发现,AI 对入门级岗位的冲击最为严重。该研究基于相关数据得出这一结论,提示初级职位从业者面临更高的被替代风险。研究结果对职场新人及企业用人策略具有参考意义。
斯坦福大学一项研究发现,AI 对入门级岗位的冲击最为严重。该研究基于相关数据得出这一结论,提示初级职位从业者面临更高的被替代风险。研究结果对职场新人及企业用人策略具有参考意义。
MIT 研究人员开发出名为 Extreme Event Aware(η-learning)的工具,可生成某地区历史记录中从未出现但统计上可能发生的极端天气事件地图,并附带持续时间、强度和影响面积估算。
Industrial-Instruction框架利用906份松下公开技术文档构建了两个开放QA数据集,各含约13.6k问答对。用该数据微调小于10B参数的开源LLM,在松下基准上将Set-Match Accuracy从28.5%提升至42.0%,F1从46.6%提升至63.5%。
针对十亿级规模下原始数据扩展遭遇性能瓶颈的问题,研究提出用户行为稠密化定律,量化数据规模与最小充分分词容量间的关系。实验发现二者对数近似线性,斜率随分词方法和数据源变化。据此开发的ALGN自适应变长分词方法在多种数据源和下游任务上优于现有基线。
RIBOSPAN 是一个 16.1 亿参数的双向 RNA 基础模型,原生预训练上下文长度达 10,240 nt,支持单核苷酸分辨率的完整长 RNA 建模。原生 10K 预训练在 10,240 token 下保持强重建能力,长上下文基准显示其上下文响应与表征分离俱佳,且推理时 YaRN 缩放可恢复短上下文模型直接外推丢失的上下文组织。
针对大语言模型策略优化中的稳定性-探索权衡问题,研究提出环境正则化策略优化(ERPO),将正则化从动作侧移至输入侧,通过Query-KL项约束查询分布漂移,同时保留探索能力。ERPO可无缝接入GRPO/PPO/REINFORCE等流程,无需额外前向传播。在六个数学推理基准上,ERPO替代标准Policy-KL正则化,在高温解码和长时训练下实现更强准确率和更稳定行为。
新研究提出“Projector Is All You Train”:为语言模型添加新模态只需训练连接编码器与主干的投影层,无需微调模型本身。3D 测试中,冻结主干的模型性能持平或超越联合微调,训练速度快一倍,而联合微调的 Llama 在 GSM8K 上从 86.96% 暴跌至 0.61%。
论文发现,后训练无法修复薄弱的长程规划基础:噪声轨迹会累积错误,稀疏奖励导致信用分配不当,冲突教师引发遗忘。研究建议优先训练清晰世界模型和长轨迹,奖励信号过稀疏时采用OPD(on-policy distillation),并避免合并规划策略不兼容的教师。OPD在长程噪声场景下优于结果奖励GRPO,因教师反馈贯穿整个轨迹而非仅在末端。
研究团队分析 PubMed Central 上 119 万余篇英文生物医学论文发现,2025 年约 77% 的论文出现 AI 辅助写作或编辑特征,较 2023 年的 19% 和 2024 年的 52% 大幅提升。讨论部分使用比例最高(约 78%),韩国、中国等非英语母语地区超 80%。研究呼吁建立完善使用规范和监管机制,以应对 AI 生成虚假事实及披露不足等风险。
斯坦福大学经济学家最新研究显示,AI 正导致部分领域年轻员工的入门级岗位显著流失,而年长员工迄今基本未受影响。在 AI 暴露度最高的职业中,22 至 25 岁员工的就业水平已比低暴露领域同龄人低 19%,高于去年的 13%。
DataSpace 新基准测试数据智能体在异构工作区中的可验证分析能力,涵盖 410 个需结合数据库、CSV/JSON、长文档与视频并返回精确表格的任务。最强模型准确率仅 66.34%;固定模型后仅更换智能体框架即可将准确率从 30.98% 提升至 46.34%。跨所有测试模型,跨源连接与多数据类型混合是持续短板,且许多失败发生在智能体已找到正确信息后误解请求或提交错误列。
Google Research 与 USC 推出 ME-POIs 框架,将聚合移动数据融入文本地点嵌入。在洛杉矶和休斯顿的 5 项地图增强任务中,34/35 个模型-任务组合获得提升,访问意图 F1 最高提升 81.9%。模型约 53.7M 参数,但代码与权重尚未公开。
ContinualSkillBench 在 5 个领域各设 100 个关联任务,对比智能体保留反馈、更新技能与从零求解的效果。顺序执行在 15 组模型-领域设置中 14 组提升归一化奖励,整体相对提升 16.9%。
Netflix 每周运行数十万次节目级推荐解释的 LLM 评判器,服务数百万移动端会员,并将其视为包含诞生、训练、部署、监控四阶段的完整生命周期。训练阶段采用推理对齐的规则调优,以元评判器输出为学习信号;部署时同一评判器承担质量门控与反思生成双重角色。五周 A/B 测试显示,相比无解释对照组,浏览到播放的转化率提升,且未出现质量相关问题。
Pretraining Recurrent Networks without Recurrence by @akarshkumar0101 & @phillip_isola is a great paper! It makes an end...
微软新论文发现,AI 智能体因被训练得过于顺从,替用户谈判时通常会吃亏,甚至会泄露预算并在对方施压时让步。为此提出 SocialRL 训练方法,让模型在六个谈判与调度游戏中以交易结果为导向学习。一个 4B 模型在全部游戏中平均得分 0.627,追平 GPT-4.1 的 0.625,但仅靠提示词反而会恶化表现。
斯坦福和CMU提出Task Model Induction,将真实工作录屏拆解为独立任务并重建带循环的目标树,而非当作单一操作序列。该方法恢复了74.9%的实际操作,是现有最佳摘要器的两倍多,基于其构建的技能在未见任务上表现提升30%。研究指出,挖掘演示数据训练智能体时应输入目标结构而非原始转录。
皮尤研究中心研究显示,自 2022 年 11 月 ChatGPT 问世后发布的网页中,35% 存在 AI 创作迹象。该研究基于 Common Crawl 存档中近 50 万个英文网页,利用 Open Pangram 技术检测,其中 2026 年 7 月随机抽取的 1 万个网页样本里约 10% 有明显 AI 痕迹。.com 网站出现 AI 迹象的比例约为 .edu 和 .gov 网站的 10 倍。
WorldToken 提出时间优先策略,将每决策步的多视角图像、本体感觉与任务条件融合为单一世界 token,由因果时序 Transformer 建模并配合扩散动作头生成动作块。在 23 个 RoboCasa 任务上,85.3M 参数策略借助每任务 2,900 条生成演示达到 59.45% 平均闭环成功率。缩减可见历史会显著降低闭环成功率,但结果不证明其优于其他序列组织方式。
http://x.com/i/article/2091196172736073730
Task Model Induction(TMI)能从原始屏幕录制与鼠标键盘事件中提取符号化任务模型,任务分组与真实标注一致性达 0.974。该方法重建 74.9% 的执行步骤,基于任务模型提炼的技能在保留任务上较最强工作流归纳基线提升 30.0% 准确率。论文:arxiv.org/abs/2608.20319。
ClawGym II 框架将 OpenClaw 或 Claude Code 作为黑盒纳入 RL 训练循环,无需访问其内部机制。通过 Qwen3-30A3B,该方法在 ClawGym-Bench Pass@1 上经 OpenClaw 提升 9.98 分、经 Claude Code 提升 14.81 分,混合训练亦有效,并扩展至 JobBench 和 OfficeQA。
一项针对 LLM 作为合成调查受访者的心理测量学审计发现,LLM 能复现人类调查结果的大致方向,但无法还原真实的人类回答分布。用 LLM 生成数据训练的模型在预测真实人类时平均 R² 为 -0.18,而用人类数据训练的模型为 0.28。论文认为 LLM 仅适用于低成本试点调查,不能替代真实受访者。
微软新论文主张智能体训练应在实际部署环境中进行,否则训练出的模型与上线版本不一致。为此推出 Agent Lightning v1.0,一个轻量级受控智能体强化学习框架,通过真实部署的 harness 训练现有智能体,而非在 RL 训练器中重建智能体循环。
清华等高校论文发现,AI智能体可优化训练计划数小时,却很少意识到计划本身有误。在1,338条后训练轨迹中,3,557个相邻实验仅74个(2.1%)改变了高层策略,多数迭代停留在同一方法内调整数据、超参数等。加入实验日志、技能库和评估器虽使GSM8K提升12.6分、HumanEval提升40.8分,但仍未触发策略变更;2–8倍推理token也几乎未带来AIME 2025可靠增益。
Netflix 自研的基于语言模型的推荐系统 GenRec 在离线测试和约 10% 流量的四周 A/B 实验中均优于现有生产系统,排名质量离线提升约 1.6%,第二阶段训练所需标注数据减少约 40 倍。
Google 新论文提出 EnvHarness,通过重塑现有环境来针对智能体弱点进行训练,同时保持原任务和验证器不变。EnvRigger 自动发现弱点并生成包装器,仅在验证有效后保留。在 SWE-bench Verified 上,同等 300 环境预算下,智能体解决率达 54.79%,优于原始环境的 52.13% 和生成环境的 50.37%。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合匿名移动模式与文本描述结合,为地点构建融合身份与动态功能的嵌入向量。在未见地点上,该框架使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估算准确率提升 24.7%。
NVIDIA 与伯克利联合开源触觉机器人方法 T-Rex,将触觉作为模型一等公民,采用双时钟异步架构,以每视觉 tick 4 次触觉 tick 的高频修正实时优化操作。
Google 提出 EnvHarness 与 EnvRigger,解决智能体训练环境静态化、无法随智能体进化的问题。EnvHarness 通过可编程插件层重塑环境行为且保留原验证器,EnvRigger 将策略视为黑盒、诊断其轨迹缺陷并合成新组件。在四个领域五个基准上,held-out 实例最高提升 9.0 分,执行步骤减少 9.8%。
NAPE提出极简自监督框架,用因果Transformer从先前补丁预测log-mel频谱图的下一补丁嵌入,仅靠因果掩码和停止梯度作为训练信号,无需重建解码器、声学tokenizer或师生架构。在六项音频与语音基准上,NAPE在多项任务取得最优微调性能,跨编码器规模扩展一致,并展现强线性探测结果与结构化注意力模式。
IAR提出注入、对齐、恢复三阶段后训练框架,将固定语料库转化为参数化知识,实现无检索问答。在Llama、Phi、Qwen和SmolLM模型族及CC和CCI数据集上,IAR在8个数据集-模型组合中的7个上优于Vanilla SFT,域问答准确率平均提升3.6个百分点,通用性能平均提升12.1个百分点。
EXIMO 提出一种高效微调视觉-语言-动作(VLA)策略的三阶段算法:探索、模仿与优化。探索阶段由视觉语言模型(VLM)充当规划器,将长程任务分解为短程子任务并收集编排数据;模仿阶段用该数据微调 VLA;优化阶段采用残差离线策略强化学习进一步提升。实验表明,EXIMO 在样本效率和最终性能上显著优于现有方法。
EnvHarness 提出一种可编程插件层,在不修改底层逻辑的前提下重塑静态环境行为,并配套 EnvRigger 将目标策略视为黑盒,通过观察执行轨迹自动合成组件。在四个领域的五个基准上,EnvHarness 超越原始环境与领域专用生成管线,在保留实例上最高提升 9.0 分,同时减少 9.8% 执行步骤,并为强化学习提供更优的优化信号。
研究团队提出量化感知修复(QAH)替代量化感知训练(QAT),以恢复压缩并量化至 4 位的 LLM。在 GPT-OSS 120B 压缩至 60B 并量化为 MXFP4 的流程中,QAH 学生模型在 9 项基准的 7 项上匹敌或超越其 bfloat16 来源,权重内存减少约 4 倍,并以 Hypernova-60B 开源发布。
TLive-Omni 将图像、视频、音频和文本输入映射到统一表示空间,专为电商直播场景设计。其引入 Per-vGrid 时间戳 token 组织以对齐视频与音频,并通过三阶段监督训练和 Faithful-RFT 强化微调提升回答忠实度与表达质量,同时满足实时性要求。实验表明,该模型在电商直播基准任务上表现强劲,并在通用基准上展现出良好泛化能力。
RecVerse 是一款基于 GUI 的购物行为模拟智能体,通过截图感知页面并生成多轮轨迹,以解决现有模拟器在长会话记忆与优化目标上的两大挑战。它采用认知启发的分层记忆(工作记忆、情景记忆、偏好记忆),并以轨迹级强化学习目标优化整个会话,使行为分布与购物意图更贴近真实用户。