内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 1283 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「数据/训练」清除

今天8月26日 周三

01:57Hacker News 热门(buzzing.cc 中文翻译)46斯坦福大学研究发现,AI 对入门级岗位的冲击最为严重
00:14Artificial Intelligence News(RSS)40MIT 新工具无需历史数据即可预测极端天气

8月25日周二

18:07HuggingFace Daily Papers(社区热门论文)45Industrial-Instruction:从工业技术报告构建指令微调与基准数据集的端到端框架
18:07HuggingFace Daily Papers(社区热门论文)48面向十亿级容量的用户表征学习:迈向"稠密化定律"
17:07HuggingFace Daily Papers(社区热门论文)46RIBOSPAN:面向通用 RNA 建模的长上下文基础模型
16:07HuggingFace Daily Papers(社区热门论文)46超越稳定性-探索困境:面向LLM策略优化的环境正则化方法
12:48Rohan Paul42冻结主干只训投影层:新模态不损原能力
07:48Rohan Paul34长程规划智能体:预训练与OPD蒸馏研究
07:24IT之家(RSS)49研究团队调查发现超七成英语生物医学论文已使用 AI 辅助写作,呼吁业界建立完善监管机制
05:59Ars Technica:AI(RSS)50斯坦福研究:AI 对入门级岗位冲击最大
02:59Epoch AI53美国GDP统计漏算英伟达经济贡献

8月24日周一

22:48Rohan Paul37DataSpace 基准:最强模型数据智能体准确率仅 66.34%
21:59MarkTechPost(RSS)37Google Research 与 USC 推出 ME-POIs 框架,将移动数据融入地点嵌入
20:18Rohan Paul37ContinualSkillBench:LLM 智能体能否真正进化能力?
09:18elvis36Netflix 如何用 LLM 评判器优化推荐解释
03:44Dongxi 东锡 NLP24无递归预训练循环网络论文获赞

8月23日周日

23:48Rohan Paul36微软 SocialRL 让 4B 模型谈判胜过 GPT-4.1
21:18Rohan Paul36斯坦福CMU新方法:从录屏提取任务模型
17:24IT之家(RSS)44皮尤研究中心:ChatGPT 问世以来的新网页中,三分之一存在 AI 痕迹
11:18Rohan Paul31斯坦福北大新研究:QWM 让世界模型不参与训练
08:00HuggingFace Daily Papers(社区热门论文)47WorldToken:面向机器人模仿学习的时间优先序列建模
07:44Dongxi 东锡 NLP31TRACES:面向发现式智能的基准
05:44DAIR.AI30Task Model Induction:将录屏转为可复用技能

8月22日周六

22:48Rohan Paul37ClawGym II:黑盒 RL 训练智能体提升基准分数
22:48Rohan Paul37LLM 合成调查数据有效性遭质疑
21:48Rohan Paul37Agent Lightning v1.0:微软提出在真实部署环境中训练智能体
20:48Rohan Paul41清华等发现AI训练智能体难改策略
15:58The Decoder:AI News(RSS)47Netflix 测试语言模型 GenRec,替代手工构建的推荐逻辑
10:18Rohan Paul37EnvHarness:让智能体训练环境动态适应
07:44Dongxi 东锡 NLP25本周最佳两篇:EnvHarness 与 SPADE
03:38Google Research:Blog(网页)49移动性如何让语言模型更深入地理解地点
00:31Jim Fan72T-Rex:NVIDIA 与伯克利开源触觉机器人方法

8月21日周五

21:48elvis30Google EnvHarness 与 EnvRigger 构建智能体训练环境
16:06HuggingFace Daily Papers(社区热门论文)52NAPE:下一补丁嵌入预测实现可扩展音频学习器
11:06HuggingFace Daily Papers(社区热门论文)43IAR:面向无检索文档知识内化的三阶段后训练框架
10:06HuggingFace Daily Papers(社区热门论文)48EXIMO:用 VLM 引导探索来微调 VLA 机器人策略
10:06HuggingFace Daily Papers(社区热门论文)56EnvHarness:为智能体学习唤醒静态环境
08:00HuggingFace Daily Papers(社区热门论文)52量化感知修复:恢复压缩 4 位 LLM 的实用方案
08:00HuggingFace Daily Papers(社区热门论文)39TLive-Omni:面向电商直播的全模态理解模型
08:00HuggingFace Daily Papers(社区热门论文)52RecVerse:面向真实购物行为保真模拟的 GUI 智能体
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「数据/训练」 · 1283 条清除

8月26日

星期三 · 2 条
01:57
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 46/100
斯坦福大学研究发现,AI 对入门级岗位的冲击最为严重

斯坦福大学一项研究发现,AI 对入门级岗位的冲击最为严重。该研究基于相关数据得出这一结论,提示初级职位从业者面临更高的被替代风险。研究结果对职场新人及企业用人策略具有参考意义。

数据/训练论文/研究
00:14
Artificial Intelligence News(RSS)
AI 评分 40/100
MIT 新工具无需历史数据即可预测极端天气

MIT 研究人员开发出名为 Extreme Event Aware(η-learning)的工具,可生成某地区历史记录中从未出现但统计上可能发生的极端天气事件地图,并附带持续时间、强度和影响面积估算。

数据/训练论文/研究

8月25日

星期二 · 9 条
18:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
Industrial-Instruction:从工业技术报告构建指令微调与基准数据集的端到端框架

Industrial-Instruction框架利用906份松下公开技术文档构建了两个开放QA数据集,各含约13.6k问答对。用该数据微调小于10B参数的开源LLM,在松下基准上将Set-Match Accuracy从28.5%提升至42.0%,F1从46.6%提升至63.5%。

Anthropic检索增强数据/训练论文/研究
18:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 48/100
面向十亿级容量的用户表征学习:迈向"稠密化定律"

针对十亿级规模下原始数据扩展遭遇性能瓶颈的问题,研究提出用户行为稠密化定律,量化数据规模与最小充分分词容量间的关系。实验发现二者对数近似线性,斜率随分词方法和数据源变化。据此开发的ALGN自适应变长分词方法在多种数据源和下游任务上优于现有基线。

arXiv数据/训练论文/研究
17:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 46/100
RIBOSPAN:面向通用 RNA 建模的长上下文基础模型

RIBOSPAN 是一个 16.1 亿参数的双向 RNA 基础模型,原生预训练上下文长度达 10,240 nt,支持单核苷酸分辨率的完整长 RNA 建模。原生 10K 预训练在 10,240 token 下保持强重建能力,长上下文基准显示其上下文响应与表征分离俱佳,且推理时 YaRN 缩放可恢复短上下文模型直接外推丢失的上下文组织。

arXiv数据/训练论文/研究
16:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 46/100
超越稳定性-探索困境:面向LLM策略优化的环境正则化方法

针对大语言模型策略优化中的稳定性-探索权衡问题,研究提出环境正则化策略优化(ERPO),将正则化从动作侧移至输入侧,通过Query-KL项约束查询分布漂移,同时保留探索能力。ERPO可无缝接入GRPO/PPO/REINFORCE等流程,无需额外前向传播。在六个数学推理基准上,ERPO替代标准Policy-KL正则化,在高温解码和长时训练下实现更强准确率和更稳定行为。

arXiv数据/训练论文/研究
12:48
Rohan Paul@rohanpaul_ai
AI 评分 42/100
冻结主干只训投影层:新模态不损原能力

新研究提出“Projector Is All You Train”:为语言模型添加新模态只需训练连接编码器与主干的投影层,无需微调模型本身。3D 测试中,冻结主干的模型性能持平或超越联合微调,训练速度快一倍,而联合微调的 Llama 在 GSM8K 上从 86.96% 暴跌至 0.61%。

arXiv多模态数据/训练论文/研究
07:48
Rohan Paul@rohanpaul_ai
AI 评分 34/100
长程规划智能体:预训练与OPD蒸馏研究

论文发现,后训练无法修复薄弱的长程规划基础:噪声轨迹会累积错误,稀疏奖励导致信用分配不当,冲突教师引发遗忘。研究建议优先训练清晰世界模型和长轨迹,奖励信号过稀疏时采用OPD(on-policy distillation),并避免合并规划策略不兼容的教师。OPD在长程噪声场景下优于结果奖励GRPO,因教师反馈贯穿整个轨迹而非仅在末端。

智能体数据/训练论文/研究
07:24
IT之家(RSS)
AI 评分 49/100
研究团队调查发现超七成英语生物医学论文已使用 AI 辅助写作,呼吁业界建立完善监管机制

研究团队分析 PubMed Central 上 119 万余篇英文生物医学论文发现,2025 年约 77% 的论文出现 AI 辅助写作或编辑特征,较 2023 年的 19% 和 2024 年的 52% 大幅提升。讨论部分使用比例最高(约 78%),韩国、中国等非英语母语地区超 80%。研究呼吁建立完善使用规范和监管机制,以应对 AI 生成虚假事实及披露不足等风险。

数据/训练论文/研究
05:59
Ars Technica:AI(RSS)
AI 评分 50/100
斯坦福研究:AI 对入门级岗位冲击最大

斯坦福大学经济学家最新研究显示,AI 正导致部分领域年轻员工的入门级岗位显著流失,而年长员工迄今基本未受影响。在 AI 暴露度最高的职业中,22 至 25 岁员工的就业水平已比低暴露领域同龄人低 19%,高于去年的 13%。

数据/训练论文/研究
02:59
Epoch AI@EpochAIResearch
AI 评分 53/100
我们发现,美国GDP统计遗漏了英伟达为美国经济增加的大部分价值。因此,过去一年GDP增长被低估了约0.3个百分点。
数据/训练论文/研究

8月24日

星期一 · 5 条
22:48
Rohan Paul@rohanpaul_ai
AI 评分 37/100
DataSpace 基准:最强模型数据智能体准确率仅 66.34%

DataSpace 新基准测试数据智能体在异构工作区中的可验证分析能力,涵盖 410 个需结合数据库、CSV/JSON、长文档与视频并返回精确表格的任务。最强模型准确率仅 66.34%;固定模型后仅更换智能体框架即可将准确率从 30.98% 提升至 46.34%。跨所有测试模型,跨源连接与多数据类型混合是持续短板,且许多失败发生在智能体已找到正确信息后误解请求或提交错误列。

智能体arXiv数据/训练论文/研究
21:59
MarkTechPost(RSS)
AI 评分 37/100
Google Research 与 USC 推出 ME-POIs 框架,将移动数据融入地点嵌入

Google Research 与 USC 推出 ME-POIs 框架,将聚合移动数据融入文本地点嵌入。在洛杉矶和休斯顿的 5 项地图增强任务中,34/35 个模型-任务组合获得提升,访问意图 F1 最高提升 81.9%。模型约 53.7M 参数,但代码与权重尚未公开。

Google数据/训练论文/研究
20:18
Rohan Paul@rohanpaul_ai
AI 评分 37/100
ContinualSkillBench:LLM 智能体能否真正进化能力?

ContinualSkillBench 在 5 个领域各设 100 个关联任务,对比智能体保留反馈、更新技能与从零求解的效果。顺序执行在 15 组模型-领域设置中 14 组提升归一化奖励,整体相对提升 16.9%。

智能体arXiv数据/训练论文/研究
09:18
elvis@omarsar0
AI 评分 36/100
Netflix 如何用 LLM 评判器优化推荐解释

Netflix 每周运行数十万次节目级推荐解释的 LLM 评判器,服务数百万移动端会员,并将其视为包含诞生、训练、部署、监控四阶段的完整生命周期。训练阶段采用推理对齐的规则调优,以元评判器输出为学习信号;部署时同一评判器承担质量门控与反思生成双重角色。五周 A/B 测试显示,相比无解释对照组,浏览到播放的转化率提升,且未出现质量相关问题。

数据/训练论文/研究部署/工程
03:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 24/100
无递归预训练循环网络【引用 @chrmanning】:@akarshkumar0101 与 @phillip_isola 的《无递归预训练循环网络》是一篇很棒的论文!它通过 Transformer 教师模型绕开了 RNN 的难题,学习良好的预测性状态表征,并对记忆转移函数进行监督学习。

Christopher Manning: Pretraining Recurrent Networks without Recurrence by @akarshkumar0101 & @phillip_isola is a great paper! It makes an end...

数据/训练论文/研究

8月23日

星期日 · 7 条
23:48
Rohan Paul@rohanpaul_ai
AI 评分 36/100
微软 SocialRL 让 4B 模型谈判胜过 GPT-4.1

微软新论文发现,AI 智能体因被训练得过于顺从,替用户谈判时通常会吃亏,甚至会泄露预算并在对方施压时让步。为此提出 SocialRL 训练方法,让模型在六个谈判与调度游戏中以交易结果为导向学习。一个 4B 模型在全部游戏中平均得分 0.627,追平 GPT-4.1 的 0.625,但仅靠提示词反而会恶化表现。

智能体Microsoft数据/训练论文/研究
21:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
斯坦福CMU新方法:从录屏提取任务模型

斯坦福和CMU提出Task Model Induction,将真实工作录屏拆解为独立任务并重建带循环的目标树,而非当作单一操作序列。该方法恢复了74.9%的实际操作,是现有最佳摘要器的两倍多,基于其构建的技能在未见任务上表现提升30%。研究指出,挖掘演示数据训练智能体时应输入目标结构而非原始转录。

智能体arXiv数据/训练论文/研究
17:24
IT之家(RSS)
AI 评分 44/100
皮尤研究中心:ChatGPT 问世以来的新网页中,三分之一存在 AI 痕迹

皮尤研究中心研究显示,自 2022 年 11 月 ChatGPT 问世后发布的网页中,35% 存在 AI 创作迹象。该研究基于 Common Crawl 存档中近 50 万个英文网页,利用 Open Pangram 技术检测,其中 2026 年 7 月随机抽取的 1 万个网页样本里约 10% 有明显 AI 痕迹。.com 网站出现 AI 迹象的比例约为 .edu 和 .gov 网站的 10 倍。

数据/训练论文/研究
11:18
Rohan Paul@rohanpaul_ai
AI 评分 31/100
斯坦福大学和北京大学的新论文指出,在学到的世界模型内部训练机器人策略,会继承该模型的每一个错误。随着任务变长、图像变复杂,这些错误会不断累积。QWM(基于世界模型的 Q 学习)从不在模型内部训练任何内容。在此方法中,世界模型完全不参与训练,它只帮助机器人做选择。- arxiv.org/abs/2608.17163标题:"Q-Learning With World Models"
具身智能数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 47/100
WorldToken:面向机器人模仿学习的时间优先序列建模

WorldToken 提出时间优先策略,将每决策步的多视角图像、本体感觉与任务条件融合为单一世界 token,由因果时序 Transformer 建模并配合扩散动作头生成动作块。在 23 个 RoboCasa 任务上,85.3M 参数策略借助每任务 2,900 条生成演示达到 59.45% 平均闭环成功率。缩减可见历史会显著降低闭环成功率,但结果不证明其优于其他序列组织方式。

具身智能数据/训练论文/研究
07:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 31/100
检验结果,审计过程。面向发现式智能的 benchmark:TRACES

Dongxi 东锡 NLP: http://x.com/i/article/2091196172736073730

数据/训练评测/基准
05:44
DAIR.AI@dair_ai
AI 评分 30/100
Task Model Induction:将录屏转为可复用技能

Task Model Induction(TMI)能从原始屏幕录制与鼠标键盘事件中提取符号化任务模型,任务分组与真实标注一致性达 0.974。该方法重建 74.9% 的执行步骤,基于任务模型提炼的技能在保留任务上较最强工作流归纳基线提升 30.0% 准确率。论文:arxiv.org/abs/2608.20319。

智能体数据/训练论文/研究

8月22日

星期六 · 9 条
22:48
Rohan Paul@rohanpaul_ai
AI 评分 37/100
ClawGym II:黑盒 RL 训练智能体提升基准分数

ClawGym II 框架将 OpenClaw 或 Claude Code 作为黑盒纳入 RL 训练循环,无需访问其内部机制。通过 Qwen3-30A3B,该方法在 ClawGym-Bench Pass@1 上经 OpenClaw 提升 9.98 分、经 Claude Code 提升 14.81 分,混合训练亦有效,并扩展至 JobBench 和 OfficeQA。

智能体AnthropicarXiv数据/训练
22:48
Rohan Paul@rohanpaul_ai
AI 评分 37/100
LLM 合成调查数据有效性遭质疑

一项针对 LLM 作为合成调查受访者的心理测量学审计发现,LLM 能复现人类调查结果的大致方向,但无法还原真实的人类回答分布。用 LLM 生成数据训练的模型在预测真实人类时平均 R² 为 -0.18,而用人类数据训练的模型为 0.28。论文认为 LLM 仅适用于低成本试点调查,不能替代真实受访者。

arXiv数据/训练论文/研究
21:48
Rohan Paul@rohanpaul_ai
AI 评分 37/100
Agent Lightning v1.0:微软提出在真实部署环境中训练智能体

微软新论文主张智能体训练应在实际部署环境中进行,否则训练出的模型与上线版本不一致。为此推出 Agent Lightning v1.0,一个轻量级受控智能体强化学习框架,通过真实部署的 harness 训练现有智能体,而非在 RL 训练器中重建智能体循环。

智能体Microsoft数据/训练论文/研究
20:48
Rohan Paul@rohanpaul_ai
AI 评分 41/100
清华等发现AI训练智能体难改策略

清华等高校论文发现,AI智能体可优化训练计划数小时,却很少意识到计划本身有误。在1,338条后训练轨迹中,3,557个相邻实验仅74个(2.1%)改变了高层策略,多数迭代停留在同一方法内调整数据、超参数等。加入实验日志、技能库和评估器虽使GSM8K提升12.6分、HumanEval提升40.8分,但仍未触发策略变更;2–8倍推理token也几乎未带来AIME 2025可靠增益。

智能体arXiv数据/训练论文/研究
15:58
The Decoder:AI News(RSS)
AI 评分 47/100
Netflix 测试语言模型 GenRec,替代手工构建的推荐逻辑

Netflix 自研的基于语言模型的推荐系统 GenRec 在离线测试和约 10% 流量的四周 A/B 实验中均优于现有生产系统,排名质量离线提升约 1.6%,第二阶段训练所需标注数据减少约 40 倍。

数据/训练论文/研究部署/工程
10:18
Rohan Paul@rohanpaul_ai
AI 评分 37/100
EnvHarness:让智能体训练环境动态适应

Google 新论文提出 EnvHarness,通过重塑现有环境来针对智能体弱点进行训练,同时保持原任务和验证器不变。EnvRigger 自动发现弱点并生成包装器,仅在验证有效后保留。在 SWE-bench Verified 上,同等 300 环境预算下,智能体解决率达 54.79%,优于原始环境的 52.13% 和生成环境的 50.37%。

智能体Google数据/训练论文/研究
07:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 25/100
本周最佳两篇,Week 34EnvHarness: Awakening Static Worlds for Agent Learning https://arxiv.org/pdf/2608.19880SPADE: Self-Play in Adaptive Synthetic Executable Environments https://arxiv.org/pdf/2608.19197
智能体数据/训练论文/研究
03:38
Google Research:Blog(网页)
AI 评分 49/100
移动性如何让语言模型更深入地理解地点

Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合匿名移动模式与文本描述结合,为地点构建融合身份与动态功能的嵌入向量。在未见地点上,该框架使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估算准确率提升 24.7%。

Google数据/训练论文/研究
00:31
Jim Fan@DrJimFan
AI 评分 72/100
T-Rex:NVIDIA 与伯克利开源触觉机器人方法

NVIDIA 与伯克利联合开源触觉机器人方法 T-Rex,将触觉作为模型一等公民,采用双时钟异步架构,以每视觉 tick 4 次触觉 tick 的高频修正实时优化操作。

具身智能数据/训练论文/研究

8月21日

星期五 · 8 条
21:48
elvis@omarsar0
AI 评分 30/100
Google EnvHarness 与 EnvRigger 构建智能体训练环境

Google 提出 EnvHarness 与 EnvRigger,解决智能体训练环境静态化、无法随智能体进化的问题。EnvHarness 通过可编程插件层重塑环境行为且保留原验证器,EnvRigger 将策略视为黑盒、诊断其轨迹缺陷并合成新组件。在四个领域五个基准上,held-out 实例最高提升 9.0 分,执行步骤减少 9.8%。

智能体arXivGoogle数据/训练
16:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
NAPE:下一补丁嵌入预测实现可扩展音频学习器

NAPE提出极简自监督框架,用因果Transformer从先前补丁预测log-mel频谱图的下一补丁嵌入,仅靠因果掩码和停止梯度作为训练信号,无需重建解码器、声学tokenizer或师生架构。在六项音频与语音基准上,NAPE在多项任务取得最优微调性能,跨编码器规模扩展一致,并展现强线性探测结果与结构化注意力模式。

数据/训练论文/研究语音
11:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 43/100
IAR:面向无检索文档知识内化的三阶段后训练框架

IAR提出注入、对齐、恢复三阶段后训练框架,将固定语料库转化为参数化知识,实现无检索问答。在Llama、Phi、Qwen和SmolLM模型族及CC和CCI数据集上,IAR在8个数据集-模型组合中的7个上优于Vanilla SFT,域问答准确率平均提升3.6个百分点,通用性能平均提升12.1个百分点。

数据/训练论文/研究
10:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 48/100
EXIMO:用 VLM 引导探索来微调 VLA 机器人策略

EXIMO 提出一种高效微调视觉-语言-动作(VLA)策略的三阶段算法:探索、模仿与优化。探索阶段由视觉语言模型(VLM)充当规划器,将长程任务分解为短程子任务并收集编排数据;模仿阶段用该数据微调 VLA;优化阶段采用残差离线策略强化学习进一步提升。实验表明,EXIMO 在样本效率和最终性能上显著优于现有方法。

具身智能数据/训练论文/研究
10:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 56/100
EnvHarness:为智能体学习唤醒静态环境

EnvHarness 提出一种可编程插件层,在不修改底层逻辑的前提下重塑静态环境行为,并配套 EnvRigger 将目标策略视为黑盒,通过观察执行轨迹自动合成组件。在四个领域的五个基准上,EnvHarness 超越原始环境与领域专用生成管线,在保留实例上最高提升 9.0 分,同时减少 9.8% 执行步骤,并为强化学习提供更优的优化信号。

智能体arXiv数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
量化感知修复:恢复压缩 4 位 LLM 的实用方案

研究团队提出量化感知修复(QAH)替代量化感知训练(QAT),以恢复压缩并量化至 4 位的 LLM。在 GPT-OSS 120B 压缩至 60B 并量化为 MXFP4 的流程中,QAH 学生模型在 9 项基准的 7 项上匹敌或超越其 bfloat16 来源,权重内存减少约 4 倍,并以 Hypernova-60B 开源发布。

数据/训练论文/研究部署/工程
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 39/100
TLive-Omni:面向电商直播的全模态理解模型

TLive-Omni 将图像、视频、音频和文本输入映射到统一表示空间,专为电商直播场景设计。其引入 Per-vGrid 时间戳 token 组织以对齐视频与音频,并通过三阶段监督训练和 Faithful-RFT 强化微调提升回答忠实度与表达质量,同时满足实时性要求。实验表明,该模型在电商直播基准任务上表现强劲,并在通用基准上展现出良好泛化能力。

多模态数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
RecVerse:面向真实购物行为保真模拟的 GUI 智能体

RecVerse 是一款基于 GUI 的购物行为模拟智能体,通过截图感知页面并生成多轮轨迹,以解决现有模拟器在长会话记忆与优化目标上的两大挑战。它采用认知启发的分层记忆(工作记忆、情景记忆、偏好记忆),并以轨迹级强化学习目标优化整个会话,使行为分布与购物意图更贴近真实用户。

智能体arXiv数据/训练论文/研究
已加载 40 条