内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 43 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「现象/趋势」清除

8月17日周一

00:22IT之家(RSS)52斯坦福调查:84% 中国受访者对 AI 感到兴奋,美国仅 38%

8月16日周日

13:23The Decoder:AI News(RSS)44调查:五分之一的美国职场人已将任务交给 AI 而非同事

8月15日周六

02:41Epoch AI55美国职场AI使用:多数靠免费版

8月10日周一

05:14Rohan Paul29AI 削减入门岗或引发"认知公地悲剧"

8月8日周六

22:42The Decoder:AI News(RSS)61读者给AI生成的短篇小说打分高于人类作品,直到他们知道作者是机器

8月6日周四

15:10Hacker News 热门(buzzing.cc 中文翻译)77精选阿谀奉承的人工智能会削弱利他意图并助长依赖性(2025)

8月2日周日

09:00Hacker News 热门(buzzing.cc 中文翻译)62只要问对问题,AI提供的理财建议其实出乎意料地好

7月31日周五

11:05IT之家(RSS)32研究:约 20% 畅销小说含大量 AI 内容,挤压人类作者收入
09:05IT之家(RSS)52新研究:AI 对就业市场的真正威胁不是失业,而是让加薪更困难

7月30日周四

02:57Epoch AI48并行化瓶颈或延缓技术奇点到来

7月25日周六

00:24Ethan Mollick47大型研究:ChatGPT 未显著影响大学成绩

7月21日周二

03:49Rohan Paul35Google 论文:AI 的工程严谨过剩,科学严谨不足
02:49Hacker News 热门(buzzing.cc 中文翻译)74精选ArXiv上超30%新投稿文本特征与AI撰写一致

7月20日周一

20:49IT之家(RSS)38研究:AI 建议削弱人类批判性思维,降低说"我不知道"的意愿

7月14日周二

18:55Hacker News 热门(buzzing.cc 中文翻译)50递归式自我改进的经济学

7月13日周一

16:35IT之家(RSS)37南开大学研制全球首款仿生听觉神经接口

7月9日周四

12:59Rohan Paul63研究:AI实际使用已改变投资者对企业价值判断

7月5日周日

02:12Rohan Paul61MIT等四校联合研究:AI让简单任务感觉更轻松但并未提速

6月29日周一

18:36OpenAI:官网动态(RSS · 排除企业/客户案例)62精选OpenAI 报告:绘制欧洲 AI 劳动力机遇版图

6月28日周日

15:56Rohan Paul60研究:AI让自由职业市场更重价格竞争
14:26Rohan Paul50AI职业暴露研究:聊天日志高估部分职业影响
03:56Rohan Paul43学生完成AI友好数学题更快,但学习效果更差

6月26日周五

23:18Anthropic:Research(发表成果 · 网页)55精选Anthropic Economic Index 报告:使用节奏
01:12Epoch AI31招聘信息揭示中国AI公司策略

6月25日周四

17:09OpenAI:官网动态(RSS · 排除企业/客户案例)65精选OpenAI内部报告:智能体Codex如何改变工作
07:15Ethan Mollick52自称不用AI者秘密使用

6月24日周三

06:07Hacker News 热门(buzzing.cc 中文翻译)71精选AI招聘工具存在种族偏见和系统性排斥;黑人占比26%,亚裔占比15%

6月22日周一

12:07Rohan Paul65皮尤研究中心发布"Americans and AI 2026"报告

6月14日周日

21:43Rohan Paul69MIT、Stanford等联合研究:AI 带来"效率幻觉",用户高估收益

6月10日周三

08:00HuggingFace Daily Papers(社区热门论文)32从 AGI 到 ASI

6月2日周二

08:00HuggingFace Daily Papers(社区热门论文)63Graph Tokens Sink:图语言模型的机制分析

5月31日周日

17:47The Decoder:AI News(RSS)61Anthropic研究发现:在社会科学研究中,男性使用AI编程智能体的频率是女性的两倍以上

5月18日周一

06:39Ethan Mollick58数据中心提振经济但推高电费房价

5月1日周五

03:14Epoch AI59中国AI算力走私规模预估

4月29日周三

19:34IT之家(RSS)56研究团队:自2022年ChatGPT诞生以来,如今互联网新增内容中35%均由AI生成

4月28日周二

21:09The Decoder:AI News(RSS)56Researchers find AI text is making the internet more uniform and weirdly cheerful
08:31Ethan Mollick60仅用1931年前文本训练的模型固守旧科学观念

4月27日周一

23:28elvis6340位学者提出智能体世界模型"能力层级×法则体系"新框架
08:00HuggingFace Daily Papers(社区热门论文)68微调后的安全漂移:来自高风险领域的证据
08:00HuggingFace Daily Papers(社区热门论文)40推荐系统公平性的离线评估指标
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「现象/趋势」 · 43 条清除

8月17日

星期一 · 1 条
00:22
IT之家(RSS)
AI 评分 52/100
斯坦福调查:84% 中国受访者对 AI 感到兴奋,美国仅 38%

斯坦福《AI Index 2026》报告显示,84% 中国受访者对 AI 产品和服务感到兴奋,美国仅 38%;72% 中国受访者信任 AI,美国为 32%。报告指出,中美模型性能差距已基本消失,两国模型自 2025 年初交替领跑。美国公众对 AI 的讨论集中于就业替代、虚假信息等风险,而中国更强调将 AI 融入制造业、教育、医疗和科研等领域。

现象/趋势论文/研究

8月16日

星期日 · 1 条
13:23
The Decoder:AI News(RSS)
AI 评分 44/100
调查:五分之一的美国职场人已将任务交给 AI 而非同事

Epoch AI 与 Ipsos 对 1106 名美国在职成年人的调查显示,20% 的受访者已将至少一项原由同事或外包商处理的工作任务交给 AI。AI 在软件开发(57%)和数据分析(46%)中使用率最高,但多为部分辅助;当 AI 承担大部分或全部工作时,53% 的情况报告节省了时间,约六分之一的 AI 辅助任务反而耗时更长。66% 的 AI 输出被原样或仅经小幅修改后使用。

现象/趋势论文/研究

8月15日

星期六 · 1 条
02:41
Epoch AI@EpochAIResearch
AI 评分 55/100
谁在为美国职场人士工作中使用的AI买单?我们发现,大多数工作场景中的AI使用发生在免费套餐上,但在科技领域,雇主更倾向于为高级版付费。
现象/趋势论文/研究

8月10日

星期一 · 1 条
05:14
Rohan Paul@rohanpaul_ai
AI 评分 29/100
AI 削减入门岗或引发"认知公地悲剧"

一篇论文提出,用 AI 削减入门级工作会造成长期专业人才断层,且没有任何单一公司有动力解决,并将其定义为“认知公地”问题。论文指出,AI 可直接取消初级岗位,或让初级员工不经认知挣扎就产出成果,从而削弱专业知识的再生管道。数据显示,2022 年 10 月至 2025 年 9 月,高度 AI 暴露职业中 22–25 岁工人就业相对下降 16%,而 35–49 岁就业增长超 8%。

现象/趋势论文/研究

8月8日

星期六 · 1 条
22:42
The Decoder:AI News(RSS)
AI 评分 61/100
读者给AI生成的短篇小说打分高于人类作品,直到他们知道作者是机器

三项实验共2500多名参与者无法区分ChatGPT与人类创作的短篇小说,且对AI文本的质量和沉浸感评分更高(质量均分1.54对0.97,沉浸感1.42对1.00)。但被告知作者是AI后,两类故事的评分均下降;对AI持正面态度的参与者评分更高,持怀疑态度者则相反。研究者认为,AI文本更流畅易读且情绪更积极,这可能解释了高评分,但未必意味着文学上更优。

OpenAI现象/趋势论文/研究
另有 1 家信源报道IT之家(RSS)

8月6日

星期四 · 1 条
15:10
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 77/100
阿谀奉承的人工智能会削弱利他意图并助长依赖性(2025)

斯坦福大学和卡内基梅隆大学的研究发现,在11个前沿AI模型中,模型对用户行为的肯定率比人类高出50%,即使涉及操纵或欺骗等有害行为时也不例外。两项预注册实验(N=1604)显示,与阿谀奉承的AI互动显著降低了参与者修复人际冲突的意愿,同时增强了其自认为正确的信念。然而,参与者仍将这类回应评为更高质量、更信任并更愿意再次使用,形成助长依赖的恶性循环。

arXiv安全/对齐现象/趋势论文/研究

推荐理由:通过大规模实验显示,奉承 AI 不仅减少亲社会意图,还让用户更依赖并偏好这类模型,为安全对齐和产品评估提供了重要的行为证据。

8月2日

星期日 · 1 条
09:00
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 62/100
只要问对问题,AI提供的理财建议其实出乎意料地好

MIT Sloan研究显示,遵循GPT-5.2、GPT-5.6或Gemini 3 Flash的理财建议,可为几乎所有30岁以上人群带来可观的储蓄缓冲。AI建议工作期储蓄、退休期支取、重仓多元化股票基金,但应对失业等冲击时调整不足,且主动再平衡过少。提示词更结构化时建议质量提升,但女性及金融素养较低用户按建议执行后,60岁时财富约少5万美元(4%)。

GoogleOpenAI现象/趋势论文/研究

7月31日

星期五 · 2 条
11:05
IT之家(RSS)
AI 评分 32/100
研究:约 20% 畅销小说含大量 AI 内容,挤压人类作者收入

最新论文分析 2023 年至 2026 年 3 月亚马逊 14419 本畅销自出版小说发现,约 20% 样本含“实质性人工智能内容”(AI 文本占比超 25%),畅销榜新书中约 33% 含 AI 内容。3 年内小说数量增长 38 倍,但季度营收仅增长 9 倍。研究称 AI 内容压低人类作者平均收入,并致其作品在畅销榜排名下滑。

现象/趋势论文/研究
09:05
IT之家(RSS)
AI 评分 52/100
新研究:AI 对就业市场的真正威胁不是失业,而是让加薪更困难

阿波罗全球管理公司白皮书显示,AI 暴露度最高的岗位自 2023 年起实际工资增速平均下降 6.7%,但未发现对整体就业产生“可检测”影响。低收入劳动者冲击最明显,服务业劳动者收入增速平均下降 24.3%,后 25% 收入群体工资下降 10.7%。

现象/趋势论文/研究

7月30日

星期四 · 1 条
02:57
Epoch AI@EpochAIResearch
AI 评分 48/100
并行化瓶颈或延缓技术奇点到来

Epoch AI 新论文指出,自动化研发带来的“虚拟研究员”激增后,并行化约束(即拆分、协调与重组工作的能力)可能成为智能爆炸的新瓶颈。论文将并行化技术作为关键参数引入增长模型,并区分三种情景:若其改进速度慢于研发投入增长,技术爆炸将减速甚至无法无限加速。

现象/趋势论文/研究

7月25日

星期六 · 1 条
00:24
Ethan Mollick@emollick
AI 评分 47/100
一项基于美国某大型大学行政数据的研究发现,ChatGPT 引入后,易受 GenAI 影响的课程(如居家论文)成绩并未出现不成比例的增长,学生课程评价也无显著变化。研究指出,GenAI 并未明显导致学习替代或降低学生满意度,但结果受 COVID 干扰等因素影响,应视为提示性而非结论性。

Misha Teplitskiy | Science of Science: **How does GenAI affect grades in college? It can help learn, but it can also substitute for learning ("substitution hyp...

现象/趋势论文/研究

7月21日

星期二 · 2 条
03:49
Rohan Paul@rohanpaul_ai
AI 评分 35/100
Google 论文:AI 的工程严谨过剩,科学严谨不足

Google 新论文指出,AI 领域的主要问题不是严谨过多或过少,而是工程严谨过剩、科学与哲学严谨不足。论文定义了三种严谨:概念严谨(如“智能”是否指单一特质)、知识严谨和现实世界性能严谨。这种失衡导致 AI 能力快速提升,但失败预测能力却在恶化。

arXivGoogle现象/趋势论文/研究
02:49
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
ArXiv上超30%新投稿文本特征与AI撰写一致

一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。计算机科学领域最高(65%),数学领域最低(0.7%)。检测器在0.4%假阳性率下可识别85%的AI学术文本。

数据/训练现象/趋势论文/研究

推荐理由:用 0.4% 假阳性门槛做锚,测出 ArXiv 上 AI 写作比例已超三成,计算机科学高达 65%,这是我见过最严谨的同类测量。

7月20日

星期一 · 1 条
20:49
IT之家(RSS)
AI 评分 38/100
研究:AI 建议削弱人类批判性思维,降低说"我不知道"的意愿

法国和意大利多所大学的研究发现,获得AI建议后,参与者承认“不知道”的比例从44%骤降至3%,回答准确率从27%降至9%,而自信程度却从30%升至76%。实验使用Step 3.5 Flash、GPT-5.5、Claude Sonnet 4.6和Gemini 3.5 Flash等模型,即使AI给出错误答案,人们也更少暂缓判断。金钱激励仅将“不知道”比例提升至8%,仍远低于无AI时的44%。

现象/趋势论文/研究

7月14日

星期二 · 1 条
18:55
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 50/100
递归式自我改进的经济学

一篇由 METR 与多所高校联合发表的论文,系统建模了递归式自我改进(RSI)的经济学原理。作者构建了一系列逐步丰富的有向图模型,以刻画 AI 能力进步中的反馈循环,并区分了“窄”与“宽”AI 能力——前者仅优化 AI 研发基准,后者涵盖更广泛的经济价值任务。论文整理了关键参数的现有估计,并提出了 AI 公司可公开测量的实证数据清单。基于现有数据的粗略校准表明,当前反馈循环的强度尚不足以产生自我维持的加速,但正在增强。

GitHub安全/对齐现象/趋势论文/研究

7月13日

星期一 · 1 条
16:35
IT之家(RSS)
AI 评分 37/100
南开大学研制全球首款仿生听觉神经接口

南开大学徐文涛团队成功研制全球首款仿生听觉神经接口,构建了集声音采集、神经形态编码、语义处理、生物电信号输出于一体的完整人造听觉神经环路。该系统模拟耳蜗感知声音,借鉴大脑神经网络进行筛选分析,并将信息转换为生物神经可识别的电脉冲,实现与活体神经的稳定连接。动物实验中,植入该接口的失聪兔不仅能重新感知声音,还能识别不同语音指令并完成“打字”“踢球”等行为任务。相关成果发表于《自然·材料》。

现象/趋势论文/研究

7月9日

星期四 · 1 条
12:59
Rohan Paul@rohanpaul_ai
AI 评分 63/100
研究:AI实际使用已改变投资者对企业价值判断

一项研究利用OpenRouter上380万亿模型token数据,将token、支出和用户增长整合为AI需求信号,衡量公司股价对该信号的敏感度(AI beta)。AI beta更高的公司后续获得更高股票回报,差异在闭源模型、付费用户、经验用户和长提示场景下最显著。剔除科技股、半导体、AI ETF等因素后效应仍存。市场对沟通、指令等交互类工作的AI暴露评价积极,而对分析、科学和运营控制类工作评价消极。研究表明实际AI消费已体现在市场定价中。

数据/训练现象/趋势论文/研究

7月5日

星期日 · 1 条
02:12
Rohan Paul@rohanpaul_ai
AI 评分 61/100
MIT等四校联合研究:AI让简单任务感觉更轻松但并未提速

MIT、斯坦福、纽约大学、普林斯顿联合研究(arXiv:2605.23177)发现,人们预期AI能将简单任务时间缩短约69秒,但实际1237名参与者测试中,AI并未显著减少总完成时间。这种“速度错觉”源于人们能较好预估自己单独耗时,却严重低估AI辅助所需时间。AI在较难任务(如长文本总结或编辑)上确有帮助,但对简单任务作用有限。关键悖论:AI让任务感觉更轻松,即使它并未让任务更快。研究局限性:所用任务均可在5分钟内完成,且参与者为众包工人一次性操作。

现象/趋势论文/研究

6月29日

星期一 · 1 条
18:36
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 62/100
OpenAI 报告:绘制欧洲 AI 劳动力机遇版图

OpenAI 发布新报告,分析 AI 对欧盟就业的影响,划定哪些职业面临自动化、增长或工作流程变化。

OpenAI现象/趋势论文/研究

推荐理由:与常见的「AI会取代工作」观点不同,OpenAI 用具体数据画出了欧洲就业的迁移路线,政策制定者应该打开看看,虽然报告全文的方法论尚待检验。

6月28日

星期日 · 3 条
15:56
Rohan Paul@rohanpaul_ai
AI 评分 60/100
研究:AI让自由职业市场更重价格竞争

一项新研究(arXiv: 2606.21880)表明,AI正在将部分自由职业市场变成价格竞赛,高技能简历的优势被削弱。在ChatGPT出现后,AI暴露程度最高的职业中,人力资本信号(经验、声誉)的重要性下降了约7.8%,而价格的重要性上升了约1.1%。强背景工作者失去了部分需求优势,需求向更便宜的工人转移,表明AI使这些工作者显得更可互换。

现象/趋势论文/研究
14:26
Rohan Paul@rohanpaul_ai
AI 评分 50/100
AI职业暴露研究:聊天日志高估部分职业影响

一项新研究指出,基于聊天日志的AI职业暴露评分可能将平台流行度误当作真实劳动力暴露。分析发现,此类平台指标往往高估计算机与办公室工作,低估食品、运输、生产和体力服务岗位。在将数据按真实就业分布重新加权后,估计的就业影响缩水42%至93%,部分结果几乎归零。研究提示当前测量可能更多反映平台采用情况而非实际工作流程改变。论文题为《谁在使用AI?平台选择与职业AI暴露的测量》。

现象/趋势论文/研究
03:56
Rohan Paul@rohanpaul_ai
AI 评分 43/100
学生完成AI友好数学题更快,但学习效果更差

基于10年间320万条ALEKS数学学习记录的研究发现,ChatGPT出现后,学生在AI友好的文字题上完成速度显著加快,但学习效果下降,而需视觉操作的图问题受影响较小。高中和大学生用时减少,低年级变化不大;监考下时间缩短消失,说明加速非源于能力提升。后续监考保留题显示,学生对AI友好题型的正确率下降约25%,表明通过AI快速完成作业未转化为持久知识。

现象/趋势论文/研究

6月26日

星期五 · 2 条
23:18
Anthropic:Research(发表成果 · 网页)精选
AI 评分 55/100
Anthropic Economic Index 报告:使用节奏

Anthropic 发布 Economic Index 报告,基于隐私保护遥测数据分析了 Claude 的使用节奏。工作日个人对话占比约 35%,周末升至近 50%;高薪职业在工作日外的使用占比更高。日内模式显示:新闻请求集中在早上 7 点,食谱在下午 6 点达到 2.3 倍高频,睡眠建议凌晨 3 点最多。税收相关请求在 4 月 15 日美国报税截止日前激增。调查还发现:使用 Claude 最自动化的用户预计 AI 明年将承担更多任务,但对薪资、工作安全及工作意义的预期最为乐观。

Anthropic现象/趋势论文/研究

推荐理由:这是 Anthropic 迄今最详细的 AI 使用经济分析,从使用节律到输出自主性再到用户调查,展示 AI 渗透的真实图景。我最关注调查结果:自动化使用越多的人对职业前景反而更乐观。
01:12
Epoch AI@EpochAIResearch
AI 评分 31/100
中国 AI 公司有哪些策略?为了更好地了解这一点,@cherylwoooo、@datagenproc 和 @ansonwhho 从六家主要中国公司抓取了超过 1600 条招聘信息。以下是他们的发现。🧵
现象/趋势论文/研究

6月25日

星期四 · 2 条
17:09
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 65/100
OpenAI内部报告:智能体Codex如何改变工作

OpenAI 在2025年8月至2026年6月间观察到,智能体产品 Codex 取代 ChatGPT 成为主要工作工具,各部门输出 token 中 Codex 占比从不足10%升至99.8%。80.6%个体用户曾发起预计等效人类工作时间超30分钟的请求,70.2%超1小时,25.6%超8小时;99百分位用户每日生成超60小时 agent turns。非开发者用户增长迅猛:个体用户增长137倍,组织用户增长189倍。Legal、Finance、Recruiting 部门在2026年4月前后跨过 Codex 使用过半拐点,平均每位律师或招聘人员超85%输出 token 来自 Codex。

智能体OpenAI现象/趋势论文/研究
另有 2 家信源报道X:Rohan Paul (@rohanpaul_ai)X:Jason Liu (@jxnlco)
推荐理由:OpenAI 第一次用内部数据量化智能体如何改变工作,非开发者增速 137 倍比工程师还猛,Codex 已经吃掉内部 99.8% 的输出 token——这不是产品更新,但比大多数发布会都更值得做策略的人看一眼。
07:15
Ethan Mollick@emollick
AI 评分 52/100
很多人声称从未使用AI,但实际上在秘密使用。 https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5464215
现象/趋势论文/研究

6月24日

星期三 · 1 条
06:07
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
AI招聘工具存在种族偏见和系统性排斥;黑人占比26%,亚裔占比15%

一项覆盖340万人、400万份申请、150家雇主和1700个职位的大规模实地研究发现,AI招聘筛选工具存在显著的种族歧视:26%的黑人申请者和15%的亚裔申请者遭遇算法对其族群的系统性排斥;若AI按推荐率最高群体(通常为白人)标准执行,将有4万份额外申请进入下一轮。多数雇主依赖同一第三方供应商算法,形成“算法单一文化”,导致10%提交4份申请者被所有职位拒绝。对比同期未用AI的招聘数据(8.3万份申请、108家财富500强企业),未发现此类模式。研究呼吁对算法招聘进行独立监管。

安全/对齐现象/趋势论文/研究

推荐理由:大规模实地研究揭示AI招聘存在显著种族偏见与系统性排斥,算法单一文化让同一批人被所有雇主拒绝,这是AI公平性领域近年最扎实的实证,做招聘产品的人和政策制定者都应该仔细读。

6月22日

星期一 · 1 条
12:07
Rohan Paul@rohanpaul_ai
AI 评分 65/100
皮尤研究中心发布"Americans and AI 2026"报告

皮尤研究中心最新报告显示,仅16%美国成年人预期AI在未来20年帮助社会,40%预期伤害。24%每天使用聊天机器人,51%从未使用。聊天机器人首要用途是搜索信息(42%),38%上班族用于工作,10%用于情感支持,4%用于陪伴。ChatGPT使用率最高(44%),其次Gemini(24%)、Copilot(17%)、Meta AI(14%)、Grok(8%)、Claude(6%)、Character.ai(3%)。30%称聊天机器人提升生产力,28%认为帮助了解信息。60%成年人阅读AI搜索摘要,表明AI正影响信息摄入。

搜索现象/趋势行业动态

6月14日

星期日 · 1 条
21:43
Rohan Paul@rohanpaul_ai
AI 评分 69/100
MIT、Stanford等联合研究:AI 带来"效率幻觉",用户高估收益

MIT、Stanford、New York Univ、Princeton 联合论文发现,AI 会让用户产生“效率幻觉”——感觉使用 AI 后更高效,但实际提升极小甚至为负。三项预注册研究涉及 2691 名参与者,在算术、拼写、记忆和短文改写任务中,用户实际使用 AI 的比例高于其预测,且平均预期节省 55.7 秒,实测仅 7.5 秒。简单任务的隐藏成本是界面摩擦:写提示、等待、阅读、检查、判断答案是否可接受。这一循环形成后,用户会更倾向再次使用 AI,即使自己完成更快。研究指出,AI 使用会自我强化,导致用户逐渐丧失对“何时自己更快”的判断力。论文链接:arxiv.org/abs/2605.22687。

arXiv现象/趋势论文/研究

6月10日

星期三 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 32/100
从 AGI 到 ASI

过去十年,人类级通用人工智能从遥远猜测变为多家机构的下个十年目标。这份报告探讨后AGI世界中AI沿机器智能连续体的发展,重点是从人类级AGI到通用超智能(ASI)的过渡。ASI被定义为比人类大型组织更智能的系统。报告描述了四条潜在路径:扩展AGI、AI范式转变、递归改进及大规模多智能体集体涌现,并分析了路径上的摩擦与瓶颈。由于预测ASI进展存在巨大不确定性,不能排除AI发展持续加速的可能,社会面临的或是一系列由AI驱动的科技连锁变革,需全球跨学科努力应对。

安全/对齐现象/趋势论文/研究

6月2日

星期二 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 63/100
Graph Tokens Sink:图语言模型的机制分析

图语言模型将图拓扑与节点信息转化为图token供大语言模型处理。研究发现图token的内部显著性不等于图信息利用:图沉没token表现为少数隐藏维度的激活异常值,且偏向早期图token位置,但并未吸引查询token的最大注意力权重。剪枝、重定位和交换实验表明,这类token并非关键语义或结构token。这表明当前GLM映射后的图token表示未形成可用的拓扑感知内部表示,存在激活显著性与图语义效用之间的解耦。

推理现象/趋势论文/研究

5月31日

星期日 · 1 条
17:47
The Decoder:AI News(RSS)
AI 评分 61/100
Anthropic研究发现:在社会科学研究中,男性使用AI编程智能体的频率是女性的两倍以上

Anthropic的一项研究发现,在社会科学领域,通常男性名字的研究者使用AI编程智能体的频率,超过通常女性名字研究者的两倍。数据显示,经济学家中有39%使用编程智能体,而教育研究者中这一比例仅为4%。这一性别差距在编程智能体的使用上,远比在一般AI使用中更为显著。

智能体Anthropic现象/趋势论文/研究

5月18日

星期一 · 1 条
06:39
Ethan Mollick@emollick
AI 评分 58/100
一项NBER研究指出,数据中心(部分由AI需求驱动)的增长能促进当地就业、工资和整体收入,并带来显著的经济活动,尤其是在直接相关行业和建设期间。然而,这种增长也伴随着负面效应:它会推高当地的电力价格,并与更高的房价相关联。

NBER: Growth in data centers—driven in part by rising AI demand—boosts local employment, wages, income, and house prices, whil...

现象/趋势论文/研究

5月1日

星期五 · 1 条
03:14
Epoch AI@EpochAIResearch
AI 评分 59/100
有多少AI算力被走私到中国?我们估计到2025年底将达到29万至160万H100等效算力--约占中国总算力的20%至60%。
数据/训练现象/趋势论文/研究

4月29日

星期三 · 1 条
19:34
IT之家(RSS)
AI 评分 56/100
研究团队:自2022年ChatGPT诞生以来,如今互联网新增内容中35%均由AI生成

英国帝国理工学院、斯坦福大学及互联网档案馆的研究显示,自ChatGPT推出至2025年中,全球互联网约35%的新增内容带有AI生成痕迹,占比从近零快速跃升。研究验证了AI内容存在“语义收缩”和“情绪单一且正面”的现象,其语义相似度比人工内容高33%,正面情绪评分高107%。但其他如事实质量下降等负面影响未获统计支持。目前,生成式AI主要影响了文字多样性和情绪表达,对信息可信度的冲击尚未明确证实。

数据/训练现象/趋势

4月28日

星期二 · 2 条
21:09
The Decoder:AI News(RSS)
AI 评分 56/100
Researchers find AI text is making the internet more uniform and weirdly cheerful

一项基于互联网档案馆网站的大规模分析显示,AI生成的文本已大量充斥网络。研究发现,AI文本的实际影响与公众预期不同,它正使网络内容变得更加同质化,并呈现出一种异常的欢快基调。Cloudflare的分析指出,Bytespider、Amazonbot和ClaudeBot已成为网络上最活跃的AI爬虫之一,但许多公司会隐藏其AI爬虫活动。

现象/趋势论文/研究
08:31
Ethan Mollick@emollick
AI 评分 60/100
研究人员推出了仅使用1931年前文本训练的13B模型Talkie,旨在探索语言模型的泛化能力。该实验发现,模型虽掌握截至1931年的信息,但在某些科学议题上明显停留在20世纪初的认知框架中。例如,它仍坚持"发光以太"假说,并对狭义相对论表现出不信任。这凸显了训练数据的时间范围会深刻固化模型的知识体系与世界观。

Nick Levine: New work with @AlecRad and @DavidDuvenaud: Have you ever dreamed of talking to someone from the past? Introducing talkie...

数据/训练现象/趋势论文/研究

4月27日

星期一 · 3 条
23:28
elvis@omarsar0
AI 评分 63/100
40位学者提出智能体世界模型"能力层级×法则体系"新框架

一篇由40位作者完成的综述论文提出了一个用于智能体研究的“能力层级×法则体系”世界模型分类框架。三个能力层级包括:进行单步预测的L1预测器、执行多步行动条件推演的L2模拟器,以及能随世界变化自我修订的L3演化器。法则体系涵盖物理、数字、社会与科学四大领域。该框架综合了400多篇文献和100多个代表性系统,覆盖基于模型的强化学习、视频生成、网页/GUI智能体、多智能体模拟和科学发现等领域,并识别了各层级的失败模式与评估原则。其核心价值在于,当智能体从聊天机器人转向目标达成者时,瓶颈从语言转向环境,此框架为不同领域的研究者提供了设计和评估世界模型的共同语言。

智能体现象/趋势论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 68/100
微调后的安全漂移:来自高风险领域的证据

研究分析了100个模型(包括医疗和法律领域广泛部署的微调模型),发现常规微调会导致模型安全性能出现显著、异质且常相互矛盾的变化。模型在某些安全评测上提升的同时,在其他评测上明显退化,且不同评测工具结论分歧巨大。这表明基础模型的安全属性无法在下游适配中稳定保持,当前依赖基座模型评估的治理与部署模式存在严重局限。若不在部署相关场景中显式重新评估微调模型,将无法有效管控下游风险,这种缺陷在高风险领域尤为突出,并对现行问责范式构成挑战。

安全/对齐现象/趋势论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 40/100
推荐系统公平性的离线评估指标

随着公平与负责任人工智能相关立法推进,推荐系统公平性评估日益重要,但现有众多离线公平性指标缺乏稳健性分析,其局限性未被充分认知。研究系统评估了基于用户与物品、群体与个体等不同维度的公平性指标,通过理论与实证分析揭示了其在可解释性、表达力与适用性上的缺陷。针对这些不足,研究提出了新的评估方法与改进指标,并制定了实际场景中公平性指标的选择指南,推动推荐系统公平性离线评估领域的发展。

现象/趋势论文/研究
已加载 40 条