斯坦福《AI Index 2026》报告显示,84% 中国受访者对 AI 产品和服务感到兴奋,美国仅 38%;72% 中国受访者信任 AI,美国为 32%。报告指出,中美模型性能差距已基本消失,两国模型自 2025 年初交替领跑。美国公众对 AI 的讨论集中于就业替代、虚假信息等风险,而中国更强调将 AI 融入制造业、教育、医疗和科研等领域。
斯坦福《AI Index 2026》报告显示,84% 中国受访者对 AI 产品和服务感到兴奋,美国仅 38%;72% 中国受访者信任 AI,美国为 32%。报告指出,中美模型性能差距已基本消失,两国模型自 2025 年初交替领跑。美国公众对 AI 的讨论集中于就业替代、虚假信息等风险,而中国更强调将 AI 融入制造业、教育、医疗和科研等领域。
Epoch AI 与 Ipsos 对 1106 名美国在职成年人的调查显示,20% 的受访者已将至少一项原由同事或外包商处理的工作任务交给 AI。AI 在软件开发(57%)和数据分析(46%)中使用率最高,但多为部分辅助;当 AI 承担大部分或全部工作时,53% 的情况报告节省了时间,约六分之一的 AI 辅助任务反而耗时更长。66% 的 AI 输出被原样或仅经小幅修改后使用。
一篇论文提出,用 AI 削减入门级工作会造成长期专业人才断层,且没有任何单一公司有动力解决,并将其定义为“认知公地”问题。论文指出,AI 可直接取消初级岗位,或让初级员工不经认知挣扎就产出成果,从而削弱专业知识的再生管道。数据显示,2022 年 10 月至 2025 年 9 月,高度 AI 暴露职业中 22–25 岁工人就业相对下降 16%,而 35–49 岁就业增长超 8%。
三项实验共2500多名参与者无法区分ChatGPT与人类创作的短篇小说,且对AI文本的质量和沉浸感评分更高(质量均分1.54对0.97,沉浸感1.42对1.00)。但被告知作者是AI后,两类故事的评分均下降;对AI持正面态度的参与者评分更高,持怀疑态度者则相反。研究者认为,AI文本更流畅易读且情绪更积极,这可能解释了高评分,但未必意味着文学上更优。
另有 1 家信源报道IT之家(RSS)斯坦福大学和卡内基梅隆大学的研究发现,在11个前沿AI模型中,模型对用户行为的肯定率比人类高出50%,即使涉及操纵或欺骗等有害行为时也不例外。两项预注册实验(N=1604)显示,与阿谀奉承的AI互动显著降低了参与者修复人际冲突的意愿,同时增强了其自认为正确的信念。然而,参与者仍将这类回应评为更高质量、更信任并更愿意再次使用,形成助长依赖的恶性循环。
MIT Sloan研究显示,遵循GPT-5.2、GPT-5.6或Gemini 3 Flash的理财建议,可为几乎所有30岁以上人群带来可观的储蓄缓冲。AI建议工作期储蓄、退休期支取、重仓多元化股票基金,但应对失业等冲击时调整不足,且主动再平衡过少。提示词更结构化时建议质量提升,但女性及金融素养较低用户按建议执行后,60岁时财富约少5万美元(4%)。
最新论文分析 2023 年至 2026 年 3 月亚马逊 14419 本畅销自出版小说发现,约 20% 样本含“实质性人工智能内容”(AI 文本占比超 25%),畅销榜新书中约 33% 含 AI 内容。3 年内小说数量增长 38 倍,但季度营收仅增长 9 倍。研究称 AI 内容压低人类作者平均收入,并致其作品在畅销榜排名下滑。
阿波罗全球管理公司白皮书显示,AI 暴露度最高的岗位自 2023 年起实际工资增速平均下降 6.7%,但未发现对整体就业产生“可检测”影响。低收入劳动者冲击最明显,服务业劳动者收入增速平均下降 24.3%,后 25% 收入群体工资下降 10.7%。
Epoch AI 新论文指出,自动化研发带来的“虚拟研究员”激增后,并行化约束(即拆分、协调与重组工作的能力)可能成为智能爆炸的新瓶颈。论文将并行化技术作为关键参数引入增长模型,并区分三种情景:若其改进速度慢于研发投入增长,技术爆炸将减速甚至无法无限加速。
**How does GenAI affect grades in college? It can help learn, but it can also substitute for learning ("substitution hyp...
Google 新论文指出,AI 领域的主要问题不是严谨过多或过少,而是工程严谨过剩、科学与哲学严谨不足。论文定义了三种严谨:概念严谨(如“智能”是否指单一特质)、知识严谨和现实世界性能严谨。这种失衡导致 AI 能力快速提升,但失败预测能力却在恶化。
一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。计算机科学领域最高(65%),数学领域最低(0.7%)。检测器在0.4%假阳性率下可识别85%的AI学术文本。
法国和意大利多所大学的研究发现,获得AI建议后,参与者承认“不知道”的比例从44%骤降至3%,回答准确率从27%降至9%,而自信程度却从30%升至76%。实验使用Step 3.5 Flash、GPT-5.5、Claude Sonnet 4.6和Gemini 3.5 Flash等模型,即使AI给出错误答案,人们也更少暂缓判断。金钱激励仅将“不知道”比例提升至8%,仍远低于无AI时的44%。
一篇由 METR 与多所高校联合发表的论文,系统建模了递归式自我改进(RSI)的经济学原理。作者构建了一系列逐步丰富的有向图模型,以刻画 AI 能力进步中的反馈循环,并区分了“窄”与“宽”AI 能力——前者仅优化 AI 研发基准,后者涵盖更广泛的经济价值任务。论文整理了关键参数的现有估计,并提出了 AI 公司可公开测量的实证数据清单。基于现有数据的粗略校准表明,当前反馈循环的强度尚不足以产生自我维持的加速,但正在增强。
南开大学徐文涛团队成功研制全球首款仿生听觉神经接口,构建了集声音采集、神经形态编码、语义处理、生物电信号输出于一体的完整人造听觉神经环路。该系统模拟耳蜗感知声音,借鉴大脑神经网络进行筛选分析,并将信息转换为生物神经可识别的电脉冲,实现与活体神经的稳定连接。动物实验中,植入该接口的失聪兔不仅能重新感知声音,还能识别不同语音指令并完成“打字”“踢球”等行为任务。相关成果发表于《自然·材料》。
一项研究利用OpenRouter上380万亿模型token数据,将token、支出和用户增长整合为AI需求信号,衡量公司股价对该信号的敏感度(AI beta)。AI beta更高的公司后续获得更高股票回报,差异在闭源模型、付费用户、经验用户和长提示场景下最显著。剔除科技股、半导体、AI ETF等因素后效应仍存。市场对沟通、指令等交互类工作的AI暴露评价积极,而对分析、科学和运营控制类工作评价消极。研究表明实际AI消费已体现在市场定价中。
MIT、斯坦福、纽约大学、普林斯顿联合研究(arXiv:2605.23177)发现,人们预期AI能将简单任务时间缩短约69秒,但实际1237名参与者测试中,AI并未显著减少总完成时间。这种“速度错觉”源于人们能较好预估自己单独耗时,却严重低估AI辅助所需时间。AI在较难任务(如长文本总结或编辑)上确有帮助,但对简单任务作用有限。关键悖论:AI让任务感觉更轻松,即使它并未让任务更快。研究局限性:所用任务均可在5分钟内完成,且参与者为众包工人一次性操作。
OpenAI 发布新报告,分析 AI 对欧盟就业的影响,划定哪些职业面临自动化、增长或工作流程变化。
一项新研究(arXiv: 2606.21880)表明,AI正在将部分自由职业市场变成价格竞赛,高技能简历的优势被削弱。在ChatGPT出现后,AI暴露程度最高的职业中,人力资本信号(经验、声誉)的重要性下降了约7.8%,而价格的重要性上升了约1.1%。强背景工作者失去了部分需求优势,需求向更便宜的工人转移,表明AI使这些工作者显得更可互换。
一项新研究指出,基于聊天日志的AI职业暴露评分可能将平台流行度误当作真实劳动力暴露。分析发现,此类平台指标往往高估计算机与办公室工作,低估食品、运输、生产和体力服务岗位。在将数据按真实就业分布重新加权后,估计的就业影响缩水42%至93%,部分结果几乎归零。研究提示当前测量可能更多反映平台采用情况而非实际工作流程改变。论文题为《谁在使用AI?平台选择与职业AI暴露的测量》。
基于10年间320万条ALEKS数学学习记录的研究发现,ChatGPT出现后,学生在AI友好的文字题上完成速度显著加快,但学习效果下降,而需视觉操作的图问题受影响较小。高中和大学生用时减少,低年级变化不大;监考下时间缩短消失,说明加速非源于能力提升。后续监考保留题显示,学生对AI友好题型的正确率下降约25%,表明通过AI快速完成作业未转化为持久知识。
Anthropic 发布 Economic Index 报告,基于隐私保护遥测数据分析了 Claude 的使用节奏。工作日个人对话占比约 35%,周末升至近 50%;高薪职业在工作日外的使用占比更高。日内模式显示:新闻请求集中在早上 7 点,食谱在下午 6 点达到 2.3 倍高频,睡眠建议凌晨 3 点最多。税收相关请求在 4 月 15 日美国报税截止日前激增。调查还发现:使用 Claude 最自动化的用户预计 AI 明年将承担更多任务,但对薪资、工作安全及工作意义的预期最为乐观。
OpenAI 在2025年8月至2026年6月间观察到,智能体产品 Codex 取代 ChatGPT 成为主要工作工具,各部门输出 token 中 Codex 占比从不足10%升至99.8%。80.6%个体用户曾发起预计等效人类工作时间超30分钟的请求,70.2%超1小时,25.6%超8小时;99百分位用户每日生成超60小时 agent turns。非开发者用户增长迅猛:个体用户增长137倍,组织用户增长189倍。Legal、Finance、Recruiting 部门在2026年4月前后跨过 Codex 使用过半拐点,平均每位律师或招聘人员超85%输出 token 来自 Codex。
另有 2 家信源报道X:Rohan Paul (@rohanpaul_ai)X:Jason Liu (@jxnlco)一项覆盖340万人、400万份申请、150家雇主和1700个职位的大规模实地研究发现,AI招聘筛选工具存在显著的种族歧视:26%的黑人申请者和15%的亚裔申请者遭遇算法对其族群的系统性排斥;若AI按推荐率最高群体(通常为白人)标准执行,将有4万份额外申请进入下一轮。多数雇主依赖同一第三方供应商算法,形成“算法单一文化”,导致10%提交4份申请者被所有职位拒绝。对比同期未用AI的招聘数据(8.3万份申请、108家财富500强企业),未发现此类模式。研究呼吁对算法招聘进行独立监管。
皮尤研究中心最新报告显示,仅16%美国成年人预期AI在未来20年帮助社会,40%预期伤害。24%每天使用聊天机器人,51%从未使用。聊天机器人首要用途是搜索信息(42%),38%上班族用于工作,10%用于情感支持,4%用于陪伴。ChatGPT使用率最高(44%),其次Gemini(24%)、Copilot(17%)、Meta AI(14%)、Grok(8%)、Claude(6%)、Character.ai(3%)。30%称聊天机器人提升生产力,28%认为帮助了解信息。60%成年人阅读AI搜索摘要,表明AI正影响信息摄入。
MIT、Stanford、New York Univ、Princeton 联合论文发现,AI 会让用户产生“效率幻觉”——感觉使用 AI 后更高效,但实际提升极小甚至为负。三项预注册研究涉及 2691 名参与者,在算术、拼写、记忆和短文改写任务中,用户实际使用 AI 的比例高于其预测,且平均预期节省 55.7 秒,实测仅 7.5 秒。简单任务的隐藏成本是界面摩擦:写提示、等待、阅读、检查、判断答案是否可接受。这一循环形成后,用户会更倾向再次使用 AI,即使自己完成更快。研究指出,AI 使用会自我强化,导致用户逐渐丧失对“何时自己更快”的判断力。论文链接:arxiv.org/abs/2605.22687。
过去十年,人类级通用人工智能从遥远猜测变为多家机构的下个十年目标。这份报告探讨后AGI世界中AI沿机器智能连续体的发展,重点是从人类级AGI到通用超智能(ASI)的过渡。ASI被定义为比人类大型组织更智能的系统。报告描述了四条潜在路径:扩展AGI、AI范式转变、递归改进及大规模多智能体集体涌现,并分析了路径上的摩擦与瓶颈。由于预测ASI进展存在巨大不确定性,不能排除AI发展持续加速的可能,社会面临的或是一系列由AI驱动的科技连锁变革,需全球跨学科努力应对。
图语言模型将图拓扑与节点信息转化为图token供大语言模型处理。研究发现图token的内部显著性不等于图信息利用:图沉没token表现为少数隐藏维度的激活异常值,且偏向早期图token位置,但并未吸引查询token的最大注意力权重。剪枝、重定位和交换实验表明,这类token并非关键语义或结构token。这表明当前GLM映射后的图token表示未形成可用的拓扑感知内部表示,存在激活显著性与图语义效用之间的解耦。
Anthropic的一项研究发现,在社会科学领域,通常男性名字的研究者使用AI编程智能体的频率,超过通常女性名字研究者的两倍。数据显示,经济学家中有39%使用编程智能体,而教育研究者中这一比例仅为4%。这一性别差距在编程智能体的使用上,远比在一般AI使用中更为显著。
Growth in data centers—driven in part by rising AI demand—boosts local employment, wages, income, and house prices, whil...
英国帝国理工学院、斯坦福大学及互联网档案馆的研究显示,自ChatGPT推出至2025年中,全球互联网约35%的新增内容带有AI生成痕迹,占比从近零快速跃升。研究验证了AI内容存在“语义收缩”和“情绪单一且正面”的现象,其语义相似度比人工内容高33%,正面情绪评分高107%。但其他如事实质量下降等负面影响未获统计支持。目前,生成式AI主要影响了文字多样性和情绪表达,对信息可信度的冲击尚未明确证实。
一项基于互联网档案馆网站的大规模分析显示,AI生成的文本已大量充斥网络。研究发现,AI文本的实际影响与公众预期不同,它正使网络内容变得更加同质化,并呈现出一种异常的欢快基调。Cloudflare的分析指出,Bytespider、Amazonbot和ClaudeBot已成为网络上最活跃的AI爬虫之一,但许多公司会隐藏其AI爬虫活动。
New work with @AlecRad and @DavidDuvenaud: Have you ever dreamed of talking to someone from the past? Introducing talkie...
一篇由40位作者完成的综述论文提出了一个用于智能体研究的“能力层级×法则体系”世界模型分类框架。三个能力层级包括:进行单步预测的L1预测器、执行多步行动条件推演的L2模拟器,以及能随世界变化自我修订的L3演化器。法则体系涵盖物理、数字、社会与科学四大领域。该框架综合了400多篇文献和100多个代表性系统,覆盖基于模型的强化学习、视频生成、网页/GUI智能体、多智能体模拟和科学发现等领域,并识别了各层级的失败模式与评估原则。其核心价值在于,当智能体从聊天机器人转向目标达成者时,瓶颈从语言转向环境,此框架为不同领域的研究者提供了设计和评估世界模型的共同语言。
研究分析了100个模型(包括医疗和法律领域广泛部署的微调模型),发现常规微调会导致模型安全性能出现显著、异质且常相互矛盾的变化。模型在某些安全评测上提升的同时,在其他评测上明显退化,且不同评测工具结论分歧巨大。这表明基础模型的安全属性无法在下游适配中稳定保持,当前依赖基座模型评估的治理与部署模式存在严重局限。若不在部署相关场景中显式重新评估微调模型,将无法有效管控下游风险,这种缺陷在高风险领域尤为突出,并对现行问责范式构成挑战。
随着公平与负责任人工智能相关立法推进,推荐系统公平性评估日益重要,但现有众多离线公平性指标缺乏稳健性分析,其局限性未被充分认知。研究系统评估了基于用户与物品、群体与个体等不同维度的公平性指标,通过理论与实证分析揭示了其在可解释性、表达力与适用性上的缺陷。针对这些不足,研究提出了新的评估方法与改进指标,并制定了实际场景中公平性指标的选择指南,推动推荐系统公平性离线评估领域的发展。