作者开发的AI电竞教练框架“Harness Agent”被字节跳动官方采用。该框架能分析CS2游戏录屏中的走位、身法、对枪、经济等多维度数据,并提供改进建议。字节跳动将其与自家的Doubao-Seed-2.0-Lite模型结合,进行了长达25小时的不间断对局分析演示,该演示已成为Doubao-Seed-2.0-Lite的官方宣传案例。具体的项目细节视频仍在制作中。
GitHub 探讨如何为 Copilot 编码智能体构建“信任层”。文章提出,在“正确”答案非确定性的场景下,可通过领域分析来验证智能体的自主行为,避免使用脆弱的脚本或黑盒判断。该方法旨在提升 AI 编码助手的可靠性与透明度,确保其行为符合预期标准。
为确保 vLLM 从 0.8.5 到 0.18.1 的重大重写后,在线强化学习训练结果与 V0 参考运行一致,团队优先修复后端行为而非调整 RL 目标。关键修复包括:将日志概率模式设为 `processed_logprobs` 以匹配采样器分布;禁用 V1 特有的前缀缓存和异步调度等运行时默认值;调整权重更新路径以匹配 V0 的缓存保留行为;并确保 rollout 后端使用 fp32 精度的 `lm_head` 进行最终投影。这些措施消除了策略比率均值偏差,使 V1 在 KL 散度、熵等指标上与 V0 达成一致。
开发者西蒙·威利森指出,“氛围编码”和“能动性工程”两大趋势正以超预期的速度发展。“氛围编码”指开发者依赖AI生成代码但未必完全理解其逻辑,“能动性工程”则强调构建能自主执行复杂任务的AI代理。这两种方式正日益融合,引发对代码质量、开发者技能以及系统可靠性的担忧。相关讨论在Hacker News上获得107点关注,反映出业界对此趋势的高度关注与争议。
可穿戴设备1.0因仅测量数据(如心率、睡眠)而陷入停滞,用户需自行解读与行动。下一代消费硬件类别被命名为“自适应健康生态系统”,它能实时感知用户生理数据、自主决策并主动干预。例如,Dreamspan的Lucid Pro通过读取睡眠数据,自动调节床和周围空气以改善睡眠。未来将扩展至大脑、代谢等领域,所有硬件基于SpanOS平台协同工作,实现全栈生理读取。这标志着可穿戴设备的真正演进,率先推出并优化该系统的企业将主导未来十年消费健康市场。Dreamspan的最终目标是借助此技术推动人类实现150年的健康寿命。
通过将X平台创作者工作室近90天的数据分析数据输入大模型,AI提炼出关键运营规律。核心发现包括:每日发帖3-5条是曝光效率最佳区间,而非单纯追求数量;周三互动率最高,周四涨粉效果最好,周六则最利于冲击曝光量。此外,近44%的新增关注者集中来源于少数“高涨粉日”,表明涨粉主要依赖爆款帖文的拉动效应。
团队开发了Composer自动安装系统,利用早期模型(如Composer 1.5)为强化学习训练自动配置可运行环境。该系统分两阶段工作:先由智能体设定成功环境的目标命令与描述,再由另一智能体执行具体配置,包括安装依赖、模拟缺失组件并进行测试。在一项针对区块链项目Celo的真实实验中,该系统成功处理了稀疏文档和复杂依赖。采用此方法后,Composer 2在环境设置基准测试中的得分从47.9%提升至61.7%,为后续训练提供了更优基础。
作者通过自动化流程每日筛选arXiv论文,并利用智能体将其转化为可交互的“LLM Artifacts”。这一系统基于LLM Wikis概念演进,使论文知识可操作化:Artifacts支持动态注入见解、组件及实验建议,并能通过智能体协调器直接提问或自动化执行实验。其核心在于通过多智能体主动协作,持续挖掘可行动的知识,帮助研究者高效学习与跟进前沿。
Google 整合了利用其 AI Mode、Search Live 和 Shopping 功能来帮助植物茁壮成长的主要方法。这些工具能提供实时的园艺指导、植物护理建议以及相关产品购买信息,用户可直接在搜索中获取并应用这些技巧,以优化自己的园艺实践。
Stanford CS336 上,Tatsu 讲了一节 LLM 架构课,把过去 3 年所有主流 LLM 拆开,看它们的共通模板 结论挺爆:90% 的架构选择已…
开源一套我的提示词合集 前几天,收到一位微信好友反馈,说使用了我不少公开的提示词,效果很不错 这一年来,公开分享了不少提示词,一直沉淀在飞书文档 为了方…
关联讨论 1 条X:小互 (@xiaohu)2018年F1中国站,AMD CEO苏姿丰曾遭遇记者带有种族微歧视的提问。八年间,她将公司市值从濒临破产的30亿美元提升至6500亿美元。最新财报显示,其数据中心营收同比暴涨57%,股价大涨。她预判AI Agent的兴起将使CPU与GPU需求比例从1:8转向1:1,这为AMD的混合方案开辟道路,并挑战NVIDIA的垄断。凭借Zen架构与MI300系列,AMD在数据中心市场份额已从近乎为零升至40%,完成了最有力的反击。
作者宣布其创立的“Solo π LAB”社区已初具雏形,核心目标是分享个人已验证的独立项目,旨在帮助每个成员成为“超级个体”或“OPC”,并成功运营“一人公司”。为此,社区正在整理并推出“Solo π 计划”,旨在系统性地带领成员实践。作者强调,在AI时代,个人拥有无限可能,并希望陪伴所有热爱AI、积极探索一人公司模式的伙伴共同成长。
爱彼迎CEO布莱恩·切斯基指出,在AI时代,仅负责“管人”而不参与具体工作的管理者将很快失去价值,必须深入业务、掌握工作上下文。这一观点在科技行业引发共鸣,Coinbase已宣布取消“纯管理者”岗位并裁员以扁平化组织,Block和Meta等公司也强调减少永久性中层管理。未来,管理者需转型为“队员兼教练”,与团队共同实战。
作者利用豆包Seed2.0-lite全模态理解模型,重新实践了将长视频自动转换为图文博客的工作流。传统ASR+LLM方案因信息丢失严重而效果不佳,新方案的核心在于模型能同时理解视频的音频、画面和屏幕文字,进行联合推理,从而保留技术视频中的关键视觉信息(如代码、图表)。通过将多模态能力封装为可复用的Agent Skill,并采用四步最佳实践——视频切片、生成结构化素材、反查关键帧配图、生成终稿——解决了传统流程的上下文割裂问题,使输出更接近人类技术编辑的整理成果。
作者在其著作中补充了关于策略蒸馏如何成为核心后训练优化技术的历史回顾。其数学原理相对简单,其发展得益于分布式训练系统的进步。关键转折在于强化学习设置中采用蒸馏目标,这启发了丰富的奖励塑造思路。策略蒸馏的普及也源于近年来强化学习算法工程的大规模投入。技术演进从学习教师示范转向学生自我推演,回顾看似明显,实则经历了大量工作。相关研究如MiniLLM率先提出了类似策略梯度的在策略推演蒸馏方法。
这个项目能让Gemma 4 推理提速到6倍 比谷歌的3倍还快,而且不损失质量 https://github.com/z-lab/dflash
关联讨论 1 条X:Berry Xia (@berryxia)Warp 团队将其内部用于大幅提升工作流效率的“Skills”工具集完全开源。用户通过一条命令 `npx skills add warpdotdev/oz-skills` 即可安装包含 SEO 与无障碍审计、文档自动写作、Terraform/DevOps 配置、GitHub Issue 处理等在内的15个高质量生产级技能。团队此举旨在将其实用工具开放给整个社区,而非私有化,体现了开放精神。项目 GitHub 仓库已开放,并鼓励社区贡献。
关联讨论 1 条X:邵猛 (@shao__meng)OpenAI的B2B Signals研究揭示了前沿企业深化AI应用、规模化基于Codex的智能体工作流,并构建持久竞争优势的路径。这些企业正超越基础应用,将AI深度集成至核心业务流程,通过部署能自主执行复杂任务的智能体工作流来提升效率与创新能力。研究指出,成功的关键在于规模化应用AI代理,这能带来显著的运营优势并形成竞争壁垒。
关联讨论 1 条Claude:Blog(网页)一篇关于Claude Mythos和GPT-5.5的分析文章指出,两者在网络安全能力上基本持平,GPT-5.5可能更具成本效益。Mythos在部分通用基准和SWE-bench Pro上略微领先,但并未形成显著的能力突破。分析认为Mythos的性能符合既往趋势,并非偏离趋势的巨大飞跃。与此同时,OpenAI近期发布了多项出色产品,这反衬出Claude Mythos为何仍保持高度保密状态。
洛小山发布了一篇关于如何创建具有“活人感”AI助理的长文,内容包含大量实用干货与实战经验。文章指出,在该领域表现出色的实践者或项目,大多具有游戏开发背景或是资深游戏玩家。这一关联性提示,游戏行业在角色塑造、交互设计和叙事构建方面的经验,可能为开发更自然、拟人化的AI助理提供了关键的方法论借鉴。
开源一套我的提示词合集 前几天,收到一位微信好友反馈,说使用了我不少公开的提示词,效果很不错 这一年来,公开分享了不少提示词,一直沉淀在飞书文档 为了方…
关联讨论 1 条X:小互 (@xiaohu)