内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态教程 · 3103 条
来源全部一手资讯X
类型教程
全部模型产品行业论文教程观点

今天8月24日 周一

13:29MarkTechPost(RSS)472026年最佳GPU Neocloud排名:CoreWeave、Nebius、Lambda、Crusoe与Groq按公开定价和签约电力对比
09:44赵纯想47缓存命中率96%成本降3.2倍
06:18DogeDesigner37Grok Build 让用户用手势实时操控视觉
05:18SemiAnalysis54实测Claude与OpenAI高价套餐收益
01:18Rohan Paul26Booster K1 机器人轻便便携更安全
00:18elvis34AI芯片架构全景:RSI或重塑算力格局

8月23日周日

22:26Hacker News 热门(buzzing.cc 中文翻译)29Qwen 3.8 27B 仅用 30 分钟完成一项逆向工程任务
21:56Hacker News 热门(buzzing.cc 中文翻译)59pgrust 如何用 AI 在 5 微秒内完成代码的 JIT 编译
18:44AYi59阿易 AI Notes 按实用性重排 AI 做 PPT 的 Skill 榜单,ppt-master 居首
18:26Hacker News 热门(buzzing.cc 中文翻译)49NanoGPT 速通前沿:Fable 5 以 81.7% 通过率登顶
17:24karminski-牙医39DeepSeek-V4-Flash-Vision 与 OX-Alpha 多模态实测
15:59MarkTechPost(RSS)53用 deepDoctection 构建端到端文档智能流水线
11:47lauren54控制 Grok 用量:避免高频定时任务
11:24IT之家(RSS)59《使命召唤:现代战争 4》测试版率先搭载英伟达 DLSS 4.5 光线重建技术
07:59MarkTechPost(RSS)33面向企业 AI 安全的 NeMo Guardrails 开发者指南
07:26Hacker News 热门(buzzing.cc 中文翻译)45使用 Codex 一周后的印象:与 Claude 的对比
06:56Hacker News 热门(buzzing.cc 中文翻译)28为什么你身边的LLM看起来比实际更"笨"
06:48Chubby♨️35Ox Alpha 模型 DeepSWE 测试接近 GPT-5.6 Sol mid
05:53clem 🤗34英伟达自研编码框架满分通过ARC-AGI-3
05:44Dongxi 东锡 NLP21TRACES基准:不信任正确答案的评测
04:59Lee Robinson47如何信任Bot自主操作?设计思路解析
03:48Chubby♨️30Claude Code"high=10"非降级,Anthropic澄清
03:18Ethan Mollick36Ox Alpha 表现平平,未达开源前沿
01:18SemiAnalysis48评估LLM推理的新指标:tok/s/MW
01:18Ethan Mollick39Codex与Claude Code可自动填表省时
01:18elvis33DAIR.AI 推荐 /eli5 技能:可视化深奥技术概念
00:11Elon Musk31Grok Bot 从屏幕录像学会用户工作方式

8月22日周六

23:56Hacker News 热门(buzzing.cc 中文翻译)61构建一个(几乎)完全自主托管、沙箱化、具有代理能力的软件工厂
23:38ByteByteGo(RSS)46Ollama vs vLLM vs SGLang:三大开源模型推理引擎对比
23:18Ethan Mollick44Anthropic 内部流行 ELI5 技能:用 HTML 图文解释
22:18DogeDesigner31Grok Build 助新手两天完成 3D 户型漫游
21:58MarkTechPost(RSS)40解码AI开源课程:三种智能体循环运行方式及其背后的供应商经济学
18:24IT之家(RSS)53雷鸟 iO AI 眼镜体验:全天智记是亮点,堪比随身助理
17:48Chubby♨️42Grok 4.6登顶CursorBench,4.7将更强
15:28The Decoder:AI News(RSS)47心理学方法揭示AI安全测试的重大缺陷
13:44AYi36Anthropic 内部 /eli5 技能:HTML 大图解释复杂系统
12:44AYi41GPT Image 2 精准还原 B 站辩论直播场景
11:41Elon Musk28马斯克:用 Grok 机器人就这么简单
11:26Hacker News 热门(buzzing.cc 中文翻译)45Waymo 首次公开自动驾驶计算系统:自研 5nm ASIC 与冗余架构
11:18Ethan Mollick29Fable 用数学生成《黄衣王》卡科萨着色器
已加载 40 条
全部 AI 动态
2026年8月24日星期一 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
教程 · 3103 条清除

8月24日

星期一 · 6 条
13:29
MarkTechPost(RSS)
AI 评分 47/100
2026年最佳GPU Neocloud排名:CoreWeave、Nebius、Lambda、Crusoe与Groq按公开定价和签约电力对比

五家最大GPU neocloud商业模式各异:CoreWeave与Nebius向SEC报告,Lambda和Crusoe为私有并筹备IPO,Groq在将LPU技术授权给NVIDIA后转型为推理云。

评测/基准部署/工程
09:44
赵纯想@chunxiangai
AI 评分 47/100
缓存命中率96%成本降3.2倍

经三天优化,缓存命中率提升至96%,输出/输入比例提升2.5倍,在请求数与输出数不变的情况下成本降低3.2倍。优化核心是采用 Observational Memory(OM)概念,参考 Mastra 文档。此举源于被梁文峰谷+大涨价倒逼出的极限优化。

智能体教程/实践
06:18
DogeDesigner@cb_doge
AI 评分 37/100
Grok Build 太不可思议了 🔥我刚刚构建了这个可以用双手控制的交互式视觉画面。我的笔记本电脑摄像头追踪我的手掌动作,让我能实时改变视觉效果。Grok Build 正在改变每个人能创造的东西。
xAI视频评测/基准
05:18
SemiAnalysis@SemiAnalysis_
AI 评分 54/100
我们测试了Anthropic每月200美元的Claude套餐,其最高可产生每月8000美元💰️💰️的收益,而OpenAI每月200美元的套餐,若在长周期任务中耗尽全部每周限额,则可产生价值高达每月14000美元的token。该测试于6月进行。
AnthropicOpenAI评测/基准
01:18
Rohan Paul@rohanpaul_ai
AI 评分 26/100
它们在那条轨道上看起来完全如鱼得水。重量不到 20 公斤,高度适合登机箱,这些 Booster K1 非常便携。更小的体积和更轻的质量使其在人群周围更安全。
具身智能评测/基准
00:18
elvis@omarsar0
AI 评分 34/100
博主Elvis Saravia推荐一篇关于AI芯片架构的长文,该文覆盖NVIDIA、AMD、TPU、Trainium、Cerebras、Groq等主流芯片的架构、扩展(scale-up与scale-out)及软件栈。Saravia认为,一旦RSI(递归自我改进)出现,模型架构可能快速演变,与今天截然不同,从而带来全新的算力需求。

Jacob: sharing a new long-form blog post: ai chip architectures it covers the leading chip architectures (nvidia, amd, tpus, tr...

教程/实践部署/工程

8月23日

星期日 · 21 条
22:26
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 29/100
Qwen 3.8 27B 仅用 30 分钟完成一项逆向工程任务

一位开发者将一项逆向工程任务交给 Qwen 3.8 27B,模型仅用 30 分钟便完成。该案例展示了 Qwen 3.8 27B 在复杂技术任务上的处理效率,相关讨论在 Hacker News 上获得 104 个点赞。

推理评测/基准
21:56
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 59/100
pgrust 如何用 AI 在 5 微秒内完成代码的 JIT 编译

pgrust 的 JIT 编译器可在约 5μs 内完成代码编译,使其能够对每条 SQL 查询进行 JIT 编译,而非仅限子集。作者表示,借助 AI 辅助直接生成汇编代码,实现快速 JIT 编译比预期容易得多,这也是 pgrust 性能出色的原因之一。文章以构建一个支持字面量和重复(*)的简易正则表达式引擎为例,演示如何实现自己的快速 JIT 编译器。

教程/实践部署/工程
18:44
AYi@AYi_AInotes
AI 评分 59/100
阿易 AI Notes 按实用性重排 AI 做 PPT 的 Skill 榜单,ppt-master 居首

阿易 AI Notes 按真实可编辑性、审美上限与 GitHub 热度重排 AI 做 PPT 的 Skill 榜单,共 10 个。榜首 ppt-master(48.7k⭐)直接输出带完整图层、文字框的原生 .pptx 文件,适合正式交付;frontend-slides(28k⭐)与 guizang-ppt-skill(24.7k⭐)分列二三名。

GitHub开源生态教程/实践
18:26
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 49/100
NanoGPT 速通前沿:Fable 5 以 81.7% 通过率登顶

NanoGPT 速通榜单显示,Fable 5 在 2,726 秒内以 81.7% 的通过率位居第一,超越人类基线 2,600 秒。Opus 5 和 Kimi K3 分别以 53.6% 和 52.2% 的通过率位列二、三名。榜单涵盖 GPT-5.6、Grok 4.5、Qwen3.8 Max 等 20 款模型,并开放 41 条完整智能体轨迹供探索。

智能体编码评测/基准
17:24
karminski-牙医@karminski3
AI 评分 39/100
DeepSeek-V4-Flash-Vision 与 OX-Alpha 多模态实测

博主实测 DeepSeek-V4-Flash-Vision-Exp 与 OpenRouter 匿名模型 OX-Alpha 的多模态能力,用 AI 电竞教练框架对 CS2 游戏录像抽帧测试,考察两模型识别战局、分析优劣势并提出改进建议的能力。因 DeepSeek 多模态不支持视频输入,两模型均采用视频抽帧方式公平对比,并额外测出各自最佳输入图片配比。

DeepSeek多模态评测/基准
15:59
MarkTechPost(RSS)
AI 评分 53/100
用 deepDoctection 构建端到端文档智能流水线

本教程演示如何用 deepDoctection 搭建端到端文档智能流水线,涵盖布局分析、DocTR OCR 与表格抽取的配置。同时展示如何为实体识别实现自定义服务,并为 RAG 工作流生成结构化 JSONL 数据。

检索增强教程/实践部署/工程
11:47
lauren@poteto
AI 评分 54/100
控制 Grok 用量:避免高频定时任务

Lauren Tan 建议控制 Grok 机器人用量:避免过于频繁的定时任务,如 15 分钟一次的任务每天运行近 100 次,消耗大量 token,每小时或每天几次通常足够。与机器人的聊天长度也会增加成本,建议将重复性任务交给新机器人,主机器人(如 chief of staff)继续长对话。可将此帖发给机器人寻求帮助。

智能体xAI教程/实践
11:24
IT之家(RSS)
AI 评分 59/100
《使命召唤:现代战争 4》测试版率先搭载英伟达 DLSS 4.5 光线重建技术

《使命召唤:现代战争 4》预购测试版于 8 月 21 日上线,成为首款采用 DLSS 4.5 光线重建技术的游戏,并随附新版 DLSS 文件(编号 310.7.128)。该技术基于第二代 Transformer 模型,参数量增加 20%、计算能力提升 35%,玩家可通过手动替换 DLL 文件在《心灵杀手 2》《赛博朋克 2077》等游戏中提前体验。

产品更新部署/工程
07:59
MarkTechPost(RSS)
AI 评分 33/100
面向企业 AI 安全的 NeMo Guardrails 开发者指南

本教程讲解如何用 NeMo Guardrails 框架为基于 LLM 的应用构建生产级安全防护,超越简单提示词过滤,实现分层架构,包括确定性 PII 脱敏、检索过滤、输出掩码和基于策略的工具门控。通过集成有状态多轮评估与详细激活追踪,可构建可审计、安全且经济高效的 AI 助手,用于管理敏感金融交互并满足严格合规标准。

安全/对齐教程/实践部署/工程
07:26
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 45/100
使用 Codex 一周后的印象:与 Claude 的对比

开发者分享了一周内更多使用 Codex 而非 Claude 的个人印象。Codex 生成的代码注释更少、架构更简洁,但完成 PR 耗时并无优势;Claude 则更主动,常超出要求猜测意图,而 Codex 更倾向于只执行明确指令。在 Jira 集成和 MCP 登录流程上,Codex 的 CLI 方式更顺畅。

AnthropicOpenAI编码评测/基准
06:56
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 28/100
为什么你身边的LLM看起来比实际更"笨"

用户常因下载量化版模型而误判LLM真实能力,导致体验远低于社区评价。量化压缩会损失精度与推理质量,尤其在复杂任务上表现明显。实际性能差异源于部署方式而非模型本身缺陷。

现象/趋势端侧部署/工程
06:48
Chubby♨️@kimmonismus
AI 评分 35/100
Ox Alpha 模型 DeepSWE 测试接近 GPT-5.6 Sol mid

神秘模型 Ox Alpha 在 DeepSWE 测试中取得约 63% 成绩,表现与 GPT-5.6 Sol mid 相当。若该模型确为 GLM-5.3 Flash,能在 DGX Spark 上本地运行,将极具性价比。用户评价其代码质量好、处理复杂任务能力强,但速度偏慢且偶尔遗留死代码。

Ben Davis: Actual DeepSWE run on the ox alpha mystery model is done. Ended at ~63% NOT the 80% my first subset test got, which make...

编码评测/基准
05:53
clem 🤗@ClementDelangue
AI 评分 34/100
NVIDIA 构建了自己的编码框架来优化 CUDA GPU 内核,并在 ARC-AGI-3 的 25 个公开游戏中取得了 100% 的分数,解决了全部 183 个关卡。借助智能体,我们将从一个运行、优化、后训练自己的 AI 模型和内核相当困难的世界,迈向一个几乎人人都能做到的世界。1 亿 AI 构建者何时到来?
智能体编码评测/基准
05:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 21/100
TRACES一个不信任正确答案的基准。

Dongxi 东锡 NLP: http://x.com/i/article/2091179277962113024

评测/基准
04:59
Lee Robinson@leerob
AI 评分 47/100
如何信任Bot自主操作?设计思路解析

Lee Robinson 分享如何信任 Bot 自主操作:先用 LLM 自动审查每个动作,异常时请求批准;再配可自定义规则允许或拒绝操作,如明确阻止写入/破坏性动作并要求先批准。这是 YOLO 模式与全手动审查间的平衡,但也支持 YOLO 模式。

智能体安全/对齐教程/实践
03:48
Chubby♨️@kimmonismus
AI 评分 30/100
Anthropic的Thariq回应称,Claude Code中"high=10"的输出是数值映射问题,并非性能降级,"high"仍代表高推理强度,内部评测确认无性能回退。用户仍反馈多数模型(尤其Opus)使用体验明显变笨,Anthropic建议遇到明显回退时通过/feedback反馈并附ID,将提供积分补偿。

Thariq: We sometimes test API serving configs in Claude Code before rolling them out, and one running now maps the numerical eff...

Anthropic推理编码行业动态
03:18
Ethan Mollick@emollick
AI 评分 36/100
Ethan Mollick 实测神秘模型 Ox Alpha,认为其表现尚可但未达开源权重模型的前沿水平。在其新哥特城市 twigl shader 测试中,Ox Alpha 逊于引用推文中同样开源的 Kimi K3,后者被评价为"非常好的模型"。Mollick 表示仍在继续测试。

Ethan Mollick: Kimi K3 on my shader test: "create a visually interesting shader that can run in twigl-dot-app make it like an infinite ...

图像生成开源生态评测/基准
01:18
SemiAnalysis@SemiAnalysis_
AI 评分 48/100
评估LLM推理的一个有用指标是tok/s/MW:系统每消耗一兆瓦总配置功率,每秒能生成多少token。在单并发用户下,下方B300配置在DeepSeek V4上每GPU可生成约14个输出tok/s。SemiAnalysis数据中心行业模型估算每块B300的配置功率为1.9 kW(0.0019 MW)。14 tok/s ÷ 0.0019 MW = 7,368 tok/s/MW即每配置兆瓦约7,400个输出tok/s。(1/4)🧵
DeepSeek推理教程/实践部署/工程
01:18
Ethan Mollick@emollick
AI 评分 39/100
在日常实用性和节省时间方面,Codex 和 Claude Code 非常擅长处理这类任务:你让它们"把我邮件里收到的那些表格填好",它们就能很好地完成,无需你再进一步干预。对于低风险但耗时的琐事来说,真的非常方便。
智能体AnthropicOpenAI教程/实践
01:18
elvis@omarsar0
AI 评分 33/100
DAIR.AI 推荐 agent 技能 /eli5,可将深奥技术概念可视化,加速思考并改善与 agent 的协作。该技能源自 Anthropic 内部常用做法,通过 HTML 大图少字方式向零基础者解释。用户可在其 harness playground 中搭配 Pi 和 Ox Alpha 试用。

Thariq: a skill people at Anthropic have been using a lot recently: ELI5 /eli5 <what you want explained> "explain like I'm someo...

智能体Anthropic教程/实践
00:11
Elon Musk@elonmusk
AI 评分 31/100
Elon Musk 转发用户实测:Grok Bot 通过带语音的屏幕录像学会用户整理桌面的方式与原因,并自动压缩大视频文件以便观看。该智能体还能就如何录制第二部分给出改进反馈,并主动提问验证理解程度。用户称这将是许多人接触 AI 智能体的入口,并已为妻子开通使用。

Dillon Loomis: Alright, it happened. After a slow start with Grok Bot I just had my mind blown. Twice I did a screen recording with aud...

智能体xAI评测/基准

8月22日

星期六 · 13 条
23:56
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 61/100
构建一个(几乎)完全自主托管、沙箱化、具有代理能力的软件工厂

作者用一条提示词让AI智能体自主完成从创建代码库、编写应用与测试、通过CI、配置Postgres到部署上线HTTPS应用的完整软件开发生命周期。整套环境基于Coolify自托管在本地服务器上,通过Tailscale、Pi-hole和DNS-01证书验证实现无公网入口的沙箱化隔离,唯一持续成本是每月£20的Codex订阅。

智能体教程/实践部署/工程
23:38
ByteByteGo(RSS)
AI 评分 46/100
Ollama vs vLLM vs SGLang:三大开源模型推理引擎对比

Ollama、vLLM 和 SGLang 是运行开源权重模型的三种主流推理引擎,各自针对不同场景优化。

推理教程/实践部署/工程
23:18
Ethan Mollick@emollick
AI 评分 44/100
Ethan Mollick 认为 LLM 应充当跨领域"通用翻译器",比起笼统的"简化解释",更应要求"基于我已懂的知识来讲解"。他引用 Anthropic 员工 @trq212 的推文:Anthropic 内部近期常用 ELI5 技能,通过 /eli5 <主题> 指令,以"大图少字"的 HTML artifact 向零基础者解释。

Thariq: a skill people at Anthropic have been using a lot recently: ELI5 /eli5 <what you want explained> "explain like I'm someo...

Anthropic教程/实践
22:18
DogeDesigner@cb_doge
AI 评分 31/100
Grok Build 真的太不可思议了!它帮我把一张简单的公寓 2D 图纸,变成了 Blender 里的 3D 漫游场景。我才用 Blender 第二天,但 Grok Build 让整个过程变得非常轻松。@Grok Build 带来的可能性简直令人惊叹。
xAI多模态评测/基准
21:58
MarkTechPost(RSS)
AI 评分 40/100
解码AI开源课程:三种智能体循环运行方式及其背后的供应商经济学

Paul Iusztin的开源课程《Building a Coding Agent From Scratch》通过Python智能体Decode展示了三种运行模式:交互式在线、远程离线、异步在线,分别对应低延迟API、按GPU小时计费和批处理计费。

智能体教程/实践部署/工程
18:24
IT之家(RSS)
AI 评分 53/100
雷鸟 iO AI 眼镜体验:全天智记是亮点,堪比随身助理

雷鸟创新发布首款“人类增强 AI 眼镜”雷鸟 iO,主打首创的全天智记功能,能以极低功耗持续采集语音并转写、总结、记忆待办事项。该眼镜采用 0.085 立方厘米萤火光引擎 Nano 与厚度不足 0.6 mm 蓝湖光波导,重 34 克,支持 55 种语言实时翻译、AI 全自动提词器及录音转写。实测中等强度使用 13 小时耗电 24%,续航约两天。

端侧评测/基准语音
17:48
Chubby♨️@kimmonismus
AI 评分 42/100
Grok 4.6登顶CursorBench,4.7将更强

Grok 4.6 以 70.8% 登顶 CursorBench 3.2,单任务成本仅 $2.81,比 Fable 5 Max(70.5%,$17.32)便宜约 6 倍,比 Opus 5 Max(70.0%,$8.23)便宜近 3 倍。xAI 称完整版 Grok 4.7 为 2.1T 参数模型,将在数周后发布,各方面优于 4.6(1.5T),仅服务速度略慢但 token 效率更高。

Tesla Owners Silicon Valley: BREAKING: Grok 4.6 just took the #1 spot on CursorBench 3.2 — while delivering a massive efficiency advantage. ⚡💻 • Gro...

xAI编码评测/基准
15:28
The Decoder:AI News(RSS)
AI 评分 47/100
心理学方法揭示AI安全测试的重大缺陷

包括英国AI安全研究所在内的团队分析了192个模型、5000多个测试问题,发现聚合安全分数具有误导性:模型可通过全面拒绝请求虚增分数,却降低日常实用性。研究还发现不到2%的测试问题真正有效,约10个自适应选择题即可接近完整评测结果,成本降低97%至99%。新统计方法能识别“沙袋效应”,在测试中捕获80%至100%的过度谨慎行为,并可通过响应模式识别API背后实际运行的模型。

AnthropicarXiv安全/对齐数据/训练
13:44
AYi@AYi_AInotes
AI 评分 36/100
Anthropic 内部 /eli5 技能:HTML 大图解释复杂系统

Anthropic 工程师 @trq212 分享团队常用的极简 Skill:/eli5,在终端输入 /eli5 <任何问题>,Claude 即强制生成大图少字的交互式 HTML 页面,核心 Prompt 仅一句话。

Thariq: a skill people at Anthropic have been using a lot recently: ELI5 /eli5 <what you want explained> "explain like I'm someo...

Anthropic教程/实践编码
12:44
AYi@AYi_AInotes
AI 评分 41/100
GPT Image 2 精准还原 B 站辩论直播场景

GPT Image 2 生成了一张 Dario 与 Sam Altman 在 B 站直播辩论的整活截图,全中文弹幕、字幕及完整网页端 UI 无一处错别字。该模型在中文排版、复杂 UI 拓扑结构还原及人物神态光影上表现精准,显示文生图竞争已转向对真实世界复杂符号系统的理解。

OpenAI图像生成多模态评测/基准
11:41
Elon Musk@elonmusk
AI 评分 28/100
马斯克转发称,用 Grok 机器人"就这么简单"。引用推文展示了 24 小时实战:给 Grok Bot 分配 3 项任务,让它扫描 X 与网页数据、筛选信号并生成简报,用户只需定义目标、授予工具,AI 即可自主执行,工作流从"提示→回答→复制"转向"分配→执行→验证"。

Lummox: I launched Grok Bot for 24 hours, gave it 3 jobs, and stopped treating AI like a chatbot. I had it scan live X + web dat...

智能体xAI教程/实践
11:26
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 45/100
Waymo 首次公开自动驾驶计算系统:自研 5nm ASIC 与冗余架构

Waymo 首次公开其自动驾驶计算系统设计,强调为确定性、低延迟性能而打造的物理 AI 架构。该系统基于自研 5nm ASIC,提供超过 1,000 TOPS 的 ML 性能,并在八年内将算力扩展 20 倍。计算采用双独立引擎冗余设计,支持毫秒级实时决策,并与 AMD、NVIDIA、TSMC 等伙伴合作。

Google产品更新多模态端侧
11:18
Ethan Mollick@emollick
AI 评分 29/100
Fable:"我想要一个能渲染《黄衣王》中失落卡科萨的 twigl 着色器。"(着色器完全通过数学程序化生成)https://twigl.app?ol=true&ss=-P-bSSQZADUyG4yjrpbB湖畔云波拍岸,双日沉入湖面,阴影渐长,在卡科萨。
教程/实践编码
已加载 40 条