五家最大GPU neocloud商业模式各异:CoreWeave与Nebius向SEC报告,Lambda和Crusoe为私有并筹备IPO,Groq在将LPU技术授权给NVIDIA后转型为推理云。
五家最大GPU neocloud商业模式各异:CoreWeave与Nebius向SEC报告,Lambda和Crusoe为私有并筹备IPO,Groq在将LPU技术授权给NVIDIA后转型为推理云。
经三天优化,缓存命中率提升至96%,输出/输入比例提升2.5倍,在请求数与输出数不变的情况下成本降低3.2倍。优化核心是采用 Observational Memory(OM)概念,参考 Mastra 文档。此举源于被梁文峰谷+大涨价倒逼出的极限优化。
sharing a new long-form blog post: ai chip architectures it covers the leading chip architectures (nvidia, amd, tpus, tr...
一位开发者将一项逆向工程任务交给 Qwen 3.8 27B,模型仅用 30 分钟便完成。该案例展示了 Qwen 3.8 27B 在复杂技术任务上的处理效率,相关讨论在 Hacker News 上获得 104 个点赞。
pgrust 的 JIT 编译器可在约 5μs 内完成代码编译,使其能够对每条 SQL 查询进行 JIT 编译,而非仅限子集。作者表示,借助 AI 辅助直接生成汇编代码,实现快速 JIT 编译比预期容易得多,这也是 pgrust 性能出色的原因之一。文章以构建一个支持字面量和重复(*)的简易正则表达式引擎为例,演示如何实现自己的快速 JIT 编译器。
阿易 AI Notes 按真实可编辑性、审美上限与 GitHub 热度重排 AI 做 PPT 的 Skill 榜单,共 10 个。榜首 ppt-master(48.7k⭐)直接输出带完整图层、文字框的原生 .pptx 文件,适合正式交付;frontend-slides(28k⭐)与 guizang-ppt-skill(24.7k⭐)分列二三名。
NanoGPT 速通榜单显示,Fable 5 在 2,726 秒内以 81.7% 的通过率位居第一,超越人类基线 2,600 秒。Opus 5 和 Kimi K3 分别以 53.6% 和 52.2% 的通过率位列二、三名。榜单涵盖 GPT-5.6、Grok 4.5、Qwen3.8 Max 等 20 款模型,并开放 41 条完整智能体轨迹供探索。
博主实测 DeepSeek-V4-Flash-Vision-Exp 与 OpenRouter 匿名模型 OX-Alpha 的多模态能力,用 AI 电竞教练框架对 CS2 游戏录像抽帧测试,考察两模型识别战局、分析优劣势并提出改进建议的能力。因 DeepSeek 多模态不支持视频输入,两模型均采用视频抽帧方式公平对比,并额外测出各自最佳输入图片配比。
本教程演示如何用 deepDoctection 搭建端到端文档智能流水线,涵盖布局分析、DocTR OCR 与表格抽取的配置。同时展示如何为实体识别实现自定义服务,并为 RAG 工作流生成结构化 JSONL 数据。
Lauren Tan 建议控制 Grok 机器人用量:避免过于频繁的定时任务,如 15 分钟一次的任务每天运行近 100 次,消耗大量 token,每小时或每天几次通常足够。与机器人的聊天长度也会增加成本,建议将重复性任务交给新机器人,主机器人(如 chief of staff)继续长对话。可将此帖发给机器人寻求帮助。
《使命召唤:现代战争 4》预购测试版于 8 月 21 日上线,成为首款采用 DLSS 4.5 光线重建技术的游戏,并随附新版 DLSS 文件(编号 310.7.128)。该技术基于第二代 Transformer 模型,参数量增加 20%、计算能力提升 35%,玩家可通过手动替换 DLL 文件在《心灵杀手 2》《赛博朋克 2077》等游戏中提前体验。
本教程讲解如何用 NeMo Guardrails 框架为基于 LLM 的应用构建生产级安全防护,超越简单提示词过滤,实现分层架构,包括确定性 PII 脱敏、检索过滤、输出掩码和基于策略的工具门控。通过集成有状态多轮评估与详细激活追踪,可构建可审计、安全且经济高效的 AI 助手,用于管理敏感金融交互并满足严格合规标准。
开发者分享了一周内更多使用 Codex 而非 Claude 的个人印象。Codex 生成的代码注释更少、架构更简洁,但完成 PR 耗时并无优势;Claude 则更主动,常超出要求猜测意图,而 Codex 更倾向于只执行明确指令。在 Jira 集成和 MCP 登录流程上,Codex 的 CLI 方式更顺畅。
用户常因下载量化版模型而误判LLM真实能力,导致体验远低于社区评价。量化压缩会损失精度与推理质量,尤其在复杂任务上表现明显。实际性能差异源于部署方式而非模型本身缺陷。
神秘模型 Ox Alpha 在 DeepSWE 测试中取得约 63% 成绩,表现与 GPT-5.6 Sol mid 相当。若该模型确为 GLM-5.3 Flash,能在 DGX Spark 上本地运行,将极具性价比。用户评价其代码质量好、处理复杂任务能力强,但速度偏慢且偶尔遗留死代码。
Actual DeepSWE run on the ox alpha mystery model is done. Ended at ~63% NOT the 80% my first subset test got, which make...
Lee Robinson 分享如何信任 Bot 自主操作:先用 LLM 自动审查每个动作,异常时请求批准;再配可自定义规则允许或拒绝操作,如明确阻止写入/破坏性动作并要求先批准。这是 YOLO 模式与全手动审查间的平衡,但也支持 YOLO 模式。
We sometimes test API serving configs in Claude Code before rolling them out, and one running now maps the numerical eff...
Kimi K3 on my shader test: "create a visually interesting shader that can run in twigl-dot-app make it like an infinite ...
a skill people at Anthropic have been using a lot recently: ELI5 /eli5 <what you want explained> "explain like I'm someo...
Alright, it happened. After a slow start with Grok Bot I just had my mind blown. Twice I did a screen recording with aud...
作者用一条提示词让AI智能体自主完成从创建代码库、编写应用与测试、通过CI、配置Postgres到部署上线HTTPS应用的完整软件开发生命周期。整套环境基于Coolify自托管在本地服务器上,通过Tailscale、Pi-hole和DNS-01证书验证实现无公网入口的沙箱化隔离,唯一持续成本是每月£20的Codex订阅。
Ollama、vLLM 和 SGLang 是运行开源权重模型的三种主流推理引擎,各自针对不同场景优化。
a skill people at Anthropic have been using a lot recently: ELI5 /eli5 <what you want explained> "explain like I'm someo...
Paul Iusztin的开源课程《Building a Coding Agent From Scratch》通过Python智能体Decode展示了三种运行模式:交互式在线、远程离线、异步在线,分别对应低延迟API、按GPU小时计费和批处理计费。
雷鸟创新发布首款“人类增强 AI 眼镜”雷鸟 iO,主打首创的全天智记功能,能以极低功耗持续采集语音并转写、总结、记忆待办事项。该眼镜采用 0.085 立方厘米萤火光引擎 Nano 与厚度不足 0.6 mm 蓝湖光波导,重 34 克,支持 55 种语言实时翻译、AI 全自动提词器及录音转写。实测中等强度使用 13 小时耗电 24%,续航约两天。
Grok 4.6 以 70.8% 登顶 CursorBench 3.2,单任务成本仅 $2.81,比 Fable 5 Max(70.5%,$17.32)便宜约 6 倍,比 Opus 5 Max(70.0%,$8.23)便宜近 3 倍。xAI 称完整版 Grok 4.7 为 2.1T 参数模型,将在数周后发布,各方面优于 4.6(1.5T),仅服务速度略慢但 token 效率更高。
BREAKING: Grok 4.6 just took the #1 spot on CursorBench 3.2 — while delivering a massive efficiency advantage. ⚡💻 • Gro...
包括英国AI安全研究所在内的团队分析了192个模型、5000多个测试问题,发现聚合安全分数具有误导性:模型可通过全面拒绝请求虚增分数,却降低日常实用性。研究还发现不到2%的测试问题真正有效,约10个自适应选择题即可接近完整评测结果,成本降低97%至99%。新统计方法能识别“沙袋效应”,在测试中捕获80%至100%的过度谨慎行为,并可通过响应模式识别API背后实际运行的模型。
Anthropic 工程师 @trq212 分享团队常用的极简 Skill:/eli5,在终端输入 /eli5 <任何问题>,Claude 即强制生成大图少字的交互式 HTML 页面,核心 Prompt 仅一句话。
a skill people at Anthropic have been using a lot recently: ELI5 /eli5 <what you want explained> "explain like I'm someo...
GPT Image 2 生成了一张 Dario 与 Sam Altman 在 B 站直播辩论的整活截图,全中文弹幕、字幕及完整网页端 UI 无一处错别字。该模型在中文排版、复杂 UI 拓扑结构还原及人物神态光影上表现精准,显示文生图竞争已转向对真实世界复杂符号系统的理解。
I launched Grok Bot for 24 hours, gave it 3 jobs, and stopped treating AI like a chatbot. I had it scan live X + web dat...
Waymo 首次公开其自动驾驶计算系统设计,强调为确定性、低延迟性能而打造的物理 AI 架构。该系统基于自研 5nm ASIC,提供超过 1,000 TOPS 的 ML 性能,并在八年内将算力扩展 20 倍。计算采用双独立引擎冗余设计,支持毫秒级实时决策,并与 AMD、NVIDIA、TSMC 等伙伴合作。