五家最大GPU neocloud商业模式各异:CoreWeave与Nebius向SEC报告,Lambda和Crusoe为私有并筹备IPO,Groq在将LPU技术授权给NVIDIA后转型为推理云。
五家最大GPU neocloud商业模式各异:CoreWeave与Nebius向SEC报告,Lambda和Crusoe为私有并筹备IPO,Groq在将LPU技术授权给NVIDIA后转型为推理云。
一位开发者将一项逆向工程任务交给 Qwen 3.8 27B,模型仅用 30 分钟便完成。该案例展示了 Qwen 3.8 27B 在复杂技术任务上的处理效率,相关讨论在 Hacker News 上获得 104 个点赞。
pgrust 的 JIT 编译器可在约 5μs 内完成代码编译,使其能够对每条 SQL 查询进行 JIT 编译,而非仅限子集。作者表示,借助 AI 辅助直接生成汇编代码,实现快速 JIT 编译比预期容易得多,这也是 pgrust 性能出色的原因之一。文章以构建一个支持字面量和重复(*)的简易正则表达式引擎为例,演示如何实现自己的快速 JIT 编译器。
NanoGPT 速通榜单显示,Fable 5 在 2,726 秒内以 81.7% 的通过率位居第一,超越人类基线 2,600 秒。Opus 5 和 Kimi K3 分别以 53.6% 和 52.2% 的通过率位列二、三名。榜单涵盖 GPT-5.6、Grok 4.5、Qwen3.8 Max 等 20 款模型,并开放 41 条完整智能体轨迹供探索。
本教程演示如何用 deepDoctection 搭建端到端文档智能流水线,涵盖布局分析、DocTR OCR 与表格抽取的配置。同时展示如何为实体识别实现自定义服务,并为 RAG 工作流生成结构化 JSONL 数据。
《使命召唤:现代战争 4》预购测试版于 8 月 21 日上线,成为首款采用 DLSS 4.5 光线重建技术的游戏,并随附新版 DLSS 文件(编号 310.7.128)。该技术基于第二代 Transformer 模型,参数量增加 20%、计算能力提升 35%,玩家可通过手动替换 DLL 文件在《心灵杀手 2》《赛博朋克 2077》等游戏中提前体验。
本教程讲解如何用 NeMo Guardrails 框架为基于 LLM 的应用构建生产级安全防护,超越简单提示词过滤,实现分层架构,包括确定性 PII 脱敏、检索过滤、输出掩码和基于策略的工具门控。通过集成有状态多轮评估与详细激活追踪,可构建可审计、安全且经济高效的 AI 助手,用于管理敏感金融交互并满足严格合规标准。
开发者分享了一周内更多使用 Codex 而非 Claude 的个人印象。Codex 生成的代码注释更少、架构更简洁,但完成 PR 耗时并无优势;Claude 则更主动,常超出要求猜测意图,而 Codex 更倾向于只执行明确指令。在 Jira 集成和 MCP 登录流程上,Codex 的 CLI 方式更顺畅。
用户常因下载量化版模型而误判LLM真实能力,导致体验远低于社区评价。量化压缩会损失精度与推理质量,尤其在复杂任务上表现明显。实际性能差异源于部署方式而非模型本身缺陷。
作者用一条提示词让AI智能体自主完成从创建代码库、编写应用与测试、通过CI、配置Postgres到部署上线HTTPS应用的完整软件开发生命周期。整套环境基于Coolify自托管在本地服务器上,通过Tailscale、Pi-hole和DNS-01证书验证实现无公网入口的沙箱化隔离,唯一持续成本是每月£20的Codex订阅。
Ollama、vLLM 和 SGLang 是运行开源权重模型的三种主流推理引擎,各自针对不同场景优化。
Paul Iusztin的开源课程《Building a Coding Agent From Scratch》通过Python智能体Decode展示了三种运行模式:交互式在线、远程离线、异步在线,分别对应低延迟API、按GPU小时计费和批处理计费。
雷鸟创新发布首款“人类增强 AI 眼镜”雷鸟 iO,主打首创的全天智记功能,能以极低功耗持续采集语音并转写、总结、记忆待办事项。该眼镜采用 0.085 立方厘米萤火光引擎 Nano 与厚度不足 0.6 mm 蓝湖光波导,重 34 克,支持 55 种语言实时翻译、AI 全自动提词器及录音转写。实测中等强度使用 13 小时耗电 24%,续航约两天。
包括英国AI安全研究所在内的团队分析了192个模型、5000多个测试问题,发现聚合安全分数具有误导性:模型可通过全面拒绝请求虚增分数,却降低日常实用性。研究还发现不到2%的测试问题真正有效,约10个自适应选择题即可接近完整评测结果,成本降低97%至99%。新统计方法能识别“沙袋效应”,在测试中捕获80%至100%的过度谨慎行为,并可通过响应模式识别API背后实际运行的模型。
Waymo 首次公开其自动驾驶计算系统设计,强调为确定性、低延迟性能而打造的物理 AI 架构。该系统基于自研 5nm ASIC,提供超过 1,000 TOPS 的 ML 性能,并在八年内将算力扩展 20 倍。计算采用双独立引擎冗余设计,支持毫秒级实时决策,并与 AMD、NVIDIA、TSMC 等伙伴合作。
五家最大 GPU neocloud 商业模式各异:CoreWeave 与 Nebius 向 SEC 报告,Lambda 和 Crusoe 私有化并筹备 IPO,Groq 在将 LPU 技术授权给 NVIDIA 后转型为推理云。
TechCrunch 测试发现,Anthropic 的 Claude Opus 4.6 在 10 次直接请求中全部立即生成露骨色情内容,无需复杂诱导。一名匿名英国研究员开发的多轮越狱技巧可突破 Opus 4.6、Opus 3 和 Haiku 4.5 的限制,但对 Opus 4.7 至 Opus 5 无效。
另有 1 家信源报道IT之家(RSS)Suno 官方发文鼓励创作者完善个人资料,称完整资料可帮助作品被推荐、建立社区连接并提升可信度。建议包含头像、显示名、最多 5 个风格标签、简介及 Spotify、TikTok 等外部平台链接,以将一次性听众转化为长期粉丝。
本教程演示如何用 AutoFigure 工具包将文本描述、论文内容和结构化方法说明直接生成出版级科学图表。教程涵盖环境搭建、依赖修复(如 Pillow 兼容性)、SVG/PNG 渲染配置,以及通过 API 工作流将智能体文档智能流水线转换为示意图。默认使用 google/gemini-3.1-pro-preview 模型,支持离线 SVG 渲染、PDF 导出和画廊归档。
开发者与 Claude 合作构建了一个 Claude Code 技能 /debuzz,将 Claude 的回复通过 Gemini CLI 翻译成简洁直白的英文,避免其“千禧年点击诱饵”式表达。该技能支持同事、经理、高管三种模式,分别输出不同详略程度的版本,并承诺逐字打印 Gemini 的翻译结果。
Databricks 提出将零售需求计划与营销活动、门店执行相连接的方法,以应对零售和消费品团队在复杂运营周期中的决策挑战。文章聚焦于通过统一数据平台整合需求预测、营销活动与门店执行环节,帮助团队在关联但复杂的运营周期中做出更协调的决策。
Anthropic 发布 AI 原生 SDLC 实战手册,提出将传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程。手册指出,当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束,需通过 Claude 将需求压缩为 intent.md、以技能编码标准、用持续评测替代阶段门禁,并保留人工对关键代码的审查。
开发者用 Claude 配合开源模型,为 27 美元的 PineTime 智能手表(运行开源固件 InfiniTime)打造了一款仿卡西欧风格的自定义表盘。项目基于 InfiniSim 模拟器快速迭代,并采用全屏背景图方案减少编程量,但真机安装需约 10 分钟传输 240x240 图片,滑动刷新耗时 1-2 秒。代码已开源至 GitHub,并附有 AGENTS.md 经验总结。
青少年开发者 Kuber Mehta 利用 Anthropic 的 Claude Code,为缺乏官方 macOS 支持的惠普激光打印机 HP Laser 1008a 开发出原生驱动,耗时 4 小时。
Google Cloud 发布视频解析 IMAXXING 的架构,该服务监控全美 70mm IMAX 场次并在好座位出现时提醒订阅者,已吸引超 9,000 用户。
Stampli 借助 Codex 和 ChatGPT Work,将 Deep Finance 产品从原型到上市压缩至约六周,内容生产耗时从约 243 小时降至约 77 小时,提速 3.16 倍。其营销团队每周用 ChatGPT Work 生成数百条内容,并利用 GPT 驱动的自动化系统保持产品资料更新、在会议中快速检索分析数据。
Anthropic 发布面向初创公司的 Claude Code 使用指南,基于对十余家高增长公司的调研,总结出“人人皆可交付、自动化繁琐工作、信任但验证、为重构而构建、原型-自用-产品化”五大规则。
安全公司 Adversa 研究员发现一种针对 Grok 的加密上下文注入攻击,可绕过其静态安全护栏,窃取用户聊天记录、姓名和位置等数据。攻击者将恶意指令加密后连同解密密钥放入网页,Grok 在用户要求总结页面时自行解密并执行,将数据发送至攻击者服务器。xAI 已于 6 月被告知该漏洞,但截至发稿时 Grok 仍会泄露数据。
本教程基于 Anthropic HH-RLHF 数据集,使用 Direct Preference Optimization(DPO)构建端到端偏好学习流程。流程包括审计数据集的偏好偏差、运行词汇捷径诊断、用 TRL 和可选 LoRA 构建 DPO 训练管线,并微调 Qwen2.5-0.5B-Instruct 模型。最后评估奖励准确率、分析各子集表现并检查长度偏差,保存策略供后续实验。
开发者用自建 supervisor 智能体 chum-codex 自动化“规格驱动”开发流程,在 Terminal Bench 2.1 上达到 89.9%,超过 vanilla Codex 的 88.8%。
对 smolvm 1.8.3 的测试显示,它适合用硬件隔离 VM 而非共享内核容器来沙箱运行不可信的 Python 和 JavaScript 数据转换任务。离线本地镜像、无网络执行、CPU/内存限制、访客强制超时、存储配额、只读输入挂载、可写输出挂载及 --unprivileged 均按预期工作,冷启动约 0.6–1.5 秒,热执行约 50 毫秒。
GitHub Copilot app 的 My work 面板将拉取请求和问题集中在一处管理,内置 All、Active、Review requests、Done 四个默认视图,并支持创建自定义视图与过滤器。用户可从问题或拉取请求直接启动新的智能体会话,也可批量选择多个条目创建会话,还能在列表视图和表格视图间切换,并调整仓库范围或新建问题。
Databricks 发布指南,探讨如何从单一提示词设计高效的 Genie Agents。文章指出,通用智能体在处理收入等查询时,往往只会抓取第一个相关数据表,而 Genie Agents 通过更精准的提示词设计,能更准确地定位和回答用户问题。该指南旨在帮助开发者优化智能体行为,提升查询结果的准确性和相关性。
标准 RAG 依赖向量相似度检索,适合答案集中在少数文档的局部查询,但在需跨全部文档归纳模式的全局查询上表现不佳。GraphRAG 通过构建知识图谱、社区检测与分层摘要应对此类问题,微软测试显示即便上下文窗口扩至 64,000 tokens,向量检索在全局问题的全面性、多样性和来源质量上仍有差距。
算法工程师颜鑫基于本地部署的 MiniCPM-o 4.5,打造了能同时看、听、说并在对话重叠区捕捉情绪的全双工桌面陪伴机器人 YRobot。MiniCPM-o 4.5 在 Daily-Omni 全模态理解上获 80.2 分,反超 Gemini 2.5 Flash 的 79.3;INT4 量化后内存占用仅 11GB,实时率 0.20。YRobot 的模型、硬件与代码已全部开源。
GLM-5.3 (max) 在 Artificial Analysis Intelligence Index 上得分为 60,远超同类模型中位数(35),智能表现领先。
百度智能云将企业AI能力建设拆分为战略认知、技术实践、办公提效三个层级,主张分层培养、按需匹配。其线上课程支持即买即学,个人可自学、团队可批量开通;12套线下培训课程覆盖战略层案例拆解、技术层本地大模型部署与多智能体实操,以及提效层办公增效与Claude Code代码开发全流程实操。
upsteam 预演台上线,用户无需 3D 建模基础即可用参考图生成粗粒度白模,并搭建场景、人物、机位与运镜轨迹。将录制的白模视频交给 Seedance 2.5 生成,可精准锁定空间关系与运镜方向,避免纯文字提示词导致的误解,减少返工与积分消耗。适合大场面空镜、多人调度及复杂运镜等镜头,简单镜头仍可直接用文字生成。
豆包专业版 200 元/月加强套餐实测:GUI 能力可取代部分 Codex 工作,支持手机远程控电脑、跨设备联动和百万上下文。五个测试案例中,豆包完成全网插件筛选、Word 格式整理、PPT 生成,并自主操作桌面玩 2048 打到 512。作者称国产已有自己的 Codex,且豆包月活达 3.82 亿。