mamma mia i have never tried to explained ai to someone outside sf before we are not early, it literally has not even st...
mamma mia i have never tried to explained ai to someone outside sf before we are not early, it literally has not even st...
mamma mia i have never tried to explained ai to someone outside sf before we are not early, it literally has not even st...
一位开发者抱怨 AI 智能体动辄生成上千行的大 PR,让评审者不堪重负。他认为小 PR 的价值在于可消化、可评审、可理解,而非独立成品的完整性,并推测理解代码的时间随行数呈指数增长。他还反对过度注释和“用 AI 读 AI 代码”的建议,呼吁 AI 生成代码应拆分为小份供人评审。
OpenAI 自 4 月以来已有 9 位核心人物离职,覆盖产品、安全、伦理与商业侧,包括 Sora 负责人 Bill Peebles、安全系统负责人 Johannes Heidecke、唯一专职伦理学家 Chloe Bakalar、前 CFO/COO Brad Lightcap 及上任仅 8 个月的 CRO Denise Dresser。
AlphaSense 新研究显示,Anthropic 模型使用成本可能低于部分大型开源中文模型。Kimi 每 token 价格远低于 GPT-5.6 Sol,但因组装上下文消耗更多 token,单题成本反而更高。真正成本单位是“完成 token 数 × token 价格”,token 效率是系统属性而非 API 定价属性;AlphaSense 通过改变检索方式,在相同模型上实现约 3 倍成本降低。
智谱发布 GLM-5.3,基于与 GLM-5.2 相同基座经更长后训练,在 Terminal-Bench 3.0 上由 4.6 提升至 28.3,DeepSWE v1.1 上由 46.2 提升至 66.9;网络安全方面,CyberGym 得分 84.5%,ExploitBench 为 54.4%,仍低于 Mythos 5 的 78.0%。
智谱发布 GLM-5.3,在不更换基座模型的前提下,通过扩大长程任务环境和后训练规模,同时提升编程与网络安全能力。文章给出终端、软件工程和漏洞评测的分层结果,完整权重将在安全加固后开放。
https://x.com/i/article/2088426893192421376
英伟达披露持有SpaceX 1.228亿股,价值约210亿美元,源于其投资xAI后因SpaceX收购xAI而获得股权。SpaceX同时成为英伟达大客户,马斯克称其数据中心将独家采用英伟达,算力容量到2027年底或接近10GW。
We gave GLM-5.3 a complex reverse-engineering task. It found a potentially serious vulnerability in Cursor. We disclosed...
赵纯想批评“自进化”一词被滥用,从原本指模型层面的自进化,矮化为软件运行时自我修改组件。他认为固定版本软件已足够可靠,运行时变来变去缺乏明确目的,质疑其应对突发需求的必要性。
OpenRouter数据显示,84%的模型token并非来自SOTA模型,用户最常用的六款模型性能约为前沿模型的77%,成本仅为Claude Fable 5的2.5%。8月10日当周,六款模型承载了80%流量,混合价格约$0.50/百万token,而Fable 5为$20。最佳开源模型性能已从一年前的48%提升至前沿模型的80%,企业正转向更小、微调或开源模型以优化性价比。
2026年将成为开源与本地AI的里程碑之年。智谱GLM-5.3仅通过后训练提升,在CyberGym得分84.5%,超越Mythos 5的83.8%;Qwen3.8-27B可本地运行,多项关键基准超越Opus 4.6 Max;DeepSeek V4 Flash API价格低至每百万未缓存输入token $0.14、输出$0.28,接近“便宜到无法计量”。
So yeah, you can now run Opus 4.6 max locally. Just let that sink in.
作者担忧 AI 将使软件过于安全,导致美国情报与执法机构在未来两年内面临“隐身”困境——主要软件将耗尽可远程利用的漏洞。Anthropic 的 Mythos 模型已优化漏洞发现,OpenAI 及 Z.ai、Moonshot 等也展示了类似能力。这或将加剧对构建后门等“特殊访问”机制的需求。
Z.ai 今日发布 GLM-5.3,目前仅限编程套餐使用,API 即将上线,两周后开源权重至 Hugging Face。该模型在多项基准上超越 Moonshot AI 的 Kimi K3,部分指标超过 Claude Fable 5 或 GPT-5.6-Sol,仅约 750B 参数,为 Kimi K3 的三分之一。
同一事件,精选展示《GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力》GLM 5.3 notes and why we should stop being so surprised about these very strong Chinese models (most of this is talking ...
never ask a woman her age. a man his salary. or a dude in SF what latent space means
大语言模型正以近零边际成本生产“勉强够用”的软件与数字内容,形成大量低质低价与少量高价人工作品的双层市场。Veracode 报告显示约 45% 的 AI 生成代码样本未通过安全测试,IEEE-ISTAS 论文记录五次迭代提示后关键漏洞增加 37.6%。
本期 The Vergecast 中,David 和 Nilay 讨论了 Instagram 本周推出的新 Logo,质疑其设计变化。随后他们解读了扎克伯格数千字 AI 长文,核心论点是“把技术交给所有人,一切都会好起来”。节目还涉及 AI 文本水印新方法、Spotify 对 AI 艺术家的限制等新闻。
The State of Open Models, Summer 2026 ☀️ frontier models are getting larger, but small models still dominate real-world ...
字节跳动Seedance 2.5与MiniMax H3同日发布,中国厂商占据Artificial Analysis文生视频榜单前十中的九席。OpenAI退出Sora独立视频业务,因缺乏内容平台生态和付费循环,而Sora推理成本曾被估约每日1500万美元。中国创作者通过短视频平台付费生成内容,形成支撑模型迭代的商业闭环。
the major ai companies should commit to a real time priced API product. ai demand varies wildly over a day/night curve a...
There's a ton of good stuff in here, but to me this is the part that everyone mainstream is overlooking. It's literally ...
Qwen3.8-27B 现可在 17GB 内存上本地部署,模型部署硬件门槛持续降低。这为受数据安全、隐私和内网隔离限制的 AI 应用场景提供了低成本本地部署可能,大模型应用有望加速普及。
27B on 17GB RAM. Are you ready to create something incredible? 😎 Thanks for highlighting it! @UnslothAI
Dex Horthy 与 Vaib 在 YC 主持“AI that works”Unconference,汇聚 50 位旧金山湾区顶尖 AI 工程师。最大共识是各团队工作流差异巨大、信任标准不一,难以判断谁领先。讨论覆盖记忆、软件工厂、硬件、harness 工程等前沿用例,并涉及 Claude 文本水印、AI 制品及 git 与 GitHub 的未来。
AI Coding 让代码生成大幅提速,却打乱了软件工程原有的反馈机制:需求不拆解、阶段结果不定义、变更不可追溯,省下的开发时间会以 Bug、返工和沟通成本的形式补回来。AI 越快,人越需要主动制造检查点,让每一步结果可理解、可验证、可追溯。AI Coding 下半场的竞争将从生成速度转向工程过程清晰度与质量可控性。