底层系统大神Scott Gray @scottgray76 也离开@OpenAI 了,
早年在 Nervana 手写 CUDA 内核,SGEMM 能跑到硬件峰值98%,
前 CEO 直接说他是全球最强 GPU 程序员。
2016年极早期加入 @OpenAI ,写了 blocksparse 库,让稀疏 Transformer 真正能跑大规模训练--GPT-3、GPT-4、Codex、DALL-E 的论文里都有他的名字,
是把 Scaling Laws 从理论变成工程现实的人之一。
全球能写顶尖训练 CUDA 内核的人,有人估算不足百人,他是最顶尖那批。