Yuchen Jin · @Yuchenj_UW · X·2026-08-22 01:46·13天前
AI 导读

UC Berkeley 开源 FreeToken,单张 RTX PRO 6000 可运行 753B 的 GLM-5.2,速度达 14.9 tok/s;8GB 显存的 RTX 4060 笔记本可运行 Qwen3.6-35B,速度 39.3 tok/s。FreeToken 在消费级 GPU 上比 Ollama 快 2-4 倍,无需极端量化即可用官方权重运行前沿模型。

Yuchen Jin@Yuchenj_UW
43AI 编辑部评分,满分 100
2026-08-22 01:46· 13天前
AI 导读

UC Berkeley 开源 FreeToken,单张 RTX PRO 6000 可运行 753B 的 GLM-5.2,速度达 14.9 tok/s;8GB 显存的 RTX 4060 笔记本可运行 Qwen3.6-35B,速度 39.3 tok/s。FreeToken 在消费级 GPU 上比 Ollama 快 2-4 倍,无需极端量化即可用官方权重运行前沿模型。

UC Berkeley open-sourced FreeToken. Wild results:

A single RTX PRO 6000 runs the 753B GLM-5.2 at 14.9 tok/s!

An 8GB RTX 4060 laptop (~$1,000) runs Qwen3.6-35B at 39.3 tok/s!

FreeToken is 2–4x faster than Ollama across consumer GPUs. Local AI inference is getting very real. Great work by @Andy_ShuoYang and UC Berkeley Sky Lab!

Shuo YangYour gaming PC can now serve frontier models at interactive speed using official checkpoints without extreme quantization! Qwen3.6 35B → 8GB RTX 4060 laptop @ 3...