Ant Ling · @AntLingAGI · X·2026-08-05 23:24·13天前
AI 导读

🚀 今天,我们发布 Ling-3.0-flash 的 INT4 和 FP4(MXFP4)版本。 两者均可通过我们适配 Spark 的 SGLang 路径,在单台 NVIDIA DGX Spark 上端到端运行。 对于 FP4,W4A16 是稳定默认配置,而 W4A8 则为更高吞吐量而调优。 量化模型的效率和精度仍在持续演进中。我们将持续更新推理实现和量化权重。

Ant Ling@AntLingAGI
59AI 编辑部评分,满分 100
2026-08-05 23:24· 13天前
AI 导读

🚀 今天,我们发布 Ling-3.0-flash 的 INT4 和 FP4(MXFP4)版本。 两者均可通过我们适配 Spark 的 SGLang 路径,在单台 NVIDIA DGX Spark 上端到端运行。 对于 FP4,W4A16 是稳定默认配置,而 W4A8 则为更高吞吐量而调优。 量化模型的效率和精度仍在持续演进中。我们将持续更新推理实现和量化权重。

🚀 Today, we're releasing INT4 and FP4 (MXFP4) variants of Ling-3.0-flash.

Both run end to end on a single NVIDIA DGX Spark via our Spark-adapted SGLang path.

For FP4, W4A16 is the stable default, while W4A8 is tuned for higher throughput.

The efficiency and accuracy of the quantized models are still evolving. We will continue updating the inference implementation and quantized weights over time.