正文 · AI 翻译
很高兴看到 Step 3.7 Flash 在 @FireworksAI_HQ 上线。
Step 3.7 Flash 从第一天起就专为推理设计,它将硬件友好的架构与 MTP 辅助解码相结合,实现了高达 400 tokens/s 的速度。
它快速、多模态,并随时准备为实际工作流程中的强大 AI 智能体提供动力。
Many research labs only consider inference efficiency after the fact. Step 3.7 Flash is a 198B sparse MoE VLM designed by @StepFun_ai for inference from the sta...