# DeepSeek-V4-Flash-Vision-Exp 模型已开源，多模态 Agent 能力接近 Opus-4.8

- 来源：IT之家（RSS）
- 发布时间：2026-08-31 19:35
- AIHOT 分数：76
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmth7tmq2067orodmh6g0sxie
- 原文链接：https://www.ithome.com/0/996/637.htm

## 精选理由

原文梳理了模型开源内容与能力定位，读者可据此评估其在多模态 Agent 场景中的可用性。

## AI 摘要

DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp，采用 MIT License，公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。

## 正文

IT之家 8 月 31 日消息，刚刚，DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线，采用 MIT License 开源。

公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现，以及最小化 PyTorch 推理实现，覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。

据IT之家了解，DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列首款原生支持图片输入的视觉模型，官方明确标注为“Exp”实验版本，于 2026 年 8 月 21 日上线 DeepSeek API 平台。

该模型支持在文本之外输入图片，可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括 JPEG、PNG、GIF、WebP。

深度求索官方表示，V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力，能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。在 Agent、推理、世界知识等纯文本任务上与 V4-Flash 正式版持平，原有优势完整保留。在需要视觉理解的 Agent 基准测试中较 V4-Flash 大幅提升，多模态 Agent 能力已接近 Opus-4.8。
