目前,DeepSeek V4系列首款多模态模型DeepSeek-V4-Flash-Vision-Exp已在Hugging Face上线,采用MIT License协议开源。
公开内容包含模型权重文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。
本次公开的内容涵盖模型权重文件、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,完整覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等全部核心模块。
早在8月21日下午,DeepSeek官方API文档的模型详情页面就已提前上线该模型,这也是V4系列中首款原生支持图片输入的视觉模型。除基础文本交互能力外,该模型可直接接收图片输入,完成图像内容描述、截图文字识别、图表解析等多类任务,同时兼容JPEG、PNG、GIF、WebP等所有主流图像格式。
据深度求索官方介绍,该模型在各类主流智能Agent框架下均具备优异的多模态适配效果,可依托工具调用拓展更多实际工作场景。在推理、世界知识等纯文本任务维度,其性能与V4-Flash正式版完全对齐,完整继承原有能力优势;而在视觉类Agent基准测试中,相比V4-Flash实现了显著性能提升,多模态Agent能力已接近Opus-4.8的水平。
