DeepSeek 开源首个多模态模型:305B 参数、MIT 协议,给 Agent 装上眼睛
9 月 1 日前后,DeepSeek 在 Hugging Face 上线了 V4 家族首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。305B 参数、MIT 协议、权重全开,这是 DeepSeek 第一次把"看得见"的能力放进 V4 系列。
这个模型是干什么的
先看定位:它不是拿来"看图说话"的。官方口径很明确——多模态 Agent 能力。也就是说,模型要干的是"看了屏幕、图表、界面之后,自己去操作、去完成任务",而不是人类问一句"图里有什么"它答一句。这个定位和市面上多数视觉模型不一样,它对标的是"给智能体长眼睛"。
技术上,它是在 DeepSeek-V4-Flash 架构上接视觉编码器和 Aligner,再做持续训练获得视觉理解。底层还是 MoE、DFlash attention、Hyper-Connections、DSpark 投机解码这套 DeepSeek 自家架构,等于在原模型上加视觉模块,不是另起炉灶。所以纯文本能力基本没动,视觉能力是"加上去的增量"。
从官方模型卡的评测数据看:多模态 Agent 指标上,ApexBench(Pass@1)36.5,比不带视觉的 V4-Flash-0731 的 26.2 明显高一截,据报道已接近 Opus-4.8 的 39.4;Agents’ Last Exam 27.3、Chartography 64.3、ZeroBench(Pass@5)35.0。而纯文本 Agent 任务基本持平:Terminal Bench 2.1 是 83.9、DeepSWE 59.3、Toolathlon-Verified 75.9。翻译成大白话:加了眼睛,原来的文本本事没丢。
对做 AI 应用的人来说,这事的信号是:开源模型开始把视觉理解往"Agent 干活"方向做,而不是堆一个什么都能聊的多模态聊天机器人。MIT 协议意味着商用、改权重都放开,不用跟厂商谈授权。
怎么用、怎么部署
官方仓库里带了 tokenizer、prompt 编码参考和最小 PyTorch 推理实现,支持两种 prompt 写法:OpenAI 风格的 JSON 消息,以及 <image>path</image> 这种紧凑文本记法。
部署可以走 vLLM,官方给的示例是单机 4×GB300:
docker run --gpus all \
vllm/vllm-openai:deepseekv4-flash-vision deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
--kv-cache-dtype fp8 \
--block-size 256 \
--tensor-parallel-size 4 \
--tool-call-parser deepseek_v4 \
--enable-auto-tool-choice \
--reasoning-parser deepseek_v4
```
SGLang 也支持,打开 DSpark 投机解码即可:
```bash
sglang serve \
--model-path deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
--tp 4 \
--speculative-algorithm DSPARK \
--host 0.0.0.0 \
--port 30000
```
社区适配也很快:unsloth 已经出了 GGUF 量化版,llama.cpp、LM Studio、Ollama 生态里也有量化版本。API 方面,据报道价格和 V4-Flash 保持一致,不想自建的话直接调接口。
**几个坑提前说**
第一,305B 是总参数量,它是 MoE 架构,单次推理激活的参数没那么多,但显存门槛依然不低,官方示例直接 4 张 GB300 起步。个人电脑别指望全量本地跑,想玩就上量化版或者 API。
第二,名字带 Exp,是实验模型。官方自己也说了主打多模态 Agent,纯文本任务和 V4-Flash-0731 一个水平——只要文本能力的话,没必要为这个换模型。
第三,评测分数和"生产环境稳定干活"之间还有距离。Agent 类评测场景窄,落地时工具调用、环境适配这些坑还得自己踩。
对普通开发者,值得做的就一件事:把"让模型看截图、读图表、操作界面"这几个场景在自己的业务里过一遍,看哪些活能交出去。视觉 Agent 这条赛道,开源这边算正式开跑了。你怎么看,评论区聊聊。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)