最近 DeepSeek 动作密集:先后发布 DeepSeek-V4-Flash、DeepSeek-V4-Pro 正式版,拉高了大模型基准线;又推出了支持热插拔插件的 DeepSeek Harness。而在今天,官方再补一刀——正式上线实验性多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp,为此前"只会读文字"的纯语言模型补上了视觉这块短板。
核心能力:多模态对标旗舰,文本反而更强
这一版本最直观的变化,是视觉理解能力一步到位,直接对标 Anthropic 旗舰模型 Claude Opus-4.8 的水平(据官方公布的自测数据)。官方自测显示,该模型在复杂表格OCR、手写笔记识别、工程图纸解析、带干扰元素的图表分析等常见视觉场景中,准确率均达到商用可用标准,甚至支持视觉推理类任务,比如根据几何图形推导解题步骤、根据商品图片判断品类并提取关键参数。更值得注意的是,它的纯文本能力并未因加入视觉而打折扣——官方口径是接近甚至小幅超越 V4-Flash 正式版,在 Terminal Bench 2.1、Toolathlon-Verified 等文本代理任务中得分更高,代码生成、长文本摘要、逻辑推理等核心文本场景的表现依然稳居第一梯队。功能兼容性方面,该模型支持:
- 非思考 / 思考(CoT)双模式:非思考模式可实现毫秒级快速识图,适合批量OCR、简单图像分类场景;思考模式支持多步视觉推理,适配复杂分析、解题类需求
- JSON 结构化输出、工具调用(Function Calling):识别结果可直接输出结构化数据,也可联动外部工具完成“识图→查询→执行”的完整流程
- Responses API、Anthropic API 兼容层:现有基于Anthropic API开发的业务可零成本迁移,无需修改底层调用逻辑
- 对话前缀续写:支持多轮视觉对话场景,可基于之前的识图结果继续提问、迭代分析需要留意的一点是:不支持 FIM 补全(Beta)。上下文长度达 1M tokens,最大输出长度 384K tokens,长任务场景足够富余,哪怕是长文档+多张配图的混合输入也能轻松处理。

数据来源:DeepSeek 官方公布,截至 2026-08-23,实验版数据仅供参考。
价格与计费:与 V4-Flash 持平,峰谷机制延续
定价延续了 V4-Flash 的档位,未因多模态能力而加价,是目前同级别多模态模型中性价比最高的选择之一:
| 计费项 | 低谷价 | 高峰价(工作日 9:00–12:00、14:00–18:00 翻倍) |
|---|---|---|
| 输入(缓存命中) | 0.05 元/百万 tokens | 0.10 元/百万 tokens |
| 输入(缓存未命中) | 1.5 元/百万 tokens | 3.0 元/百万 tokens |
| 输出 | 4.5 元/百万 tokens | 9.0 元/百万 tokens |
甲方的周末规则也已同步生效:自 8 月 23 日 00:00 起,周六、周日全天不分峰谷,统一按低谷价计费,个人项目选周末跑能明显降低成本,学生党、个人开发者尝鲜几乎没有门槛。图片计费规则:图片按尺寸换算为 token,单张最多消耗 384 tokens;小于 384×384 的图片会放大、过大图片会缩至约 800×800,多张图片独立计算、不额外加收费用,哪怕是单次上传10张图片的批量处理场景,成本也几乎可以忽略。

图片来自网络,仅供娱乐。
配套与调用:Harness 同步更新
DeepSeek Harness 同步更新至 0.1.1,已内置对新视觉模型的支持,开发者可直接上手。Harness 的热插拔插件生态也同步适配了视觉能力,可快速接入图像预处理、OCR后处理、视觉内容审核等插件,无需自行开发底层逻辑。模型现已上线官网及 API 平台,通过 model='deepseek-v4-flash-vision-exp' 即可调用,迁移成本极低。
UP导航 点评
对开发者而言,这个版本完全解决了此前的真实痛点:遇到识图场景(OCR、图表分析、看图干活、视觉推理)时,不必再切换模型或倒腾多套插件链路,一个模型即可覆盖文本理解、视觉处理、工具调用全流程,且文本 + 多模态 + 同价的组合让升级成本为零,诚意拉满。不过仍要提醒两点:其一,这是实验版(Exp),榜单多为官方自测口径,生产级稳定性与第三方独立评测还在观察期,不宜在核心业务上直接依赖;其二,高峰时段价格并不算低,建议个人尝鲜、非紧急任务选周末低谷时段调用。等正式版与更多独立实测出来后,UP导航 会继续跟进。
说明:本文数据整理自 DeepSeek 官方公告、API 文档及公开报道,截至 2026-08-23,具体以官方正式文档为准。