说真的,DeepSeek 这次补视觉我最在意的是那个 -Exp

Hello,我是飞飞。

DeepSeek 8月21号上线了 V4-Flash-Vision-Exp,这是他们首个能看图的模型。我刷到这条的直觉反应是盯着那个 -Exp 后缀看了两秒,实验版这三个字的分量比”接近 Opus 4.8”那句宣传重得多。

为什么没用过它

先把我的处境摆出来。

我的 AI 大脑每天用 DeepSeek V4-Flash 跑查重、格式检查这些杂活,定位就是”嫌 Claude 慢就切的快档”。但凡遇到带截图的查重场景,必须切回 Claude,因为 DeepSeek 压根看不了图。

这不是小问题。我写文章经常要引用工具截图、对比界面差异、分析数据图表,这些场景 DeepSeek 一个都接不住。你让它分析一张代码截图里的 bug,它只能回你”抱歉我无法查看图片”。

所以我此前写过的判断是”DeepSeek V4 无多模态落后一代”。纯文本能力再强,看不了图就意味着一大类真实工作场景你进不去。

这次补上了什么

Vision-Exp 8月21号上线,支持 JPEG、PNG、GIF、WebP 四种格式。

API 调用方式跟纯文本一样,图片可以 base64 内联、外部 URL、或者先传 Files API 拿 file_id 引用。

关键数据我列一下:

  • 单张图片最多占 384 tokens
  • 按 V4-Flash 的价格计费(输入 $0.14/百万 token)
  • 算下来每张图约 $0.000054

官方给的基准是 Chartography 64.3 分,说”多模态 Agent 能力已接近 Opus 4.8”。

同时纯文本 Agent 得分 Terminal Bench 2.1 拿了 83.9,跟 V4-Flash 正式版的 82.7 基本持平。

说个有意思的点。

加视觉能力通常会拖累纯文本表现,因为模型要在有限参数里同时学两种模态。DeepSeek 这次后训练能保持文本能力不退化,说明他们在多模态融合上没翻车。

我看到 83.9 这个数字的时候想起一件事。我之前写过 V4-Flash 的 agent 实测,当时它在 Terminal Bench 2.1 拿了 82.7 分。现在 Vision-Exp 加了视觉能力,这个分数从 82.7 涨到 83.9,涨了 1.2 个点。

涨幅不大,但方向对了。

具体为啥能涨我也说不清,但至少证明他们在多模态融合这一步没有牺牲掉文本侧的表现。

还有个配套更新是 Files API 免费上线。你可以先把图片传上去拿 file_id,后续多个请求都用这个 id 引用,不用每次重传。这对需要持续处理同一批视觉素材的多轮工作流特别有用,比如 PPT 迭代、网页设计 review。

那句对比基准的陷阱

“接近 Opus 4.8” 这话我看到时立刻去翻 Anthropic 的发布时间线。

Opus 4.8 不是 Claude 最新版本。Opus 5 在 7月24号就发布了,重点提升 Coding 和 Agent 能力。所以 DeepSeek 这次对标的是一个已经被迭代掉的版本。

Vision-Exp 的能力可能很扎实,但这个对比基准给人的印象容易偏。

你听到”接近 Opus”,脑子里浮现的是 Claude 当下最强的那个版本,但实际对标的是两个月前的旧版。

更关键的是,Chartography 这个基准我没找到 Opus 4.8 的公开分数,只能靠官方说法判断。

独立验证(Artificial Analysis / Arena)还没覆盖 Vision-Exp,所以这个”接近”的含金量现在没法核。

官方数字可能准确,但没有独立验证的自测分数,当方向看不当结论用

等 AA 或 Arena 跑完再下判断更稳妥。

实验版这三个字的分量

回到开头那个 -Exp 后缀。

实验版意味着三件事:能力可能调整、限流可能变、价格可能改。

官方 API 文档明确标注”这是一个实验性质的模型”,言下之意是别把它当正式版用在生产环境。

我见过的实验版转正路径基本都是这样。

GPT-4 Turbo 实验版跑了大半年才转正,期间调过两次价格、改过三次限流规则。Claude 3 Opus 测试版也是先开放给小范围用户,等稳定性数据足够了才全面放开。

Vision-Exp 现在的价格还是跟 V4-Flash 一样,但我不觉得这个优势能撑多久。

按常规路径,实验版转正通常伴随定价调整,尤其是多模态模型。视觉处理的计算成本本来就比纯文本高,DeepSeek 现在按纯文本价格计费,可能是为了吸引早期用户测试,也可能是他们的 MoE 架构(说人话就是用多个小模型分工处理不同任务)确实把成本压得足够低。

还有个技术细节社区有人提到:插入图片后,上下文缓存机制可能会归零。

如果这个属实,意味着多轮对话的成本控制会比纯文本复杂。

官方还没正面回应这个,但这是多模态上下文管理的常见坑。

所以我的判断是,Vision-Exp 现在适合拿来试试看,但别急着把关键流程迁过去。

等它去掉 -Exp 后缀、进正式版,再考虑正经接入生产环境。

国产赛道真实位置

把 Vision-Exp 放进国产多模态赛道里看,它不是领跑者,是补课的。

Kimi K3(月之暗面)原生支持 4 种模态,Artificial Analysis 智能指数 57,在 189 款模型里排到了前 4,MIT 权重已开源。Qwen 3.8 Max(阿里)原生支持文本、图像、视频、文档,2.4T 参数,承诺开源权重但还没独立验证。GLM 5.2(智谱)走的是文本优先路线,视觉能力靠配套模型 GLM-4.5V。

DeepSeek 这次进场时间比这几家晚了至少半年,而且还是实验版。

但 DeepSeek 有自己的打法。

我之前写国产模型追赶路径时的判断是”卡住’开源加低推理成本’这个位置,不跟你在每一个榜上死磕旗舰”。

Vision-Exp 的成本优势明显,如果视觉理解能力真能接近 Opus 4.8(输入 $15/百万 token),DeepSeek 的 $0.14 是数量级差距。

算一笔账。

假设你每天要处理 100 张截图做 code review,每张图按 384 tokens 算。用 Claude Opus 一个月下来是 $1728(100 张 × 384 tokens × 30 天 × $15/百万 token)。用 DeepSeek Vision-Exp 只要 $16(同样算法 × $0.14/百万 token)。

这个差距足够让很多对价格敏感的团队动心。

晚到不可怕,晚到但更便宜、能接住大部分场景,这条路也能走通。

前提是得熬过实验版这一关,证明自己能稳定交付。

我现在还没试

说实话,我还没拿 Vision-Exp 跑过一次真活。

但我心里已经列了几个想试的场景。

最想试的是代码截图里的 bug 定位。有时候用户会直接截图报错信息发过来,而不是贴文本。我上个月就遇到一次,用户发了张 Python traceback 截图,我得手动把里面的报错信息敲出来才能喂给模型。如果 Vision-Exp 能准确识别截图里的代码行号、报错信息、调用栈,并定位到问题根源,这一个场景就能省掉我每个月不少 Claude 调用。

还有数据图表的关键信息提取。我经常要分析一些技术报告里的性能曲线图、架构示意图。这些图表通常文字很小、信息密度高,对 OCR 和理解能力要求都不低。Vision-Exp 能不能准确提取图表里的数值、趋势、对比关系,这个我得实测才知道。

最后一个是多张界面截图的差异对比。UI review 的时候经常要对比两个版本的界面差异,比如设计稿改了按钮位置、调整了配色,你截两张图问模型”这两张有什么区别”。这个场景对视觉理解的要求更高,因为它不只是看清文字,还得理解布局、颜色、间距这些视觉元素。

这些都是我日常会碰到的高频场景,也是我之前因为 DeepSeek 看不了图而必须切 Claude 的地方。

但现在是实验版,我不敢把它接进关键流程。等跑完几轮测试、确认它在这几个场景下的表现稳定,再考虑把一部分 Claude 的活迁过去。

还有个问题是独立验证什么时候出来。

Artificial Analysis 和 Arena 这两个榜对我来说分量比官方自测重,因为它们是独立机构、有真实用户投票。

等这两边的数据出来,Vision-Exp 的能力天花板在哪就能看得更清楚。

你要是也在用 DeepSeek 跑日常杂活,这次 Vision-Exp 值得关注,但别急着全面接入。

试试看,看它稳不稳,再决定下一步。