云霞资讯网

DeepSeekV4多模态模型正式开源,Agent能力接近Opus-4.8

DeepSeek这次把一件事摆到了台面上:V4 系列首款多模态模型 `DeepSeek-V4-Flash-Vision-
DeepSeek这次把一件事摆到了台面上:V4 系列首款多模态模型 `DeepSeek-V4-Flash-Vision-Exp` 已经上线,Hugging Face 能看到,官方 API 文档里也已经挂出来了。它不是那种只会在发布会上说两句的“概念版”,公开的东西很实在,模型权重、Tokenizer、Prompt Encoding 参考实现,连最小化的 PyTorch 推理实现都放了出来,MIT License,态度很直接。

真正值得看的是,它不是单纯把“能看图”这件事补上了,而是把原本那条文本能力线,顺手往多模态 Agent 方向推了一截。图片输入、截图文字识别、图表解析,这些功能单拎出来都不算新鲜,难点从来不是能不能做,而是能不能做得稳,能不能接进实际工作流,能不能在工具调用、信息提取、任务拆解这些场景里少掉链子。DeepSeek 这次给出的意思很清楚:它不是只想做一个会看图的模型,它想让模型进入“能干活”的那一侧。
这类更新最容易被忽略的一点,是它表面上讲的是多模态,底层其实还是在争一个入口。过去大家聊模型,容易被纯文本能力带着走,推理、知识、代码,谁强谁弱一目了然。可一旦进入 Agent 场景,光会答题就不够了,模型得能处理截图、理解页面、识别图表、从视觉信息里抽出动作。也就是说,能力比较的标尺变了。谁先把图片真正接进工作流,谁就更容易从“聊天模型”往“任务模型”跨一步。
DeepSeek 官方这次给的口径也比较明确:纯文本任务层面,它和 V4-Flash 正式版保持一致,原有能力没有被拖下去;视觉类 Agent 基准测试则有明显提升,多模态 Agent 能力接近 `Opus-4.8` 水平。这个说法的重点不在那句对标,而在前半句。很多模型一上多模态,文本能力就开始晃,最后变成样样都能碰一点,样样都不够稳。现在至少从官方表述看,它想避免这种常见问题,意思是新增视觉能力,不拿文本底盘去换。
这件事放到现实里,其实比参数更有意义。对很多人来说,真正会碰到模型的地方,不是在抽象 benchmark 上,而是在一张截图、一个报表、一个网页、一个 PDF 里。你要它看图,不是为了看热闹,是为了少做一次人工抄录,少切一次工具,少在几个页面之间来回跳。能不能把这类细碎但高频的动作接住,往往比“模型很大”更接近真实价值。
所以这次更新最容易被低估的地方,不是它又多了一个能力点,而是它把“视觉输入”这件事放到了一个更偏实用的位置。不是摆设,也不是演示,而是直接指向 Agent。这个方向一旦走顺,后面影响的就不只是评测榜,而是实际部署方式、调用方式,甚至是企业里怎么接入模型的习惯。
不过话也要说回来,模型发布里最容易让人上头的,就是各种对标和提升。接近谁、超过谁、强了多少,听着都很热闹,但真正落到手里,还是那几个老问题:截图复杂一点还稳不稳,长图表能不能读准,模糊图片会不会误判,批量任务里速度和成本顶不顶得住。多模态这条路从来不是“功能写上去就算成了”,而是要看它能不能在真实输入里站住。
DeepSeek 这次给人的感觉,不是要把话说满,而是把门打开了一点。开源、可见、可试、可接入,这几个词放在一起,本身就比一段漂亮宣传更有分量。接下来真正会把它和别的模型拉开距离的,不是发布时的措辞,而是谁先在真实场景里把这套能力用顺。
模型更新很多,但能直接让人想到“这东西可以接进我手头工作”的,不多。这次算一个。