顶级体验!DeepSeek V4 Vision多模态模型介绍与效果实测!DeepSeek V4-Flash-Vision-Exp重磅发布!
开发者周然的第一反应
8月21日上午,杭州一家智能体创业公司的后端负责人周然(化名)在DeepSeek开放平台控制台里,发现模型列表多了一个带“vision-exp”后缀的新选项。他所在团队正在开发一款面向电商运营的Agent,过去需要把商品图先交给外部OCR与物体识别服务,再送回大模型生成文案和页面结构。周然把模型参数改为“deepseek-v4-flash-vision-exp”,上传了三张商品白底图,等待返回第一行结构化描述。
这是DeepSeek当天正式开放多模态视觉理解模型的一幕。据DeepSeek官方公告,全新的V4-Flash-Vision-Exp上线DeepSeek API平台,开启多模态API服务。官方披露,该模型在纯文本能力上与DeepSeek-V4-Flash正式版持平,包括Agent、推理与世界知识;在需要视觉理解的Agent Benchmark上,则较V4-Flash实现大幅跃升,多模态Agent能力已接近Opus-4.8。
视觉输入折算成token,价格与文本版一致
对开发者而言,最直接的改变来自API调用方式。用户可以通过设置model='deepseek-v4-flash-vision-exp'访问该模型。图片在API服务中会转换成token后按token计费,一张图片最多占384 tokens,计费价格与V4-Flash模型一致。这意味着,视觉输入没有单独设置高额图像调用费,直接折算成文本token,成本结构相对容易预估。
官方给出的案例显示,V4-Flash-Vision-Exp在各类Agent框架内展现出多模态适配能力,包括在Agent框架下生成商业定制西藏自驾游PPT、对DeepSeek Harness官网进行二次创作,以及制作黏土怪物风格动态特效的前端Mini Demo。这些场景的共同点是,模型需要先理解图像内容,再驱动后续任务执行,目标不仅是生成图片描述。
Files API与Harness连续更新
随着视觉模型上线,DeepSeek同步推出Files API。开发者可以先上传图片文件,随后通过file_id在不同请求中引用同一文件,无需重复上传。对于多轮Agent任务,这一设计可减少重复传输,也便于在同一批图像上反复调用模型。
同日,DeepSeek Harness宣布支持官方多模态。据公开信息,自开发者预览版v0.1.0-rc.6首日发布以来,DeepSeek Harness已完成三次版本更新,分别为v0.1.0-rc.7、v0.1.0-rc.8和v0.1.1-rc.1。更新主要围绕多模态能力、子代理协作、跨平台兼容和日常使用体验。模型适配器新增DeepSeek-V4-Flash-Vision-Exp选项,支持配置原生图片请求;/goal、/plan等命令可接收图文输入,@菜单可引用文件和会话;MCP/ACP支持图片附件持久化,PTC Mode支持转发嵌套图片。
密集上新背后的战略与风险
从7月31日DeepSeek-V4-Flash正式版API上线公测,到8月13日DeepSeek Harness开发者预览版以MIT协议开源,再到8月21日视觉模型与Files API发布,DeepSeek在不到一个月内连续补全了模型层、工具链和多模态入口。据DeepSeek官方表述,此次更新面向Agent时代,试图让模型从“能读图”走向“能在真实任务中操作图像信息”。
不过,官方同时强调V4-Flash-Vision-Exp属于实验性质模型。这意味着其稳定性、安全对齐和长期维护策略仍待观察。所谓“多模态Agent能力已接近Opus-4.8”,目前主要来自DeepSeek官方自评,第三方基准测试尚未全面公开。业内人士指出,视觉模型进入Agent流程后,图像理解偏差可能被后续多步任务放大,企业在关键业务中仍需设置人工校验环节。
价格策略是DeepSeek此轮更新的另一条主线。图片最多384 tokens、计费与V4-Flash一致的设定,降低了开发者从文本Agent切换到多模态Agent的成本门槛。但低价策略能否转化为稳定盈利,仍取决于模型调用量、推理效率和后续商业服务能力。据公开信息,DeepSeek尚未披露该视觉模型的独立营收或成本数据。
从周然的角度看,新模型是否值得全面切换,还需要用团队自己的多模态Agent数据集跑一轮回归测试。他说,视觉输入一旦进入自动执行链路,准确率比单次演示更重要。
本文由AI辅助生成


