AI智能体的完整运转,离不开文本理解与视觉感知两大基础能力。近期,DeepSeek正式上线旗下首款多模态API模型DeepSeek‑V4‑Flash‑Vision‑Exp,为原有V4‑Flash模型装上“视觉眼睛”。这一次升级并非简单增加图片识别功能,而是面向Agent开发场景补齐感知短板,并且做到视觉能力加量不加价,改写了多模态接口的成本格局。

在能力表现层面,新增视觉能力后,模型的纯文本实力非但没有衰减,反而有所提升。七项Agent相关评测当中,该模型有六项成绩优于旧版V4‑Flash‑0731,多模态综合能力可以比肩海外头部模型。它不局限于识别图片内文字,还可以完成截图复刻代码、根据需求生成专业B端PPT等高复杂度任务。例如输入网页截图,模型可以拆解页面布局、色值、间距,输出完整可运行、适配移动端的HTML代码;仅凭文字描述,也能产出细节严谨、贴合行业调性的完整PPT提案,适配开发者多种多样的业务需求。开发者调用这一套接口,就可以同时搞定文本与图像处理,无需对接第二个第三方模型。

本次发布最受行业关注的,是极具冲击力的计费策略。该模型设定单张图片token消耗最高封顶384,图片部分直接沿用V4‑Flash原有定价,不会产生多模态专项附加费用。横向对比海外主流多模态模型,同等规格图片的token消耗普遍高出数倍,千张图片调用成本差距最高可达数十倍。按照公开价格测算,一千张图片调用成本仅约1.15元,低谷时段价格甚至不足0.6元

悬殊的成本差距带来产品设计思路的分水岭:高昂的识图成本下,开发者需要谨慎权衡每一次图片调用;而近乎低廉的成本,可以支持Agent每一步运行都进行截图读取,放开视觉感知的使用频次,给智能体产品开辟全新的设计可能性。

技术配套方面,DeepSeek在短短八天内完成整套Agent基础设施闭环。此前开源的DeepSeek Harness作为Agent运行时,同步迭代新版本,开箱兼容新的多模态模型,开发者无需修改适配代码。图片输入提供base64内联、外部URL、Files API三条通路,其中Files API免费开放,同一张图片仅需上传一次,后续依靠文件ID重复调用,避免反复上传图片带来的流量与计算损耗,尤其适合频繁读取设计稿、报表、网页截图的Agent业务。

对于AI行业来说,多模态能力的平民化,是Agent大规模落地的重要前提。过去,高质量视觉接口高昂开销,抬高了各类看图智能体的开发门槛。DeepSeek这一次更新,把高性能多模态能力压到极低的使用成本,补齐智能体“看懂世界”的关键一环。当然该版本尚属于实验版本,后续依旧需要在真实业务场景当中持续打磨稳定性,但低廉的调用门槛,已经给大量中小开发者、创业团队打开了新的想象空间。