DeepSeek给便宜模型装上了眼睛:V4-Flash-Vision上线,1分钱能看9张图

来源:互联网 时间:2026-08-22

A5站长网8月22日消息,DeepSeek在API平台上线了实验性视觉理解模型deepseek-v4-flash-vision-exp。等了四个月,DeepSeek的旗舰系列终于补上了图像理解这块短板——之前V4系列只能处理文本,被开发者调侃为大鲸鱼没眼睛。

先说结论:这次更新的重心不是识图本身,而是Agent。纯文本能力(推理、编程、世界知识)与V4-Flash正式版持平,但在多模态Agent任务上,官方称能力大幅跃升,已经接近Anthropic的Opus 4.8。多模态Agent指的是模型能看懂截图并直接采取行动,不用人反复盯着提示——这正是眼下AI落地方向里最吃香的能力。

规格上给得很足。支持JPEG、PNG、GIF、WebP四种格式,Base64、公开URL、Files API三种接入方式,单次请求最多能塞600张图,最长边支持8192像素。识图能力实测:给它一张英短银渐层的照片,能秒级报出品种,还顺带列出毛色分布、爪垫颜色这些辨识依据。

最狠的是定价策略。图片会折算成token计费,单张图最多占384个token——按高峰时段、缓存未命中算,看一张图约0.12分钱,1分钱理论上能看9张图。横向对比一下,同样场景下谷歌Image 2看一张要2.06分,贵了将近20倍。API定价与V4-Flash完全一致:缓存命中时空闲时段0.05元/百万token,高峰时段0.10元;缓存未命中时输入1.5元起,输出最高9元。

384个token这个上限是刻意为之。模型推理前会把图片缩放到约800×800像素,这意味着它看小字、密密麻麻的图表会吃亏。Hacker News上这个发布帖拿了467分143条评论,最集中的批评就在这:浏览器截图里的小字号文字、复杂版式,800像素预算不够用。但换个角度想,大量Agent任务只需要看懂页面布局、仪表盘、收据的大结构,不需要逐字读——低分辨率监控器能看清谁进了大厅、走的哪扇门,只是读不出工牌。对绝大多数跑在生产环境里的低价Agent来说,够用就是好用。

配套动作也跟上了。DeepSeek Harness同步升级到v0.1.0-rc.8,原生支持图片请求和图文混合输入,集成了Claude Code、Codex作为可插拔子代理,多模态Agent工作流一次打通。手机端App也上线了识图模式,普通用户可以直接体验。接口层面兼容OpenAI和Anthropic的API格式,现有Agent改个模型名就能接入视觉能力。

有一个细节值得留意:V4-Flash文本模型的权重是MIT协议公开的,可以下载到本地跑;但这个视觉版没有放出独立checkpoint,只能在DeepSeek的服务器上按量调用。文本免费送,视觉按米表收费——商业上的算盘,打得挺清楚。

相关文章

A5创业网 版权所有

返回顶部