DeepSeek睁开眼了!Opus-4.8的性能,1000张图不到20美分

发布时间:2026年08月25日 来源:AIGC开放社区 作者:suani 浏览量:6

DeepSeek一直走纯文本路线,如今模型终于睁开了眼睛。

图片

新模型 deepseek-v4-flash-vision-exp 上线 DeepSeek API 平台,这是 DeepSeek 的第一个多模态视觉模型。

文本能力与 V4-Flash 持平,多模态 Agent 能力逼近 Opus-4.8,价格还停在 Flash 档。分析1000张图片成本不到20美分,高分辨率截图输入成本是 Opus 的1/80。

睁开眼

模型仍是实验版。文本侧,Agent、推理、世界知识都与 V4-Flash 持平。

此前 V4 全系只处理文本,NL2Repo、DeepSWE 这类代码 Agent 任务是它的主场,如今视觉短板补上。

官方基准表如下:

图片

文本类 Agent 评测,视觉版与纯文本版 V4-Flash-0731 大致持平,Terminal Bench 2.1 拿83.9,DeepSWE 拿59.3,都比纯文本版略高,装上眼睛没拖累文本。

跟 Opus-4.8 比,11项测评里,DeepSWE 59.3对58.0,Agents' Last Exam 27.3对25.7,ZeroBench 35.0对34.0,3项基准超越 Opus-4.8,其他也接近 Opus-4.8。

多模态侧,ApexBench 从纯文本版的26.2涨到36.5,Agents' Last Exam 从25.2涨到27.3。

有开发者实测,它与 Kimi K3,GPT 5.6 Sol,和 Opus4.8 对比,多模态性能表现已进入顶级模型行列。

图片

开发者 Tim Jayas 用 Three.js 做马车,评价 V4-Flash-Vision 比 Opus 4.8 更优秀。

图片

一个280B的模型,性能竟有3T级的表现。

算算账

社区实测补上细节。图表阅读、发票 OCR、跨图像对比都准,数小物体偏弱,9个三角形只数出8个。

图片

图像按 token 计费,单张最多384 tokens,原图不管多大,模型内部智能缩放,大图自动压到800×800像素预算,价格按 V4-Flash 文本档算。

峰值输入每百万 tokens 0.44美元,闲时0.22美元,折合单张图约0.017美分,1000张不到20美分。

这样算下来,高分辨率截图输入单张约0.0002美元,Opus 是0.0156美元,差出1/80。

Files API 同步上线,免费。

图片

图像传一次拿 file_id,后续请求直接引用,跨请求、跨会话复用,不用重复上传。单文件最大64MB,存储配额25GB,最多10000个文件,有效期1小时到30天。

生产环境别把图片塞 base64,费带宽,还会撞上48MB请求体上限,用 Files API 省带宽。

社区测评反馈来看,适合场景有:截图驱动的视觉 Agent、UI 自动化、文档提取、图表问答、批量 OCR、长图文混合办公自动化。

构建视觉 Agent 的开发者,把截图塞进工作流的 SaaS(软件即服务)团队,处理长流程办公自动化的工具商都非常适合。

像素级精细视觉识别不是长项,高频小字识别还得交给专业 OCR 模型。

单次请求最多600张图,单张最大8192px,超过15张降到4096px,格式只认 JPEG、PNG、GIF、WebP。

DeepSeek Harness 也同步发布了 v0.1.1 版本,支持新增的 DeepSeek-V4-Flash-Vision-Exp 多模态模型,并支持配置原生图片请求。

图片

参考资料:

https://x.com/deepseek_ai/status/2090730032574631962 https://x.com/tianyi/status/2090730841509171466

免责声明:本文来自AIGC开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。

0 0 0
有话要说  人讨论    6 人阅读
发表

游客

这位投稿者太神秘了,什么都没留下~

超天才网©2017 www.supergenius.cn All Rights Reserved ICP备09005826号 京ICP证130304号

联系我们| 加入我们| 法律声明| 关于我们| 评论互动

超天才网©2013-2014 All Rights Reserved ICP备09005826号 京ICP证130304号

关注我们: