DeepSeek上线能看图的模型:V4-Flash-Vision,视觉任务接入Agent

Published on: 2026-08-24

8月21日,DeepSeek在API平台悄悄挂出了一个新模型:deepseek-v4-flash-vision-exp。名字挺长,翻译过来就一句话--这是DeepSeek第一个能"看图片"的模型。过去V4-Flash只能读文字,现在它把眼睛睁开了:截图、图表、界面布局,都能直接扔进去理解了。

对铠盒AIBOX这类本地AI盒子的用户来说,这个更新值得盯一眼。不是因为模型跑在你家里,而是它把"Agent能看世界"这道门又推开了一条缝--而谁能把这道门守在本地、7×24小时开着,才是我们该关心的问题。

它到底多了什么能力

📖 名词释义

AI Box(又称 AI盒子 / 智能体计算机 / Agent Computer),是一种专门运行 AI Agent 的本地硬件设备,预装智能体应用管理系统,开箱即用,7×24 小时在线运行。用户可以通过微信、飞书、企业微信、钉钉等社交软件远程指挥 AI 帮你干活。

先说清楚定位:V4-Flash-Vision-Exp是个实验版(名字里那个Exp就是Experimental),它是在纯文本的V4-Flash基础上加了视觉层。DeepSeek自己的说法是,文本能力--Agent、推理、世界知识--跟原版V4-Flash完全持平,不增不减,只是多了一双眼睛。

这双眼睛能干什么?支持JPEG、PNG、GIF、WebB三种格式(注:实际为JPEG/PNG/GIF/WebP),单次请求最多塞600张图,最长边支持到8192像素。能力上能做图像识别、图表分析、截图文字提取--官方演示里举的例子,是秒级识别一只英短银渐层猫,还能列出毛色分布、爪垫颜色这种辨识依据。

更关键的是多模态Agent能力的跃升。DeepSeek称它在需要视觉理解的Agent Benchmark上大幅超过纯文本版V4-Flash,多模态Agent综合表现已经逼近Claude Opus 4.8。换句话说,以前Agent跑计算机操作任务时是个"盲人",现在能看截图、看界面了,GUI自动化、屏幕操作这类场景一下子就通了。

配图

加视觉不加价,这是最狠的一刀

多模态模型普遍单独计费,图片消耗的Token往往比同长度文本贵好几倍。DeepSeek这波直接把视觉能力并进了原有计费体系--和纯文本V4-Flash执行完全相同的价格标准。

具体怎么算:图片会被转成token计入用量,单张图片最多按384个token封顶,按输入token的费率走。定价沿V4-Flash那套:缓存命中时空闲0.05元/百万token、高峰0.10元/百万token;缓存未命中时输入分别为1.5元(空闲)、3元(高峰)/百万token,输出分别为4.5元(空闲)、9元(高峰)/百万token。

有媒体算了笔账:同尺寸图片,头部模型单图消耗Token从258到1334不等,千图成本最高接近29元;而DeepSeek单图封顶384Token,配合百万输入3元的基础定价,千张图输入成本仅约1.15元,低谷时段半价后不到6毛。成本差距最高能到50倍。

同步上线的还有免费的Files API:图片传一次,拿到file_id,后续请求直接引用,不用每次重复上传。对要做批量截图分析、长文档检查、数据图表理解的视觉Agent来说,这个设计很贴心。

对开发者意味着什么

最舒服的一点是兼容性。它支持OpenAI的Chat Completions、Anthropic的Messages、以及Responses API三种格式,现有Agent和工具不用重写接口,只改个model名字就能把视觉能力接上。同步发布的DeepSeek Harness 0.1.1也开箱支持了这个新模型。

它还保留了V4-Flash的1M超长上下文,支持思考模式(high/max),复杂多模态任务建议开max档。手机端同步上线了"识图模式",普通用户也能直接体验图像交互。

但要说清楚边界:这是个API-only的实验版,没有开源权重,不能下载到自己机器上跑。所有图像理解都发生在DeepSeek的云端。基准也是DeepSeek自测的--11项对Opus 4.8的对比里,它3项领先、8项落后,最直观的Terminal Bench 2.1是83.9对85.0。所以"接近Opus 4.8"这话,得打折听。

铠盒AIBOX看到的另一层机会

模型能看图了,本地AI盒子能从中得到什么?说白了,多模态Agent的玩法一下变多了:截图转代码、界面识别后自动填表、图表读取做数据汇总、长文档配图检查--这些以前得人盯着屏幕干的活,现在可以交给Agent流水线。

但模型是云端的,眼睛长在DeepSeek的服务器上。你让Agent分析一张含客户信息的截图,那张图就得先传到DeepSeek的云。这跟铠盒AIBOX"数据不出家门"的思路正好是反着的。

所以真正的分工是这样:把"看得见的、临时的、协作的"视觉任务交给云端多模态模型,把"敏感的、长线的、要持续跑的"留在本地底座。铠盒AIBOX的价值不在跟DeepSeek比谁眼睛亮,而在它是那个永远插着电、7×24小时在线的调度中枢--你睡觉了,它还能按编排好的流程,调用包括V4-Flash-Vision在内的多个模型API,把看图和干活这两件事串起来跑完。

想进一步了解本地AI盒子怎么调度多个模型、把数据留在自己手里,可以看为什么AI盒子比装电脑里强,或者直接去产品页官网商城对比。

多模态Agent的时代刚拉开帘子,DeepSeek这步是给所有本地底座提了个醒:模型越来越能干,但谁能把模型调度好、把数据主权守住,谁才是在牌桌上的那个。巨头把“会看图的模型”做出来了,我们该想的是——这些眼睛,该长在谁身上。

配图


延伸阅读

DeepSeek #V4FlashVision #多模态 #AI前沿 #铠盒AIBOX

了解更多 请搜索【铠盒AIBOX】

联系邮箱:[email protected]

--铠盒AIBOX · 7×24小时为你工作的私人AI助手 | AI前沿

推荐产品

铠盒 A1 家用入门款 铠盒 A1 Pro 增强款 铠盒 A2 专业款 铠盒 A2 Pro 进阶款 铠盒 X1 企业款 铠盒 G1 旗舰款
© KAIHE AI - Agent Computer Specialist