8月21日晚,DeepSeek悄然上线了视觉理解模型deepseek-v4-flash-vision-exp。同一周,它的Harness框架刚刚开源,首日GitHub破3万星。
一边是让大模型”看见”世界的眼睛,一边是让大模型”干活”的缰绳。DeepSeek在72小时内完成了两场关键补课。
迟到的眼睛:DeepSeek视觉模型的两条时间线
DeepSeek做视觉研究其实不晚。
2024年3月,DeepSeek-VL开源,1.3B和7B两个版本,能看自然图片、网页、公式、图表。同年10月,Janus把图像理解与生成塞进同一套自回归框架。12月,DeepSeek-VL2换成混合专家架构,参数量分成3B、16B和27B三档。
2025年1月除夕,Janus-Pro开源,7B版本在GenEval文字生成图片评测里拿到0.80,超过DALL-E 3的0.67。2025年10月,DeepSeek-OCR用视觉token压缩长文档。2026年1月,OCR 2发布。
从DeepSeek-VL开始算,两年里至少7条公开记录。视觉研究一直在做,也一直往外放。
但普通开发者一直没有那个入口。
另一边,竞对早就跑远了。OpenAI在2023年11月开放GPT-4 Turbo with Vision,图片可以直接进Chat Completions API。一个月后,Google上线Gemini Pro Vision API。2024年3月,Claude 3全系加入视觉能力。
2025年4月,李彦宏在百度Create大会上说,”DeepSeek也不是万能的”,随后列出的问题里就有模态单一。
那时候,DeepSeek已经做了一年视觉研究。
从论文到API:一条漫长的路
2026年4月7日,部分用户打开DeepSeek,界面里突然多出三个入口:「快速」「专家」「视觉」。
4月29日,多模态团队负责人陈小康确认识图功能开始灰度。DeepSeek一名资深研究员写道,”小鲸鱼现在能看见了”。
第二天,DeepSeek把《Thinking with Visual Primitives》放上GitHub,几个小时后又撤下。论文研究的是一个很具体的问题:模型看到一张拥挤的图片后,常常知道自己在说什么,却说不清说的是哪个人、哪条线。团队把点坐标和边界框直接插进推理过程,让模型一边指出位置一边往下想。
6月18日,网页和App的识图模式正式上线。有媒体上传梁文锋的照片测试,DeepSeek连续两次把他认成张一鸣。
它已经能读英文截图,也能把网页转成代码。到了人脸面前,却连自己老板都认不出来。
8月21日,deepseek-v4-flash-vision-exp正式开放API。两条线终于碰到了一起。
视觉模型的核心能力
新模型基于V4-Flash纯文本模型开发,保留了100万token上下文和38.4万token最大输出,支持JSON Output、Tool Calls、Responses API,也兼容Anthropic API。
视觉能力的关键指标:
| 能力维度 | 表现 |
|---|---|
| 图片格式 | JPEG、PNG、GIF、WebP |
| 单次请求图片上限 | 600张 |
| 单张图片token上限 | 384 token |
| 图片输入成本 | 约0.001元/张(高峰期) |
| 多模态Agent基准 | 逼近Claude Opus 4.8 |
定价完全沿用V4-Flash。每百万token输入,缓存未命中时高峰期3元,空闲期1.5元。缓存命中分别是0.1元和0.05元。输出高峰期9元,空闲期4.5元。
图片同样按token结算。一张图片在高峰期、缓存未命中的输入费用约为0.001152元。处理一千张图片,图片输入本身只有约1.152元。
Files API同步上线,免费。开发者可以提前上传图片,把file_id放进请求,同一张图只需要传一次。单个文件最大64MiB,每个用户最多存25GiB、10000个文件。
Agent场景的视觉推理
DeepSeek展示的三个案例都不是传统的”看图说话”:一个Agent给高端客户制作西藏自驾游PPT,一个重新设计DeepSeek Harness官网,还有一个根据视觉要求制作带动态效果的前端Demo。
它们都需要模型在长流程任务里反复处理视觉信息。Responses API同样接受input_image,浏览器Agent可以拿到网页截图后把它重新送进下一轮推理;代码Agent可以检查渲染结果,图表、扫描件和软件界面也能直接成为上下文。
四项多模态Agent对比测试结果:
| 基准测试 | Vision Exp | Claude Opus 4.8 | 差距 |
|---|---|---|---|
| Agents’ Last Exam | 27.3 | 25.7 | +1.6 |
| ZeroBench | 35.0 | 34.0 | +1.0 |
| ApexBench | 36.5 | 39.4 | -2.9 |
| Chartography | 64.3 | 65.0 | -0.7 |
四项差距都没有超过3分。更有意思的是,加上视觉以后,原来的文本Agent能力没有明显掉下去。和7月31日发布的纯文本V4-Flash逐项比较,五项文本Agent评测全部上涨。Terminal Bench 2.1从82.7涨到83.9,DeepSWE从54.4到59.3,超过了Opus 4.8的58.0。
Harness:驾驭大模型的缰绳
视觉模型让DeepSeek”看见”了世界,Harness则要让它”干活”。
8月1日,DeepSeek Harness团队负责人崔添翼在X平台发布内测招募。再往前几天,英伟达CEO黄仁勋和LangChain创始人Harrison Chase公开对谈,主题只有一个:当Agent开始真正替人调用工具、执行流程,企业该把工程资源放在哪里?
黄仁勋给了Harness一个边界:这不是一个简单的模型包装层,而是一整套围绕模型构建的智能体工程系统,包括系统提示词、工具说明、记忆管理、上下文管理、任务拆分、重试机制、评测体系、权限控制和审计追踪。
如果大模型是发动机,Harness就是把发动机变成整车的系统工程。变速箱、制动器、仪表盘、方向盘,缺一不可。
Agent = Model + Harness
8月13日深夜,DeepSeek Harness v0.1开发者预览版正式公测,MIT协议开源。半小时破1万星,首日冲到3万星,Hacker News登顶TOP 1。
官方公式很直白:
模型(大脑)+ Harness(身体)= 智能体(Agent)
Harness的英文原意是”马具、线束”——把力量连接到可以工作的机构上,又不让这股力量脱缰。落到AI上,Harness负责把模型接到文件系统、Shell、代码编辑器、网页和其他Agent上,同时记录它做了什么、限制它能做什么,并在出错时决定是重试、取消、压缩上下文,还是把问题交还给用户。
为什么Harness如此重要?
LangChain团队做过一个对照实验:让GPT-5.2-Codex在Terminal Bench 2.0上运行,如果只用默认提示词和标准工具,得分只有52.8%,排在三十名开外。不修改模型权重,只调整系统提示词、工具描述和中间件,得分飙升到66.5%,跻身前五。
模型还是那个模型,效果天壤之别。
黄仁勋披露的数据更惊人:LangChain让Nemotron 3 Ultra配合Harness优化,在Deep Agents评测中得分追到0.86,与最高分闭源模型的0.87只差0.01,单次评测成本从43.48美元压到了4.48美元,便宜近10倍。
Anthropic的研究团队让Claude Opus 4.5做过一个复古游戏制作器。单Agent不用Harness,20分钟完成,成本9美元,代码达不到标准。套上三个Agent Harness后,6小时完成,成本200美元。看着成本提高了,但输出的是可以端到端交付的工作软件。
真相是,模型早就具备了创造完整软件的能力,只是需要被Harness激活。
DeepSeek Harness的架构设计
Harness最醒目的设计主张是”一切皆插件”——模型、工具、技能、会话、沙箱、存储、循环、调度、UI,所有Agent能力都由插件组合而成,可以自由替换、灵活重组。甚至连Agent Loop本身也是插件。
底层是Cordis插件元框架,来自北京大学与DeepSeek联合署名论文。运行中的Harness本质上是一个Cordis Context,不同包向Context注册服务、事件和能力,最终由配置文件把它们组合成一套可运行的智能体。
四种预设模式:
| 模式 | 定位 | 适用场景 |
|---|---|---|
| 标准模式 | 完整编码Agent | 日常开发任务 |
| PTC模式 | 模型写TypeScript程序一次执行多步调用 | 复杂工作流 |
| 极简模式 | 仅Bash+编辑器两工具 | 轻量任务 |
| 创造模式 | 可运行模型编写的插件代码 | 高级用户 |
与Claude Code、OpenAI Codex的本质差异:Codex、Claude Code是”装修好的办公室”——菜单、对话、结果都预先设计好;DeepSeek Harness更像”刚交付的毛坯房”:墙、门、电路都有,但工位怎么摆由你决定。前者是做好的Agent,后者是组装Agent的运行时。
两条线的交汇:视觉+Harness=真正的Agent
梁文锋在5月一场投资者交流会上,把AGI路线排成了几级台阶:语言模型、思维链、Agent、持续学习、自我迭代,再到具身智能。多模态被他放在组件的位置,和搜索差不多。
但他同时说过,V4以及后续版本会支持原生多模态。视觉在DeepSeek的路线里一直有位置,只是排得没有那么靠前。
等路线走到第三步Agent,情况开始不一样了。
Agent要读屏幕,要看图表,要处理工具扔回来的截图。它不可能永远生活在纯文本里。那些已经做了两年的视觉能力,终于从论文、仓库和测试页面里,一路走到了API。
Harness则解决另一个问题:如何让Agent长期可靠地运行。Framework解决的是”如何开发一个Agent”,Harness解决的是”如何让一个Agent稳定地干活”。
8月19日,DeepSeek Harness留下一份技术说明:官方适配器已经能够把图片序列化成image_url。8月21日,Vision Exp加入默认模型目录,对应的合并提交写着”publish the vision model”。
视觉提供感知能力,Harness提供执行能力。两者结合,才是一个完整的Agent。
与国际竞对的差距正在缩小
在SWE-bench Verified排行榜上,DeepSeek V4以80.6%的得分与Gemini 3.1 Pro持平,价格仅为Claude的1/10。视觉模型的多模态Agent能力已经逼近Claude Opus 4.8。
开源Harness的发布则填补了工程层面的短板。过去两年,DeepSeek的角色是”算力性价比之王”——从V4-Flash的¥1/百万token到V4-Pro的峰谷定价,它赢在”同样的活,花最少的钱”。但模型层之上,开发者真正每天打开的工具是IDE和Agent,这些入口目前被Claude Code、Cursor、GitHub Copilot牢牢把持。
做编程智能体,商业上几乎是必然选择。据Research and Markets数据,2025年全球AI编程工具市场规模已达295.7亿美元,预计2030年攀升至646.8亿美元。
国内Harness生态:一场正在发生的竞赛
DeepSeek不是唯一在做Harness的国内玩家。
腾讯是国内最早公开布道Harness理念的大厂之一。WorkBuddy现在已成为中国日活第一的AI Agent,从决定做claw模式到全量上线只花了一周。WorkBuddy的Harness早在面向市场前就在腾讯内部完成了打磨,超过2000名员工将日常工作交给它。
开源社区的节奏比大厂更快。OpenClaw(龙虾)版本已经具备完善的Harness能力,Hermes(爱马仕)主打”自主学习、持久记忆、越用越聪明”,其”技能进化”机制在完成5次及以上同类工具调用后,自动将执行流程提炼为标准化的技能文档。
Harness争夺战的底层逻辑
黄仁勋在7月的对谈中说了一句很重的话:
“如今大多数公司建立在业务流程之上,而未来大多数公司将建立在Harness工程之上。”
他甚至抛出了一个更激进的观点:”未来的公司会把越来越多能力建在Harness上。”
作为英伟达的老板,黄仁勋对AI产业的判断始终围绕一个核心:AI最终必须进入真实世界,成为生产力。因为只有这样,他的GPU才有更大的增长空间。
Harness对应的就是这个目标。对企业来说,真正有价值的并不是一个能够聊天的AI,而是一批能够承担具体工作的AI员工。未来,企业可能拥有负责市场分析的Agent、负责软件开发的Agent、负责客户服务的Agent、负责供应链管理的Agent。但只有Harness才能让这些Agent真正进入企业流程。
结语:从”价格屠夫”到”Agent基础设施提供商”
2024年,开发者想给DeepSeek发一张图片,官方API还接不住。2026年8月21日,这张图片终于进来了。
同一个月,Harness开源,首日3万星。
DeepSeek的眼睛确实睁开得晚,缰绳也确实套得迟。但等它真正睁开眼睛、套上缰绳的时候,前面的路已经不允许它继续闭着眼睛走了。
从”价格屠夫”到”Agent基础设施提供商”,DeepSeek正在完成一次关键的身份转换。视觉模型补齐了感知能力,Harness补齐了执行能力,两者结合才是一个完整的Agent系统。
黄仁勋说,Agent = Harness + Model。DeepSeek现在两个都有了。
接下来的问题是:开发者买不买单?