发布时间:2026/8/23 22:38:55
DeepSeek给Agent装了“原装眼睛“:社区外挂一星期,官方亲手拆了 昨天我们聊完社区给 DeepSeek 补眼睛——ModLens 这些插件用外部视觉模型当翻译帮纯文本的 DeepSeek 看懂图片。结果今天下午DeepSeek 官方就把原装眼睛掏出来了。8月21日DeepSeek 上线了 V4 系列首个视觉模型DeepSeek-V4-Flash-Vision-Exp开放 API 澎湃。时间线是这样的一周前DeepSeek 自己看不见图。GitHub 讨论区里怎么让 DeepSeek 看图成了高频问题上传图片直接报错MODEL_DOES_NOT_SUPPORT_IMAGES36氪这一周社区忙坏了。桥接 Qwen-VL 的、写 vision bridge 插件的、做 dsh-deepseek-vision 的……大家抢着给 DeepSeek 装假眼今天官方真眼到了。更绝的是昨天大家刚在文章里夸完社区插件多好用今天就发现——官方这套原装眼睛直接抄了社区的后路。这事值得掰开讲。先复盘社区这一周是怎么装眼睛的DeepSeek 的 V4 系列模型是纯文本的。模型目录里被声明成输入模态只有 text图片甚至进不了会话Agent 自然也没法处理。但 DeepSeek 自己刚开源了 Harness——一个高度插件化的 Agent 运行时。Agent 能调终端、改文件、跑代码、调外部工具偏偏面对最常见的截图、网页图片、报错界面时只能干瞪眼 36氪。这个尴尬局面社区用一周填上了。主流方案是桥接在 DeepSeek 前面再接一个 Qwen-VL 之类的视觉模型先把图片翻译成文字描述再交给 DeepSeek 推理。最出名的 ModLens 就是干这个的——把图片解析成结构化 JSONOCR 文字 版面布局 语义内容喂给 DeepSeek让它借别人的眼睛看世界 阿里云开发者社区。聪明但绕路。多了一层外部调用多了一份延迟和成本还把自己的视觉能力托付给了别的公司。这就像一个人没有眼睛雇了个秘书每天帮他念——能用但总归隔着一层。社区也知道这是权宜之计。所以当 Harness 的 RC.8 更新里出现模型适配器支持配置原生图片请求时不少开发者第一反应都是官方的视觉模型是不是要来了36氪有人甚至直接从 Harness 的代码和配置里扒出了deepseek-v4-flash-vision-exp这个还没官宣的模型名 36氪。果然今天下午官方正式官宣。官方原装眼睛纯文本不降级视觉大幅跃升先看硬数据。纯文本能力不降级。在 Agent、推理、世界知识等纯文本任务上Vision-Exp 与 V4-Flash 正式版基本持平 DeepSeek官方更新日志。这是最关键的信号——加上视觉没有拖累原本的文本推理。视觉能力大幅跃升。在需要视觉理解的 Agent Benchmark 上多模态 Agent 能力已接近 Anthropic 的 Opus-4.8 DeepSeek官方更新日志。具体到跟 Opus-4.8 的对比其实是互有胜负 网易科技领先DeepSWE59.3 vs 58.0、Agents Last Exam27.3 vs 25.7、ZeroBench35.0 vs 34.0追平Terminal Bench 2.183.9 vs 85.0、Toolathlon-Verified75.9 vs 76.2、Chartography64.3 vs 65.0落后NL2Repo57.7 vs 69.7、DSBench-Hard63.6 vs 71.7差 8-12 分接近 Opus-4.8这个说法在代码 Agent 的复杂任务上其实还差着一截但互有胜负这四个字对于刚补上视觉第一天的模型来说已经很能打了。跟自家 V4-Flash 比更能看出视觉的增量ApexBench 从 26.2 涨到 36.5Agents Last Exam 从 25.2 涨到 27.3 网易科技。而且官方特别说明旧版 V4-Flash 在这两个基准里是直接忽略多模态元素的——所以这个涨幅实打实来自能看见。外挂 vs 原生官方怎么抄后路的官方原装眼睛跟社区外挂的区别不只是不用借别家模型这么简单。第一刀同价。图片按 token 折算一张图最多占 384 tokens价格与 V4-Flash 完全一致 澎湃。缓存命中的价格空闲和高峰时段分别只要 0.05 元和 0.10 元每百万 token 36氪。这意味着什么多模态不溢价。行业里多模态能力通常是收费理由——OpenAI、Anthropic 的视觉模型普遍比纯文本贵。DeepSeek 直接把视觉能力做到和文本一个价。这招太熟了。R1 当年打推理溢价DSH 开源打 Agent 外壳溢价现在多模态继续不溢价——DeepSeek 的每一次出手都在重复同一个动作把某个被视作溢价点的东西打成地板价。第二刀Files API 同步上线还免费。图片上传一次之后通过file_id在不同请求里反复引用不用重复上传 DeepSeek官方更新日志。对要反复分析同一批截图、图表的工作流来说省的是实打实的带宽和麻烦。第三刀直接进 Harness。同一天发布的 v0.1.1-rc.1模型适配器直接新增了 V4-Flash-Vision-Exp 选项支持原生图片请求/goal、/plan命令支持图文混合输入菜单能引用文件和会话 澎湃。开箱即用。社区用一周搭的桥官方用原生同价免费工具链一套组合拳轻飘飘地接走了。当然这样说有点委屈社区——ModLens 那批插件的价值并没有消失它证明了需求、试出了方向、也留下了给纯文本模型补能力的方法论。某种意义上社区这周是在替 DeepSeek 做免费的需求探测和市场验证。而这可能正是 DeepSeek 想要的。真正的变化Agent 第一次能看见自己的活儿了但如果你只把这件事理解成DeepSeek 终于能看图了那就漏掉了最核心的东西。注意官方放出的三个演示案例——都不是看图说话这种基础任务 OSCHINA给高净值客户做商业定制的西藏自驾游 PPT——要野性、粗粝、有实拍质感一个月行程、藏南藏北、三种定价方案按黑蓝深海 玻璃 UI ASCII 像素等视觉要求重构 DeepSeek Harness 官网——多轮交互式创作制作带黏土怪物动效的前端 Mini Demo。这三个任务的共同点是模型要先看懂图片、页面结构和设计意图再调用工具产出 PPT 或代码。用深科技的话说——现实中的 Agent 很多时候并不只在文本和代码之间工作它需要读网页布局、判断按钮位置、理解截图和图表、查看自己生成出来的 PPT 或网页效果再根据视觉结果继续修改 DeepTech深科技。这才是视觉对 Agent 的真正意义不是让它会看照片是让它能看见自己的工作结果形成执行闭环。以前 Agent 生成一个 PPT自己看不见长什么样只能盲写。写完对不对、丑不丑、排版乱不乱它不知道。现在它能看了——看完不满意还能改。从单向输出到闭环执行这才是视觉带给 Agent 的质变。但别急Exp两个字说明一切这款模型带着Exp实验后缀是有原因的。DeepSeek 没有公布参数规模没有发布技术报告也没有给视觉 Benchmark 36氪。更耐人寻味的是架构猜测DeepSeek 此前有独立的 DeepSeek-OCR 产品线而普通 V4-Flash 到 7 月底仍只支持文本输入。有分析认为Vision-Exp 很可能不是重新训练一个从底层统一处理文本和视觉的模型而是把已有的视觉编码、OCR 或图像理解模块接到了 V4-Flash 前面再由后者完成推理和生成 36氪。如果是这种架构它和 Gemini、GPT 这类强调统一多模态训练的模型本质上还是有区别的——更像外挂转正而不是原生进化。还有个仓促的细节今天早些时候有开发者实测发现这个模型最初接收image_url时仍返回expected text直到官方模型表和视觉接口陆续更新后才恢复 36氪。这哪是憋大招的样子这是抢时间补位。但换个角度想DeepSeek 为什么要抢这个时间因为它在补齐 Agent 拼图的最后一块感知入口。回看这条时间线4月底 V4 发布无视觉→ 7月31日 V4-Flash 转正Agent 特化→ 8月13日 V4-Pro GA Harness 开源 → 8月19日 RC.8 埋多模态接口 → 8月21日官方视觉模型落地。每一步都在往Agent 能用、好用、闭环的方向推。V4 负责模型能力Harness 负责接入真实任务视觉负责让 Agent 理解屏幕上的世界DeepTech深科技。三块拼图今天算是齐了。写在最后社区当探测器官方来收网把昨天那篇和今天这篇连起来看有个特别值得玩味的画面社区替 DeepSeek 装了一周假眼DeepSeek 在今天亲手摘下来换上了原装真眼。这不一定是谁在算计谁但它确实构成了一套高效的生态打法开源框架先把缺什么暴露给社区社区用插件快速验证需求和方向官方看准了再出手用原生同价一步到位。社区验证需求官方收割成果——这是一切皆插件这套玩法里官方和社区最默契的一次配合。而对整个行业来说今天真正的信号是多模态也不再是溢价的理由了。推理的溢价R1 打掉了外壳的溢价DSH 打掉了现在视觉的溢价也正在被打掉。DeepSeek 还是那个 DeepSeek——永远在告诉市场你以为贵的东西其实可以很便宜。至于那双原装眼睛到底是不是从社区外挂转正来的DeepSeek 不会说。但它已经用行动证明了在一个把一切都做成插件的世界里最快长出器官的方式是先让全世界帮你长一遍。我是词元下期我们聊聊DeepSeek 的视觉模型直接对标 Opus-4.8但多模态这条路统一训练和外挂转正到底哪条才是终局

相关新闻

2026/8/23 22:38:55

群晖NAS上使用Docker部署HomeAssistant智能家居平台完整指南

1. 项目概述:为什么要在群晖上跑HomeAssistant?如果你和我一样,家里有一台群晖NAS,并且对智能家居有点兴趣,那么把HomeAssistant(简称HA)装到群晖上,几乎是顺理成章、性价比最高的选…

2026/8/23 22:38:55

深度学习生成医学图像:CBCT生成伪CT的临床可用方案

深度学习生成医学图像:CBCT生成伪CT的临床可用方案 摘要 锥形束CT(Cone-Beam CT, CBCT)因其低辐射剂量和高空间分辨率,在放射治疗图像引导中应用广泛,但其图像质量受散射噪声和重建伪影影响,HU值准确性不足,限制了其在剂量计算等临床场景中的应用。本文系统阐述基于深…

2026/8/23 22:38:55

JK触发器时序逻辑仿真实验报告

JK触发器时序逻辑仿真实验报告 摘要 本实验基于74LS76双JK触发器芯片,通过硬件描述语言(Verilog HDL)搭建仿真测试平台,系统性地验证了JK触发器的逻辑功能与时序特性。实验重点覆盖了JK四种输入组合(00、01、10、11)在时钟下降沿触发时的输出状态,并深入探究了异步清零…

2026/8/23 23:39:23

谁在抢占具身智能的“数据油田”?

在这场轰轰烈烈的“数据圈地运动”中,一批新物种正在快速崛起。他们不造机器人本体,却掌握着所有机器人公司的命脉。亿欧智库甄选的20家数据采集标杆案例,为我们勾勒出了一幅清晰的产业地图。“重资产派”以无*智科和数*堂为代表。他们信奉“…

2026/8/23 23:39:23

C语言结构体:自定义数据类型,让变量打包出行

本章目标:掌握结构体声明与初始化 理解内存对齐的来龙去脉 学会结构体正确传参 理解自引用原理引入:数组的局限,就是结构体的舞台 学到现在,我们接触的数据类型都是"单一类型": int a → 一个整数double …

2026/8/23 23:39:22

AI行业日报|2026-08-22:5个热点事件

AI行业日报|2026-08-22:5个热点事件 本期日报聚焦大模型基础设施演进、AI数据产业链动态及企业级服务架构优化。内容涵盖推理调度、训练数据需求、模型路由方案、隐私安全机制及智能体工程化实践,供AI从业者与开发者参考。 1. Nvidia研究指出…

2026/8/23 0:02:04

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/23 0:02:04

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/23 0:02:04

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/23 0:02:04

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/23 0:02:04

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/23 0:02:04

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/23 13:29:45

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/23 6:14:43

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/23 4:22:01

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…