
昨天我們聊完社區給 DeepSeek 補眼睛——ModLens 這些插件用外部視覺模型當翻譯幫純文本的 DeepSeek 看懂圖片。結果今天下午DeepSeek 官方就把原裝眼睛掏出來了。8月21日DeepSeek 上線了 V4 系列首個視覺模型DeepSeek-V4-Flash-Vision-Exp開放 API 澎湃。時間線是這樣的一周前DeepSeek 自己看不見圖。GitHub 討論區里怎么讓 DeepSeek 看圖成了高頻問題上傳圖片直接報錯MODEL_DOES_NOT_SUPPORT_IMAGES36氪這一周社區忙壞了。橋接 Qwen-VL 的、寫 vision bridge 插件的、做 dsh-deepseek-vision 的……大家搶著給 DeepSeek 裝假眼今天官方真眼到了。更絕的是昨天大家剛在文章里夸完社區插件多好用今天就發現——官方這套原裝眼睛直接抄了社區的后路。這事值得掰開講。先復盤社區這一周是怎么裝眼睛的DeepSeek 的 V4 系列模型是純文本的。模型目錄里被聲明成輸入模態只有 text圖片甚至進不了會話Agent 自然也沒法處理。但 DeepSeek 自己剛開源了 Harness——一個高度插件化的 Agent 運行時。Agent 能調終端、改文件、跑代碼、調外部工具偏偏面對最常見的截圖、網頁圖片、報錯界面時只能干瞪眼 36氪。這個尷尬局面社區用一周填上了。主流方案是橋接在 DeepSeek 前面再接一個 Qwen-VL 之類的視覺模型先把圖片翻譯成文字描述再交給 DeepSeek 推理。最出名的 ModLens 就是干這個的——把圖片解析成結構化 JSONOCR 文字 版面布局 語義內容喂給 DeepSeek讓它借別人的眼睛看世界 阿里云開發者社區。聰明但繞路。多了一層外部調用多了一份延遲和成本還把自己的視覺能力托付給了別的公司。這就像一個人沒有眼睛雇了個秘書每天幫他念——能用但總歸隔著一層。社區也知道這是權宜之計。所以當 Harness 的 RC.8 更新里出現模型適配器支持配置原生圖片請求時不少開發者第一反應都是官方的視覺模型是不是要來了36氪有人甚至直接從 Harness 的代碼和配置里扒出了deepseek-v4-flash-vision-exp這個還沒官宣的模型名 36氪。果然今天下午官方正式官宣。官方原裝眼睛純文本不降級視覺大幅躍升先看硬數據。純文本能力不降級。在 Agent、推理、世界知識等純文本任務上Vision-Exp 與 V4-Flash 正式版基本持平 DeepSeek官方更新日志。這是最關鍵的信號——加上視覺沒有拖累原本的文本推理。視覺能力大幅躍升。在需要視覺理解的 Agent Benchmark 上多模態 Agent 能力已接近 Anthropic 的 Opus-4.8 DeepSeek官方更新日志。具體到跟 Opus-4.8 的對比其實是互有勝負 網易科技領先DeepSWE59.3 vs 58.0、Agents Last Exam27.3 vs 25.7、ZeroBench35.0 vs 34.0追平Terminal Bench 2.183.9 vs 85.0、Toolathlon-Verified75.9 vs 76.2、Chartography64.3 vs 65.0落后NL2Repo57.7 vs 69.7、DSBench-Hard63.6 vs 71.7差 8-12 分接近 Opus-4.8這個說法在代碼 Agent 的復雜任務上其實還差著一截但互有勝負這四個字對于剛補上視覺第一天的模型來說已經很能打了。跟自家 V4-Flash 比更能看出視覺的增量ApexBench 從 26.2 漲到 36.5Agents Last Exam 從 25.2 漲到 27.3 網易科技。而且官方特別說明舊版 V4-Flash 在這兩個基準里是直接忽略多模態元素的——所以這個漲幅實打實來自能看見。外掛 vs 原生官方怎么抄后路的官方原裝眼睛跟社區外掛的區別不只是不用借別家模型這么簡單。第一刀同價。圖片按 token 折算一張圖最多占 384 tokens價格與 V4-Flash 完全一致 澎湃。緩存命中的價格空閑和高峰時段分別只要 0.05 元和 0.10 元每百萬 token 36氪。這意味著什么多模態不溢價。行業里多模態能力通常是收費理由——OpenAI、Anthropic 的視覺模型普遍比純文本貴。DeepSeek 直接把視覺能力做到和文本一個價。這招太熟了。R1 當年打推理溢價DSH 開源打 Agent 外殼溢價現在多模態繼續不溢價——DeepSeek 的每一次出手都在重復同一個動作把某個被視作溢價點的東西打成地板價。第二刀Files API 同步上線還免費。圖片上傳一次之后通過file_id在不同請求里反復引用不用重復上傳 DeepSeek官方更新日志。對要反復分析同一批截圖、圖表的工作流來說省的是實打實的帶寬和麻煩。第三刀直接進 Harness。同一天發布的 v0.1.1-rc.1模型適配器直接新增了 V4-Flash-Vision-Exp 選項支持原生圖片請求/goal、/plan命令支持圖文混合輸入菜單能引用文件和會話 澎湃。開箱即用。社區用一周搭的橋官方用原生同價免費工具鏈一套組合拳輕飄飄地接走了。當然這樣說有點委屈社區——ModLens 那批插件的價值并沒有消失它證明了需求、試出了方向、也留下了給純文本模型補能力的方法論。某種意義上社區這周是在替 DeepSeek 做免費的需求探測和市場驗證。而這可能正是 DeepSeek 想要的。真正的變化Agent 第一次能看見自己的活兒了但如果你只把這件事理解成DeepSeek 終于能看圖了那就漏掉了最核心的東西。注意官方放出的三個演示案例——都不是看圖說話這種基礎任務 OSCHINA給高凈值客戶做商業定制的西藏自駕游 PPT——要野性、粗糲、有實拍質感一個月行程、藏南藏北、三種定價方案按黑藍深海 玻璃 UI ASCII 像素等視覺要求重構 DeepSeek Harness 官網——多輪交互式創作制作帶黏土怪物動效的前端 Mini Demo。這三個任務的共同點是模型要先看懂圖片、頁面結構和設計意圖再調用工具產出 PPT 或代碼。用深科技的話說——現實中的 Agent 很多時候并不只在文本和代碼之間工作它需要讀網頁布局、判斷按鈕位置、理解截圖和圖表、查看自己生成出來的 PPT 或網頁效果再根據視覺結果繼續修改 DeepTech深科技。這才是視覺對 Agent 的真正意義不是讓它會看照片是讓它能看見自己的工作結果形成執行閉環。以前 Agent 生成一個 PPT自己看不見長什么樣只能盲寫。寫完對不對、丑不丑、排版亂不亂它不知道。現在它能看了——看完不滿意還能改。從單向輸出到閉環執行這才是視覺帶給 Agent 的質變。但別急Exp兩個字說明一切這款模型帶著Exp實驗后綴是有原因的。DeepSeek 沒有公布參數規模沒有發布技術報告也沒有給視覺 Benchmark 36氪。更耐人尋味的是架構猜測DeepSeek 此前有獨立的 DeepSeek-OCR 產品線而普通 V4-Flash 到 7 月底仍只支持文本輸入。有分析認為Vision-Exp 很可能不是重新訓練一個從底層統一處理文本和視覺的模型而是把已有的視覺編碼、OCR 或圖像理解模塊接到了 V4-Flash 前面再由后者完成推理和生成 36氪。如果是這種架構它和 Gemini、GPT 這類強調統一多模態訓練的模型本質上還是有區別的——更像外掛轉正而不是原生進化。還有個倉促的細節今天早些時候有開發者實測發現這個模型最初接收image_url時仍返回expected text直到官方模型表和視覺接口陸續更新后才恢復 36氪。這哪是憋大招的樣子這是搶時間補位。但換個角度想DeepSeek 為什么要搶這個時間因為它在補齊 Agent 拼圖的最后一塊感知入口。回看這條時間線4月底 V4 發布無視覺→ 7月31日 V4-Flash 轉正Agent 特化→ 8月13日 V4-Pro GA Harness 開源 → 8月19日 RC.8 埋多模態接口 → 8月21日官方視覺模型落地。每一步都在往Agent 能用、好用、閉環的方向推。V4 負責模型能力Harness 負責接入真實任務視覺負責讓 Agent 理解屏幕上的世界DeepTech深科技。三塊拼圖今天算是齊了。寫在最后社區當探測器官方來收網把昨天那篇和今天這篇連起來看有個特別值得玩味的畫面社區替 DeepSeek 裝了一周假眼DeepSeek 在今天親手摘下來換上了原裝真眼。這不一定是誰在算計誰但它確實構成了一套高效的生態打法開源框架先把缺什么暴露給社區社區用插件快速驗證需求和方向官方看準了再出手用原生同價一步到位。社區驗證需求官方收割成果——這是一切皆插件這套玩法里官方和社區最默契的一次配合。而對整個行業來說今天真正的信號是多模態也不再是溢價的理由了。推理的溢價R1 打掉了外殼的溢價DSH 打掉了現在視覺的溢價也正在被打掉。DeepSeek 還是那個 DeepSeek——永遠在告訴市場你以為貴的東西其實可以很便宜。至于那雙原裝眼睛到底是不是從社區外掛轉正來的DeepSeek 不會說。但它已經用行動證明了在一個把一切都做成插件的世界里最快長出器官的方式是先讓全世界幫你長一遍。我是詞元下期我們聊聊DeepSeek 的視覺模型直接對標 Opus-4.8但多模態這條路統一訓練和外掛轉正到底哪條才是終局