Techapple.com
AI時代

DeepSeek 推出視覺模型 deepseek-v4-flash-vision-exp:輸入圖片即可理解內容

DeepSeek 近日於官方 API 文檔推出視覺模型 deepseek-v4-flash-vision-exp,開發者可以在文字之外同時輸入圖片,讓模型描述圖片內容、辨識截圖中的文字,以至分析圖表數據。這是 v4-flash 系列的視覺版本,支援在標準對話格式中同時傳入文字與圖片。

重點一覽

  • 新模型 deepseek-v4-flash-vision-exp 支援圖片輸入,可描述圖片、辨識文字及分析圖表。
  • 支援 JPEG、PNG、GIF、WebP 四種格式,以檔案實際內容判斷而非副檔名。
  • 提供三種傳圖方式:Base64 內聯、外部 URL,以及 Files API 上傳引用。
  • 單次請求最多 600 張圖片,每張圖片最高消耗 384 個 token。

三種傳入圖片的方式

開發者可以用三種方式向模型提供圖片,全部採用標準的 OpenAI 相容對話補全格式,即 content 為一個內容塊(block)陣列而非純文字。

1. Base64 編碼(內聯)

將圖片以 base64 編碼後,以 data: URL 形式直接嵌入請求。這是最簡單處理本地檔案的方式,但編碼後的資料會計入 48 MiB 的請求體大小限制。

2. 外部圖片 URL

傳入一個可公開存取的 http(s) 連結,模型會自動下載圖片。URL 長度最多 8192 個字元,圖片檔案最大 32 MiB,且需在 60 秒內完成下載。

3. 透過 Files API 引用檔案

先以 Files API 上傳一次圖片,之後在請求中以其 file_id 引用。當需要在多個請求中重複使用同一張圖片,或圖片會令請求體超過 48 MiB 內聯限制時,這是較合適的選擇。經 Files API 引用的圖片最大可達 64 MiB。

細節級別與 token 計費

針對 image_url 輸入,開發者可選填 detail 欄位控制圖片處理方式:low 會在推理前將圖片縮放至 512×512,處理較快且更省 token;high、original 則保留原圖,auto 會自動選擇。

計費方面,圖片會按尺寸換算成 token,並與文字 token 一併計算。每張圖片在進入模型前會自動縮放,因此單張圖片的 token 消耗設有 384 個的上限。舉例而言,2000×2000 與 5000×5000 的圖片經縮放後,消耗的 token 數量相同。

使用限制

值得留意的是,圖片僅支援出現在 user 訊息中,放在 system 或 assistant 訊息會回傳 400 錯誤;而只有此視覺模型接受圖片,其他模型會回傳錯誤。單次請求最多可包含 600 張圖片,圖片單邊最長為 8192 像素,當單次請求包含 15 張或以上圖片時,單邊限制會降至 4096 像素。

支援多種介面

除了 OpenAI 相容的 Chat Completions 端點,此視覺模型亦支援 Anthropic 相容的 /messages 端點,以及 OpenAI 相容的 Responses API,開發者可沿用熟悉的框架接入圖片理解功能。

適用場景

這項視覺能力適合多種實務情境,例如整理截圖中的文字、解讀圖表趨勢,以至為圖片生成描述或進行分類。由於採用標準對話格式,現有基於 OpenAI SDK 或 Anthropic SDK 的專案只需加入圖片內容塊,即可快速接入,毋須大幅改寫既有程式碼。

常見問題

deepseek-v4-flash-vision-exp 支援哪些圖片格式?

支援 JPEG、PNG、GIF、WebP 四種格式,以檔案實際內容判斷,而非檔案名稱或 MIME 類型。

圖片如何計費?

圖片會按尺寸換算成 token 並與文字 token 一併計費,每張圖片最高消耗 384 個 token。

可以在哪些 API 介面使用?

支援 OpenAI 相容的 Chat Completions、Anthropic 相容的 /messages 端點,以及 Responses API。

資料來源:DeepSeek API Docs – Vision

TechApple.com 編輯部

堅持製作專業科技內容,全員擁有多種不同技術知識的特異科技媒體團隊。 電郵:editor@techapple.com