2026 年 8 月,DeepSeek 在 API 文件中正式加入 Vision 指南:deepseek-v4-flash-vision-exp 模型可以直接接收圖片,你可以請它描述畫面、讀出截圖上的文字、分析圖表內容。對原本就在用 DeepSeek API 做文字處理的開發者來說,多模態從「要另外接一家服務」變成「同一個 API 多放一個欄位」。這篇依照DeepSeek 官方 Vision 文件整理接入方式、三種圖片輸入管道、限制重點,以及台灣開發者實際導入前該驗證的環節。

快速結論

已在 DeepSeek 生態的開發者,接入成本很低;但先驗證繁中辨識品質

已用 OpenAI SDK 的開發者

API 相容 OpenAI Chat Completions,改 base_url 與模型名就能送出第一張圖。

要批次處理大量圖片的團隊

走 Files API 先上傳再引用 file_id,比每張圖都 base64 內嵌好管理。

想接截圖 OCR 的個人用戶

先看完限制章節:request body 有上限、實驗模型行為可能調整。

這次開放了什麼

依官方文件,deepseek-v4-flash-vision-exp 接受圖片與文字混合輸入,典型用途包括描述照片內容、讀取截圖中的文字、分析圖表。支援的圖片格式是 JPEG、PNG、GIF 與 WebP,而且格式是從檔案實際內容判斷,不是看副檔名或宣告的 MIME type——改副檔名混不過去,這點對自動化管線反而是好事。

呼叫方式維持 OpenAI 相容:base_url 是 https://api.deepseek.com,訊息的 content 從純字串改成文字與 image_url 區塊的陣列。同一模型也能走 Responses API(圖片放在 input_image 區塊)與 Anthropic API 相容介面,已經用這兩種介面的團隊不用重寫客戶端。

三種圖片輸入方式

方式做法適合情境注意事項
Base64 內嵌把圖檔編碼成 data: URL 直接放進請求本地檔案、快速驗證編碼後資料計入 48 MiB request body 上限,大圖或批次要留意
外部圖片 URL貼一個公開可達的 http(s) 圖址圖片已在雲端或 CDN 上圖床穩定度直接影響成功率,私有圖要先發可訪問連結
Files API file_id先呼叫 Files API 上傳,再用回傳的 file_id 引用批次處理、同一圖片重複使用走 file_id 時 detail 參數會被忽略;Anthropic API 介面需加 anthropic-beta: files-api-2025-04-14 標頭

另外有 detail 參數可選 low、high、original、auto,控制模型看圖的解析度取向。官方沒有保證每個等級的確切像素處理方式,建議用自己的典型圖片各送一次,比較輸出品質與 token 用量後再定案。

限制與計費重點

  • 圖片會換算成 token:圖片輸入計入上下文長度與計費,詳細換算規則以官方文件的 Token Usage 章節為準。成本估算不要只算文字。
  • 請求大小上限:單次 request body 上限 48 MiB,base64 路線尤其容易踩到。
  • 圖片位置有規矩:在 system 或 assistant 訊息裡放圖片會被 400 錯誤拒絕,圖片只能放在 user 訊息或工具輸出中。
  • 實驗性質:模型名帶 exp 字樣,代表行為與計費細節可能調整,正式上線前把模型名設成可設定參數。

台灣開發者要注意的事

  • 帳務與付款:DeepSeek API 採儲值扣點,需要在 platform.deepseek.com 註冊並完成儲值;台灣開發者通常以海外信用卡處理,先小額試跑確認帳務流程走得通。
  • 資料落地:截圖若含客戶資料、個資或公司內部資訊,送到境外 API 之前要先過濾或遮罩。這不是 DeepSeek 特有的問題,任何境外多模態 API 都一樣。
  • 繁體中文先驗證:官方文件沒有公布繁體中文文件辨識的基準數據。如果你的場景是發票、收據、中文截圖,拿 10 到 20 張真實樣本跑一次再決定。
  • 網路品質自測:從台灣連 api.deepseek.com 的延遲與穩定度,請以你自己的環境實測為準,尖峰時段多測幾次。

建議導入流程

第一次接入,建議按這個順序:一、在 DeepSeek 平台建立 API key 並小額儲值;二、用 curl 或 OpenAI SDK 以 base64 送一張測試截圖,確認整條鏈路跑得通;三、拿真實樣本(含繁中文字、圖表、低解析度截圖)驗證辨識品質;四、依使用型態決定輸入管道——圖片已在雲端就貼 URL,批次或大檔就走 Files API;五、補上錯誤處理(400 格式錯誤、超過大小上限)與成本監控,再切正式流量。多模態接入最大的坑從來不是 API 本身,而是沒有拿自己的資料先驗證就上線。

常見問題

需要換 SDK 嗎?

不用。API 相容 OpenAI Chat Completions,現成的 OpenAI SDK 改 base_url 與模型名即可;用 Responses API 或 Anthropic 相容介面的團隊也有對應路徑。

跟 Gemini 或 GPT 的多模態怎麼選?

如果你已在 DeepSeek 生態、且對成本敏感,值得拿同一批樣本做 A/B 比較。選型的關鍵不是基準分數,而是你的圖片型態在哪家辨識最穩、總成本最低。

實驗模型可以正式上線嗎?

技術上可以,但建議把模型名、detail 等級都做成設定參數,並監控錯誤率與 token 用量。實驗階段的行為調整期,能快速切換就是最大的保險。

結論

DeepSeek 把視覺能力接進既有的 OpenAI 相容 API,對已在使用者來說接入成本接近零:三種輸入方式覆蓋從快速驗證到批次管線,限制條款(48 MiB、圖片位置、實驗標記)也都寫得明白。台灣開發者的務實路線:先小額儲值跑通鏈路,用繁中真實樣本驗證品質,確認成本曲線後再放大使用。多模態工具的比較永遠是「用你的資料測」,文件只是入場券。