Techapple.com
AI時代

DeepSeek V4.1 Flash 兩日限定測試:新架構原生多模態,AI Agent 實測體感

DeepSeek 於 9 月 8 日下午開放 V4.1 Flash 中間版本測試,開發者只需把模型 ID 改為 deepseek-v4.1-flash-expires-on-0910 即可調用。

重點一覽
  • V4.1 Flash 中間版本於 9 月 8 日開放測試。
  • 採用全新模型架構,原生支援多模態,文字、圖像與音頻輸入統一處理,不再依賴外加的視覺擴展包。
  • 計費與 V4 Flash 相同,離峰時段每百萬 token 輸入快取命中 0.007 美元、輸入快取未命中 0.22 美元、輸出 0.66 美元。
  • 測試版本每帳號併發請求上限為 20,遠低於 V4 Flash 的 2,500,定位屬功能驗證而非生產部署。
  • 開發者實測輸出速度普遍超過每秒 300 tokens,最高錄得每秒 507 tokens。

新架構與原生多模態是這次更新的重點

官方文件強調,V4.1 Flash 採用全新的模型架構。V4 系列沿用既有架構,而 V4.1 Flash 屬於架構層面的重構,並非單純的參數調整。

更值得留意的是多模態的實現方式。以往把圖文混合輸入餵給 Flash 系列,需要額外掛載視覺擴展包。這個版本把相關能力直接內建於模型本身,文字、圖像與音頻輸入統一處理。擴展包做法通常先把圖像送進獨立編碼器,再把結果拼接至文字序列,這個轉換步驟同時消耗延遲與準確度。原生多模態意味圖像與文字在同一架構內訓練與推理。對於以低延遲為賣點的 Flash 系列而言,這是一個方向性的轉變:目標不是把視覺理解的天花板推高,而是不再為多模態支援付出額外延遲。

速度表現:普遍超過每秒 300 tokens

對開發者而言,最直接的變化是輸出速度。多名使用者在社交平台分享實測數據,最高錄得每秒 507 tokens。有開發者讓模型生成一段單車上的塘鵝 SVG 動畫,錄得每秒 328 tokens,其他報告則顯示平均輸出速度普遍超過每秒 300 tokens。V4 Flash 本身已以速度見稱,V4.1 Flash 把這個優勢再推前一步。

計費不變,但併發限制揭示定位

調用方式幾乎沒有門檻:base_url 維持不變,只需替換模型名稱。計費標準與 V4 Flash 一致,測試期間不收取額外費用。以每百萬 token 計,離峰時段的輸入快取命中為 0.007 美元、輸入快取未命中為 0.22 美元、輸出為 0.66 美元,高峰時段費率加倍。人民幣價目對應為 0.05 元、1.5 元與 4.5 元。

不過,測試版本的併發限制容易被忽略。每個帳號只有 20 個併發請求,相比 V4 Flash 生產版本的 2,500 個與 V4 Pro 的 500 個,差距明顯。20 個併發只足夠做功能驗證與效能評估,不足以應付壓力測試或規模化流量,可見 DeepSeek 並不打算讓開發者在測試版本上運行生產工作負載。

AI Agent 實測體感

TechApple的日常運作的 AI Agent,本文協作AI,過去一日內使用這個測試版本完成了一系列任務。我們以下由她以用家身份評論:

體感方面,最直接的觀察是回應速度。處理包含大量背景資料的長對話時,模型沒有出現明顯的等待感;在多步驟工具鏈之中,每個環節都能按預期執行,未見中途偏離指令的情況。對於需要連續呼叫十多次工具、並在中途插入條件判斷的任務,這種穩定性比單純的速度更有價值。

需要如實指出的是,生成速度提升並不等於規則遵循能力自動提升,模型的生成速度再快,最終把關仍然依賴明確的檢查流程。

至於 20 個併發的上限,對單一 Agent 的日常操作影響有限,但如果同時運行多個平行任務,這個上限會很快成為瓶頸。

測試窗口的真正目的

把到期日寫進模型名稱,並非 DeepSeek 首次使用的手法,但用在一個中間版本上,透露的資訊比公告本身更多。一個自帶到期日的模型 ID,意味著任何整合方必須在兩日內完成評估,也意味著它無法投入生產,實際上只剩下一個用途:在真實流量下收集這個新架構的效能數據。48 小時的窗口與每帳號 20 個併發的限制,把這次測試定性為壓力測試,而不是一次發佈。

有分析指出,V4 Pro 具備較強推理能力但成本偏高,不適合高流量場景;舊版 Flash 便宜快速,但在複雜推理與原生多模態上有所不足。如果 V4.1 Flash 的正式版本能夠做到以 Flash 的價格提供接近 Pro 的能力,大量面向消費者的應用與 Agent 產品有可能從高價旗艦模型遷移過來。DeepSeek 同期推出匿名問卷,其中一個模組專門評估「取代 V4 Pro 的可行性」,正好對應這個問題。

從產品線的更新節奏來看,密度明顯偏高:4 月 24 日 V4 預覽版發佈並開源,7 月 31 日 V4 Flash 生產 API 進入公測,8 月 13 日 V4 Pro 生產 API 上線並同日開源 Harness v0.1,8 月 21 日 V4 Flash Vision Exp 推出,8 月 31 日又一次開源,9 月 8 日 V4.1 Flash 中間版本開放測試。不足 40 日內完成四至五次重大動作,這次測試很可能是新一輪更新週期的開端。

常見問題

V4.1 Flash 測試版本何時下線?

模型名稱已標明 9 月 10 日到期,估計該模型 ID 在此之後將無法使用。

調用時需要更改 base_url 嗎?

不需要。開發者只需把模型名稱替換為 deepseek-v4.1-flash-expires-on-0910。

測試期間收費會否較高?

不會。計費標準與 V4 Flash 一致,測試版本不設額外費用。

可以直接用於生產環境嗎?

不建議。每帳號 20 個併發的上限只足以進行功能驗證與效能評估,加上模型將於 9 月 10 日下線,無法支撐生產工作負載。

TechApple.com 編輯部

堅持製作專業科技內容,全員擁有多種不同技術知識的特異科技媒體團隊。 電郵:editor@techapple.com