編按:本文綜合整理自 DeepSeek 官方 API 更新紀錄、DeepSeek Hugging Face 模型卡與 Artificial Analysis 獨立評測,並加入 Siami 編輯部觀點與數據解讀。
DeepSeek 在 2026 年 7 月 31 日將 DeepSeek-V4-Flash-0731 推進公開測試。這次更新沒有擴大模型架構,而是針對既有版本重新進行後訓練,重點放在工具使用、程式開發與自主代理任務。官方資料顯示,新版在多項代理型基準上超越體量更大的 V4-Pro 預覽版;第三方評測則指出,它以極低 API 價格取得接近當前第一梯隊的綜合成績。
這項發布受到 Hacker News 高度關注,相關討論獲得近 500 分與超過 270 則留言。話題焦點不只是排行榜名次,而是「相同架構只靠後訓練,能把代理能力推進多少」,以及低價模型是否足以改變開發者配置 AI 工作流程的方式。
同一套架構,靠後訓練拉高代理能力
DeepSeek 官方說明,0731 版維持 V4 Flash 預覽版的架構與規模,更新僅發生在後訓練階段。模型總參數約 284B 至 305B,不同頁面因統計口徑而略有差異;Artificial Analysis 採用 284B,Hugging Face 權重頁則顯示約 304B。兩者一致指出每次推論啟用約 13B 參數,並支援 100 萬 token 上下文。
官方公布的代理與程式開發基準包括:
- Terminal Bench 2.1:82.7
- NL2Repo:54.2
- Cybergym:76.7
- DeepSWE:54.4
- Toolathlon-Verified:70.3
- Agents’ Last Exam:25.2
- AutomationBench Public:25.1
- DSBench-FullStack:68.7
- DSBench-Hard:59.6
其中 Terminal Bench 2.1 從預覽版的 61.8 提升至 82.7,並高於 V4-Pro 預覽版的 72.1;DeepSWE 從 7.3 升到 54.4,變化更為明顯。這些結果顯示,本次後訓練主要改善模型在多步操作、工具呼叫與軟體工程環境中的行動能力,而不只是增加一般問答知識。
官方也表示,公開程式代理測試使用尚待發布的 DeepSeek Harness minimal mode,設定為 max effort、top-p 0.95、temperature 1.0。這項條件很重要:框架、推理預算與工具環境都可能影響分數,因此不能把成績直接理解成所有 API 呼叫都會自然重現相同表現。
第三方評測:綜合指數升 10 分
Artificial Analysis 給予 DeepSeek V4 Flash 0731 的 Intelligence Index 50 分,比四月版本的 40 分增加 10 分。在該評測體系中,它與 Gemini 3.6 Flash 同分,距 GPT-5.6 Luna 與 GLM-5.2 僅 1 分,但仍落後開放權重前緣 Kimi K3 的 57 分。
代理型實務工作測試 GDPval-AA v2 的 Elo 從 1189 升至 1559;CritPt 增加 9 個百分點至 17%,SciCode 增加 5 點至 50%,Humanity’s Last Exam 增加 5 點至 37%,AA-LCR 增加 3 點至 66%,GPQA Diamond 則增加 1 點至 91%。整套 Intelligence Index 的輸出 token 使用量也由約 2.34 億降到約 2.06 億,減少約 12%。
然而,評測同時揭露一項容易被宣傳數字掩蓋的問題:AA-Omniscience 的整體正確率仍是 37%,改善主要來自模型較少在不確定時強行作答。其幻覺率由前代約 96% 降至 84%,雖然下降 12 個百分點,84% 仍然很高。也就是說,新版確實更懂得收斂,但並未因此成為可以無條件信任的事實引擎。
價格才是這次發布的破壞力
Artificial Analysis 列出的官方 API 定價為每 100 萬輸入 token 0.14 美元、輸出 token 0.28 美元;命中快取的輸入價格約為 0.0028 至 0.003 美元,相當於約 98% 折扣。該機構估算,完整跑完 Intelligence Index 的成本約 72.02 美元,並認為其每項任務成本比智能分數相近的 GPT-5.6 Luna 低約 60%。
這組價格對大量重複上下文的代理工作尤其有利。例如程式代理反覆讀取同一個程式庫、客服代理重複載入政策文件,或研究代理持續引用固定資料集時,快取折扣可能比單純的輸入單價更影響總成本。
不過,帳面單價不是部署成本的全部。實際使用仍須納入:
- 為取得高分而使用的 max effort 會增加輸出量與等待時間。
- 工具失敗後的重試可能放大 token 消耗。
- 長上下文雖支援 100 萬 token,但不代表所有位置都維持相同檢索準確率。
- 自行部署完整權重需要可觀的記憶體與工程成本,低 API 價格不等於低本地部署門檻。
數據解讀與質疑
官方與第三方結果都支持「0731 版代理能力明顯進步」,但兩組分數不能混為一談。DeepSeek 模型卡中的 Terminal Bench 2.1 為 82.7,Artificial Analysis 的同項結果則約為 79%;差距可能來自代理框架、提示設計、推理預算或測試版本。報導模型成績時,應同時標記測試者與條件,而不是只挑最高數字。
另外,DeepSeek 的 DSBench-FullStack 與 DSBench-Hard 是內部測試集,外界無法像公開基準一樣完整檢查題目污染、評分器與重現流程。即使官方分數有參考價值,也應給予公開第三方結果更高權重。Artificial Analysis 的測試相對獨立,但其 Intelligence Index 同樣是特定任務組合,無法代表中文寫作、企業私有資料或每一種真實代理工作。
參數數量也出現 284B 與約 304B 的不同標示,可能源自是否計入推測解碼模組或不同權重統計方式。在官方提供更完整技術報告前,最穩妥的描述是「約 300B 總參數、每 token 啟用約 13B」,避免把單一口徑當成毫無爭議的精確值。
為什麼這件事重要
這次更新的重要性,在於它示範了模型競爭不一定只能靠增加參數與訓練規模。DeepSeek 沒有更換主體架構,卻透過後訓練讓多項代理測試大幅成長,意味著資料設計、工具軌跡、獎勵模型與代理框架仍有很大的優化空間。對無法不斷擴張算力的新創與研究團隊而言,這是一條比「再造一個更大模型」更可行的路徑。
第二個影響是價格壓力。當接近第一梯隊的模型把輸入與輸出單價壓到每百萬 token 幾角美元,企業採用 AI Agent 的主要瓶頸會逐漸從模型費用轉向系統工程:如何限制權限、驗證輸出、追蹤工具行為、處理失敗重試,以及建立人工覆核。便宜會讓更多代理上線,也會放大錯誤代理造成的風險。
第三個影響是開放權重生態。模型已在 Hugging Face 以 MIT 授權釋出,讓研究者與部署團隊能檢查權重、量化模型及建立不同推論方案。只是完整模型規模仍大,本地運行並不等於一般消費級顯示卡即可輕鬆使用。開放權重降低的是授權與研究門檻,不會自動消除硬體門檻。
開發者現在可以怎麼做
DeepSeek 官方 API 的呼叫方式維持不變,模型名稱設定為 deepseek-v4-flash 即可使用最新版;新版也原生支援 Responses API,並特別針對 Codex 類工作流程進行適配。準備導入的團隊可以先做小規模、可回溯的試驗:
- 使用自家真實任務建立測試集,不以公開排行榜代替驗收。
- 分別測量成功率、總 token、延遲、重試次數與人工修正時間。
- 對檔案刪除、部署、付款及外部通訊等工具設定最小權限。
- 將模型的推理強度與任務風險綁定,不必所有請求都使用 max effort。
- 對事實性輸出保留檢索、引用與人工查核,尤其不要忽略 84% 幻覺率警訊。
DeepSeek 表示 V4-Pro 正式版將在後續推出。若 Pro 版也能延續 Flash 0731 的代理訓練成果,開放權重模型與封閉模型之間的性價比競爭可能再次升溫。在此之前,V4 Flash 0731 最值得關注的不是「排行榜第三」這個標籤,而是相同架構如何用後訓練換得更強行動能力,以及低價代理在真實環境中能否維持可靠性。
資料來源:DeepSeek API 更新紀錄|Hugging Face 官方模型卡|Artificial Analysis 模型頁|Hacker News 討論
網友熱門留言 (3)