編按:本文綜合整理自 DeepSeek 官方 API Change Log(2026-07-31)、並以 Artificial Analysis 第三方模型分析 作為量化基準交叉驗證;網路回應引自 Hacker News 討論串。最後加入 Siami 編輯部觀點與分析。
事件概要:0731 正式版 API 進入公開測試
DeepSeek 於 2026 年 7 月 31 日透過官方 API 文件釋出 DeepSeek-V4-Flash 正式版(標記為 0731)——呼叫方式跟過去的 Preview 完全相同,只要把模型名設為 deepseek-v4-flash 就會路由到新版。
這次更新最關鍵的訊息在 changelog 第二段:「0731 保留與 Preview 完全相同的模型架構與參數量、只重新做後訓練」。換句話說,這不是又一次預訓練換代、而是 DeepSeek 把同一組基礎權重再 distill / post-train 一輪——這種「只換後訓練權重、不動架構」的升級方式,跟傳統大模型公司動輒換代、要求客戶重灌 SDK 的做法完全不同。
另一個被官方單獨標注、但容易在長串 benchmark 數字中被忽略的訊息是:「此更新僅升級 V4-Flash API;V4-Pro API、APP/WEB 模型都沒有變動」——這是 DeepSeek 在「V4-Pro 正式版即將在近期釋出」聲明之外、給出最明確的版本切割。
官方公告的九項 Coding Agent 基準分數
DeepSeek 這次沒有發 PR、沒開發表會,直接把 benchmark 表嵌進 Change Log。九個分項成績如下(全部以 DeepSeek 自家 Harness 跑):
- Terminal Bench 2.1:82.7
- NL2Repo:54.2
- Cybergym:76.7
- DeepSWE:54.4
- Toolathlon verified:70.3
- Agent Last Exam:25.2
- Automation Bench(Public):25.1
- DSBench-FullStack(內部):68.7
- DSBench-Hard(內部):59.6
官方特地留了兩條註解:
Note 1:公開基準集中、凡是 Code Agent 任務,官方 V4-Flash 都用「DeepSeek Harness minimal mode」(即將開源)作為框架,以 max effort 等級、topp=0.95、temperature=1.0 跑出。 Note 2:DSBench-FullStack 是內部全端開發測試集、DSBench-Hard 是內部 Coding Agent 難題測試集——這兩項沒有公開第三方對標。
另外官方文件也明示:官方 V4-Flash 原生支援 Responses API 格式、且專門為 Codex 調校——這是繼 OpenAI 之後、又一家把 Responses API 視為 agent 時代標準介面的公司。
HN 社群的真實反應:熱議、質疑、跟 OpenAI 的橫向比較
這個 changelog 在 Hacker News 拿下 266 分、112 則留言(撰稿時已升至 299 分、38 則有效樹枝內回應)。討論串最熱門的兩個子題分別是「這次升級到底跨了多少」、以及「跟 GPT-5.6 Terra 能不能直接比」。
dnhkng 把官方 benchmark 整理成一張表後、往下延伸對比 OpenAI 的 GPT-5.6 Terra:Terminal Bench 82.7 vs 78.4、Toolathlon 70.3 vs 53.1 都由 Flash 領先;但 DeepSWE 54.4 vs 69.6、Agents’ Last Exam 25.2 vs 50.4 由 Terra 拿下。
Iolaum 隨即拋出最尖銳的質疑——「他們是用自家 Harness 跑的,這樣對比公平嗎?」
NitpickLawyer 反駁:「他們是在比同一個架構、同一組預訓練權重、只換後訓練,這根本就是世界上最『蘋果對蘋果』的對比;Flash vs Terra 對比確實基準不齊,但官方已經寫明原生支援 Responses API、且為 Codex 調校,就等第三方同框架實測。」
這條 HN 子討論的結論有兩個共通點:
- 0731 vs Preview 是公平對比(架構不變、後訓練換一輪)。
- Flash vs GPT-5.6 Terra 需要等 DeepSeek Harness 開源才有第三方同框架成績。
另一位評論者 throwaw12 用一句話總結了市場期待:「開放權重的 Flash 用 Sonnet 等級的實際表現、賣 GPT-3 時代的價格——只要真實工作量測能撐住,就是 dev tool 圈的又一個里程碑。」
為什麼這件事重要
把這次「只重新後訓練一輪」的事件放回整個 2026 下半年中國 AI 模型的時間軸,會浮現三條很少被放在一起看的線索。
1. 中國 AI 公司第一次把「純後訓練升級」當成行銷主軸
過去兩年中國 AI 廠商的標準劇本是「新模型+新架構+萬卡訓練」——每次對外發表都會捲起參數量、訓練 token、H800 數量的數字軍備。DeepSeek 這次反其道而行:架構不動、權重不動、只跑一輪後訓練。
這跟 Anthropic 的 Claude Sonnet / Opus 線、OpenAI 的 GPT-5.x 系列「透過後訓練反覆推出新版」的玩法非常接近——差別在 DeepSeek 把這件事公開講清楚、並且把 benchmark 跟註解都放進 Change Log、而不是用一篇行銷稿包裝。
2. 自家 Harness 加上「Responses API 原生支援」,預告 Agent 工具鏈的下一階段
DeepSeek 把 benchmark 全部用 自家 Harness 跑、且把「V4-Flash 為 Codex 調校」列為官方聲明——這把過去一年模型廠商的玩法明確化:
- 第一階段:只丟權重。
- 第二階段:丟模型 + 推論框架(vLLM、SGLang、TGI)。
- 第三階段(現在):模型 + Agent Harness + Responses API 介面必須成套出貨。
也就是說,未來的 dev tool 廠商必須考慮「用哪一套 model + harness + tool-call schema」,而不是只看 benchmark。dnhkng 在 HN 上那句「未來的玩法應該是『模型+Harness 同步釋出』」正是這個趨勢的社區自發總結。
3. 「V4-Pro 近期推出」是把 Cloud API 戰線再次拉進中國內戰
DeepSeek 在 Change Log 最後一段寫得直白:「官方版 V4-Pro 將在近期釋出」——這個時間點落在 0731 Flash 公開測試之後、政治意義遠大於技術:
- 7 月 27 日梁文鋒才因外洩逐字稿事件、被迫「緊急暫停第二輪 710 億美元融資」(詳見 Siami 7/27 報導);
- 8 月初即將推出 V4-Pro 正式版、意味 DeepSeek 在估值暫停的同時、還是選擇用產品動能回應外界對「中國 AI 算力差距」的質疑。
對 OpenAI、Anthropic 而言,V4-Pro 正式版公開釋出那天、就是中國 top-tier 模型第一次在「同一個月內」跟 GPT-5.x 跟 Claude Opus 5 正面交鋒。
數據解讀與質疑:哪些數字可以直接信、哪些要打折扣
官方 benchmark 表看起來漂亮,但 「同框架 vs 不同框架」的差別 會直接影響讀者該如何解讀這九項分數。
可以直接信的數字(同一個架構、同一組預訓練權重、只換後訓練):
- Terminal Bench 2.1:Preview 的 56.9 → 0731 的 82.7(+25.8)。
- Toolathlon verified:51.8 → 70.3(+18.5)。
- NL2Repo、Cybergym、DeepSWE 三項也都有對應 Preview 期可對照的相對幅度。
要打折扣的數字(橫向跟其他模型比較時):
- DSBench-FullStack 68.7 跟 DSBench-Hard 59.6:DeepSeek 內部測試集、沒有公開對標——沒人可以驗證、也沒人可以反駁。
- 拿 0731 Flash 的 Terminal Bench 82.7 直接 vs GPT-5.6 Terra 的 78.4:對比時的推論框架、agent loop、tool-call schema 未必一致——NitpickLawyer 在 HN 上點出,DeepSeek 已宣告「原生支援 Responses API、並為 Codex 調校」,未來第三方用同框架實測、才是真的同台比分數的時刻。
一個不容易從官方資料解讀出來的訊號是「DeepSeek-V4-Pro 仍要再等」——V4-Pro Preview 自今年 4 月 24 日上線後、遲未釋出正式版;0731 Flash 升級的同時、Pro 維持不動,這本身是商業策略訊號,DeepSeek 正在把 Cloud API 的高階戰線保留給接下來的 Pro 正式版、避免一發就把牌出完。
接下來值得追蹤的三件事
- DeepSeek Harness 是否會釋出開源版本——HN 討論串多次點到「等 Harness 開源才能做公平對標」,目前官方只說「即將釋出」、沒有時程。
- DeepSeek-V4-Pro 正式版發表日——一旦定檔,就是中國 Cloud API 進入新一波價格/性能肉搏戰的起點。
- Codex 是否把 DeepSeek-V4-Flash 列為原生支援模型——官方已宣告「為 Codex 調校」,下一步是 OpenAI 把 Flash 列入 Codex CLI 的可選模型清單——這會是 dev tool 圈最關鍵的相容性訊號。
編按再提醒:上述九項 benchmark 全部以 DeepSeek 自家 Harness 跑出,不等於第三方用公開框架實測的同樣分數;讀者引用 Terminal Bench、Toolathlon、Cybergym 數字時,建議加上「DeepSeek 官方公布」出處註明。
網友熱門留言 (5)