編按:本文綜合整理自 Fireworks AI 官方部落格、MarkTechPost 報導、Digital Applied 分析,並加入 Siami 編輯部觀點與分析。
Ember-1:少一半 Token,同樣答案
Fireworks Research 在 2026 年 9 月 23 日推出 Ember-1,這是一款基於 Moonshot AI Kimi K3 後訓練(post-training)的精煉模型,主打少用 40% Token、保留 K3 等級品質。Fireworks 同時宣布這是「Specialized Intelligence」系列的開端,未來會持續推出針對特定用途優化的精煉模型。
Ember-1 在多項外部基準、兩家企業客戶的生產環境 A/B 測試,以及 Fireworks 內部工程師的日常程式開發工作負載上都通過驗證,品質與原版 K3 持平甚至略勝。對需要大量自動化程式開發、又想壓低 Token 成本的公司,這是目前性價比最高的選項之一。
Ember-1 是怎麼煉成的
使用者告訴 Fireworks:「我們想要 K3 的程式能力,但不想付那麼多錢。」問題在於 K3 的長思考鏈(reasoning trace)讓自動化程式開發在成本上吃不消。直接調低 K3 的 reasoning effort 也無效——品質掉太多。
要兼顧品質與 Token 預算,只能重新訓練。Fireworks 團隊跑了超過 50 組訓練實驗、超過 200 次評測,並開發新的訓練演算法讓模型學會「不要想太久」。整個過程都在自家的 Fireworks Serverless Training 平台上完成——不用自己管 GPU 叢集,有想法就能立刻開跑實驗,研發到上線的時間與成本都大幅壓縮。
訓練資料涵蓋數學、程式、指令遵循、對話、搜尋、工具使用、軟體工程等多元任務,並刻意收集單一任務與多輪互動的混合樣本。最終成果:在七個基準與兩家客戶的真實流量中,K3 的推理長度可以縮短 35–50% 而不犧牲正確率。
問題的本質:推理模型想太多
像 Kimi K3 這類推理模型,九成以上的 Token 都花在內部推理,而非最終答案。這個結構對單次請求來說成本已經偏高,在多輪代理(agentic)工作負載上更是災難——每一輪都會把所有先前的推理重新讀進 context,隨著輪數增加,context 長度會呈二次方成長。
K3 想很多,但很多時候是想得比任務需要的多。
Fireworks 內部實驗證明,這些「多餘的推理」其實可以完全不影響答案地被移除。這正是 Ember-1 的核心思路:保留 K3 的有效推理,剔除無效的部分。
但並非所有 K3 推理都是浪費——部分反思行為(revisiting assumption、responding to feedback、tracing outcome back)有助於模型從錯誤中恢復。Ember-1 的訓練目標就是「保留反思、剔除廢迴圈」。
Specialized Intelligence Index:Ember-1 在 Bedside Bench 設下新 Pareto 前緣
Fireworks 本週同步推出 Specialized Intelligence Index(SII),用各行業專家打造的「真實工作任務」來比較開放、封閉、與精煉模型的表現。
在 Doximity 的 Bedside Bench(500 個臨床案例、10 個專科分類,醫師驗證)上,Ember-1 在「品質/成本」座標系中對所有對手設定了新 Pareto 前緣,包含 GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5。
換言之:在這個醫療推理場景,Ember-1 是當前最划算的選項。
跨產業基準:5 大主流 Coding 基準的全面驗證
Fireworks 在另外 5 個業界基準上比較 Ember-1 與原版 K3(K3 Low、K3 High、K3 Max)的「品質 vs 成本」。定價基準採公開 K3 API 牌價:uncached input $3/M、cached input $0.30/M、output $15/M。
| 基準 | N | K3 Low | K3 High | K3 Max | Ember-1 | Ember-1 vs K3 Max(成本變化) |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 89 | 76.4% | 77.6% | 80.9% | 82.0% | -51.9% / 少 $23.1 |
| SWE-bench Verified | 500 | 80.4% | 86.0% | 93.2% | 92.2% | -15.5% / 少 $68.1 |
| SWE-Interact | 75 | 6.7% | 13.3% | 21.3% | 20.0% | -32.5% / 少 $60.8 |
| DeepSWE 1.1 | 113 | 55.8% | 62.8% | 66.4% | 75.2% | -23.7% / 少 $126.9 |
| τ-2 Bench Airline | 50 | 64% | 64% | 64% | 66% | -5.9% / 少 $0.3 |
Fireworks 的結論是:「要讓 K3 變便宜,正解不再是調低 reasoning effort,而是直接換成 Ember-1。」
客戶驗證:真實生產環境的 A/B 測試
基準只是參考,真正的考驗是能不能扛住真實生產流量。Fireworks 與兩家客戶合作,在其程式開發工作負載上跑 A/B 測試:
- 兩個案例都達到約 35% Token 節省,品質持平
- 大多數下游產品指標(任務完成率、成功率、失敗率)持平甚至改善
- 其中一家客戶已將 Ember-1 部署到正式生產,並計劃逐步替換基礎模型
這是真正會讓 CFO 眼睛一亮的數字。
內部驗證:自家工程師「沒發現」換了模型
Fireworks 內部大量的程式開發流量都走自家推論服務。在客戶看到 Ember-1 之前,團隊先讓自家工程師在日常開發工作中實際使用,包含 vibe testing、規模化的真實任務。
最讓團隊驕傲的結果:沒有消息就是好消息。工程師在不知情的情況下繼續寫程式,沒有察覺底層模型已經換掉,同時消耗顯著較少的 Token。
對一個價值主張就是「同樣答案、更少 Token」的模型來說,無聲無息的內部切換就是最強的信號。
接下來會發生什麼
Ember-1 目前以 Research Preview 形式在 Serverless 上與原版 Kimi K3 並行提供。Fireworks 也推出新的「Research Releases」機制:開發者可以獲得為期兩週的 Serverless 試用期,依社群需求決定是否轉為永久模型。
同時 Fireworks 開放 Ember-1 的企業訓練支援——客戶可以用自有資料在自家場景下進一步優化模型。Fireworks Research 的長期路線是:「未來的開源模型不是『什麼都能做』,而是『專門做你的事』。」
為什麼這件事重要
Ember-1 不只是「同一個模型少花一點錢」這麼單純。它代表的是 AI 推論商業模式的一個分水嶺:
- 後訓練市場正式成形:當閉源巨頭(OpenAI、Google)與開源旗艦(Kimi K3、DeepSeek V4、GLM 5)把基準推高到一定水位後,「在這個基礎上做精煉」變成一門獨立生意。Fireworks 的 Serverless Training 平台讓企業客戶不必養 GPU 叢集就能享受自己的精煉模型。
- Token 經濟的轉折點:隨著代理式(agentic)應用普及,Token 消耗呈指數成長。能用一半 Token 達成相同品質的模型不只是省錢,而是直接決定一個產品能不能 scale。
- 「Specialized Intelligence」概念驗證:用 SII 這套「真實行業任務」基準(而非學術玩具基準)來評比模型,會逐漸成為企業採購的真實指標。對台灣 B2B AI 服務商來說,這是產品定位的參考座標。
- 中國開源模型的國際化管道:Ember-1 證明了中國頂尖開源模型可以透過美國 AI Infra 商的後訓練進入全球市場。Moonshot AI 提供基礎,Fireworks 提供客製化——這種分工會越來越常見。
對台灣開發者與新創來說,這個訊號很明確:與其追逐「更大的模型」,不如思考「更對的模型」。當 Llama、Qwen、Kimi 等開源基礎已經夠強時,下一輪的競爭會發生在精煉層。
數據解讀與質疑
1. Fireworks 的比較基準是否公允?Pareto 前緣是否名副其實?
Fireworks 在 Bedside Bench 上宣稱「Ember-1 設定新 Pareto 前緣,勝過 GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5」。但這個比較有三個值得追問的地方:
- Opus 5 的版本:Hacker News 上有用戶指出 Fireworks 引用的「Claude Opus 5」基準成績並沒有公開的 Opus 5.5 對應數據。要嘛 Fireworks 用的是某個內部版本,要嘛這個比較存在版本錯位問題。
- 價格計算基準:表格中的成本是依「K3 的牌價」計算,但實際企業合約可能有折扣。在 Fireworks 上 K3 與 Ember-1 牌價相同,所以省下的就是思考長度,而非價格差。這個細節在原文被刻意淡化。
- SII 是自家基準:SII 是 Fireworks 設計的基準,是否會偏向自家模型的優勢(如程式開發、Token 效率)需要觀察第三方的獨立驗證。
2. 「後訓練」並不等於「公開權重」
Ember-1 沒有公開權重、沒有 Hugging Face 模型頁、僅在 Fireworks Serverless 上提供。這跟「開源」完全不同。對在意資料隱私的企業,這是個紅旗。
同時,後訓練的具體演算法細節(loss function、reward shaping)Fireworks 並未公開。這讓「為什麼少 40% Token 仍能維持品質」成為一個黑盒子。
3. 35–50% Token 縮短是否真實?
官方數據是基於「K3 reasoning effort high / max vs Ember-1」的比較。但對真實使用者而言,K3 max 並不是預設設定——多數企業客戶已經在用 K3 high 或 K3 max。所以「vs K3 max」的對比雖然亮眼,但對多數用戶的「實際節省」可能比 35–50% 略低。
4. Kimi K3 的市場定位問題
Moonshot AI 在 2026 年 7 月推出 K3 時主打「2.8T 參數、1M context、頂級推理」,結果一個多月後 Fireworks 就能把 Token 成本砍掉 40%。這對 K3 的原始定位造成壓力——「頂級品質」與「頂級成本」開始被解耦,企業客戶也許會開始質疑「我們付的是 2.8T 的錢,還是 K3-max 的錢?」。
原始資料與延伸閱讀
- 官方部落格:Introducing Ember-1
- 官方公告 X:@FireworksAI_HQ
- SII 基準:Specialized Intelligence Index
- API 文件:Ember-1 API & Playground
- 第三方報導:MarkTechPost、Digital Applied
- Kimi K3 背景:Moonshot AI、OpenRouter
- HN 討論:news.ycombinator.com/item?id=49868830
網友熱門留言 (5)