← 返回 Siami 首頁

Manifest 撤掉自家 LLM Router:當快取與一致性比省錢更重要

▲ 127 💬 81
Manifest 撤掉自家 LLM Router:當快取與一致性比省錢更重要

編按:本文綜合整理自 Manifest 工程部落格Hacker News 討論串HuggingFace 路由相關論文,並加入 Siami 編輯部觀點與分析。

Manifest 砍掉自家 LLM Router:四個月七千用戶實戰後的反思

LLM gateway 公司 Manifest 在 7 月 31 日發表了一篇罕見的「反向」工程文:他們在 3 月推出 LLM Router,6 月宣告棄用,並預計 9 月 1 日徹底關閉。當整個產業還在比拚「我的 router 能省多少錢」的同時,這家公司直接把產品線砍掉,並且公開解釋為什麼。

文章作者 Bruno Perez 開宗明義:「我們不再相信 model routing。對大多數使用情境來說,鎖定一個經過實戰考驗的模型,仍然是最好的做法。」

這篇文章在 Hacker News 上一小時內衝到 127 分、81 則留言,是近期 AI 基礎設施類文章罕見的熱度。Siami 認為它的價值不在於結論對錯,而在於揭露了 router 商業模式背後的隱藏成本。


為什麼這件事重要

2026 年是 LLM Router 的爆發年。從 HuggingFace 收錄的 R2-RouterSkillOrchestraTRACERCluster-Route-Escalate,arXiv 上半年就有超過 20 篇 router 相關論文。商業端更熱:Inworld AI 的 router 評比 列了 8 家主流方案、ClawRouter 標榜省 92%、Eden AI 整理的 2026 十大 router 已是各家業務必備素材。

在這股熱潮中,一家已經做出 router 並實際上線的公司跳出來說「我們撤了」,這比再多一篇「router 省錢 78%」的行銷稿都更有資訊密度。Manifest 不是旁觀者評論,是帶著七千個雲端用戶、四個月的生產數據在說話。

更關鍵的是,他們的論點剛好打在 2026 年 LLM 成本結構的痛點上:當 Anthropic prompt caching 可以把系統提示與對話歷史的讀取成本壓到 75-90% 折扣時,router 原本承諾的「把簡單任務丟去小模型」這條路,突然變得沒那麼必要了。


四個撤掉 router 的核心理由

1. 複雜度無法只從 prompt 推斷

Perez 舉了一個例子:使用者輸入「評估 $GIT_REPO 的測試並改進它」。如果 $GIT_REPO 是一個 HTML5 個人網站,這是一個幾秒鐘的任務;但如果目標是 Linux kernel repo,那就是完全不同的世界。

router 在看到 prompt 的那一瞬間,無法知道背後那個「簡單」任務的真實複雜度。很多決定複雜度的 context(要呼叫哪些工具、要讀哪些檔案)是在 prompt 之後才浮現的。Router 在第一時間做的判斷,本質上是在猜。

2. 快取比 routing 更省錢

Anthropic、OpenAI 等主流 provider 都已支援 prefix cache(系統提示 + 對話歷史的快取讀取),折扣幅度通常在 75% 到 90% 之間。對大多數 agent 應用來說,系統提示本身就佔了 prompt 的大部分 token 數。

這造成一個尷尬的現象:一個聰明的 cache-aware router 會自動幫同一個 session 黏住同一個模型,因為換模型會讓 prefix cache 失效。換句話說,這個 router 為了把成本降到最低,最有效的做法就是——不做 routing。Perez 諷刺地說:「router 會透過不做它的本份,來完成它的任務。」

3. Routing 破壞工程師對模型行為的掌握

文章引用了一句被工程師社群反覆引用的話:「工程師不應該在意選哪個 LLM。」Manifest 對此強烈反對。

他們主張,就像畫家要知道哪支筆適合畫什麼、匠人要選對工具一樣,工程師也應該了解每個模型的長處與短處。在 Manifest,每位工程師都會根據任務意圖主動挑選模型與 effort 參數,而不是交給自動 router 決定。

當 session 中途從 GPT-4o 換成 Claude、再換成 DeepSeek 時,工程師會失去對「這個 prompt 應該長什麼樣」的直覺。整體工作品質下降,人也無法真正熟悉自己手上的工具。

4. 不可預測性本身有成本

沒有人喜歡不可預測,軟體工程師尤其討厭。在自動化 agentic workflow 或自主代理中,多一層不確定性的管理成本,往往比省下的 token 還貴

評估怎麼做、system prompt 怎麼寫、觀測性怎麼設計——這些原本已經夠難的工程問題,在 router 介入後全部變得更難。Manifest 結論是:明確隔離不同請求、為每種任務設定專屬模型與參數,在多數情境下都比較好。


為什麼 router 派會反駁

Siami 認為不能只聽一面之詞。Router 派的核心反駁大致有三條:

  • HuggingFace 2026 論文 Cluster-Route-Escalate 報告在 coding 任務上達到最強模型 97-99% 準確率、延遲降低 18%**。這是在 CodeRouterBench benchmark 上的硬數字,跟 Manifest 的「生產數據」是不同維度的證據。
  • 多模型 fallback 是 reliability 而非 cost 議題。Simbian 在 2026 年的 LLM Router CISO 文章 指出,當某家 provider 當機或限流時,router 是企業級 AI 部署的風險控制基礎設施,不是省錢工具。
  • 簡單 trained router 的 overhead 極低Medium 上的 LLM 路由指南 提到,基於 Qwen 1.75B 這類小模型的分類器,單次推理成本接近 0,整體開銷 < 1%。

換句話說,Manifest 的批評主要打的是**「router 替你做認知決策」這條路徑,但「router 當 failover / provider abstraction」**這條路徑他們其實沒否定。


數據解讀 / 質疑

Manifest 的案例有兩個值得追問的地方:

第一,樣本偏差。Manifest 的七千用戶主要是透過他們的 cloud gateway 存取 LLM 的開發者,這群人很可能本來就會手動挑模型。Router 對他們而言是冗餘的。但對於企業內部沒有 AI expert 的業務團隊(用 Notion AI、客服 chatbot 這類場景),router 可能是救命工具。

第二,時間點偏頗。Manifest 推出 router 的 3 月,Anthropic 還沒全面開放 prompt caching,OpenAI 的 cached input 計費也才剛上線。如果他們今天才推出 router,也許結論會不同。這也是為什麼 Manifest 文章標題用「我們撤掉了」而不是「router 無用」——他們沒說 router 永遠不行,而是說在他們的時空背景下,特定形態的 router 不值得做

第三,HN 上的 overgard 留言 點出一個殘酷事實:「模型每週出一個新版本,工程師根本沒時間學」,所以 Manifest 那種「工程師手動精通每個模型」的理想,在 2026 年的 release cadence 下其實不切實際。遊戲工作室的 drusepth 用隨機抽樣並排瀏覽的方式,比較像現實世界的妥協解。


Siami 觀點:省錢不是 router 唯一的故事

Siami 編輯部認為這篇文章真正的價值,是把**「router 成本效益分析」**從「行銷話術」拉回「工程實證」。

在 2026 年的 LLM 開銷結構下,prompt cache 的折扣幅度已經逼近 router 的最佳省錢效果。再疊加模型品質差異化的縮小(cyanregiment 在 HN 觀察「頂級模型之間其實沒什麼差距」),router 的護城河正在快速消失。

但這不表示 router 會消失。Siami 認為未來一年 router 會從「省錢工具」演化成「可靠性基礎設施」

  • Multi-provider failover(避免單一 provider 當機)— 企業級剛需
  • Schema-based routing(見 HuggingFace 2603.26728 論文)— 把結構化輸出驗證整合進路由決策
  • CISO 控制面Simbian 觀點)— 風險集中度管理

Manifest 砍掉的是 router 的「成本故事」,但 router 還有「可靠性故事」可以講。他們沒否定後者,只是選擇不再做前者。


編按:本文綜合整理自 Manifest 工程部落格Hacker News 討論串HuggingFace 路由相關論文,並加入 Siami 編輯部觀點與分析。

網友熱門留言 (5)

#1 HN @overgard 0
我很懷疑這個論點。實務上誰有時間每週研究新模型?不知道訓練細節就直接挑模型,根本是把義大利麵往牆上丟,而且那個義大利麵還可能很貴、把 bug 偷偷塞進你的 code base。
#2 HN @drusepth 0
我在我們遊戲工作室的 AI router 上加了一個功能:隨機抽樣 prompt 同時丟給所有支援的模型產生結果,開發者可以並排瀏覽輸出。越來越熟悉每個模型的強項後,我越來越不相信通用 router 能幫我有效分流。
#3 HN @jurgenburgen 0
我有一個挑模型的心法:公司已經決定 provider,所以我直接打開 harness 的 model picker,選最貴那家的最新版本、調到最高 effort setting。這招很省時間。
#4 HN @mrkeen 0
程式設計師的工作就是宣告『我了解這個問題到能教電腦解決它的程度』。如果連程式設計師都難以推理,我更不相信坐在旁邊的同事能把它自動化掉。
#5 HN @cyanregiment 0
那些「好的模型」之間其實沒什麼競爭差距,定價和行銷吹得比實力還兇。有些任務用本地 Mistral 7B 這種弱模型就夠了,要 OCR 這類工作才需要強模型。