編按:本文綜合整理自 Manifest 工程部落格、Hacker News 討論串、HuggingFace 路由相關論文,並加入 Siami 編輯部觀點與分析。
Manifest 砍掉自家 LLM Router:四個月七千用戶實戰後的反思
LLM gateway 公司 Manifest 在 7 月 31 日發表了一篇罕見的「反向」工程文:他們在 3 月推出 LLM Router,6 月宣告棄用,並預計 9 月 1 日徹底關閉。當整個產業還在比拚「我的 router 能省多少錢」的同時,這家公司直接把產品線砍掉,並且公開解釋為什麼。
文章作者 Bruno Perez 開宗明義:「我們不再相信 model routing。對大多數使用情境來說,鎖定一個經過實戰考驗的模型,仍然是最好的做法。」
這篇文章在 Hacker News 上一小時內衝到 127 分、81 則留言,是近期 AI 基礎設施類文章罕見的熱度。Siami 認為它的價值不在於結論對錯,而在於揭露了 router 商業模式背後的隱藏成本。
為什麼這件事重要
2026 年是 LLM Router 的爆發年。從 HuggingFace 收錄的 R2-Router、SkillOrchestra、TRACER 到 Cluster-Route-Escalate,arXiv 上半年就有超過 20 篇 router 相關論文。商業端更熱:Inworld AI 的 router 評比 列了 8 家主流方案、ClawRouter 標榜省 92%、Eden AI 整理的 2026 十大 router 已是各家業務必備素材。
在這股熱潮中,一家已經做出 router 並實際上線的公司跳出來說「我們撤了」,這比再多一篇「router 省錢 78%」的行銷稿都更有資訊密度。Manifest 不是旁觀者評論,是帶著七千個雲端用戶、四個月的生產數據在說話。
更關鍵的是,他們的論點剛好打在 2026 年 LLM 成本結構的痛點上:當 Anthropic prompt caching 可以把系統提示與對話歷史的讀取成本壓到 75-90% 折扣時,router 原本承諾的「把簡單任務丟去小模型」這條路,突然變得沒那麼必要了。
四個撤掉 router 的核心理由
1. 複雜度無法只從 prompt 推斷
Perez 舉了一個例子:使用者輸入「評估 $GIT_REPO 的測試並改進它」。如果 $GIT_REPO 是一個 HTML5 個人網站,這是一個幾秒鐘的任務;但如果目標是 Linux kernel repo,那就是完全不同的世界。
router 在看到 prompt 的那一瞬間,無法知道背後那個「簡單」任務的真實複雜度。很多決定複雜度的 context(要呼叫哪些工具、要讀哪些檔案)是在 prompt 之後才浮現的。Router 在第一時間做的判斷,本質上是在猜。
2. 快取比 routing 更省錢
Anthropic、OpenAI 等主流 provider 都已支援 prefix cache(系統提示 + 對話歷史的快取讀取),折扣幅度通常在 75% 到 90% 之間。對大多數 agent 應用來說,系統提示本身就佔了 prompt 的大部分 token 數。
這造成一個尷尬的現象:一個聰明的 cache-aware router 會自動幫同一個 session 黏住同一個模型,因為換模型會讓 prefix cache 失效。換句話說,這個 router 為了把成本降到最低,最有效的做法就是——不做 routing。Perez 諷刺地說:「router 會透過不做它的本份,來完成它的任務。」
3. Routing 破壞工程師對模型行為的掌握
文章引用了一句被工程師社群反覆引用的話:「工程師不應該在意選哪個 LLM。」Manifest 對此強烈反對。
他們主張,就像畫家要知道哪支筆適合畫什麼、匠人要選對工具一樣,工程師也應該了解每個模型的長處與短處。在 Manifest,每位工程師都會根據任務意圖主動挑選模型與 effort 參數,而不是交給自動 router 決定。
當 session 中途從 GPT-4o 換成 Claude、再換成 DeepSeek 時,工程師會失去對「這個 prompt 應該長什麼樣」的直覺。整體工作品質下降,人也無法真正熟悉自己手上的工具。
4. 不可預測性本身有成本
沒有人喜歡不可預測,軟體工程師尤其討厭。在自動化 agentic workflow 或自主代理中,多一層不確定性的管理成本,往往比省下的 token 還貴。
評估怎麼做、system prompt 怎麼寫、觀測性怎麼設計——這些原本已經夠難的工程問題,在 router 介入後全部變得更難。Manifest 結論是:明確隔離不同請求、為每種任務設定專屬模型與參數,在多數情境下都比較好。
為什麼 router 派會反駁
Siami 認為不能只聽一面之詞。Router 派的核心反駁大致有三條:
- HuggingFace 2026 論文 Cluster-Route-Escalate 報告在 coding 任務上達到最強模型 97-99% 準確率、延遲降低 18%**。這是在 CodeRouterBench benchmark 上的硬數字,跟 Manifest 的「生產數據」是不同維度的證據。
- 多模型 fallback 是 reliability 而非 cost 議題。Simbian 在 2026 年的 LLM Router CISO 文章 指出,當某家 provider 當機或限流時,router 是企業級 AI 部署的風險控制基礎設施,不是省錢工具。
- 簡單 trained router 的 overhead 極低。Medium 上的 LLM 路由指南 提到,基於 Qwen 1.75B 這類小模型的分類器,單次推理成本接近 0,整體開銷 < 1%。
換句話說,Manifest 的批評主要打的是**「router 替你做認知決策」這條路徑,但「router 當 failover / provider abstraction」**這條路徑他們其實沒否定。
數據解讀 / 質疑
Manifest 的案例有兩個值得追問的地方:
第一,樣本偏差。Manifest 的七千用戶主要是透過他們的 cloud gateway 存取 LLM 的開發者,這群人很可能本來就會手動挑模型。Router 對他們而言是冗餘的。但對於企業內部沒有 AI expert 的業務團隊(用 Notion AI、客服 chatbot 這類場景),router 可能是救命工具。
第二,時間點偏頗。Manifest 推出 router 的 3 月,Anthropic 還沒全面開放 prompt caching,OpenAI 的 cached input 計費也才剛上線。如果他們今天才推出 router,也許結論會不同。這也是為什麼 Manifest 文章標題用「我們撤掉了」而不是「router 無用」——他們沒說 router 永遠不行,而是說在他們的時空背景下,特定形態的 router 不值得做。
第三,HN 上的 overgard 留言 點出一個殘酷事實:「模型每週出一個新版本,工程師根本沒時間學」,所以 Manifest 那種「工程師手動精通每個模型」的理想,在 2026 年的 release cadence 下其實不切實際。遊戲工作室的 drusepth 用隨機抽樣並排瀏覽的方式,比較像現實世界的妥協解。
Siami 觀點:省錢不是 router 唯一的故事
Siami 編輯部認為這篇文章真正的價值,是把**「router 成本效益分析」**從「行銷話術」拉回「工程實證」。
在 2026 年的 LLM 開銷結構下,prompt cache 的折扣幅度已經逼近 router 的最佳省錢效果。再疊加模型品質差異化的縮小(cyanregiment 在 HN 觀察「頂級模型之間其實沒什麼差距」),router 的護城河正在快速消失。
但這不表示 router 會消失。Siami 認為未來一年 router 會從「省錢工具」演化成「可靠性基礎設施」:
- Multi-provider failover(避免單一 provider 當機)— 企業級剛需
- Schema-based routing(見 HuggingFace 2603.26728 論文)— 把結構化輸出驗證整合進路由決策
- CISO 控制面(Simbian 觀點)— 風險集中度管理
Manifest 砍掉的是 router 的「成本故事」,但 router 還有「可靠性故事」可以講。他們沒否定後者,只是選擇不再做前者。
編按:本文綜合整理自 Manifest 工程部落格、Hacker News 討論串、HuggingFace 路由相關論文,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (5)