編按:本文綜合整理自 VentureBeat 報導、vLLM 官方部落格、開源模型索引 openlm.ai,以及 Hacker News 第一手開發者討論,並加入 Siami 編輯部觀點與分析。
北京 AI 公司 Moonshot 於 7 月 16 日正式開源旗下旗艦模型 Kimi K3,總參數量高達 2.8 兆,整體具備原生視覺理解與百萬級上下文;28 日深夜再為 Kimi Code 編程介面補上 K3-256k 變體,把「256K 上下文 + 長程 Agent」當作主要賣點,重新鎖定工程師日常的場景。這則消息在 Hacker News 累積超過 478 點支持、衝上熱門榜前三名,也是本輪編輯部挑選的標的。
Kimi K3 的核心架構亮點
K3 並非單純放大既有模型,而是結合兩項 Moonshot 自家研發的注意力技術:
- Kimi Delta Attention(KDA):以差分方式壓縮歷史快取,讓長上下文場景下的記憶體與推論成本不再線性爆漲。
- Attention Residuals(AttnRes):在標準 Transformer 殘差流中間插入輕量注意力分支,避免深層模型難以收斂的老問題。
- Stable LatentMoE:總參數 2.8 兆,但每次前向推論只啟動 16 個專家(總計 896 個),稀疏率達到 1.79%。
換言之,「2.8 兆」聽起來很嚇人,實際運行只比一般 30B 稠密模型更省資源。也因為這樣,K3 才能撐起 256K 標準、1M 進階的上下文而不會讓記憶體爆炸。
K3-256k 變體:為編程 Agent 而生
Moonshot 同步在 Kimi Code 文件站上線 K3-256k 這個變體,預設走 256K 上下文與長程 Agent 工作流,與 1M 版本相比,犧牲部分極限長度,換來更穩定的編碼體驗。官方列出幾個關鍵場景:
- 跨檔案大型重構
- 多步驟除錯與回歸測試
- 長篇規格書/需求文件一次餵入
- 多人協作的程式碼審查自動化
對已經用過 Claude Code、Cursor 之類工具的開發者來說,K3-256k 最大的吸引力是「換模型不換工具」:只要在 Provider 介面切換到 kimi-k3-256k,原本的編程助理外殼幾乎不用改。Hacker News 上已經有開發者回報,30 秒就完成從 Claude Code 切到 K3。
為什麼這件事重要
這是 Moonshot 第一次在「開源旗艦 + 長上下文 + 編程 Agent」三個面向同時擠進第一梯隊。VentureBeat 整理的基準數字相當刺眼:
Humanity’s Last Exam(with tools)44.9%,贏過 GPT-5 的 41.7%、Claude Sonnet 4.5 的 32%;BrowseComp 60.2%,同樣壓過兩家美國旗艦。
但真正的訊號不是單一 benchmark,而是 K3 在 LMArena 的「前端程式」擂台上超越 Opus 4.8、Cost-per-task 卻只要其三分之一。Moonshot 從 K2 開始鎖定「程式碼長任務」這條路線,到 K3 終於把性價比、上下文、視覺三項要素一次補齊。對 Anthropic 而言,這也是為什麼其在 7 月緊急把 Opus 4.8 / Sonnet 4.5 端出一系列價格攻防戰的原因之一。
對台灣、中國的開發團隊來說,這代表長上下文編程不再被 OpenAI / Anthropic 寡佔。本地化部署、合規審查、垂直行業微調,都能直接拿到一份能在自己機房跑的旗艦基模。
計價、商業模式與「偽開源」疑慮
VentureBeat 確認 K3 的 API 公開牌價如下:
- 輸入:每百萬 token $3.00
- 輸出:每百萬 token $15.00
- 快取命中:每百萬 token $0.30
帳面上看,輸出價格只有 Claude Opus 4.8 的六成,但社群很快發現 Moonshot 的「開源」其實有但書:整組權重大約 1.5 TB,可在 Hugging Face 下載,但商用條款屬於自訂商業授權(custom commercial license),並不符合 OSI 對「open source」的嚴格定義。換句話說,企業若想拿權重做衍生微調、甚至直接拿來賣 SaaS,得先讀一遍 Moonshot 的白紙黑字。
- 權重下載:Hugging Face
moonshotai/Kimi-K3-Instruct(約 1.5 TB) - 線上 API:Moonshot 官方平台、Kimi Code、各大雲端轉售
- vLLM 開源推理:vLLM 已於 7 月 22 日釋出生產級預覽,本地部署方案大致完備
「開源」兩個字在 2026 年的紅海市場越來越模糊,K3 的角色更接近『可下載的旗艦』,而不是 Llama 3 那一類 Apache 2.0 開源。企業法務端要小心。
數據解讀與質疑
- 關於 44.9% HLE 分數:這個 benchmark 容易被針對性訓練而灌水,r/mlscaling 上不少工程師提醒「模型可能在訓練集見過類似題」。Moonshot 雖提供完整技術報告,但社群仍要求揭露訓練資料去污染流程。
- 關於 1M context:Moonshot 官方說「真的能跑滿 1M」,但 vLLM 預覽版的實測多落在 200K–400K 就開始掉專注度。K3-256k 變體之所以存在,正是因為 1M 在實際 agent 工作流中不夠穩定。
- 關於 API 價格的誤導:$15/M 看似便宜,但 K3 對長任務的思考(reasoning)tokens 計算方式不像 Claude 那樣透明,要跑過一輪才知道實際帳單。HN 上「Kimi K3 is not cheap」這篇討論串就是圍繞這點。
- 關於「擊敗所有美國模型」:這是 Reddit / X 上少數誇張說法,原始 benchmark 跟 Arena 排名只能說明在「特定編程子項目」上 K3 領先,並非所有基準通用冠軍。
後續觀察重點
- 企業法務是否接受 Moonshot 自訂授權、能否在 vLLM 之外找到更順暢的部署管線。
- Anthropic 與 OpenAI 在 8 月會端出什麼對應牌:Claude Fable 5、GPT-5.5、還是 Gemini 3.6 全家族都到齊?
- 台灣的在地雲端(中華電信、台灣大哥大雲端)是否會引進 K3 作為企業代理服務。
- 256K 與 1M 在不同工作流的甜蜜點:到底是寫中型 repo 時用 256K 就好,還是大型 monorepo 必須衝 1M。
編按:本文綜合整理自 VentureBeat 報導、vLLM 官方部落格、openlm.ai 模型索引、Hacker News 第一手討論串,並加入 Siami 編輯部觀點與分析。