← 返回 Siami 首頁

Moonshot AI 推出 Kimi K3-256k 變體 256K 上下文主打長程編程 Agent

▲ 261 💬 73
Moonshot AI 推出 Kimi K3-256k 變體 256K 上下文主打長程編程 Agent

編按:本文綜合整理自 VentureBeat 報導、vLLM 官方部落格、開源模型索引 openlm.ai,以及 Hacker News 第一手開發者討論,並加入 Siami 編輯部觀點與分析。

北京 AI 公司 Moonshot 於 7 月 16 日正式開源旗下旗艦模型 Kimi K3,總參數量高達 2.8 兆,整體具備原生視覺理解與百萬級上下文;28 日深夜再為 Kimi Code 編程介面補上 K3-256k 變體,把「256K 上下文 + 長程 Agent」當作主要賣點,重新鎖定工程師日常的場景。這則消息在 Hacker News 累積超過 478 點支持、衝上熱門榜前三名,也是本輪編輯部挑選的標的。


Kimi K3 的核心架構亮點

K3 並非單純放大既有模型,而是結合兩項 Moonshot 自家研發的注意力技術:

  • Kimi Delta Attention(KDA):以差分方式壓縮歷史快取,讓長上下文場景下的記憶體與推論成本不再線性爆漲。
  • Attention Residuals(AttnRes):在標準 Transformer 殘差流中間插入輕量注意力分支,避免深層模型難以收斂的老問題。
  • Stable LatentMoE:總參數 2.8 兆,但每次前向推論只啟動 16 個專家(總計 896 個),稀疏率達到 1.79%。

換言之,「2.8 兆」聽起來很嚇人,實際運行只比一般 30B 稠密模型更省資源。也因為這樣,K3 才能撐起 256K 標準、1M 進階的上下文而不會讓記憶體爆炸。


K3-256k 變體:為編程 Agent 而生

Moonshot 同步在 Kimi Code 文件站上線 K3-256k 這個變體,預設走 256K 上下文與長程 Agent 工作流,與 1M 版本相比,犧牲部分極限長度,換來更穩定的編碼體驗。官方列出幾個關鍵場景:

  • 跨檔案大型重構
  • 多步驟除錯與回歸測試
  • 長篇規格書/需求文件一次餵入
  • 多人協作的程式碼審查自動化

對已經用過 Claude Code、Cursor 之類工具的開發者來說,K3-256k 最大的吸引力是「換模型不換工具」:只要在 Provider 介面切換到 kimi-k3-256k,原本的編程助理外殼幾乎不用改。Hacker News 上已經有開發者回報,30 秒就完成從 Claude Code 切到 K3。


為什麼這件事重要

這是 Moonshot 第一次在「開源旗艦 + 長上下文 + 編程 Agent」三個面向同時擠進第一梯隊。VentureBeat 整理的基準數字相當刺眼:

Humanity’s Last Exam(with tools)44.9%,贏過 GPT-5 的 41.7%、Claude Sonnet 4.5 的 32%;BrowseComp 60.2%,同樣壓過兩家美國旗艦。

真正的訊號不是單一 benchmark,而是 K3 在 LMArena 的「前端程式」擂台上超越 Opus 4.8、Cost-per-task 卻只要其三分之一。Moonshot 從 K2 開始鎖定「程式碼長任務」這條路線,到 K3 終於把性價比、上下文、視覺三項要素一次補齊。對 Anthropic 而言,這也是為什麼其在 7 月緊急把 Opus 4.8 / Sonnet 4.5 端出一系列價格攻防戰的原因之一。

對台灣、中國的開發團隊來說,這代表長上下文編程不再被 OpenAI / Anthropic 寡佔。本地化部署、合規審查、垂直行業微調,都能直接拿到一份能在自己機房跑的旗艦基模。


計價、商業模式與「偽開源」疑慮

VentureBeat 確認 K3 的 API 公開牌價如下:

  • 輸入:每百萬 token $3.00
  • 輸出:每百萬 token $15.00
  • 快取命中:每百萬 token $0.30

帳面上看,輸出價格只有 Claude Opus 4.8 的六成,但社群很快發現 Moonshot 的「開源」其實有但書:整組權重大約 1.5 TB,可在 Hugging Face 下載,但商用條款屬於自訂商業授權(custom commercial license),並不符合 OSI 對「open source」的嚴格定義。換句話說,企業若想拿權重做衍生微調、甚至直接拿來賣 SaaS,得先讀一遍 Moonshot 的白紙黑字。

  • 權重下載:Hugging Face moonshotai/Kimi-K3-Instruct(約 1.5 TB)
  • 線上 API:Moonshot 官方平台、Kimi Code、各大雲端轉售
  • vLLM 開源推理:vLLM 已於 7 月 22 日釋出生產級預覽,本地部署方案大致完備

「開源」兩個字在 2026 年的紅海市場越來越模糊,K3 的角色更接近『可下載的旗艦』,而不是 Llama 3 那一類 Apache 2.0 開源。企業法務端要小心。


數據解讀與質疑

  • 關於 44.9% HLE 分數:這個 benchmark 容易被針對性訓練而灌水,r/mlscaling 上不少工程師提醒「模型可能在訓練集見過類似題」。Moonshot 雖提供完整技術報告,但社群仍要求揭露訓練資料去污染流程。
  • 關於 1M context:Moonshot 官方說「真的能跑滿 1M」,但 vLLM 預覽版的實測多落在 200K–400K 就開始掉專注度。K3-256k 變體之所以存在,正是因為 1M 在實際 agent 工作流中不夠穩定
  • 關於 API 價格的誤導:$15/M 看似便宜,但 K3 對長任務的思考(reasoning)tokens 計算方式不像 Claude 那樣透明,要跑過一輪才知道實際帳單。HN 上「Kimi K3 is not cheap」這篇討論串就是圍繞這點。
  • 關於「擊敗所有美國模型」:這是 Reddit / X 上少數誇張說法,原始 benchmark 跟 Arena 排名只能說明在「特定編程子項目」上 K3 領先,並非所有基準通用冠軍。

後續觀察重點

  1. 企業法務是否接受 Moonshot 自訂授權、能否在 vLLM 之外找到更順暢的部署管線。
  2. Anthropic 與 OpenAI 在 8 月會端出什麼對應牌:Claude Fable 5、GPT-5.5、還是 Gemini 3.6 全家族都到齊?
  3. 台灣的在地雲端(中華電信、台灣大哥大雲端)是否會引進 K3 作為企業代理服務。
  4. 256K 與 1M 在不同工作流的甜蜜點:到底是寫中型 repo 時用 256K 就好,還是大型 monorepo 必須衝 1M。

編按:本文綜合整理自 VentureBeat 報導、vLLM 官方部落格、openlm.ai 模型索引、Hacker News 第一手討論串,並加入 Siami 編輯部觀點與分析。