我們正在開源我們最新的模型 Kimi K2.6,其特色是具備最先進的程式碼編寫、長時程執行和代理人協同作業能力。Kimi K2.6 現已可透過 Kimi.com、Kimi App、API 和 Kimi Code 使用。

Kimi K2.6 在長時程程式碼編寫任務上展現了強大的進步,在程式語言(例如 Rust、Go 和 Python)和任務(例如前端、DevOps 和效能優化)之間具有可靠的泛化能力。在我們涵蓋各種複雜端對端任務的內部程式碼基準測試 Kimi Code Bench 上,Kimi K2.6 相較於 Kimi K2.5 有顯著的進步。

Kimi K2.6 在複雜工程任務中展現了強大的長時程程式碼編寫能力:

Kimi K2.6 成功在 Mac 上本機下載並部署了 Qwen3.5-0.8B 模型。透過使用一種高度小眾的程式語言 Zig 來實作和優化模型推理,它展現了卓越的離散分佈泛化能力。在超過 4,000 次工具呼叫、超過 12 小時的連續執行和 14 次迭代中,Kimi K2.6 將吞吐量從約 15 tokens/秒大幅提升至約 193 tokens/秒,最終速度比 LM Studio 快約 20%。

Kimi K2.6 自主重寫了 exchange-core,這是一個已有 8 年歷史的開源金融撮合引擎。在 13 小時的執行過程中,該模型迭代了 12 種優化策略,發起了超過 1,000 次工具呼叫,精確修改了超過 4,000 行程式碼。Kimi K2.6 扮演專家系統架構師的角色,分析 CPU 和分配的火焰圖以找出隱藏的瓶頸,並大膽地重新配置核心執行緒拓撲(從 4ME+2RE 變為 2ME+1RE)。儘管引擎已接近其效能極限,Kimi K2.6 仍實現了 185% 的中等吞吐量躍升(從 0.43 提升至 1.24 MT/s)和 133% 的效能吞吐量增長(從 1.23 飆升至 2.86 MT/s)。

在 Beta 測試中,K2.6 在企業評估的長時程程式碼編寫任務上表現良好(隨機排序):

在無程式碼環境中,AI 必須處理每一個邊緣案例。當出現預期之外的情況時,沒有開發人員可以介入。K2.6 在處理細微的 API 行為和在情況出錯時進行恢復方面,明顯比 K2.5 更有效,並且它能在遇到障礙前執行更長時程的任務。與 K2.5 相比,我們看到了將使用者從想法轉變為部署的實際進步。

K2.6 最讓我們印象深刻的是它在大型程式碼庫中的精確度。當初始路徑受阻時,它擅長進行智慧的轉向:遵循現有的架構模式,尋找隱藏的相關變更,並將修復範圍限定在實際問題上。這種專注的適應性有助於 Augment Code 減少浪費的週期,並為企業級工程工作提供更快、更具成本效益的代理式程式碼編寫。

Kimi K2.6 的演進令人印象深刻。它在程式碼編寫任務上的表現可與領先的閉源模型媲美,並且由於其對第三方框架的深入理解,提供了強大的工具呼叫品質。Kimi K2.6 的卓越可靠性使其成為複雜和長時程工程任務的絕佳選擇。

Kimi K2.6 為開源模型設定了新的標準,尤其是在長時程、代理式程式碼編寫工作流程方面。它能處理複雜的多步驟任務,具有更強的指令遵循能力和持續的高程式碼品質。我們看到它能夠在遠超典型模型的長時間程式碼編寫會話中保持穩定性。它還能發現深層的、不明顯的錯誤,這些錯誤通常需要大量開發時間才能發現。總體而言,K2.6 為可靠的程式碼編寫設定了新的標竿。

在 CodeBuddy 進行的內部評估中,Kimi K2.6 相較於 K2.5 有顯著進步:程式碼生成準確性提高了 12%,長上下文穩定性提高了 18%,工具調用成功率達到了 96.60%。其更強的推理能力和更一致的輸出品質為確保 CodeBuddy WorkBuddy 中可靠的使用者體驗提供了堅實的支持。

K2.6 在我們的基準測試(+15%)和並排比較中,都比 K2.5 有了明顯的改進。它似乎具有更好的指令遵循能力、更徹底的探索和推理,並且不太可能出現程式碼錯誤或使用技巧。

我們很高興看到開源模型又一次飛躍,Kimi K2.6 的發布標誌著高風險、代理式工作流程的重大進展。最具影響力的改進在於其長時程的可靠性和指令遵循能力。K2.6 在長時間程式碼編寫會話中能保持架構完整性,使其成為自主代理管道(如所有「claws」)的穩定基礎。它在長上下文任務上展現了相較於 K2.5 的可衡量躍升,在複雜推理方面達到了最先進的效能。

我們提前試用了 K2.6 並透過 Hermes Agent 進行了測試。工具呼叫和代理式迴圈感覺明顯更緊密,程式碼編寫有了明顯的提升,其創意範圍也讓我們感到驚喜。我們非常期待與 Kimi 一起舉辦關於創意的駭客松。Kimi 團隊持續超出預期!

K2.6 以極低的成本提供了最先進的效能。它在跨程式碼庫的長上下文任務以及支援像 KiloClaw 這樣的全天候代理人所需的日常工作中表現出色。

Kimi K2.6 提高了開源模型的標準。它在程式碼編寫方面表現出色,尤其是在 OpenClaw 和 Hermes 等代理式工具方面。在早期測試中,它能在長時間的多步驟會話中保持令人印象深刻的穩定性。它將開箱即用地支援 Ollama 的所有整合,我們很期待看到開發人員能用它來構建什麼。

在 OpenCode 中,Kimi K2.6 被證明是異常可靠的。它在任務分解和工具呼叫方面的處理方式穩定且一致。憑藉對任務要求的更敏銳理解和更簡化的多步驟操作,它能有效減少重複性開銷,從而提供更順暢、更值得信賴的端對端體驗。

Kimi K2.6 在 Qoder 的內部評估中表現強勁,相較於 K2.5 有顯著進步。特別是,工具呼叫和模型調用的頻率顯著增加,這反映了模型在任務執行期間的主動性和智慧的實質性提升。這種增強的工具呼叫主動性使模型能夠更積極地掌握開發人員的意圖並自動完成上下文,從而最大限度地減少使用者中斷和等待時間。

K2.6 在我們的開發人員最關心的功能方面,相較於 K2.5 有了重大進展:我們在 Next.js 基準測試中看到了超過 50% 的進步,使其成為該平台上表現最佳的模型之一。結合其成本效益比,它透過 AI Gateway 提供代理式程式碼編寫和前端生成,是一個引人注目的選擇。我們很高興能將它提供給我們的開發者社群。

基於強大的程式碼編寫能力,Kimi K2.6 可以將簡單的提示轉換為完整的前端介面,生成結構化的佈局,並帶有深思熟慮的設計選擇,例如美觀的英雄區塊,以及互動元素和豐富的動畫,包括滾動觸發效果。憑藉熟練運用圖像和影片生成工具的能力,Kimi K2.6 支持生成視覺上連貫的資產,並有助於提高英雄區塊的品質和顯著性。

此外,Kimi K2.6 將開發範圍從靜態前端開發擴展到簡單的全端工作流程——涵蓋身份驗證、使用者互動到資料庫操作,適用於交易記錄或會話管理等輕量級用例。

我們建立了一個內部 Kimi Design Bench,分為四個類別:視覺輸入任務、登陸頁面構建、全端應用程式開發和通用創意程式設計。與 Google AI Studio 相比,Kimi K2.6 在這些類別中表現出有希望的結果並表現良好。

以下是由 K2.6 Agent 從單一提示生成的範例,配備預先配置好的框架和工具:

橫向擴展,而不僅僅是縱向擴展。代理人協同作業動態地將任務分解為異質子任務,由自創的領域專門代理人並行執行。

基於 K2.5 Agent Swarm 研究預覽,Kimi K2.6 Agent Swarm 在代理人協同作業體驗方面展現了質的飛躍。它無縫協調異質代理人以結合互補技能:廣泛搜索與深度研究相結合,大規模文檔分析與長篇寫作融合,以及多格式內容生成並行執行。這種組合式智慧使代理人協同作業能夠在單次自主運行中交付端對端輸出——涵蓋文檔、網站、幻燈片和電子表格。

該架構可橫向擴展至 300 個子代理人,跨 4,000 個協調步驟同時執行,相較於 K2.5 的 100 個子代理人和 1,500 個步驟有了大幅擴展。這種大規模並行化從根本上減少了端對端延遲,同時顯著提高了輸出品質並擴展了代理人協同作業的運行邊界。

它還可以將任何高品質文件,如 PDF、電子表格、幻燈片和 Word 文檔,轉換為技能。Kimi K2.6 捕捉並維護了文件的結構和風格 DNA,使您能夠在未來的任務中重現相同的品質和格式。

K2.6 在自主、主動的代理人(如 OpenClaw 和 Hermes)方面表現強勁,這些代理人跨多個應用程式運行,並進行持續的 24/7 執行。

與簡單的聊天互動不同,這些工作流程要求 AI 作為主動的背景代理人來主動管理日程、執行程式碼和協調跨平台操作。

我們的 RL 基礎設施團隊使用了一個由 K2.6 支持的代理人,該代理人自主運行了 5 天,管理監控、事件響應和系統運營,展現了持久的上下文、多線程任務處理以及從警報到解決的完整週期執行。這是 K2.6 的工作日誌(已匿名化以移除敏感資訊):

Kimi K2.6 在實際可靠性方面帶來了可衡量的改進:更精確的 API 解釋、更穩定的長運行效能以及在延長的研究任務中增強的安全意識。

效能提升透過我們的內部 Claw Bench 量化,該評估套件涵蓋五個領域:程式碼任務、IM 生態系統整合、資訊研究與分析、排程任務管理和記憶體利用率。在所有指標上,Kimi K2.6 在任務完成率和工具調用準確性方面顯著優於 Kimi K2.5——尤其是在需要持續自主運行而無需人工監督的工作流程中。

基於 Kimi K2.6 強大的協調能力,Kimi K2.6 將您的主動代理擴展到 Claw Groups 作為研究預覽——這是代理人協同作業架構的新實例。

Claw Groups 擁抱開放、異質的生態系統:多個代理人和人類作為真正的協作者運行。使用者可以從任何設備、運行任何模型的代理人進行導入,每個代理人攜帶自己的專業工具集、技能和持久記憶體上下文。無論部署在本地筆記本電腦、移動設備還是雲實例上,這些不同的代理人都能無縫整合到共享的操作空間中。

在這個協同作業的中心,Kimi K2.6 作為一個適應性協調器。它根據代理人的特定技能配置檔和可用工具動態地將任務匹配給代理人,以優化能力匹配。當代理人遇到失敗或停滯時,協調器會檢測到中斷,自動重新分配任務或重新生成子任務,並主動管理從啟動到驗證再到完成的可交付成果的整個生命週期。

我們還要感謝 K2.6 驅動的 Claw Groups 中的代理人——我們一直在透過實際應用來打磨我們自己的代理行銷團隊,以改進人機協作工作流程。使用 Claw Groups,我們運行端對端的內容生產和發布活動,由演示製作者、基準測試製作者、社交媒體代理人和影片製作者等專業代理人協同工作。K2.6 協調整個過程,使代理人能夠共享中間結果,並將想法轉化為一致、完整的可交付成果。

我們正在超越簡單地向 AI 提問或分配任務,進入一個人類和 AI 作為真正夥伴協作的階段——結合優勢共同解決問題。Claw Groups 標誌著我們朝著一個「我的代理人」、「你的代理人」和「我們的團隊」之間的界限無縫溶解成協作系統的未來邁出的最新努力。

為了重現官方 Kimi-K2.6 基準測試結果,我們建議使用官方 API。對於第三方提供商,請參考 Kimi Vendor Verifier (KVV) 以選擇高準確度的服務。詳細資訊:https://www.kimi.com/blog/kimi-vendor-verifier