
社區(qū)反應迅速月之暗面放出 Kimi K3 完整權重之后社區(qū)動作比預想快“在 M1 Max 上跑 Kimi K3”的帖子今天登上了 Hacker News 首頁。Deltafin 項目支持本地運行這是一個名為“Deltafin”的小型研究項目支持在 Apple Silicon Mac 上本地運行 Kimi K32.8 萬億參數(shù)。HN 討論帖評論兩極分化HN 討論帖的評論兩極分化嚴重。一邊說“0.3 token 每秒這東西有什么意義”另一邊說“你想想2.8 萬億參數(shù)在你的桌面電腦上跑。”兩邊都有道理但這個爭論跳過了更有意思的問題——K3 能在 Mac 上跑起來并非有人想方設法去壓縮它而是這件事從一開始就寫在了架構里。Raschka 架構筆記Raschka 在 K3 開源完整權重 48 小時內就出了一篇架構筆記。他的第一句判斷很簡單“本質上是 Kimi Linear 的規(guī)模化生產(chǎn)版本。”Kimi Linear 是 Moonshot 去年的工作只有 48B 參數(shù)。現(xiàn)在 K3 把它放大到了約 2.8 萬億加了一個關鍵組件LatentMoE。LatentMoE 概念及優(yōu)勢這個概念不是 Kimi 首創(chuàng)——NVIDIA 的 Nemotron 3 Ultra 也用了類似方案——但 K3 是第一個把它做到這個體量的。核心思路是把標準 MoE 里的大線性層通過下投影壓縮。通俗來講模型雖然整體巨大但每次推理只激活一小部分專家其余老老實實待在磁盤或網(wǎng)絡存儲上。一個 MoE 模型對本地推理天然友好不是靠事后裁剪是架構生來如此。MXFP4 原生訓練第二個設計是 MXFP4 原生訓練。K3 從訓練第一天起就是 MXFP4 格式。這意味著下載下來的權重不需要經(jīng)歷一次額外的量化步驟——下載即用。對服務器這不重要對一臺 Mac 很重要。1.6TB 的權重文件如果還需要再轉換一輪格式大多數(shù)人連試都不會試。K3 把這個步驟省了。NoPE 設計第三個更激進NoPE。K3 移除了全部 RoPE 位置編碼全模型不用任何位置嵌入。Raschka 說據(jù)他所知這是第一個在“前沿級別”模型上這么干的。其他架構的做法更保守——Gemma - 4 在滑動窗口注意力層用 RoPE全局注意力層用 NoPE。K3 則一刀切。去掉 RoPE 與本地推理的關系為什么這跟本地推理有關因為去掉 RoPE 意味著計算路徑更短。HN 上有人解釋了這是怎么回事因果掩碼本身就隱含位置信息KDA 層從 Gated DeltaNet 派生本質上是 RNN - like天然理解序列順序而且 K3 在第一個注意力層之前堆了 3 個 KDA 層——位置信息在注意力啟動之前就已經(jīng)被學到了。沒有 RoPE少了一步計算在每一點速度都很重要的場景下這不算小事。deltafin 項目串聯(lián)架構特性deltafin 這個項目就是把這些架構特性串起來的。它做的事不復雜K3 的 MXFP4 專家權重按需從 HTTP 流式傳輸?shù)奖镜卮疟P緩存用 fused NEON 內核和 Metal/MPS 做推理。逐 token 拉專家推理完就放。項目提供 OpenAI 兼容的 API 接口支持確定性解碼——每次跑同樣的 prompt 會得到完全相同的輸出。antirez 在 M5 Max 上搞定 K3Redis 作者 antirez 幾乎同時在做同一件事但更硬核一些他在 M5 Max 上搞定了 K3。antirez 讀取權重及后續(xù)計劃antirez 用 M5 Max 128GB 直接從 Hugging Face 流式讀取 K3 的 1.6TB 權重。“有點慢”他承認。但從他后續(xù)的推文來看這不只是一個好玩的項目。他在等兩臺 512GB Mac Studio——“進行 Q2 精度量化至少聊天場景下可以達到可接受的速度。”他的判斷是 K3 在 MXFP4 上訓練的“感覺量化效果會很不錯”。再談 HN 爭論再回到 HN 那條爭論。速度與應用場景0.3 tok/s 確實慢。隨著 KV cache 增長會越來越慢——完整 1M token 上下文下 cache 就占約 27GB。但問題不是速度是用什么場景來衡量。如果你是坐在屏幕前等回復0.3 tok/s 是折磨。如果你是把一批測試用例掛上去過夜跑評估或者用 LLM - as - judge 做離線打標那這個速度完全沒問題。有人說得挺到位“OpenAI 和 Anthropic 的批量 API 給你打五折。這個是打九八折。”與以往不同的路數(shù)更關鍵的是這次和以前不一樣。傳統(tǒng)大模型與 K3 的對比以前的路數(shù)是大模型發(fā)布 - 社區(qū)費盡全力做量化、裁剪、蒸餾 - 勉強塞進消費級硬件性能打折扣。K3 的路數(shù)是反過來的模型架構本身的設計選擇——LatentMoE、MXFP4 原生訓練、NoPE——讓它在發(fā)布的時候就已經(jīng)準備好了被人在各種硬件上跑。不是“有沒有辦法壓縮”而是“用不著壓縮”。K3 架構思路的意義不是說每個大模型都應該這么設計。但如果開源權重的核心價值在于任何人、任何機器都能用那 K3 的架構思路——讓一臺 Mac 也能跑 2.8 萬億參數(shù)——本身就是在擴大“開源”兩個字的實際含義。未來速度提升的期待接下來要看的是兩臺通過 Thunderbolt 5 連接的 Mac Studio 512GB 能不能把速度推到“可交互”的水平。antirez 覺得行。其他人可以等著看。