Kyojin 引擎讓兩臺 300B MoE 模型各跑在單臺 128GB Strix Halo 上
基於 ExLlamaV3 的 Kyojin 引擎在 AMD Strix Halo(gfx1151、ROCm)上讓兩個 300B 級 MoE 模型各裝進一臺 128GB 迷你主機:GLM-5.3-Flash 佔 99.7GB,3.5K 上下文預填充 580 tok/s,解碼 26 到 30 tok/s;MiMo-V2.6-Flash 佔 105GB,解碼最高 44 tok/s(程式碼場景)。
基於 ExLlamaV3 的 Kyojin 引擎在 AMD Strix Halo(gfx1151、ROCm)上讓兩個 300B 級 MoE 模型各裝進一臺 128GB 迷你主機:GLM-5.3-Flash 佔 99.7GB,3.5K 上下文預填充 580 tok/s,解碼 26 到 30 tok/s;MiMo-V2.6-Flash 佔 105GB,解碼最高 44 tok/s(程式碼場景)。
有使用者觀察到,近期開源與閉源模型(如 GLM 5.3 Flash)的寫作風格正趨向高資訊密度和更豐富的詞彙,用更少的詞表達更多內容,類似 William Gibson 的壓縮文風。作者認為這可能與 token 效率最佳化有關,但代價是普通讀者難以一眼讀懂,例如模型會使用 Baudrillardian 這類生僻詞。
r/LocalLLaMA 使用者 pmarsh 發帖稱自己已接近本地推理硬體投入的中間水平,評論區隨即給出多種低成本方案:2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器可跑 qwen 3.8 flash 超 15 tok/s;雙 7900XTX 不到 2000 美元可跑 27B Q8 超 220k 上下文;CMP 170HX 視訊記憶體超頻可達 2TB/s,單流解碼約 60 tok/s。
NVIDIA 提出衡量 AI 工廠投資回報的三個變數:產能(每兆瓦吞吐與每 token 成本)、使用壽命和需求。它援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍;每兆瓦 AI 工廠造價約 6000 萬美元。
Anthropic Frontier Red Team 在內部 Binary Exploitation 基準中隨機抽取 100 個任務評估多個模型:GLM-5.3 在 4% 的試驗裡實現了完整控制流劫持,Claude Mythos Preview 為 6%。此前模型 Claude Opus 4.6 與 GLM-5.2 在這些任務中一次都沒有成功。該團隊認為,GLM-5.3 的成績雖低於 Claude Mythos Preview,但一個有意義的能力門檻已被跨過。
智譜 AI(海外稱 Z.ai)的 GLM-5.3 具備自主建置端到端網路漏洞利用的能力,且發布時未設有效防護,Anthropic 測試顯示攻擊者用簡單技巧即可在 64% 到 100% 的情況下繞過其防護。在 ExploitBench 上,GLM-5.3 於 410 次嘗試中成功開發出 50 次端到端利用,接近 Claude Mythos Preview 的 56 次;在內部二進位制利用基準中取得 4% 的完整控制流劫持,Claude Mythos Preview 為 6%。
智譜分享 GLM-5.3 如何幫助建置並最佳化服務 GLM-5.3-Flash 的推理基礎設施,系統從首次跑通到可上生產不到兩週,端到端吞吐量達到初始基線的 3 倍。關鍵在於密集反饋:本地正確性測試、執行軌跡、微基準與端到端測量,讓團隊做有針對性的假設驗證,而不是隻看聚合效能指標。
智譜 GLM Coding Plan 迎來上線一週年,官方給所有現有訂閱者發放一張 Reset Card,可同時重置每週額度和 5 小時額度。該福利面向個人版與團隊版訂閱使用者,屬於週年回饋,官方未說明領取截止時間與使用期限。
智譜(Zai)宣布 GLM-5.3 開放權重,可下載、本地執行並自行定製,官方稱這是其面向 agentic coding 與網路防禦能力最強的模型。權重已發布在 Hugging Face 的 zai-org/GLM-5.3 頁面,技術細節見 z.ai/blog/glm-5.3。原文未公布引數規模、許可證型別與硬體要求。
智譜(Zai_org)宣布 GLM-5.3 的模型權重將於 2026 年 8 月 28 日發布,Hugging Face 頁面已給出下載地址。這是繼此前訊息之後的又一進展,權重開放意味著可以本地部署與自行量化。目前官方只給出發布時間和連結,未說明許可證、引數規模與硬體要求。
Awni Hannun 指出,蘋果每年向 Google 支付約十億美元使用 Gemini,而他認為可以免費獲得更好的模型,即 GLM 5.2 以及即將發布的 Kimi K3。這條推文只對比了付費與免費模型,未說明蘋果為何選擇 Gemini,也未給出效能資料或發布時間。
2026 年 2 月 12 日發布的 v0.30.7 修復了 Kimi Linear 與 DeepSeek V3.2 的 indexer 和權重載入問題,並加快 DSV32 生成速度。這一版新增 GLM5、不含視覺能力的 Qwen3.5 系列與 LongCat MLA 支援,LFM2 模型可用 Pythonic 方式呼叫工具,另加入 Mistral 工具解析器。訓練流程中的驗證集改為可選,還有一項為下一版本提號的版本號變更。
MLX LM 發布 v0.30.6,新增 Kimi-K2.5、LongCat Flash/Lite 和 Step 3.5 Flash 等模型支援,並引入 Transformers v5。服務端加入分散式推理,支援 chat_template_kwargs、top_logprobs 與載入自訂模型,同時新增 CLI。