2026 年 10 月 3 日,德國 Aleph Alpha 發布開源權重模型 Kolibri,權重以 Apache 2.0 許可在 Hugging Face 開放下載。這是一個英德雙語 MoE Transformer,總引數 78B、每 token 啟用約 3B,官方稱其面向公共管理、工業與航空航天等受監管領域,針對… 看完整事件
Aleph Alpha 發布 78B MoE 開源模型 Kolibri-1
德國 Aleph Alpha 在 Hugging Face 發布 Kolibri-1,78B 總引數、3.46B 啟用引數,支援最高 100 萬 token 上下文,Apache 2.0 許可。模型用 768 張 B300 訓練 4 周、20T token,語料約 62.5% 英文、23.9% 德文、13.6% 程式碼。目前尚無量化版本,llama.cpp 是否支援該架構未知,社群評測認為效能接近 Qwen 3.5 35B。
3.46B 啟用引數意味著它可能適合你的 Mac Studio 本地推理,但需先確認 MLX、llama.cpp 是否支援該架構及量化版本何時放出。
原標題:Aleph-Alpha/Kolibri-1 · Hugging Face - 78B parameters. 3.46B active. Up to 1M tokens of context - Apache 2.0
閱讀原文
| 評分 | 72 / 78(平均 75,門檻 76) |
|---|---|
| 狀態 | 未入選 |
相關報導
Kyojin 引擎讓兩臺 300B MoE 模型各跑在單臺 128GB Strix Halo 上
基於 ExLlamaV3 的 Kyojin 引擎在 AMD Strix Halo(gfx1151、ROCm)上讓兩個 300B 級 MoE 模型各裝進一臺 128GB 迷你主機:GLM-5.3-Flash 佔 99.7GB,3.5K 上下文預填充 580 tok/s,解碼 26 到 30 tok/s;MiMo-V2.6-Flash 佔 105GB,解碼最高 44 tok/s(程式碼場景)。
開發者開源二戰主題小模型 Peacebell,291M 與 148M 兩版
開發者 Wayne Workman 用 11 個月業餘時間從零訓練了專注二戰資訊的小語言模型 Peacebell,已開源權重與訓練材料,含 291M 和 148M 兩個引數版本。148M 版是為參加 HuggingFace 限制 150M 以內模型規模的榜單而做,同時發布了 WWII 主題基準 ww2bench,題目不公開以防進入訓練資料。模型可在 CPU 上執行,作者提供了定製 vLLM fork,並稱其長上下文表現較差,下一版預計 2027 年發布。
llama.cpp 新增 clef 決策模型支援(純文字)
llama.cpp 合併 PR #29831,為 clef 決策模型加入純文字推理支援,並更新 gguf-py 常量。該版本覆蓋 macOS Apple Silicon、Linux、Windows、Android 等平台,其中 Apple Silicon 的 KleidiAI 加速建置被停用。
llama.cpp 的 OpenVINO 後端更新,MoE 推理大幅提速
ggml-openvino 後端更新至 2026.4.1,新增 MoE 路由融合與 GDN 歸一化融合,並預設在 GPU 上啟用 MoE 融合。在 Arc B390 上跑 gemma-4-26B-A4B,配合 q4_asym64 重新量化,pp512 從 66.16 t/s 提升到 1608.73 t/s,困惑度基本不變。同時修復了 stateful 執行下 rank-3 軸處理導致的 MoE 崩潰,並改進裝置列舉與記憶體上報。
LiquidAI 發布 LFM2.5-Encoder 350M 多語言編碼器
LiquidAI 發布 LFM2.5-Encoder,含 350M 與 230M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度任務。官方稱其吞吐量追平或超過 ModernBERT,CPU 長上下文更強,並可通過 WebGPU 在瀏覽器執行;GGUF 權重已發布,llama.cpp 支援 PR 已提交。