AISpot
所屬事件:Reflection 發布首個開放權重模型 Beam:501B 引數、23B 啟用(2 個來源 · 2 則報導)

2026 年 10 月 5 日,美國初創公司 Reflection 發布其首個開放權重模型 Beam。Beam 是純文字稀疏混合專家(MoE)模型,總引數 5010 億、啟用 230 億,面向程式設計、推理與 agentic 負載,預訓練使用 23.8 萬億 token,上下文視窗 100 萬 token。其強化學習階… 看完整事件

Reflection 發布首個開放權重模型 Beam:501B 總引數、23B 啟用

Hacker News front page10/5 20:16官方公告模型開源研究

Reflection 發布首個開放權重模型 Beam:稀疏 MoE,總引數 501B、啟用 23B,面向程式設計、推理與 agentic 負載。預訓練使用 23.8 萬億 token,RL 階段動用 10.5K 塊 NVIDIA GB300 訓練 4 周、生成超 1 億條 rollout、約 13 億個沙箱,官方稱是開放實驗室中規模最大的 RL 訓練之一。評測中其與 GLM 5.2 相當但推理算力少 3–4 倍,接近 Qwen 3.8-Max,原始能力仍落後 Kimi K3;

首次披露 Reflection 開放權重模型的規模細節,含 10.5K 塊 GB300、4 周、超 1 億條 rollout 的 RL 訓練量,以及與 GLM 5.2、Qwen 3.8-Max、Kimi K3 的逐項評測對比,對關注開放權重模型與推理成本的人有參考價值。

原標題:Beam: Reflection's 501B open-weight model
閱讀原文

同一事件共有 2 則報導(2 個來源),看事件全貌

評分88 / 88(平均 88,門檻 76)
狀態精選

相關報導

Hacker News front page● 精選10/3 11:43AI 評分85

Aleph Alpha 發布開源主權模型 Kolibri,78B 引數 Apache 2.0

德國 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,Apache 2.0 許可,權重已上 Hugging Face。它採用 MoE 架構,總引數 78.1B,每 token 僅啟用 3.46B,支援德語和英語,原生上下文 262,144 token,知識截止 2026 年 6 月 18 日。模型在德國和芬蘭基礎設施上從零訓練,使用 768 塊 NVIDIA B200,訓練約 24 萬億 token,其中德語佔比超五分之一。

llama.cpp releases● 精選10/3 12:54AI 評分70

llama.cpp 的 OpenVINO 後端更新至 2026.4.1 並大幅最佳化 MoE 效能

ggml-openvino 後端更新到 2026.4.1,重點最佳化 Qwen3.5 MoE 推理效能,並新增推理效能分析、預設使用遠端輸出張量、磁碟快取模型直載(cache_only)等能力。在 Arc B390 上以 q4_asym64_all 重量化執行 gemma-4-26B-A4B,pp512 從 66.16 t/s 提升到 1608.73 t/s,tg128 從 25.94 提升到 26.46 t/s,困惑度基本不變。

r/LocalLLaMA top of the day10/2 22:49AI 評分43

Peacebell:個人從零訓練的二戰專用小模型開源

開發者用 11 個月業餘時間從零訓練了二戰主題小語言模型 Peacebell,並開源訓練材料與權重,提供 291M 和 148M 兩個引數版本。訓練資料全部為自建合成資料,基於維基百科等許可材料,作者稱大部分精力花在資料整理與平衡上。291M 版本可在 HuggingFace 免費試用,無需 GPU 即可本地執行,但作者提醒這是初版,長上下文表現較差。同時發布了 WWII 主題基準與排行榜,下一版預計 2027 年發布。

r/LocalLLaMA top of the day10/3 11:39AI 評分71

Hugging Face 發布多 harness RL 訓練指南

Hugging Face 後訓練團隊發布了一份多 harness 強化學習指南,介紹如何用 TRL 和 Harbor 等開源庫在不同 coding harness 中訓練開放模型。團隊稱,針對當前各人自建 harness(如 Pi 加擴充套件)的現狀,該方案給出了用任意開放模型在自訂 harness 上取得最佳效能的配方。指南已發布在 Hugging Face Spaces 上,作者歡迎反饋。