AISpot

陳丹琦團隊開源 4B 象棋模型 QUEEN,能下棋也能講解

機器之心10/6 13:36新聞報導研究模型開源

普林斯頓大學陳丹琦團隊發布約 4B 引數的國際象棋模型 QUEEN,Lichess 等級分 2697,接近特級大師快棋中位數 2730,且能用自然語言解釋自己的著法。做法是把 Lc0 的 BT5 網路經門控交叉注意力逐層接入 SmolLM3-3B,先用四階段問答課程教模型讀棋,再用七輪迭代搜尋蒸餾提升。它在 1000 道戰術題上首步不失誤率 91.6%,領先 Gemini-3.1-Pro 約 9 個百分點;

把沉默的棋類引擎逐層橋接到語言模型、再用搜尋蒸餾訓練解釋,4B 規模達 2697 分並開源權重,對關注小模型專業能力與可解釋性的讀者有參考價值。

原標題:4B模型下棋比肩大师、还会讲棋,陈丹琦团队怎么做到的?
閱讀原文

評分76 / 78(平均 77,門檻 65)
狀態精選

相關報導

機器之心● 精選10/6 13:27AI 評分84

清華團隊開源 VeriLoop E2,以外部驗證決定推理狀態提交

清華團隊開源後訓練模型 VeriLoop E2,由獨立外部 Verifier 決定候選狀態能否獲得提交資格,而非依賴模型內部置信度。該模型以 Qwen 3.8-27B 為基礎,面向程式碼、數學與物理三類可外部驗證任務,並同步發布標準權重與覆蓋 BF16 至 IQ1_M 的 GGUF 量化版,其中 Q6_K 為 20.566 GiB,比 BF16 小 58.96%。

Simon Willison● 精選10/5 00:34AI 評分66

Qwen3.8 27B 在 DGX Spark 復現文字加法實驗,169 題答對 167

有人在本地 DGX Spark 上覆現了兩年前用 GPT-4o 做過的實驗:讓模型算出大數之和、但把答案寫成英文單詞。他用 Qwen3.8-27B-Q4_K_M.gguf,經 Codex Remote(GPT-6 Astra)執行,關閉推理時每組組合跑 30 次嘗試,開啟推理後每組只跑一次,169 次裡答對 167 次。作者也公開了部分大數計算的推理過程。

Ars Technica AI● 精選10/1 17:28AI 評分78

AI 首次在 Stratego 上擊敗人類頂尖選手

卡內基梅隆、MIT、紐約大學與斯坦福的研究團隊開發出 AI「Ataraxos」,以 15 勝 1 負 4 平擊敗被公認為史上最強的 Stratego 選手 Pim Niemeijer。此前連 DeepMind 都未能造出穩定戰勝頂尖人類玩家的 Stratego 機器。該 AI 僅用 16 塊 GPU、數千美元訓練成本,相關成果針對的是資訊不完全、隱藏資訊隨時間長期展開的博弈。

r/LocalLLaMA top of the day10/2 22:49AI 評分43

Peacebell:個人從零訓練的二戰專用小模型開源

開發者用 11 個月業餘時間從零訓練了二戰主題小語言模型 Peacebell,並開源訓練材料與權重,提供 291M 和 148M 兩個引數版本。訓練資料全部為自建合成資料,基於維基百科等許可材料,作者稱大部分精力花在資料整理與平衡上。291M 版本可在 HuggingFace 免費試用,無需 GPU 即可本地執行,但作者提醒這是初版,長上下文表現較差。同時發布了 WWII 主題基準與排行榜,下一版預計 2027 年發布。

Hacker News front page● 精選10/3 11:43AI 評分85

Aleph Alpha 發布開源主權模型 Kolibri,78B 引數 Apache 2.0

德國 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,Apache 2.0 許可,權重已上 Hugging Face。它採用 MoE 架構,總引數 78.1B,每 token 僅啟用 3.46B,支援德語和英語,原生上下文 262,144 token,知識截止 2026 年 6 月 18 日。模型在德國和芬蘭基礎設施上從零訓練,使用 768 塊 NVIDIA B200,訓練約 24 萬億 token,其中德語佔比超五分之一。