AISpot

Dust:不用反向傳播預訓練 Transformer 的零階方法

Hacker News front page10/5 22:15官方公告研究

研究者提出 Dust,稱這是首個在預訓練 Transformer 語言模型上與反向傳播有競爭力的零階方法。它不擾動權重,而是在每個 token 上獨立擾動啟用(node perturbation),把每個 token 當作一個虛擬種群成員,一次前向傳播即可並行評估全部成員。論文稱在種群規模足夠大(即算力顯著更多)時 Dust 接近反向傳播,部分設定下甚至超過;

首次給出能與反向傳播抗衡的零階預訓練方法,並給出比 EGGROLL 高 10^3 至 10^4 倍的效率外推,對關注訓練演算法與算力擴充套件的研究者最有參考價值。

原標題:Dust: Pretraining Transformers Without Backpropagation
閱讀原文

評分84 / 75(平均 79,門檻 76)
狀態精選

相關報導

機器之心● 精選10/4 12:12AI 評分68

Jev 走紅,NeurIPS 2025 論文 ConfTuner 早已探索相似思路

TypeSafe AI 的 Jev 模型近期走紅,其介面可直接返回預設選項、分數或事件機率,供程式碼呼叫,但未開源、架構未公開。NeurIPS 2025 入選論文 ConfTuner 提出 Tokenized Brier Score,僅用對錯標籤即可訓練置信度機率分佈,在 LLaMA、Qwen、Ministral 上把平均 ECE 從 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884,4 張 A40 上約 4 分鐘完成微調。

Apple Machine Learning Research10/2 01:00AI 評分50

研究指離散擴散模型單步生成依賴條件獨立假設

一項研究分析了離散擴散模型(含 remasking 與 uniform-state 取樣器)的單步生成機制,指出一步生成只有在所寫位置在已固定 token 條件下相互獨立時,才與訓練分佈匹配。研究證明,任何逐位置分佈的乘積都無法匹配存在依賴關係的 token 組,而畫素、音素、詞等常見領域中的 token 本身存在固有依賴。

Hacker News front page● 精選10/3 10:36AI 評分79

Aleph Alpha 發布 78B 開源模型 Kolibri

德國 AI 公司 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,總引數 78B、啟用引數 3B,支援最長 1M token 上下文,權重已在 Hugging Face 開放下載,採用 Apache 2.0 許可。該模型為英德雙語 MoE Transformer,面向公共管理、工業與航空航天等受監管領域,在 AIME 2025 上得分 96.9,官方稱其效能可對標啟用引數四倍於己的模型。

Hacker News front page● 精選10/5 20:16AI 評分88

Reflection 發布首個開放權重模型 Beam:501B 總引數、23B 啟用

Reflection 發布首個開放權重模型 Beam:稀疏 MoE,總引數 501B、啟用 23B,面向程式設計、推理與 agentic 負載。預訓練使用 23.8 萬億 token,RL 階段動用 10.5K 塊 NVIDIA GB300 訓練 4 周、生成超 1 億條 rollout、約 13 億個沙箱,官方稱是開放實驗室中規模最大的 RL 訓練之一。評測中其與 GLM 5.2 相當但推理算力少 3–4 倍,接近 Qwen 3.8-Max,原始能力仍落後 Kimi K3;

Apple Machine Learning Research10/1 01:00AI 評分58

RLTL;DR:讓模型從失敗中自寫反饋實現自我改進

論文提出 RLTL;DR 方法:在可驗證獎勵強化學習(RLVR)中,當任務難到模型幾乎無法成功、又沒有教師模型或範例解可蒸餾時,讓策略在每次失敗後檢視驗證器輸出,並自行寫出一條 TL;DR 式反饋,下一次 rollout 以此為條件。該方法面向自我改進場景,替代只最佳化成功嘗試的常見做法。