AISpot

NTM 提出:少步擴散每步用條件歸一化流,保留精確似然

Apple Machine Learning Research10/7 20:00官方公告研究

論文提出 Normalizing Trajectory Models(NTM),把擴散模型的每個反向步建模為表達力強的條件歸一化流,並支援精確似然訓練。擴散取樣通常依賴大量細小的高斯去噪步,壓縮到少數粗粒度轉移時該假設不再成立;此前的少步方法用蒸餾、一致性訓練或對抗目標解決,但都放棄了似然框架。架構上,NTM 在每步內組合淺層可逆塊與深層並行結構。

提出一種在少步生成下仍保留精確似然訓練的新建模方式,把擴散的每一步換成條件歸一化流,對研究少步取樣與似然建模的人有參考價值。

原標題:Normalizing Trajectory Models
閱讀原文

評分68 / 63(平均 65,門檻 60)
狀態精選

相關報導

Apple Machine Learning Research10/1 20:00AI 評分50

研究指離散擴散模型單步生成依賴條件獨立假設

一項研究分析了離散擴散模型(含 remasking 與 uniform-state 取樣器)的單步生成機制,指出一步生成只有在所寫位置在已固定 token 條件下相互獨立時,才與訓練分佈匹配。研究證明,任何逐位置分佈的乘積都無法匹配存在依賴關係的 token 組,而畫素、音素、詞等常見領域中的 token 本身存在固有依賴。

Hacker News front page● 精選10/5 17:15AI 評分79

Dust:不用反向傳播預訓練 Transformer 的零階方法

研究者提出 Dust,稱這是首個在預訓練 Transformer 語言模型上與反向傳播有競爭力的零階方法。它不擾動權重,而是在每個 token 上獨立擾動啟用(node perturbation),把每個 token 當作一個虛擬種群成員,一次前向傳播即可並行評估全部成員。論文稱在種群規模足夠大(即算力顯著更多)時 Dust 接近反向傳播,部分設定下甚至超過;

Hacker News front page10/6 18:51AI 評分70

UniEvo-VL:多模態模型自蒸餾自我進化訓練配方

arXiv 上提交的 UniEvo-VL 提出一種 on-policy 自蒸餾訓練方法:讓同一個多模態模型分別以學生和教師身份出現,學生只看原始問題,教師額外看到自我批評作為特權資訊,訓練目標是縮小兩者在取樣軌跡上去噪擴散分佈的差異,無需依賴更大的外部教師模型。基於開源 Qwen-image-2512,GenEval 從 0.747 升至 0.808,GenEval2 Soft-TIFA 從 32.97 升至 35.53。

llama.cpp releases● 精選10/7 09:45AI 評分78

llama.cpp 合併 GLM5-Next MTP 支援,可作 draft 模型

llama.cpp 合併 PR #29928,為 GLM5-Next 加入多 token 預測(MTP)的 NextN 計算圖,使其能作為投機解碼的 draft 模型使用。改動包括支援只含 NextN 層或只含主幹張量的拆分 GGUF 檔案載入,並把 MTP 圖按輸出行裁剪,無輸出行的 4-token catch-up 核心耗時從 6.9 ms 降到 2.9 ms,貪心輸出雜湊與 draft 接受率不變。

量子位● 精選10/1 11:06AI 評分72

何愷明團隊提出 NAT-ARC,純視覺方案解 ARC 達 70.2%

何愷明團隊發布 NAT-ARC,用 ImageNet 上 MAE 預訓練的視覺編碼器解 ARC 抽象推理題,最佳單模型(0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合後 70.2%。該方法不依賴 LLM,預訓練階段不使用 ARC 格子,僅複用 MAE 公開 checkpoint,測試時對每題做 LoRA 微調。論文稱這是純視覺方案首次逼近專用 LLM 系統水平,並顯示預訓練打通了視覺路線的 scaling 瓶頸。