Google Developers blog10/2 22:21AI 評分43
MaxText 團隊在 TPU 上覆現 Olmo 3 7B 預訓練
該復現用 JAX/XLA 精確匹配原 PyTorch-on-GPU 參考,MFU 達 57.4%,並發現資料載入器記憶 bug。
找到 3 筆
該復現用 JAX/XLA 精確匹配原 PyTorch-on-GPU 參考,MFU 達 57.4%,並發現資料載入器記憶 bug。
何愷明團隊提出 NAT-ARC,用 ImageNet 上 MAE 預訓練的 encoder 做純視覺 ARC 解法,不依賴 LLM。單模型 0.6B 引數在 ARC-1 拿到 63.4% pass@2,整合約 2B 引數達 70.2%。論文稱預訓練打通了視覺路線的 scaling 瓶頸。
在英/法 HuBERT 受控設定中,增強預訓練語言判別可減少、部分指標上彌合連續語音和高層語言上的多語言差距,並保留跨語言共享。