Ai2 用 GPU 時間預算替代優先順序排程
Ai2 把原先基於優先順序的 GPU 排程器換成了由 GPU 時間預算、層級化公平分配和時間切片契約組成的新系統。它管理數千塊 NVIDIA H100、B200、B300,叢集規模從 88 到 1024 塊 GPU,服務約 150 名內部研究者,GPU 需求長期是供給的 2 到 3 倍。舊方案導致 GPU 蹲坑佔位、優先順序通脹(最終 100% 工作負載都標為 HIGH)以及值班工程師大量時間用於協商關閉不可搶佔任務。
找到 4 筆;也可以試試 語意搜尋
Ai2 把原先基於優先順序的 GPU 排程器換成了由 GPU 時間預算、層級化公平分配和時間切片契約組成的新系統。它管理數千塊 NVIDIA H100、B200、B300,叢集規模從 88 到 1024 塊 GPU,服務約 150 名內部研究者,GPU 需求長期是供給的 2 到 3 倍。舊方案導致 GPU 蹲坑佔位、優先順序通脹(最終 100% 工作負載都標為 HIGH)以及值班工程師大量時間用於協商關閉不可搶佔任務。
Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。
Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。
MaxText 團隊用 JAX/XLA 在 Google Cloud TPU 上從零復現了 Ai2 的 Olmo 3 7B 語言模型,預訓練與中期訓練各階段在所有留出評測上均與原始 PyTorch-on-GPU 參考結果精確一致。實現最高達到 57.4% 的模型浮點運算利用率(MFU),並在不修改訓練配方的情況下經受住執行中叢集擴縮容與跨代 TPU 切換。該案例還暴露出一個資料載入器記憶化 bug,它人為壓低了訓練損失,靠完整留出驗證才被發現。