Ai2 用 GPU 時間預算替代優先順序排程
Ai2 把原先基於優先順序的 GPU 排程器換成了由 GPU 時間預算、層級化公平分配和時間切片契約組成的新系統。它管理數千塊 NVIDIA H100、B200、B300,叢集規模從 88 到 1024 塊 GPU,服務約 150 名內部研究者,GPU 需求長期是供給的 2 到 3 倍。舊方案導致 GPU 蹲坑佔位、優先順序通脹(最終 100% 工作負載都標為 HIGH)以及值班工程師大量時間用於協商關閉不可搶佔任務。
Ai2 公開其 H100/B200/B300 叢集的排程改造:以 GPU 時間預算和層級公平分配取代優先順序排程,並詳述 GPU 蹲坑、優先順序通脹等故障現象,對運維自建 GPU 叢集者有用。
原標題:Impactful scheduling for GPU clusters
閱讀原文
| 評分 | 70 / 68(平均 69,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
輝達稱 Vera Rubin NVL72 每兆瓦吞吐量超 GB300 30 倍
輝達援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量超過 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍。輝達以「高產、耐用、通用」概括 AI 工廠回報邏輯:每兆瓦 token 數決定收益,A100 出貨六年後仍在商用,CoreWeave 已將 2020 年首批裝置的預訂延長至 2029 年。
llama.cpp b11527:WebGPU 運算元全部改用 2D workgroup 派發
llama.cpp 發布建置 b11527(PR #30219),WebGPU 後端移除 1D workgroup 派發,所有原本使用 1D 派發的運算元(如 rms_norm)統一改為 2D workgroup dispatch。
llama.cpp 發布 b11402,CUDA 後端改用整塊 FlashAttention 排程
llama.cpp 發布 b11402 版本,CUDA 後端改為優先採用整塊(whole-tile)FlashAttention 排程,以提升兩階段核心效率。
AI 設計的開源加速卡 openTPU 跑通十餘款模型
一個由 AI 設計的開源 AI 加速器 openTPU 已在真實 PCIe 卡上跑通十餘款模型的真實權重,輸出與 bit-exact 模擬器逐位一致。硬體是 Xilinx Kintex-7 xc7k480t 加兩路 DDR3,LFM2.5-230M int8 解碼 59.0 tok/s、4-bit 達 85.8 tok/s;解碼受 DRAM 頻寬限制,實測跑到峰值的 82%-94%。
斯坦福 Ousterhout 提出 Homa 協議替代 TCP
斯坦福教授 John Ousterhout 在 AI Engineer 演講中提出 Homa,一種面向資料中心的全新傳輸協議,認為 TCP 和 RDMA 正成為 AI 叢集的瓶頸。他指出 AI 負載已從大流量梯度傳輸轉向 KV cache 查詢、屏障同步等小訊息協調,這類訊息對延遲敏感,一旦與大數據流混排就會陷入 incast 佇列,拖高尾延遲並讓 GPU 空轉。Homa 基於訊息而非位元組流,採用接收端驅動的擁塞控制,並用 SRPT 優先排程短訊息。