AISpot

搜尋

依意思最接近的 12 筆

Hugging Face blog● 精選10/9 11:20AI 評分69

Ai2 用 GPU 時間預算替代優先順序排程

Ai2 把原先基於優先順序的 GPU 排程器換成了由 GPU 時間預算、層級化公平分配和時間切片契約組成的新系統。它管理數千塊 NVIDIA H100、B200、B300,叢集規模從 88 到 1024 塊 GPU,服務約 150 名內部研究者,GPU 需求長期是供給的 2 到 3 倍。舊方案導致 GPU 蹲坑佔位、優先順序通脹(最終 100% 工作負載都標為 HIGH)以及值班工程師大量時間用於協商關閉不可搶佔任務。

NVIDIA blog● 精選10/2 09:00AI 評分80

NVIDIA DGX Spark 推出 64GB 版,10 月 23 日 4999 美元起

NVIDIA 宣布 DGX Spark 新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 發售,起售價 4999 美元。該機型保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 AI 軟體棧,支援最高 1000 億引數模型本地執行;兩臺可通過 ConnectX-7 直連組成 128GB 叢集,支援 2000 億引數模型,官方 Qwen 3.8 27B 測試效能提升至 1.7 倍。

llama.cpp releases10/3 08:40AI 評分42

llama.cpp 修復圖重分配導致的 GGML_SCHED_NO_REALLOC 中止

llama.cpp 合併 PR #29856,將迴圈狀態改為一次 get_rows 收集,ubatch 狀態與額外狀態都作為其檢視,節點大小隻取決於 n_rs,而 reserve 已將其設為最大值。此前 build_rs 用獨立 get_rows 收集 n_rs - n_seqs 行額外狀態,最壞情況下該節點被設為 0 行,非連續 ubatch 會在節點數不變時觸發圖重分配,進而在 GGML_SCHED_NO_REALLOC 下中止。

Google Developers blog● 精選10/8 18:10AI 評分68

Google 發布 ML Drift:端側通用 GPU 推理框架

Google AI Edge 推出 ML Drift,一個面向端側 AI 與機器學習推理的高效能通用 GPU 計算框架。它把 OpenGL ES、OpenCL、Metal、WebGPU 等底層硬體與圖形計算 API 抽象掉,讓開發者無需直接處理這些介面,就能在移動端與桌面端建置即時互動式 ML 體驗,覆蓋從複雜影片特效到生成式 AI 的場景。

Hacker News front page10/4 15:42AI 評分72

斯坦福 Ousterhout 提出 Homa 協議替代 TCP

斯坦福教授 John Ousterhout 在 AI Engineer 演講中提出 Homa,一種面向資料中心的全新傳輸協議,認為 TCP 和 RDMA 正成為 AI 叢集的瓶頸。他指出 AI 負載已從大流量梯度傳輸轉向 KV cache 查詢、屏障同步等小訊息協調,這類訊息對延遲敏感,一旦與大數據流混排就會陷入 incast 佇列,拖高尾延遲並讓 GPU 空轉。Homa 基於訊息而非位元組流,採用接收端驅動的擁塞控制,並用 SRPT 優先排程短訊息。

llama.cpp releases10/7 07:11AI 評分42

llama.cpp 修復 SYCL 混用不同型號 GPU 的 FA 問題

llama.cpp 合併 PR #29071,修復 SYCL 後端在 Flash Attention(FA)中混用不同型號 GPU 時出現的問題。改動位於 ggml/src/ggml-sycl/ggml-sycl.cpp,提交由 Georgi Gerganov 共同署名。該修復包含在版本 b11464 中,此版本同時提供 Ubuntu x64(SYCL FP32、FP16)與 Windows x64(SYCL)等建置。

Hacker News front page10/6 12:23AI 評分73

AI 設計的開源加速卡 openTPU 跑通十餘款模型

一個由 AI 設計的開源 AI 加速器 openTPU 已在真實 PCIe 卡上跑通十餘款模型的真實權重,輸出與 bit-exact 模擬器逐位一致。硬體是 Xilinx Kintex-7 xc7k480t 加兩路 DDR3,LFM2.5-230M int8 解碼 59.0 tok/s、4-bit 達 85.8 tok/s;解碼受 DRAM 頻寬限制,實測跑到峰值的 82%-94%。

r/OpenAI top of the day10/3 10:31AI 評分27

ChatGPT Pro 使用者稱定時任務疑似被降級

一名 ChatGPT Pro(100 美元檔)使用者在社群發帖稱,ChatGPT Chat 中的定時任務(Scheduled Jobs)疑似被移除或降級:原本可建立最多 15 個定時任務,且額度高於 Codex 與 ChatGPT work,如今任務設定裡出現了與 ChatGPT work 相同的模型選擇選項。該使用者還反映定時任務仍存在訊息投遞超時等錯誤,質疑其後臺執行機制。