r/LocalLLaMA top of the day10/2 19:47AI 評分59
llama.cpp 新 PR:CUDA 把共享專家融合進 MMVQ
llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。
找到 3 筆
llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。
GPT-6 Astra Ultrafast 已在 OpenAI API 上線,並向符合條件的 ChatGPT Work 與 Codex 使用者開放。它執行在 NVIDIA Blackwell GPU 上,token 生成速度最高是 Astra Standard 模式的 8 倍,可縮短 coding agent 的 edit-test-debug 迴圈。
開發者用 Sparse VideoGen 將注意力頭動態路由到高度結構化的空間或時間稀疏掩碼,並最佳化 TPU 的 Splash Attention 核心,1440p 影片生成端到端推理最高提速 1.69 倍。