AISpot

NVIDIA

近期事件

  1. 1
    熱度 1.12 個來源 · 3 則10/3 12:44
  2. 2
    熱度 0.82 個來源 · 2 則10/3 07:27

10月3日星期六 · 2 則

  1. llama.cpp releases● 精選AI 評分62

    llama.cpp 發布 b11370,CUDA 後端將共享專家融合進 MMVQ

    llama.cpp 發布建置版本 b11370,CUDA 後端新增將共享專家(shared experts)融合進 MMVQ 的改動(#29184),並修復緩衝區空值檢查、把 stride_col_dst 移入融合引數。

    推薦理由:你準備用 Mac Studio 本地跑開源模型,這次 CUDA 側的 MoE 融合最佳化雖不直接作用於 Apple Silicon,但能幫你判斷 llama.cpp 各後端迭代節奏,並留意 macOS 建置中 KleidiAI 被停用對 MLX 之外推理路徑的影響。

  2. llama.cpp releases● 精選AI 評分80

    llama.cpp 為投機解碼加入機率取樣與拒絕取樣

    llama.cpp 合併 PR #27694,把 simple draft 與 MTP 的投機解碼改為機率取樣,目標模型用拒絕取樣驗證草稿 token。新增開關控制機率草稿取樣,預設仍為貪心;語法約束請求回退到 argmax,並支援在拒絕取樣中處理語法約束。同時修復了草稿取樣器與目標模型共用 rng 流、掩碼後分布未重歸一化等問題,並隨草稿一起截斷候選。

    推薦理由:你正為 Mac Studio 評估本地推理,這條改動直接影響 llama.cpp 在 Apple Silicon 上投機解碼的取樣正確性與速度,值得在選型時納入測試。

10月2日星期五 · 3 則

  1. NVIDIA blog● 精選AI 評分72

    NVIDIA DGX Spark 增 64GB 版,10 月 23 日 4999 美元起

    NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;

    推薦理由:如果你在 Mac Studio 之外考慮本地跑開源模型,這是同價位可對比的 CUDA 方案,且開箱即支援 Ollama、llama.cpp、LM Studio,並能一鍵把本地模型接給 OpenCode 用。

  2. OpenRouter announcements● 精選AI 評分62

    OpenRouter 上線 Model Router Benchmarks 路由器評測頁

    OpenRouter 推出 Model Router Benchmarks 頁面,用品質、速度、成本三個維度對比各家模型路由器,併合成 0 到 10 分的 Router Index。預設權重是品質 60%、每任務時間 20%、成本 20%,頁面上可拖動滑塊自行調整。

    推薦理由:你同時用 Claude Code、Codex、OpenCode 且按量付費,可以先在這頁看清各家路由器在品質、延遲與成本之間的取捨,再決定是否把模型換成路由器來省錢。

  3. NVIDIA blog● 精選AI 評分86

    OpenAI 上線 GPT-6 Astra Ultrafast,跑在 NVIDIA Blackwell 上

    GPT-6 Astra Ultrafast 已上線,執行在 NVIDIA Blackwell GPU 上,面向 OpenAI 內部以及符合條件的 ChatGPT Work 和 Codex 使用者開放,token 生成速度最高可達 Astra Standard 模式的 8 倍。開發者今天就能通過 API 呼叫,接入方式、定價與實現細節見官方 Ultrafast 指南。更快的生成可縮短 coding agent 的編輯—測試—除錯迴圈,減少工具呼叫之間的等待時間。

    推薦理由:你日常用 Codex,可對照這條訊息看是否符合條件走 ChatGPT Work/Codex 入口,或直接用 API 實測更快生成對 agent 編輯—測試—除錯迴圈的實際提速。