AISpot

NVIDIA

近期事件

  1. 1
    熱度 1.12 個來源 · 3 則10/3 12:44
  2. 2
    熱度 0.82 個來源 · 2 則10/3 07:27

10月3日星期六 · 10 則

  1. r/LocalLLaMA top of the dayAI 評分75

    TensorSharp 讓 176B MoE 模型跑在 16GB 視訊記憶體筆記本上

    開源推理引擎 TensorSharp 在 RTX 3080 Laptop(16GB 視訊記憶體)、32GB 記憶體加 SSD 的普通筆記本上跑起了 Qwen3.8 Flash Next 176B,無需 128GB 以上記憶體工作站或多 GPU。它靠量化加 MoE 感知的統一排程,協調視訊記憶體、記憶體、SSD 與快取分層。

  2. TechCrunch AIAI 評分30

    AWS 稱不再與政府機構籤資料中心保密協議

    AWS CEO Matt Garman 在部落格中表示,公司已停止在與政府機構的資料中心專案中使用保密協議(NDA),並稱過去三年向美國資料中心所在社群投入超 10 億美元。他同時反駁資料中心耗水、推高電價、汙染大、無益社群四點質疑,稱資料中心直接用水僅佔美國工業用水 0.5%,備用發電機 99.9% 時間閒置、每年約執行 10 小時。背景是全美已有 100 多個資料中心禁令在審議中,紐約已宣布大型資料中心許可暫停一年。

  3. Hacker News front pageAI 評分65

    Vx 發布:把 CPU、GPU、NPU 記憶體寫進型別系統的語言

    Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯。它要求跨記憶體空間顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期校驗放置是否可行。

  4. r/LocalLLaMA top of the dayAI 評分53

    r/LocalLLaMA 熱議低位元量化對編碼任務的影響

    r/LocalLLaMA 上一則帖子引發討論:FP8/BF16 使用者看到有人跑 IQ1_S 量化感到震驚。多位使用者指出,IQ1/IQ2 這類極端量化只適合創意寫作或閒聊,用於編碼、複雜邏輯推理或結構化 JSON 提取時困惑度飆升、語法和邏輯明顯崩壞;而 Q4_K_M 或 Q5_K_M 通常是多數模型的甜點區,困惑度曲線相對平坦、視訊記憶體佔用大幅下降且推理能力幾乎無損。

  5. r/LocalLLaMA top of the dayAI 評分51

    Qwen3.8-Flash-Next 177B 在單張 RTX 5070 12GB 上跑到 11–15 tok/s

    有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上跑 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話 14–15 tok/s,比原方案約 7 tok/s 提升明顯。一次長編碼提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

  6. r/LocalLLaMA top of the dayAI 評分33

    mlsubgen 本地生成 45 種語言字幕,僅支援 Linux 與 NVIDIA

    mlsubgen 是一個完全在本機執行的字幕生成工具,支援 45 種語言,但僅限 Linux 和 NVIDIA 顯示卡。它按語音片段而非整檔案檢測語言,可處理混合語言素材;同時執行兩個語音識別器並由本地 LLM 調和結果,且優先使用檔案內嵌字幕(包括藍光 PGS 點陣圖字幕的 OCR),無字幕可讀時才轉錄音訊。作者在 24 GB RTX A5000 上執行,提供 16、12、8 GB 視訊記憶體配置,需 16–32 GB 系統記憶體和 30–65 GB 模型儲存;

  7. llama.cpp releases● 精選AI 評分80

    llama.cpp 為投機解碼加入機率取樣與拒絕取樣

    llama.cpp 合併 PR #27694,把 simple draft 與 MTP 的投機解碼改為機率取樣,目標模型用拒絕取樣驗證草稿 token。新增開關控制機率草稿取樣,預設仍為貪心;語法約束請求回退到 argmax,並支援在拒絕取樣中處理語法約束。同時修復了草稿取樣器與目標模型共用 rng 流、掩碼後分布未重歸一化等問題,並隨草稿一起截斷候選。

  8. r/LocalLLaMA top of the dayAI 評分30

    MegaCapybara 發布:RTX5090 上跑 Qwen3.8 27B 的推理引擎

    MegaCapybara 是專為 RTX5090 打造的推理引擎,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單路編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。它自帶權重格式與後設資料,載入前會展示各量化設定相對 BF16 的 KL 與 top-1% 損失,並支援智慧 VRAM-RAM-DISC 快取、Loop Guard 與圖形介面。採用 MIT 許可,原始碼與權重建置器稍後發布。

10月2日星期五 · 8 則

  1. r/LocalLLaMA top of the dayAI 評分47

    RTX PRO 6000 實測 Qwen3.8 三版本:DFlash2 提速 2.8 倍

    在單張 RTX PRO 6000 Blackwell 96GB 上,Qwen3.8-27B 用 DFlash2 草稿模型把 Spec-Bench 單使用者解碼從 75 tok/s 提到 210 tok/s,約 2.8 倍;NVFP4 比 BF16 快 2.2 倍。三款檢查點中 Flash-Next 預填充 22.4 秒、27B 為 97 秒,長上下文召回三者均滿分,BFCL 工具呼叫 27B 以 73.3% 領先。

  2. r/LocalLLaMA top of the dayAI 評分51

    Micro Center 買 RTX 5090 需籤禁出口宣告

    據 wccftech 報導,Micro Center 現在要求購買 RTX 5090 的顧客簽署一份同意遵守禁出口政策的宣告表格,同時該卡價格已漲破 5000 美元。有使用者稱自己此前買過一臺含 5090 的整機,34 天后再想單獨購買時被經理告知已被無限期禁止購買任何 5090。此舉被認為是為了防止轉售和出口,讓更多普通顧客能買到現貨。

  3. Ars Technica AIAI 評分65

    美司法部逮捕 Earthmade CEO,涉走私 3 億美元 Nvidia 晶片入華

    美國司法部週四宣布逮捕 38 歲的 Earthmade Computer CEO Greg Lui,指控其用虛假單據走私價值超過 3 億美元、內含 Nvidia A100 與 H100 GPU 的伺服器到中國。起訴書稱他與馬來西亞、新加坡等國的貨代公司合謀,把晶片貨物非法轉運入中國。美方指這些並非 Nvidia 最先進的晶片,但足以處理海量資料並訓練大語言模型,擔心中國獲得足夠晶片會推進其 AI 或軍事能力。

  4. Ars Technica AIAI 評分40

    Nvidia Shield TV Pro 因記憶體成本上漲漲價 100 美元

    Nvidia 宣布 Shield TV Pro 即日起漲價 100 美元,售價從 199.99 美元升至 299.99 美元,官方給出的原因是 AI 導致記憶體等零部件成本在全行業大幅上升。這款 2019 年發布的 Android TV 盒子仍搭載老舊的 Tegra X1+ 處理器,支援 AI 超分和幾乎各類媒體的硬體解碼,非 Pro 版本已經停產。Nvidia 發言人稱漲價自 10 月 2 日起生效。

  5. NVIDIA blog● 精選AI 評分72

    NVIDIA DGX Spark 增 64GB 版,10 月 23 日 4999 美元起

    NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;

  6. NVIDIA blog● 精選AI 評分86

    OpenAI 上線 GPT-6 Astra Ultrafast,跑在 NVIDIA Blackwell 上

    GPT-6 Astra Ultrafast 已上線,執行在 NVIDIA Blackwell GPU 上,面向 OpenAI 內部以及符合條件的 ChatGPT Work 和 Codex 使用者開放,token 生成速度最高可達 Astra Standard 模式的 8 倍。開發者今天就能通過 API 呼叫,接入方式、定價與實現細節見官方 Ultrafast 指南。更快的生成可縮短 coding agent 的編輯—測試—除錯迴圈,減少工具呼叫之間的等待時間。

10月1日星期四 · 1 則

  1. NVIDIA blogAI 評分22

    NVIDIA 提出 AI 工廠回報三要素,稱 Vera Rubin 每兆瓦吞吐超 GB300 30 倍

    NVIDIA 提出衡量 AI 工廠投資回報的三個變數:產能(每兆瓦吞吐與每 token 成本)、使用壽命和需求。它援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍;每兆瓦 AI 工廠造價約 6000 萬美元。

9月30日星期三 · 1 則

  1. NVIDIA blogAI 評分15

    輝達開放 2027–2028 研究生獎學金申請,最高 6 萬美元

    輝達第 26 屆研究生獎學金專案開始全球接受申請,面向研究 AI、機器學習、自動駕駛、計算機圖形、機器人、醫療與高效能運算等方向的博士生,每人獎金最高 6 萬美元,並配導師與技術支援。申請者須在申請時已完成至少一年博士階段學習,截止日期為 2026 年 10 月 30 日;獲獎前還必須在 NVIDIA 研究辦公室完成 2027 年夏季的線下實習。該專案自 2002 年啟動以來已發放 220 多筆資助,總額約 800 萬美元。

9月29日星期二 · 2 則

  1. Hugging Face blogAI 評分53

    NVIDIA 開源表格基礎模型 Kumo Tabular,登頂四個基準

    NVIDIA 發布 Kumo Tabular,一個面向表格分類與迴歸的開源基礎模型,權重已上線 Hugging Face,程式碼開源於 GitHub。給定一張帶標籤行的表格,它在單次前向傳播中直接輸出新行的類別機率或數值預測,無需訓練、調參和特徵工程;模型僅用人工合成表格預訓練,提供 28M 到 215M 三種引數規模,採用 OpenMDW-1.1 許可證,可商用。

  2. MLX releases● 精選AI 評分70

    v0.32.3

    MLX 發布 v0.32.3,一批修復覆蓋 Metal、CUDA 與 CPU 後端,並新增面向 M5 的非量化 matmul 調優。Metal 側加入 gated delta nets 核心與 fast.cross_entropy 融合核心,降低 SDPA D256/D512 記憶體佔用,同時修復 fp 量化 matmul 在量化維度非 32 倍數時的結果損壞、GGUF 張量維度校驗與零尺寸軸的 scan/sort。

9月8日星期二 · 1 則

  1. X @MistralAIAI 評分55

    @MistralAI: Led by @Samsung, co-led by @eqt's Scaleup Europe Fund and @PSG_equity, with continued backing from …

    Mistral AI 宣布完成新一輪融資,由三星領投,EQT 旗下 Scaleup Europe Fund 與 PSG Equity 聯合領投,ASML、輝達、法國巴黎銀行 CIB 等繼續跟投。資金將用於基礎設施與產品能力建設、規模化部署,以及擴充套件前沿研究與模型開發。具體金額與估值未披露。

9月4日星期五 · 1 則

8月11日星期二 · 1 則

  1. Ollama blog● 精選AI 評分90

    NVIDIA Nemotron 3.5 Lightning 上線 Ollama,可完全本地執行

    NVIDIA 的 30B 總引數(3B 啟用)開源模型 Nemotron 3.5 Lightning 已上線 Ollama,可完全在本地裝置執行。它採用混合 MoE 架構,支援最長 1M token 上下文,並用多 token 預測、DFlash 或 DSpark 投機解碼,吞吐達同類開源模型 4 倍、任務完成時間快 30%,面向呼叫工具、跑測試、檢索程式碼庫等長時 agent 任務。