AISpot

搜尋

依意思最接近的 27 筆

r/LocalLLaMA top of the day10/3 19:24AI 評分65

專精推理引擎興起,放棄通用性換極致效能

一批極窄用途的推理執行時正在出現,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 和 vLLM 擅長的通用性,只針對少數模型、有時甚至只針對一個硬體家族(如 Strix Halo)做最佳化。作者認為未來通用執行時負責相容性、一次性專精執行時負責最大效能將成為常態,這也有助於智慧的民主化與去中心化,並壓榨現有硬體的更多產出。

llama.cpp releases● 精選10/4 01:37AI 評分63

llama.cpp 為 WebGPU 後端加入 f16 支援

llama.cpp 在 WebGPU 後端為 fill/set_rows 操作加入 f16 支援(PR #29897),併發布 b11382 版本。該版本覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 建置被停用。對使用 WebGPU 推理的使用者,f16 支援可減少視訊記憶體佔用並提升相容性。

NVIDIA blog10/1 14:00AI 評分22

NVIDIA 提出 AI 工廠回報三要素,稱 Vera Rubin 每兆瓦吞吐超 GB300 30 倍

NVIDIA 提出衡量 AI 工廠投資回報的三個變數:產能(每兆瓦吞吐與每 token 成本)、使用壽命和需求。它援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍;每兆瓦 AI 工廠造價約 6000 萬美元。

NVIDIA blog● 精選10/2 14:00AI 評分72

NVIDIA DGX Spark 增 64GB 版,10 月 23 日 4999 美元起

NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;

NVIDIA blog● 精選10/2 00:44AI 評分86

OpenAI 上線 GPT-6 Astra Ultrafast,跑在 NVIDIA Blackwell 上

GPT-6 Astra Ultrafast 已上線,執行在 NVIDIA Blackwell GPU 上,面向 OpenAI 內部以及符合條件的 ChatGPT Work 和 Codex 使用者開放,token 生成速度最高可達 Astra Standard 模式的 8 倍。開發者今天就能通過 API 呼叫,接入方式、定價與實現細節見官方 Ultrafast 指南。更快的生成可縮短 coding agent 的編輯—測試—除錯迴圈,減少工具呼叫之間的等待時間。

r/LocalLLaMA top of the day10/3 19:58AI 評分49

開發者發布 Ninfer 4080,16GB 顯示卡可跑 100k 上下文

開發者 roofkid 發布 Ninfer 4080,讓 RTX 4080 16GB 顯示卡以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,最高預填充 2720 tok/s、生成 262 tok/s,程式碼已在 GitHub 開源並提供 Docker 映象。它採用 DFlash2 投機解碼,作者稱預填充與生成速度明顯優於 llama.cpp、vllm 等通用推理引擎,代價是 KV 量化帶來輕微精度損失。

r/LocalLLaMA top of the day10/3 02:58AI 評分32

LocalLLaMA 網友曬本地跑模型硬體方案

r/LocalLLaMA 使用者 pmarsh 發帖稱自己已接近本地推理硬體投入的中間水平,評論區隨即給出多種低成本方案:2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器可跑 qwen 3.8 flash 超 15 tok/s;雙 7900XTX 不到 2000 美元可跑 27B Q8 超 220k 上下文;CMP 170HX 視訊記憶體超頻可達 2TB/s,單流解碼約 60 tok/s。

The Verge AI10/3 17:49AI 評分38

Capcom 稱將把 AI 整合進遊戲開發流程

Capcom 在 RE: 2026 開放會議上表示,正為“與 AI 共同製作遊戲的未來”做準備,計劃把 AI 技術整合進開發工作流。程式設計師 Satoshi Ishida 在演講中稱,製作《生化危機》這一量級的遊戲時,連簡單任務都極其耗時,AI 是應對方案。但 Capcom 此前曾表示不會使用 AI。

Latent Space● 精選9/30 23:23AI 評分81

OpenAI DevDay 發布 GPT-6.1 Sol、Dots 與 Agents API

OpenAI 在 DevDay 上發布 GPT-6.1 Sol、個人助理產品 Dots,以及內建 Computer Use 的 Agents API,開發者可基於與 Codex、ChatGPT 相同的 Computer Use 建置應用。Ari Weinstein 稱 GPT-6.1 Sol 成本是 Astra 的五分之一,用在 Computer Use 上只需七分之一。

r/LocalLLaMA top of the day10/3 21:06AI 評分75

TensorSharp 讓 176B MoE 模型跑在 16GB 視訊記憶體筆記本上

開源推理引擎 TensorSharp 在 RTX 3080 Laptop(16GB 視訊記憶體)、32GB 記憶體加 SSD 的普通筆記本上跑起了 Qwen3.8 Flash Next 176B,無需 128GB 以上記憶體工作站或多 GPU。它靠量化加 MoE 感知的統一排程,協調視訊記憶體、記憶體、SSD 與快取分層。

Hacker News front page10/3 18:23AI 評分65

Vx 發布:把 CPU、GPU、NPU 記憶體寫進型別系統的語言

Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯。它要求跨記憶體空間顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期校驗放置是否可行。

The Verge AI10/2 22:08AI 評分46

Meta 開原始碼,讓使用者自製 Muse AI 硬體

Meta 開源了讓使用者自己動手製作 Muse 硬體裝置的程式碼,這些裝置執行 Meta 新的 AI 智慧體 Muse。官方稱可用現成的 ESP32 開發板,或用 Raspberry Pi 搭配其 SDK,再連線螢幕、按鈕、感測器、執行器等外設。Meta 舉例的玩法包括:用彩色電子墨水屏顯示提醒、把 Muse 裝進 HDMI 棒投到大屏、或裝在小觸屏上做出類似 DIY Muse Charm 的裝置。

量子位● 精選10/1 16:02AI 評分80

Google 突然發布 Gemini 4 Argon,多項榜單登頂

Google 於 2026 年 10 月 1 日發布 Gemini 4 Argon,在 DeepSWE v1.1 長期軟體工程任務得 77.9%,高於 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%,並以 68.90% 登頂 Vals Index。定價為每百萬輸入 Token 2 美元、輸出 Token 10 美元,優惠期單題成本比 Astra 低約四成,輸出上限達百萬 Token。

X @GoogleDeepMind10/1 12:43AI 評分40

@GoogleDeepMind: SynthID Bio is our new family of watermarking methods made for AI-generated biological designs.

Google DeepMind 推出 SynthID Bio,一套專為 AI 生成生物設計打造的水印方法。其首次實現將不可感知的簽名直接嵌入蛋白質序列,且不影響其生物功能。該技術面向 AI 生成的生物設計場景,具體使用方式與限制尚未披露。

r/LocalLLaMA top of the day10/2 23:18AI 評分18

愛爾蘭公立學院獲資助建小型 AI 實驗室,發帖徵集教學內容

愛爾蘭一所公立繼續教育學院(相當於美國的社群學院)拿到資助,建起了一個小型 AI 實驗室,硬體條件還算不錯。發帖人向更有經驗的人徵集教學思路,目標是讓學生獲得使用 ChatGPT 之外的實用技能。帖子本身只提出征集,沒有給出課程方案、招生規模或具體裝置型號等細節。

X @GoogleDeepMind10/1 12:43AI 評分42

@GoogleDeepMind: As AI accelerates scientific discovery, we’re helping researchers keep pace by quickly authenticati…

Google DeepMind 發布了一套可快速驗證生物設計是否內建安全防護的工具,並以開放方式供研究使用。該工具面向科研人員,目的是在 AI 加速科學發現的同時,不拖慢關鍵研究進度。官方未披露具體模型名稱、效能資料或使用限制,僅提供研究用途的開放獲取連結。

llama.cpp releases10/3 12:54AI 評分42

llama.cpp 的 OpenVINO 後端更新,MoE 推理大幅提速

ggml-openvino 後端更新至 2026.4.1,新增 MoE 路由融合與 GDN 歸一化融合,並預設在 GPU 上啟用 MoE 融合。在 Arc B390 上跑 gemma-4-26B-A4B,配合 q4_asym64 重新量化,pp512 從 66.16 t/s 提升到 1608.73 t/s,困惑度基本不變。同時修復了 stateful 執行下 rank-3 軸處理導致的 MoE 崩潰,並改進裝置列舉與記憶體上報。

Latent Space● 精選10/3 09:45AI 評分85

GPT-6.1 Sol 發布,Sonnet 5.5 登頂 Agent Arena

OpenAI 發布 GPT-6.1 Sol,定價 $2/$10 每百萬輸入/輸出 token,比 Astra 的 $10/$50 便宜約 80%,在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分。Sonnet 5.5 在 Agent Arena 首秀排第 3 並在 Chat 類別登頂,Anthropic 包攬前三;Sol 每任務中位成本 $0.56,比 GPT-6 Sol 便宜 39%。

llama.cpp releases10/3 00:18AI 評分34

llama.cpp b11355 在 32KB 共享記憶體的三星 GPU 上停用 Vulkan 大 matmul tile

llama.cpp 發布 b11355 版:對共享記憶體為 32KB 的三星 GPU,Vulkan 後端停用大型 matmul tile(#28531),該提交由 Claude Op 協助完成。此版本中 macOS Apple Silicon 的 KleidiAI 啟用建置(arm64, KleidiAI enabled)與 openEuler 建置標記為 DISABLED;

X @GoogleDeepMind10/1 18:11AI 評分42

@GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

Google DeepMind 發布一期播客,討論 AI 生成內容逼真化後如何驗證內容來自人類、機器還是自然,核心手段是來源溯源與不可感知水印。節目時間軸顯示內容涵蓋水印定義、SynthID、影像與影片、SynthID Bio 以及未來韌性,其中 SynthID 部分從 4 分 35 秒開始,SynthID Bio 從 19 分 28 秒開始。

Google AI blog● 精選10/2 16:00AI 評分68

Google 發布 Gemini 4 Argon,100 萬 token 輸出上限

Google 9 月發布新前沿模型 Gemini 4 Argon,擁有業界領先的 100 萬 token 輸出上限,面向編碼、網路安全防禦、金融研究與法律起草等重負載任務;目前僅通過 Fairwind Program 向受信任的網路安全防禦者開放,尚未放開給開發者、企業和消費者。