AISpot

地端推論與硬體

10月3日星期六 · 7 則

  1. llama.cpp releases● 精選AI 評分68

    llama.cpp 新增 /v1/systemone API,支援 laya 等 5 個模型

    llama.cpp 發布 b11361,在 server 中新增 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型,並附帶模型轉換指令碼。該版本加入了共享 prompt 字首與視覺輸入支援,新增用於測試的小模型 openjev tiny,文件中明確說明不支援 date_facts。macOS Apple Silicon(arm64)建置正常,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED;

  2. r/LocalLLaMA top of the dayAI 評分37

    LocalLLaMA 討論 jev 分類模型的實際使用體驗

    r/LocalLLaMA 使用者分享 jev 系列分類模型(classifier)的真實用例:有人用 jev-reviewer 定位論文證據、避免引用幻覺,有人用 is-malicious 掃描 GitHub 倉庫與 PR 的惡意行為,還有人用 decider 4b 替代 Gemma 雙階段流程,把語音 RPG 延遲從 4-8 秒降到 2-3 秒。

10月2日星期五 · 23 則

  1. r/LocalLLaMA top of the dayAI 評分18

    愛爾蘭公立學院獲資助建小型 AI 實驗室,發帖徵集教學內容

    愛爾蘭一所公立繼續教育學院(相當於美國的社群學院)拿到資助,建起了一個小型 AI 實驗室,硬體條件還算不錯。發帖人向更有經驗的人徵集教學思路,目標是讓學生獲得使用 ChatGPT 之外的實用技能。帖子本身只提出征集,沒有給出課程方案、招生規模或具體裝置型號等細節。

  2. r/LocalLLaMA top of the dayAI 評分47

    RTX PRO 6000 實測 Qwen3.8 三版本:DFlash2 提速 2.8 倍

    在單張 RTX PRO 6000 Blackwell 96GB 上,Qwen3.8-27B 用 DFlash2 草稿模型把 Spec-Bench 單使用者解碼從 75 tok/s 提到 210 tok/s,約 2.8 倍;NVFP4 比 BF16 快 2.2 倍。三款檢查點中 Flash-Next 預填充 22.4 秒、27B 為 97 秒,長上下文召回三者均滿分,BFCL 工具呼叫 27B 以 73.3% 領先。

  3. Hacker News front pageAI 評分62

    Ai2 開源 AstaBrief 8B 科學報告模型與訓練資料

    Ai2 開源 AstaBrief 8B:一個把研究問題與檢索到的文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練,權重、訓練資料和一份可從自己 PDF 生成報告的範例工作流一併放出。它已作為 Asta 的 Generate a report 功能中的 Fast mode 上線,與 Claude 驅動的 Thinking mode 並存;

  4. Google Developers blogAI 評分45

    TPU 上最佳化稀疏注意力,1440p 影片生成推理提速 1.69 倍

    開發者用 Sparse VideoGen(SVG)把注意力頭動態路由到高度結構化的空間或時間稀疏掩碼,並在 TPU 上最佳化 Splash Attention 核心,使 1440p 影片生成的端到端推理最高提速 1.69 倍。核心側的具體改動是:跳過空記憶體 tile、把精確座標掩碼嚴格限制在邊界 tile、將 token 記憶體佈局改成時間優先(temporal-major)以獲得連續訪問。目的是把演算法層的稀疏真正對齊到硬體 tile 執行,顯著減少被浪費的矩陣運算。

  5. Google Developers blogAI 評分64

    Google Antigravity SDK 新增本地模型與 Ollama 支援

    Google Antigravity SDK 現在支援在本地離線執行 agentic 工作流,可通過 LiteRT 執行 Gemma 4 26B A4B 等模型。SDK 還提供對 Ollama、vLLM 等 OpenAI 相容推理服務的開箱支援,便於搭建隱私優先的本地工具。官方描述的混合編排方式是:雲端模型只做輕量規劃器,程式碼審計、打補丁這類消耗大量 token 的任務交由裝置上的本地模型處理。

  6. Meta AI blogAI 評分46

    匹茲堡大學在輔助機器人中用 Meta 的 DINOv3 與 SAM

    匹茲堡大學 HERL 實驗室聯合 ATDev 推進 RAMMP 輔助機器人專案(7 月 27 日發布),用 Meta 開源的 DINO、DINOv3 和 SAM 視覺模型做環境感知,專案獲美國 ARPA-H 最高 4150 萬美元資助。美國約有 550 萬輪椅使用者,每年逾 10 萬起輪椅相關傷害送進急診。團隊把模型最佳化到電池供電的邊緣裝置上執行:降低記憶體佔用、按需使用低精度、控制解析度與批處理,以犧牲少量邊界精度換取即時性與穩定性。

  7. r/LocalLLaMA top of the dayAI 評分51

    Micro Center 買 RTX 5090 需籤禁出口宣告

    據 wccftech 報導,Micro Center 現在要求購買 RTX 5090 的顧客簽署一份同意遵守禁出口政策的宣告表格,同時該卡價格已漲破 5000 美元。有使用者稱自己此前買過一臺含 5090 的整機,34 天后再想單獨購買時被經理告知已被無限期禁止購買任何 5090。此舉被認為是為了防止轉售和出口,讓更多普通顧客能買到現貨。

  8. r/LocalLLaMA top of the day● 精選AI 評分80

    微軟發布 4B 智慧體模型 FrogNano,主打倉庫級編碼

    微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。

  9. r/LocalLLaMA top of the dayAI 評分52

    自託管 AI 並不省錢,博主稱仍會繼續本地部署

    使用者 basnijholt 在 Reddit 發帖並附上部落格文章,論證自託管 AI 並不比用 API 更省錢,但他表示自己照樣會做。他提出兩點:把 200 美元的訂閱(如 Opus 5.5、Astra)與 Qwen 3.8 27B 這類本地模型直接比價並不對等;他也不會把 200 GB 的郵件、聊天記錄和位置歷史交給 API,哪怕對方承諾零資料保留。帖子發出後引發了不少爭議。

  10. Hacker News front pageAI 評分44

    Pi pod 發布:在自有伺服器沙箱中執行 pi coding agent

    Pi pod 是一個圍繞 pi coding agent 建置的自託管沙箱環境,可讓你在自己的伺服器上以隔離沙箱方式執行 pi,並補充了 agent 沙箱、原生客戶端、RBAC 會話共享和介面自動化等能力。自託管版現已提供倉庫可直接部署,託管服務尚未上線,官方計劃 v1 提供需綁卡的 7 天 Standard 試用(10 個活躍小時,之後 20 美元/月)或 50 美元/月的 Pro 方案。

  11. llama.cpp releasesAI 評分50

    llama.cpp 為 ggml 緩衝區介面新增 alloc_buffer_n 與 get_alloc_size_n

    llama.cpp 的 ggml 後端緩衝區型別介面新增 alloc_buffer_n 與 get_alloc_size_n 方法,並公開 ggml_backend_buft_alloc_buffer_n、ggml_backend_buft_get_alloc_size_n 兩個 API。預設實現負責多緩衝區分割與張量分配,Meta buffer type 提供自訂實現,按裝置建立子上下文並委託給 simple buffer type;

  12. r/LocalLLaMA top of the dayAI 評分59

    llama.cpp 新 PR 把共享專家融合進 CUDA MMVQ

    llama.cpp 的 PR #29184(作者 am17an)提出在 CUDA 後端把 MoE 的共享專家融合進 MMVQ 運算元,為部分 MoE 架構(例如 Qwen 35B A3B)帶來推理加速。評論區給出的初步結論是 token 生成速度最多提升約 5%,屬於穩步積累而非革命性改動。該改動僅針對 CUDA 後端、且只對部分 MoE 架構生效,Metal 等其他後端不受影響。

  13. NVIDIA blog● 精選AI 評分72

    NVIDIA DGX Spark 增 64GB 版,10 月 23 日 4999 美元起

    NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;

  14. 量子位AI 評分52

    openJiuwen 首發 X-Router 自演進模型路由,實測省 50%+ Token

    openJiuwen 首發 X-Router 自演進模型路由技術,按任務複雜度在本地與雲端模型池中動態選模型,實測減少 50%+ Token 消耗。該平台由華為 2012 實驗室、華為雲等團隊聯合高校與企業建置,主打昇騰親和,路由分三層:優於 1 分鐘重新整理的模型能力畫像、結合 KV 快取親和與即時負載的啟發式決策、用 Contextual Bandit 與輕量強化學習做反饋自演進,樣本不足時保留原判定。

9月30日星期三 · 4 則

  1. X @ollama● 精選AI 評分75

    Ollama 新增 Jev 風格決策模型支援

    Ollama 在部落格中宣布現已支援 Jev 風格決策模型,並同步上線決策能力文件與 API 文件。使用者可通過 ollama.com/blog 檢視說明,在 docs.ollama.com/capabilities/decision 瞭解決策能力用法,API 細節見 docs.ollama.com/api/systemone。原文未披露具體模型名稱、效能資料與發布時間以外的限制。

  2. Ollama releases● 精選AI 評分76

    Ollama v0.35.0 加入決策模型,返回選擇與機率而非文字

    Ollama v0.35.0 新增決策模型支援,通過 /v1/systemone 端點呼叫,基於 TypeSafe 的 Jev API。這類模型不返回文字,而是返回選擇、機率和分數,適合工單分流、模型路由和內容分類;目前可用 Bespoke Labs 的 Nimble 和 Together AI 的 Tev1,用 ollama pull nimble 拉取。

9月29日星期二 · 4 則

  1. Simon WillisonAI 評分40

    Photo Scrubber:本地模糊人臉並清除照片後設資料

    Photo Scrubber 是一個實驗性工具,能自動識別照片中的人臉並打碼,同時按名稱所述移除後設資料,處理在本地完成。作者拍下抗議者照片後不願分享陌生人可識別的面孔,於是讓 GPT-6 Astra 做了這個工具。它使用 Google 的 MediaPipe C++ 庫,通過 @mediapipe/tasks-vision 編譯成 WebAssembly,人臉檢測採用 BlazeFace 模型。

  2. MLX releases● 精選AI 評分70

    v0.32.3

    MLX 發布 v0.32.3,一批修復覆蓋 Metal、CUDA 與 CPU 後端,並新增面向 M5 的非量化 matmul 調優。Metal 側加入 gated delta nets 核心與 fast.cross_entropy 融合核心,降低 SDPA D256/D512 記憶體佔用,同時修復 fp 量化 matmul 在量化維度非 32 倍數時的結果損壞、GGUF 張量維度校驗與零尺寸軸的 scan/sort。

  3. Ollama blog● 精選AI 評分82

    Ollama 0.35 支援 Jev 決策模型,本地低延遲

    Ollama 0.35 起支援基於 TypeSafe Jev API 的決策模型:通過新的 /v1/systemone 端點,把文字作為 state、配上一組命名問題,本機模型在一次請求裡全部作答,且無額外費用。首批三個模型為 Bespoke Labs 的 9B nimble,以及 Together AI 的實驗性 4B tev1 和 0.8B tev1:0.8b,用 ollama pull 即可下載,可通過 curl 或 TypeSafe 官方 Python SDK 呼叫。

9月25日星期五 · 1 則

  1. Ollama releases● 精選AI 評分86

    Ollama v0.40.0:Apple Silicon 上預設改用 MLX 執行模型

    Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行,無需手動切換。用法與以往一致,例如 ollama pull qwen3.8 後 ollama run qwen3.8。該版本目前為預發布版(v0.40.0-rc0,變更範圍 v0.34.4 到 v0.40.0-rc0),官方稱預發布期間會測試並啟用更多模型,尚未說明具體支援清單與效能差異。

9月24日星期四 · 1 則

  1. Ollama releases● 精選AI 評分70

    v0.34.4 發布:Qwen 3.8 與 Gemma 4 在 Apple Silicon 上提速

    v0.34.4 發布,更新了 llama.cpp、MLX 和 XGrammar,Qwen 3.8 的提示處理在 Apple Silicon 上更快,Gemma 4 會為每張圖片自動選擇最佳解析度以保留更多高畫質細節。思考模型的結構化輸出改為單次推理完成,速度更快也更可靠;同時修復了本地模型庫很大時偶發的 model not found 報錯,以及 macOS 應用在檢測 ChatGPT 或 Codex 是否執行時無回應的問題。

更早的內容