AISpot

地端推論與硬體

9月22日星期二 · 1 則

9月19日星期六 · 3 則

9月18日星期五 · 1 則

  1. LM Studio blog● 精選AI 評分82

    Inco AI 開源 Splash 引擎,最佳化 Apple Silicon 本地推理

    Inco AI 發布開源推理引擎 Splash,專為在 Apple Silicon 上本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,已整合進 LM Studio Bionic 1.1.5 及以上版本。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四個併發請求合計吞吐 170 tokens/s,是次快引擎的 3.9 倍。

9月17日星期四 · 2 則

9月10日星期四 · 3 則

  1. Mistral AI newsAI 評分42

    Mistral 與 Cloudera 合作,模型可部署於本地及氣隙環境

    Mistral 與 Cloudera 於 2026 年 9 月 10 日宣布合作,把 Mistral 模型整合進 Cloudera 混合資料平台,企業可在私有云、公有云、本地乃至完全氣隙環境中執行推理。企業還能在受控環境裡用自有專有資料訓練定製模型,並以開放權重方式擁有模型與資料。Cloudera 稱其平台上執行著客戶自管的 30 EB 資料,合作面向金融、製造、電信等受監管行業,核心是讓資料、智慧、算力與運營留在客戶手中。

9月4日星期五 · 1 則

9月3日星期四 · 1 則

8月25日星期二 · 2 則

  1. Ollama blog● 精選AI 評分80

    Ollama 支援作為閘道器接入 Claude Desktop

    Ollama 現在可作為第三方閘道器接入 Claude Desktop,開發者在 Ollama 中開啟 Claude 開關即可自動完成配置。連線後可選任意 Ollama 模型,包括本地執行的開放模型與 Ollama 雲端模型,也能隨時切回 Anthropic 模型;在 Ollama 裡關閉 Claude 即恢復原有設定。

8月18日星期二 · 1 則

8月11日星期二 · 1 則

  1. Ollama blog● 精選AI 評分90

    NVIDIA Nemotron 3.5 Lightning 上線 Ollama,可完全本地執行

    NVIDIA 的 30B 總引數(3B 啟用)開源模型 Nemotron 3.5 Lightning 已上線 Ollama,可完全在本地裝置執行。它採用混合 MoE 架構,支援最長 1M token 上下文,並用多 token 預測、DFlash 或 DSpark 投機解碼,吞吐達同類開源模型 4 倍、任務完成時間快 30%,面向呼叫工具、跑測試、檢索程式碼庫等長時 agent 任務。

8月10日星期一 · 2 則

7月7日星期二 · 1 則

4月22日星期三 · 2 則

  1. MLX LM releases● 精選AI 評分65

    MLX 發布 v0.31.3,修復快取與工具呼叫多個 bug

    MLX 在 2026-04-22 發布補丁版 v0.31.3,以大量 bug 修復為主,並新增執行緒本地生成流(thread local generation stream),配合 MLX v0.31.2。修復覆蓋 BatchKVCache、BatchRotatingKVCache 與 ArraysCache 的 batch 維度不匹配,以及服務端並行工具呼叫、MiniMax M2 並行工具呼叫和 Mistral 空 tool_call_end 導致的工具呼叫中斷。

  2. MLX releases● 精選AI 評分74

    MLX v0.31.2 發布,CUDA 量化矩陣乘與多執行緒支援增強

    MLX 發布 v0.31.2,把 CUDA 後端的量化矩陣乘擴充套件到了 3/5/6-bit、int4 與浮點量化(qmm_naive、qmm_sm80),並新增 GatherQMM 和 CUDA FFT。框架現在支援多執行緒執行獨立計算:CommandEncoder、ThreadLocalStream 改為執行緒本地,Scheduler::enqueue 執行緒安全,JACCL 拆分為獨立庫。

4月7日星期二 · 1 則

  1. MLX LM releases● 精選AI 評分75

    mlx_lm 發布 v0.31.2,新增 Gemma 4 支援並重構批處理生成

    MLX 生態的 mlx_lm 發布 v0.31.2(上一版為 v0.31.0),重點是新增 Gemma 4 支援,包括工具呼叫解析器、多 token 的 think 與工具起止標記,並修復其量化逐層投影載入。此次還重構了 BatchGenerator、為非裁剪型快取快取系統提示與使用者訊息,批處理生成器恢復 max-kv-size 引數,伺服器新增 --allowed-origins 選項,並加入 Nemotron super 支援。

3月7日星期六 · 1 則

2月12日星期四 · 1 則

  1. MLX LM releases● 精選AI 評分84

    v0.30.7 發布:修復 Kimi Linear、DeepSeek V3.2,新增 GLM5 與 Qwen3.5

    2026 年 2 月 12 日發布的 v0.30.7 修復了 Kimi Linear 與 DeepSeek V3.2 的 indexer 和權重載入問題,並加快 DSV32 生成速度。這一版新增 GLM5、不含視覺能力的 Qwen3.5 系列與 LongCat MLA 支援,LFM2 模型可用 Pythonic 方式呼叫工具,另加入 Mistral 工具解析器。訓練流程中的驗證集改為可選,還有一項為下一版本提號的版本號變更。

2月4日星期三 · 1 則