搜尋 關鍵字 語意 找到 50 筆
機器之心● 精選 10/4 12:38 AI 評分68
AlphaGo 核心作者 Thore Graepel 在 MIT Technology Review 發文稱 LLM 不會推理,並已離開 Google DeepMind 創業做可審計的機器推理。他指出 AlphaGo 第 37 手是策略網路加搜尋機制的結果,而 LLM 的思維鏈仍只是預測下一個 token,缺少可檢查的認知狀態、知識與推理的分離,且常事後編造解釋。Yann LeCun 表示讚賞,認為真正推理必須涉及搜尋。
X @lmstudio● 精選 9/19 01:45 AI 評分63
LM Studio 宣布與 inco_ai 合作,在發布首日(day 0)接入其 Splash 推理引擎,用於在本地執行 Qwen3.8-27B。官方給出的實測資料是在 M5 Max 上最高可達 144 tok/s。使用者可通過 LM Studio 官方部落格的連結獲取並立即執行。
X @deepseek_ai9/10 07:10 AI 評分53
DeepSeek 官方表示將與開源社群緊密合作,為 V4.1-Flash 提供推理支援,並探索更多部署方案。官方同時提出可承接 2000 塊 GPU 加儲存叢集的大規模部署需求,並附上模型與論文連結。
Meta AI blog● 精選 10/2 22:11 AI 評分93
Meta Superintelligence Labs 於 2026 年 7 月 9 日發布 Muse Spark 1.1,這是 Muse Spark 的升級版多模態推理模型,面向 agentic 任務,在工具與電腦操作、程式設計和多模態理解上有明顯提升。模型支援 100 萬 token 上下文視窗,可編排多智慧體系統,並已在 Meta AI 應用和 meta.ai 的 Thinking 模式上線。
r/LocalLLaMA top of the day10/3 19:24 AI 評分42
近期出現一批極窄用途的推理執行時,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 與 vLLM 擅長的通用性,只針對少數模型甚至單一硬體家族(如 Strix Halo)做最佳化。作者認為通用執行時負責相容、過擬合執行時負責極致效能將成為常態,並有助於智慧的民主化與去中心化,讓現有硬體在特定配置下榨出最大輸出。
r/LocalLLaMA top of the day10/3 02:33 AI 評分42
作者發布專為 RTX5090 打造的推理引擎 MegaCapybara,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單任務編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。引擎具備 VRAM-RAM-DISC 快取管理、雙層 Loop Guard、帶後設資料的自研權重格式(可對比 BF16 顯示 KL 與 top-1% 損失)以及圖形介面,採用 MIT 許可,原始碼與權重建置器後續發布。
r/LocalLLaMA top of the day10/3 15:15 AI 評分64
r/LocalLLaMA 使用者集中討論名為 Strata 的推理方案,稱其是專為 Qwen 3.8 Flash Next 打造的 llama.cpp 分支,面向 12GB 以上視訊記憶體的 GPU。使用者實測在 16GB 視訊記憶體、24GB 視訊記憶體及 64GB 記憶體等配置上可執行該開源模型,有人報告解碼約 82 tok/s、60 tok/s 或 1200pp,並稱速度約為 Qwen 3.8 27B 在 llama.cpp 上的兩倍。也有人質疑相關帖子是機器人營銷,討論其是否為炒作。
X @Zai_org9/17 08:05 AI 評分55
智譜分享 GLM-5.3 如何幫助建置並最佳化為 GLM-5.3-Flash 提供服務的推理基礎設施。該系統從首次成功執行到具備生產可用性不到兩週,端到端吞吐量達到初始基線的三倍。關鍵在於密集反饋:本地正確性測試、執行軌跡、微基準與端到端測量,使團隊能針對假設做定向驗證,而非只依賴聚合效能指標。
Ollama blog● 精選 9/29 01:00 AI 評分78
Ollama 0.35 新增基於 TypeSafe Jev API 的決策模型支援,通過 /v1/systemone 端點一次請求回答多個命名問題,無額外費用。首批三個模型為 Bespoke Labs 的 9B nimble、Together AI 的 4B tev1 與 0.8B tev1:0.8b,可用於工單分流、模型路由與內容稽核。官方稱 nimble 在 M5 Max 本地執行平均每次決策 91ms,後續將加入 MLX 加速與雲端模型。
OpenRouter announcements● 精選 9/22 01:00 AI 評分78
OpenRouter 上線 Batch API,把請求打包提交後由服務商在 24 小時內擇時完成,換取約為正常每 token 價格 50% 的折扣,目前已支援 70 多個模型。兩週 beta 期間 23 萬多個批次的中位完成時間為 7 分鐘,90% 在一小時內完成;太平洋時間凌晨 5 點到中午提交明顯更慢。支援 chat completions、responses、messages 和 embeddings,輸入結果保留 30 天,圖片和檔案需用公開 URL。
X @awnihannun9/3 17:07 AI 評分46
開發者 awnihannun 稱,Qwen 27B dense 模型在 M5 Max 上實現 105 tok/s 的輸出速度。該資料針對本地推理場景,反映 Apple Silicon 新晶片在消費級硬體上執行中等規模稠密模型的效能表現,具體測試條件與量化方式未在原文說明。
llama.cpp releases● 精選 10/3 12:54 AI 評分70
ggml-openvino 後端更新到 2026.4.1,重點最佳化 Qwen3.5 MoE 推理效能,並新增推理效能分析、預設使用遠端輸出張量、磁碟快取模型直載(cache_only)等能力。在 Arc B390 上以 q4_asym64_all 重量化執行 gemma-4-26B-A4B,pp512 從 66.16 t/s 提升到 1608.73 t/s,tg128 從 25.94 提升到 26.46 t/s,困惑度基本不變。
llama.cpp releases10/3 02:06 AI 評分40
llama.cpp 發布 b11364 版本,新增對 nimble 決策模型的支援(PR #29844)。該版本覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 平台,提供 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL、Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端建置;
X @ggerganov● 精選 10/2 15:33 AI 評分80
llama.cpp 最新建置已加入 Decision 模型支援,新增 /v1/systemone 端點,可在本地進行 Jev 風格推理,兼顧效率與隱私。目前支援多個開源模型,官方表示後續還會增加更多模型。
X @lmstudio● 精選 9/19 01:45 AI 評分63
LM Studio 上線名為 Splash 的實驗性推理後端,使用者可在 Settings > Runtime > Experimental backends 中啟用。官方建議配置為 M3 或更新的 Mac、macOS 26.4 及 36GB 以上記憶體,支援的模型可在應用內搜尋 "incoai" 下載。
Ollama blog● 精選 8/10 01:00 AI 評分87
Meta Superintelligence Labs 的首個開源模型 Muse Glimmer 已在 Ollama 上線,採用 Apache 2.0 許可。它是 30B 多模態模型,面向本地執行的 agent 工作負載,上下文長度 128K 以上,支援 low 到 xhigh 四檔推理強度。
Gemini API release notes● 精選 9/15 01:00 AI 評分85
Google 於 2026 年 9 月 15 日宣布 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款音訊到音訊模型正式可用(GA),面向 Live API 的即時語音應用。前者是低延遲語音代理與即時對話的預設選項,支援交錯推理、預設非同步函式呼叫和完整會話客戶端內容更新;後者支援即時音訊互動中的後臺推理,適合需要更高後臺推理能力的場景。
MLX LM releases3/7 03:59 AI 評分42
MLX 發布 v0.31.0,新增 Qwen 3.5 張量並行支援、JoyAI LLM Flash 模型,並加入 --prefill-step-size 命令列引數以權衡速度與視訊記憶體。該版本集中修復了 CacheList 儲存/載入、MLA 模型混合量化、MiniMax M2.5 分片 RMS Norm 等問題,同時改進服務端快取並新增 cached_tokens 用量欄位。
llama.cpp releases10/2 15:28 AI 評分20
llama.cpp 合併 PR #29828,為高通 Hexagon NPU 安裝重建的 HTP skels,並修復 HTP skel 目錄依賴。該改動面向在驍龍裝置上通過 Hexagon NPU 執行本地推理的使用者,涉及 Linux arm64 與 Android arm64 的 Snapdragon 建置。相關建置產物已隨本次發布提供,並附有 attestations 連結。
MLX LM releases2/4 21:27 AI 評分53
MLX 發布 v0.30.6,新增 Kimi-K2.5、LongCat Flash、LongCat Flash Lite、Step 3.5 Flash 等模型支援,並修復 Deepseek V3.2、GLM 4.7 工具呼叫等問題。該版本還加入 Transformers v5 支援、服務端分散式推理、自訂模型載入,以及 chat_template_kwargs 和 top_logprobs 引數支援。
r/LocalLLaMA top of the day10/3 21:06 AI 評分70
開發者用自研開源推理引擎 TensorSharp,在 RTX 3080 Laptop(16GB 視訊記憶體)+32GB 記憶體+SSD 的普通筆記本上執行 Qwen3.8 Flash Next 176B。做法是量化加 MoE 感知的統一排程,把快取、視訊記憶體、記憶體和 SSD 按專家啟用情況分層協調。對比 Strata:解碼 11.09 對 10.24 tok/s,但整程耗時 16.54 秒對 62.15 秒。
Google Developers blog● 精選 10/2 22:21 AI 評分69
Google Antigravity SDK 現已支援在本地執行離線 agentic 工作流,可通過 LiteRT 呼叫 Gemma 4 26B A4B 等模型。該更新支援混合編排架構,由雲端模型擔任輕量規劃器,本地模型在裝置上處理程式碼審計與修補等高 token 消耗任務。SDK 還直接相容 Ollama、vLLM 等 OpenAI 相容推理伺服器,便於建置隱私優先的本地自主工具。
r/LocalLLaMA top of the day10/3 12:47 AI 評分38
r/LocalLLaMA 上一則帖子以「FP8/BF16 使用者看到有人跑 IQ1_S」為題引發討論。多位使用者認為量化影響取決於用途:創意寫作、閒聊可容忍 IQ1/IQ2,但編碼、複雜推理和結構化 JSON 提取會明顯崩壞。有人實測 Qwen 3.8 27b 後稱 mxfp4/nvfp4 品質接近 Q6,GSQ-RCO 在 IQ3_S、IQ3_XXS 仍可用;也有人認為 Q4_K_M 或 Q5_K_M 是多數模型的甜點區。
r/OpenAI top of the day10/3 16:36 AI 評分70
OpenAI 在官網發布 GPT-6 家族模型指南,面向初創公司,內容涵蓋如何選擇 GPT-6 模型、調節推理強度、改進提示詞與技能、協調工具呼叫,以及為生產環境準備工作流。該指南以教程形式發布在 openai.com,Reddit 討論中使用者提及 6.1 在 20 英鎊套餐上效率很高,也有人反映速度偏慢。
llama.cpp releases10/5 05:35 AI 評分37
llama.cpp 發布 b11402 版本,CUDA 後端改為優先採用整塊(whole-tile)FlashAttention 排程,以提升兩階段核心效率。
Hacker News front page10/4 10:24 AI 評分63
SCM(Screen Memories)是一款 macOS 本地優先的 AI 搜尋工具,可對任意資料夾中的照片和影片逐幀進行語義搜尋,無需帳號、雲端或上傳,推理全部在本機完成。它提供 Files、Scenes、OCR、Dialogue 和可選的本地 LLM 聊天五種搜尋模式,支援按鏡頭時間碼跳轉、Whisper 臺詞精確檢索以及 Tesseract 多語言文字識別。預設 CLIP 模型權重約 435MB,首次下載後完全離線;
量子位● 精選 10/1 16:06 AI 評分72
何愷明團隊發布 NAT-ARC,用 ImageNet 上 MAE 預訓練的視覺編碼器解 ARC 抽象推理題,最佳單模型(0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合後 70.2%。該方法不依賴 LLM,預訓練階段不使用 ARC 格子,僅複用 MAE 公開 checkpoint,測試時對每題做 LoRA 微調。論文稱這是純視覺方案首次逼近專用 LLM 系統水平,並顯示預訓練打通了視覺路線的 scaling 瓶頸。
X @lmstudio● 精選 9/19 01:45 AI 評分66
LM Studio 官方帳號宣布 Splash 引擎已開源,程式碼託管在 GitHub 的 incoai/splash 倉庫。官方僅給出倉庫連結,未披露該引擎的具體功能、支援的模型格式或硬體要求。
Google Developers blog● 精選 10/2 22:21 AI 評分68
開發者將 Sparse VideoGen(SVG)用於高解析度影片擴散模型,把注意力頭動態路由到結構化空間或時間稀疏掩碼,以緩解自注意力的二次延遲瓶頸。為在 TPU 上把演算法稀疏轉化為實際加速,團隊最佳化 Splash Attention 核心:跳過空記憶體塊、僅在邊界塊做精確座標掩碼、將 token 記憶體佈局改為時間優先以連續訪問。這些最佳化與硬體塊執行對齊後,1440p 影片生成端到端推理最高提速 1.69 倍。
llama.cpp releases10/5 12:46 AI 評分36
llama.cpp 發布建置 b11414,本版列出的程式碼改動是 Vulkan 後端修復 prealloc_y 在 flash attention 與 soft_max 之間複用時殘留舊資料的問題(PR #29591),提交標註 Assisted-by: Claude。
llama.cpp releases10/4 15:43 AI 評分30
llama.cpp 發布 b11392 版本,主要變更是 CI 設定預設權限(#29945)。該版本提供覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的預編譯產物,包括 Apple Silicon arm64、CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL 等後端;
X @sama10/2 23:19 AI 評分27
OpenAI CEO Sam Altman 就外界對 OpenAI 與 Cerebras 合作關係的猜測作出回應,稱 Cerebras 是緊密合作夥伴,雙方有深度合作,共同推進速度前沿。該表態未披露合作的具體內容、規模或時間安排。
llama.cpp releases10/2 14:52 AI 評分17
llama.cpp 發布 b11346 版本,主要變更是修復 qwen4exp 的測試(#29819)。該版本為 macOS、iOS、Linux、Android、Windows 和 openEuler 提供預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 及 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU 等後端;
Ollama releases● 精選 10/4 17:37 AI 評分80
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構將自動改用 MLX 執行。官方範例為 ollama pull qwen3.8 與 ollama run qwen3.8;預發布期間會繼續測試並啟用更多模型。
llama.cpp releases10/4 23:56 AI 評分35
llama.cpp 發布 b11399 版本,主要變更是重構 CUDA swizzling 程式碼並修復模板與迴圈邊界。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,其中 macOS Apple Silicon 的 KleidiAI 版本被標記為 DISABLED,openEuler 建置同樣被停用。
llama.cpp releases10/4 01:37 AI 評分33
llama.cpp 發布 b11382 版本,為 WebGPU 後端的 fill/set_rows 操作加入 f16 支援(PR #29897)。該版本同時更新了覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的多平台建置產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU…
r/LocalLLaMA top of the day10/3 19:58 AI 評分75
開發者 roofkid 發布 Ninfer 4080,在 RTX 4080 16GB 上以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,實測最高 prefill 2720 tok/s、生成 262 tok/s。專案採用 DFlash2 推測解碼與 KV 壓縮,程式碼已在 GitHub 開源並提供 Docker 映象。
llama.cpp releases10/3 09:36 AI 評分43
llama.cpp 合併 PR #29831,為 clef 決策模型加入初始支援,目前僅限純文字輸入。該改動同時更新了 gguf-py 常量並清理了靜態圖相關程式碼,隨附的建置產物覆蓋 macOS、Linux、Windows、Android 與 openEuler 等多個平台。
Ollama releases● 精選 9/30 00:56 AI 評分78
Ollama v0.35.0 通過 /v1/systemone 介面支援決策模型,基於 TypeSafe 的 Jev API,返回選項、機率和分數而非文字,可用於工單分類、模型路由和內容分類。首批模型為 Bespoke Labs 的 Nimble 和 Together AI 的 Tev1,可用 ollama pull nimble 拉取。
Google AI blog● 精選 10/2 16:00 AI 評分85
Google 在 9 月發布新一代前沿模型 Gemini 4 Argon,具備先進推理能力與 100 萬 token 輸出上限,目前通過 Fairwind Program 向受信任的網路安全防禦方分階段開放。
X @deepseek_ai● 精選 9/10 07:10 AI 評分75
DeepSeek 公布 V4.1-Flash 的 KV cache 相比上一代只需 1/4 的 HBM 和 1/8 的 SSD 儲存。官方指出快取命中費用常佔 agent 成本很大比例,壓縮快取可顯著降低這部分開銷。
MLX LM releases2/12 18:40 AI 評分55
MLX 發布 v0.30.7,新增 GLM5 與 Qwen3.5 系列(不含視覺)支援,並修復 Kimi Linear、DeepSeek V3.2 索引器與權重載入問題。該版本為 LFM2 模型加入 Pythonic 工具呼叫,新增 Mistral 工具解析器與 LongCat MLA,同時提升 DeepSeek V3.2 生成速度,訓練流程中驗證集改為可選。
llama.cpp releases10/5 06:24 AI 評分42
llama.cpp 合併 PR #29633,在 CUDA 後端針對小批次場景的 thin f16/bf16 mul_mat 改用 MMVF 指令,並調整了核心選擇邏輯。該改動由 NVIDIA 工程師提交,影響 Ubuntu 與 Windows 的 CUDA 12/13 建置,面向在 NVIDIA GPU 上執行本地推理的使用者。
llama.cpp releases10/4 20:50 AI 評分23
llama.cpp 發布建置版本 b11397,主要變更是將 CUDA 後端的 neu_padded 移動到實際使用位置(PR #29940),作者為 Hugging Face 的 Adrien Gallouët。該版本繼續提供 macOS、Linux、Windows、Android 等多平台預編譯包,覆蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端;
llama.cpp releases10/3 00:18 AI 評分31
llama.cpp 合併 PR #28531,在共享記憶體為 32KB 的三星 GPU 上停用 Vulkan 後端的大矩陣乘分塊(large matmul tile),以規避該硬體配置下的問題。該改動由 Claude Opus 輔助完成,並附有建置證明連結。
llama.cpp releases10/5 09:19 AI 評分12
llama.cpp 發布 b11407 版本,修復了在開啟 -DGGML_VULKAN_RUN_TESTS=ON 時 Vulkan 後端出現的未宣告識別符號問題。該版本同步提供 macOS、Linux、Windows、Android 等多平台預編譯包,涵蓋 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL 及 Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端。
X @ollama10/3 01:56 AI 評分35
Ollama 官方帳號發布 Clef Flash 與 Clef 兩個模型,均已上線 Ollama 模型庫,地址分別為 ollama.com/library/clef-flash 和 ollama.com/library/clef。使用者可通過 Ollama 直接拉取執行,但原文未披露模型引數規模、量化版本與硬體要求等細節。
Ollama releases● 精選 10/5 00:54 AI 評分75
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構將自動改用 MLX 執行。可用模型包括 qwen3.8、gemma4、qwen3.6、qwen3.5,決策模型 Nimble、tev1、clef、clef-flash 也已登陸 MLX,官方稱會繼續測試並啟用更多模型。
llama.cpp releases10/3 22:09 AI 評分27
llama.cpp 發布更新,將依賴庫 cpp-httplib 升級到 0.59.0,對應 PR #29886。該版本繼續提供覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的預編譯建置,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL 以及 Snapdragon 的 CPU、Adreno GPU 和 Hexagon NPU 等後端。
llama.cpp releases10/2 23:23 AI 評分37
llama.cpp 發布 b11352 建置版本,主要變更為最佳化 Qwen4 的掩碼構造(#29824),並將相同改動應用到 GLM5-next。該版本覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 平台,提供 CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL 等多種後端建置,其中 macOS Apple Silicon 的 KleidiAI 建置被標記為 DISABLED。