搜尋
找到 6 筆
r/LocalLLaMA top of the day10/2 22:47AI 評分47
在單張 RTX PRO 6000 Blackwell 96GB 上,Qwen3.8-27B 用 DFlash2 草稿模型把 Spec-Bench 單使用者解碼從 75 tok/s 提到 210 tok/s,約 2.8 倍;NVFP4 比 BF16 快 2.2 倍。三款檢查點中 Flash-Next 預填充 22.4 秒、27B 為 97 秒,長上下文召回三者均滿分,BFCL 工具呼叫 27B 以 73.3% 領先。
r/LocalLLaMA top of the day10/3 19:24AI 評分65
一批極窄用途的推理執行時正在出現,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 和 vLLM 擅長的通用性,只針對少數模型、有時甚至只針對一個硬體家族(如 Strix Halo)做最佳化。作者認為未來通用執行時負責相容性、一次性專精執行時負責最大效能將成為常態,這也有助於智慧的民主化與去中心化,並壓榨現有硬體的更多產出。
r/LocalLLaMA top of the day10/3 19:58AI 評分49
開發者 roofkid 發布 Ninfer 4080,讓 RTX 4080 16GB 顯示卡以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,最高預填充 2720 tok/s、生成 262 tok/s,程式碼已在 GitHub 開源並提供 Docker 映象。它採用 DFlash2 投機解碼,作者稱預填充與生成速度明顯優於 llama.cpp、vllm 等通用推理引擎,代價是 KV 量化帶來輕微精度損失。
r/LocalLLaMA top of the day10/3 16:42AI 評分41
作者自建了魔獸世界私服,並做了一個可在 PC 和手機瀏覽器免費玩的客戶端 jankcraft.xyz,再用自訂 MCP 與 agent harness 通過 websocket 控制瀏覽器客戶端讓 LLM 自動遊玩,agent 頁面已上線。目前雲端訂閱使用者可能遇到問題,本地模型只要服務端開啟 CORS 即可接入;作者提供的現成模型會隨用量增長撤下。
Google Developers blog10/2 22:21AI 評分64
Google Antigravity SDK 現在支援在本地離線執行 agentic 工作流,可通過 LiteRT 執行 Gemma 4 26B A4B 等模型。SDK 還提供對 Ollama、vLLM 等 OpenAI 相容推理服務的開箱支援,便於搭建隱私優先的本地工具。官方描述的混合編排方式是:雲端模型只做輕量規劃器,程式碼審計、打補丁這類消耗大量 token 的任務交由裝置上的本地模型處理。
r/LocalLLaMA top of the day10/2 22:49AI 評分27
開發者 Wayne Workman 用 11 個月業餘時間從零訓練了專注二戰資訊的小語言模型 Peacebell,已開源權重與訓練材料,含 291M 和 148M 兩個引數版本。148M 版是為參加 HuggingFace 限制 150M 以內模型規模的榜單而做,同時發布了 WWII 主題基準 ww2bench,題目不公開以防進入訓練資料。模型可在 CPU 上執行,作者提供了定製 vLLM fork,並稱其長上下文表現較差,下一版預計 2027 年發布。