AISpot

開源

近期事件

  1. 1
    熱度 1.13 個來源 · 3 則10/3 01:45
  2. 2
    熱度 1.12 個來源 · 3 則10/3 12:44
  3. 3
    熱度 1.12 個來源 · 2 則10/3 12:28
  4. 4
    熱度 0.82 個來源 · 2 則10/3 07:27
  5. 5
    熱度 0.83 個來源 · 4 則10/3 01:56

10月4日星期日 · 1 則

  1. llama.cpp releases● 精選AI 評分63

    llama.cpp 為 WebGPU 後端加入 f16 支援

    llama.cpp 在 WebGPU 後端為 fill/set_rows 操作加入 f16 支援(PR #29897),併發布 b11382 版本。該版本覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 建置被停用。對使用 WebGPU 推理的使用者,f16 支援可減少視訊記憶體佔用並提升相容性。

10月3日星期六 · 39 則

  1. Hugging Face blogAI 評分55

    微軟發布 ThinkingBox,按資料庫終態給 AI agent 打分

    微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。

  2. Hacker News front pageAI 評分45

    作者稱手寫程式碼時代已終結,Claude Code 讓 18 年習慣消失

    一位寫了 18 年程式碼的工程師表示,自 Claude Code 中的 Opus 4.5 越過某個門檻後,他幾乎不再手寫程式碼,並認為回不去了。他所在團隊 Filestage 每月合併 PR 從約 200 增至 300,bug 報告未增加,每位開發者每月 AI 訂閱費 20 美元,工具可自選 Codex、Claude Code 或 Cursor。他仍主張保留高階抽象,認為 LLM 應生成高階表示再交給確定性編譯器,而非直接寫彙編。

  3. llama.cpp releasesAI 評分32

    llama.cpp 修復 Windows 下 mtmd 棄用警告

    llama.cpp 發布 b11381 版本,修復了 mtmd 在 Windows 上觸發的 strdup 棄用警告(#29863),由 Hugging Face 的 Adrien Gallouët 提交。該版本繼續提供 macOS Apple Silicon(arm64)、Linux、Windows、Android 等多平台預編譯包,其中 macOS Apple Silicon 的 KleidiAI 加速版被標記為 DISABLED。

  4. Hacker News front pageAI 評分41

    Jeffy 發布 13 個本地預訓練分類器,無需 GPU

    Jeffy 是一個本地執行的簡單分類器集合,無需 GPU,在普通電腦上即可使用,自帶 13 個已訓練好的分類器,覆蓋垃圾郵件檢測、意圖路由、主題分類、情感分析,甚至能玩 Doom。使用者還可以用它訓練自己的分類器,作者表示這種架構上還能搭建更多應用,並希望瞭解大家覺得哪些任務有用、類似任務用什麼架構。

  5. r/LocalLLaMA top of the dayAI 評分75

    TensorSharp 讓 176B MoE 模型跑在 16GB 視訊記憶體筆記本上

    開源推理引擎 TensorSharp 在 RTX 3080 Laptop(16GB 視訊記憶體)、32GB 記憶體加 SSD 的普通筆記本上跑起了 Qwen3.8 Flash Next 176B,無需 128GB 以上記憶體工作站或多 GPU。它靠量化加 MoE 感知的統一排程,協調視訊記憶體、記憶體、SSD 與快取分層。

  6. r/LocalLLaMA top of the dayAI 評分49

    開發者發布 Ninfer 4080,16GB 顯示卡可跑 100k 上下文

    開發者 roofkid 發布 Ninfer 4080,讓 RTX 4080 16GB 顯示卡以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,最高預填充 2720 tok/s、生成 262 tok/s,程式碼已在 GitHub 開源並提供 Docker 映象。它採用 DFlash2 投機解碼,作者稱預填充與生成速度明顯優於 llama.cpp、vllm 等通用推理引擎,代價是 KV 量化帶來輕微精度損失。

  7. r/LocalLLaMA top of the dayAI 評分65

    專精推理引擎興起,放棄通用性換極致效能

    一批極窄用途的推理執行時正在出現,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 和 vLLM 擅長的通用性,只針對少數模型、有時甚至只針對一個硬體家族(如 Strix Halo)做最佳化。作者認為未來通用執行時負責相容性、一次性專精執行時負責最大效能將成為常態,這也有助於智慧的民主化與去中心化,並壓榨現有硬體的更多產出。

  8. Hacker News front pageAI 評分35

    LeCun 稱對 AI 滅絕人類零擔憂,批 EA 有毒

    圖靈獎得主 Yann LeCun 表示對 AI 消滅人類「零擔憂」,認為近期 OpenAI 智慧體自主入侵 Hugging Face 等事件源於沙箱設計漏洞與人類監督不足,完全可預防。他稱有效利他主義(EA)「超級有毒」,並指 Anthropic CEO Dario Amodei「完全被誤導」甚至「瘋狂」,批評其與 Sam Altman 渲染 AI 滅絕風險是「最糟糕的營銷」。LeCun 目前專注經營新公司 AMI Labs,並認為 AI 不需要新監管,真正風險是監管俘獲。

  9. Hacker News front pageAI 評分65

    Vx 發布:把 CPU、GPU、NPU 記憶體寫進型別系統的語言

    Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯。它要求跨記憶體空間顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期校驗放置是否可行。

  10. r/LocalLLaMA top of the dayAI 評分65

    MIT 許可原生代碼圖譜工具 repopedia 發布

    開發者發布 repopedia,一個 MIT 許可的原生代碼知識圖譜工具,pip 安裝後即可在倉庫上執行,用 tree-sitter 解析並生成 SQLite 圖譜檔案,無需伺服器、Docker 或 API key,程式碼不上傳雲端。它支援查詢函式呼叫者與改動影響範圍,並可通過 MCP server 讓 Claude Code 直接查圖譜,一次拿到帶 file:line 的精確答案,而非多輪 grep。

  11. r/OpenAI top of the dayAI 評分23

    Oscilloscope Diffusion 發布,可用擴散模型改造影片

    Uisato Studio 上線 Oscilloscope Diffusion,一種通過擴散模型干預已有影片的新方法:以原影片的運動與形態為起點,重新詮釋其紋理、材質與視覺語言。演示素材來自作者的 TouchDesigner 音訊反應幾何視覺化系列 Oscilloscopes, everywhere(已更新至 v1.2),也可輸入任意影片源。使用者可選擇源影片、用提示詞描述處理方式,並通過精選 LoRA 與可編輯時間線控制結果與原始畫面的接近程度。

  12. r/LocalLLaMA top of the dayAI 評分41

    自建魔獸私服,讓 LLM 通過 MCP 在瀏覽器裡玩遊戲

    作者自建了魔獸世界私服,並做了一個可在 PC 和手機瀏覽器免費玩的客戶端 jankcraft.xyz,再用自訂 MCP 與 agent harness 通過 websocket 控制瀏覽器客戶端讓 LLM 自動遊玩,agent 頁面已上線。目前雲端訂閱使用者可能遇到問題,本地模型只要服務端開啟 CORS 即可接入;作者提供的現成模型會隨用量增長撤下。

  13. llama.cpp releasesAI 評分44

    llama.cpp 新增 common_is_tty() 並修復 Windows 棄用警告

    llama.cpp 合併 PR #29860,新增 common_is_tty() 輔助函式並修復 Windows 上的棄用警告,作者為 Hugging Face 的 Adrien Gallouët。該提交同時更新了各平台預編譯產物,macOS Apple Silicon(arm64)正常提供,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED,openEuler 也處於 DISABLED 狀態。

  14. llama.cpp releases● 精選AI 評分78

    llama.cpp 修復 Ling 3.0 解析器對 json_schema 的支援

    llama.cpp 合併 PR #29813,讓 Ling 3.0 解析器支援 inputs.json_schema,此前 response_format 請求不受約束。新邏輯為回應格式語法路徑優先於工具呼叫,啟用思考時要求 JSON 前有 think 塊,且 JSON 後不允許尾隨文字。該修復對應 issue #29652,由 Claude Opus 5.5 輔助完成。

  15. llama.cpp releasesAI 評分42

    llama.cpp 的 OpenVINO 後端更新,MoE 推理大幅提速

    ggml-openvino 後端更新至 2026.4.1,新增 MoE 路由融合與 GDN 歸一化融合,並預設在 GPU 上啟用 MoE 融合。在 Arc B390 上跑 gemma-4-26B-A4B,配合 q4_asym64 重新量化,pp512 從 66.16 t/s 提升到 1608.73 t/s,困惑度基本不變。同時修復了 stateful 執行下 rank-3 軸處理導致的 MoE 崩潰,並改進裝置列舉與記憶體上報。

  16. r/LocalLLaMA top of the dayAI 評分53

    r/LocalLLaMA 熱議低位元量化對編碼任務的影響

    r/LocalLLaMA 上一則帖子引發討論:FP8/BF16 使用者看到有人跑 IQ1_S 量化感到震驚。多位使用者指出,IQ1/IQ2 這類極端量化只適合創意寫作或閒聊,用於編碼、複雜邏輯推理或結構化 JSON 提取時困惑度飆升、語法和邏輯明顯崩壞;而 Q4_K_M 或 Q5_K_M 通常是多數模型的甜點區,困惑度曲線相對平坦、視訊記憶體佔用大幅下降且推理能力幾乎無損。

  17. r/LocalLLaMA top of the dayAI 評分75

    Aleph Alpha 發布 78B MoE 開源模型 Kolibri-1

    德國 Aleph Alpha 在 Hugging Face 發布 Kolibri-1,78B 總引數、3.46B 啟用引數,支援最高 100 萬 token 上下文,Apache 2.0 許可。模型用 768 張 B300 訓練 4 周、20T token,語料約 62.5% 英文、23.9% 德文、13.6% 程式碼。目前尚無量化版本,llama.cpp 是否支援該架構未知,社群評測認為效能接近 Qwen 3.5 35B。

  18. llama.cpp releases● 精選AI 評分72

    llama.cpp 最佳化 lightning indexer 視訊記憶體與多後端支援

    llama.cpp 合併了 qwen4exp 的 lightning indexer 最佳化,把索引器打分視訊記憶體減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現在每個 head 單獨計算並原地累加進一個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 heads、Metal 用函式常量傳 head 數、Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。

  19. r/LocalLLaMA top of the dayAI 評分40

    Anyworld:本地 LLM 當 DM 的自託管多人文字 RPG

    Anyworld 是一個開源的瀏覽器多人文字冒險遊戲,由房主用 llama.cpp 本地跑模型充當 DM,也支援 OpenAI 等雲 API,玩家只需點連結加入。它支援整輪統一結算、Python 真實骰子、自訂劇本、隱藏觸發器和結構化記憶壓縮,但房主需要 Python 與網路配置能力,本地後端目前只輸出英文,重啟伺服器會丟失當前會話。作者推薦 Gemma 4-26B-A4B Q4、128k 上下文,在 RTX 5070 Ti 16GB 上每輪約 5 秒,採用 MIT 許可。

  20. r/ClaudeAI top of the day● 精選AI 評分80

    handoff-compact:自動壓縮前生成交接文件的 Claude Code 外掛

    handoff-compact 是一個 Claude Code 外掛,在 autocompact 觸發時用會話分支生成交接文件並替換原對話,實現無人值守的 handoff + /clear。作者稱長時間無人值守會話中一半 token 花在上下文已超 200k 的輪次上,既貴又因 context rot 降低品質。交接文件包含目標、狀態與驗證依據、下一步、決策與理由、已排除方案、未決問題、檔案與提交、驗證命令及最近 10 條 prompt 原文。

  21. Hacker News front pageAI 評分72

    Aleph Alpha 發布 Kolibri:78B 總參 3B 啟用開源權重模型

    德國 Aleph Alpha 於 2026 年 10 月 3 日發布 Kolibri,一個英德雙語 MoE Transformer,總引數 78B、啟用 3B,支援最長 1M token 上下文,權重已在 Hugging Face 以 Apache 2.0 許可開放下載。它面向公共管理、工業與航空航天等受監管領域,針對德語、推理、數學與 agentic 行為做了專門最佳化,官方稱其品質與服務成本處於帕累托前沿,數學、程式碼、長上下文等基準可對標啟用引數最多四倍於己的模型。

  22. r/ClaudeAI top of the dayAI 評分58

    Opus 5.5 新 Skill 把 PDF 變成動畫互動網頁書

    有人用 Opus 5.5 加一個 Skill 把 PDF 轉成帶動畫、旁白和互動測驗的網頁書,流程是 PDF→書籍規劃→分鏡→旁白→動畫與測驗→網頁書。目前只靠 Opus 5.5,沒有接入影像模型,直接喂 PDF 效果已相當好;作者計劃加入影像模型以支援繪本和人文紀錄片。專案已開源(MIT),並提供了線上書架。

  23. r/LocalLLaMA top of the dayAI 評分62

    LiquidAI 發布 LFM2.5-Encoder 350M 多語言編碼器

    LiquidAI 發布 LFM2.5-Encoder,含 350M 與 230M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度任務。官方稱其吞吐量追平或超過 ModernBERT,CPU 長上下文更強,並可通過 WebGPU 在瀏覽器執行;GGUF 權重已發布,llama.cpp 支援 PR 已提交。

  24. r/LocalLLaMA top of the dayAI 評分51

    Qwen3.8-Flash-Next 177B 在單張 RTX 5070 12GB 上跑到 11–15 tok/s

    有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上跑 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話 14–15 tok/s,比原方案約 7 tok/s 提升明顯。一次長編碼提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

  25. r/LocalLLaMA top of the day● 精選AI 評分79

    llama.cpp 新 PR 將 Qwen 索引器視訊記憶體減半

    llama.cpp 的 PR #29825 把 Qwen Flash Next 的 indexer score 視訊記憶體佔用減半,例如 131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB。作者稱 logits 完全一致,僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。

  26. r/LocalLLaMA top of the dayAI 評分73

    gufo 分支讓 Qwen3.6 35B A3B 在 Strix Halo 上跑出 3095tok/s 預填充

    開發者 nubela 發布了 gufo 的分支 gufo-Qwen3.6-35B-A3B-Q6dense,在 Strix Halo 上實現 3095 tok/s 預填充和 190 tok/s 解碼,目標是 3000 tok/s 預填充與 150 tok/s 解碼。該分支為追求速度而非智慧的負載設計,作者自行量化了模型並以 Apache 2.0 許可發布,使用 unsloth 的 GGUF 也可執行但效能較低。

更早的內容