搜尋
依意思最接近的 10 筆
r/LocalLLaMA top of the day10/2 18:47AI 評分65
Percepta 發布新架構 Spotlight,用可寫記憶取代注意力,是首個在不增加訪問成本的前提下實現記憶無限增長的架構。每個 token 讀寫無界記憶,但模型學會索引單個記憶單元,因此每次只觸及少量單元;無論記憶如何增長,觸及單元數不變,稀疏度可任意調節。該架構把負責計算的情報模組與儲存知識、流程和工作狀態的記憶分離,記憶增長時情報模組大小與權重都不變。模型可自己決定逐 token 載入和覆蓋哪些記憶,記憶既能存事實也能存技能,因此不必重訓練就能獲得新能力。
量子位● 精選10/1 16:06AI 評分66
何愷明團隊提出純視覺 ARC 解題方案 NAT-ARC,不用 LLM,單模型(huge,0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合三種預訓練策略後達 70.2%,總引數約 2B。做法是先用 ImageNet(約 130 萬張自然影像)上訓練的 MAE encoder 權重初始化編碼器,再在 ARC 訓練集離線訓練,測試時對每道題單獨 LoRA 微調;
r/LocalLLaMA top of the day10/3 11:39AI 評分63
Hugging Face 後訓練團隊用 TRL 和 Harbor 框架,開源了一套在多種 coding harness 中訓練開放模型的完整指南。指南針對每個人自有的定製 harness(如 Pi 加擴充套件),給出用任意開放模型榨取最佳效能的配方,連結已公開在 Hugging Face Spaces。
r/OpenAI top of the day10/3 06:38AI 評分42
有開發者提問,為什麼嵌入模型常選 1536 維,而不是 1024 或 2048。OpenAI 使用過 1536 維嵌入,其他廠商也提供或推薦這一維度。提問者想知道這是 1024 與 2048 之間經驗性的折中點,還是存在架構或硬體上的便利原因,並希望有實際訓練或設計過嵌入模型的人回答。
r/LocalLLaMA top of the day10/3 15:16AI 評分72
基於 ExLlamaV3 的 Kyojin 引擎在 AMD Strix Halo(gfx1151、ROCm)上讓兩個 300B 級 MoE 模型各裝進一臺 128GB 迷你主機:GLM-5.3-Flash 佔 99.7GB,3.5K 上下文預填充 580 tok/s,解碼 26 到 30 tok/s;MiMo-V2.6-Flash 佔 105GB,解碼最高 44 tok/s(程式碼場景)。
Hugging Face blog● 精選10/2 16:19AI 評分65
Ai2 開源了 8B 的科學報告生成模型 AstaBrief,可把研究問題和檢索到的文獻片段直接寫成帶引用的報告。它已在 Asta 的 Generate a report 功能中以 Fast mode 上線,與 Claude 驅動的 Thinking mode 並列:Fast mode 平均 51.1 秒生成一份報告,Thinking mode 為 178.5 秒,快約 3.5 倍。模型基於 Qwen3-8B,用 SFT 加 DPO 訓練,一次成稿,跳過了片段摘要與聚類環節。
Cloudflare blog (AI)10/1 14:04AI 評分63
Cloudflare 在 Workers AI 上線兩款由歐洲公共機構訓練的開源模型:覆蓋全部 24 種歐盟官方語言的 EuroLLM,以及瑞士 ETH Zurich、EPFL 等打造的 Apertus,今天即可申請訪問。Apertus 用逾 15 萬億 token、1500 多種語言訓練,40% 訓練資料非英語,架構、權重、資料與方法全部公開,並按 EU AI Act 與 GDPR 處理訓練退出與個人資料。
r/LocalLLaMA top of the day10/3 01:00AI 評分32
宇樹機器人發布通用人形基礎模型 UnifoLM-WLA-1.0,6B 引數,用約 2500 小時真實機器人資料訓練,單個模型覆蓋 64 項任務(10 項全身 + 54 項桌面),支援平行夾爪和兩種靈巧手。架構上以基於 Qwen3-VL 的 UnifoLM-ER-1 具身推理器為起點,加入光流與 VQ-VAE 的未來動態區域預測,用殘差 VQ 離散化末端執行器、手和下肢動作,再疊加 MMDiT 動作專家做連續控制。
r/LocalLLaMA top of the day10/3 12:44AI 評分75
德國 Aleph Alpha 在 Hugging Face 發布 Kolibri-1,78B 總引數、3.46B 啟用引數,支援最高 100 萬 token 上下文,Apache 2.0 許可。模型用 768 張 B300 訓練 4 周、20T token,語料約 62.5% 英文、23.9% 德文、13.6% 程式碼。目前尚無量化版本,llama.cpp 是否支援該架構未知,社群評測認為效能接近 Qwen 3.5 35B。
llama.cpp releases● 精選10/3 00:57AI 評分68
llama.cpp 發布 b11361,在 server 中新增 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型,並附帶模型轉換指令碼。該版本加入了共享 prompt 字首與視覺輸入支援,新增用於測試的小模型 openjev tiny,文件中明確說明不支援 date_facts。macOS Apple Silicon(arm64)建置正常,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED;