AISpot

搜尋

依意思最接近的 10 筆

r/LocalLLaMA top of the day10/2 18:47AI 評分65

Percepta 發布 Spotlight 架構:記憶無限增長且訪問成本不變

Percepta 發布新架構 Spotlight,用可寫記憶取代注意力,是首個在不增加訪問成本的前提下實現記憶無限增長的架構。每個 token 讀寫無界記憶,但模型學會索引單個記憶單元,因此每次只觸及少量單元;無論記憶如何增長,觸及單元數不變,稀疏度可任意調節。該架構把負責計算的情報模組與儲存知識、流程和工作狀態的記憶分離,記憶增長時情報模組大小與權重都不變。模型可自己決定逐 token 載入和覆蓋哪些記憶,記憶既能存事實也能存技能,因此不必重訓練就能獲得新能力。

量子位● 精選10/1 16:06AI 評分66

何愷明團隊 NAT-ARC:純視覺解 ARC,整合達 70.2%

何愷明團隊提出純視覺 ARC 解題方案 NAT-ARC,不用 LLM,單模型(huge,0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合三種預訓練策略後達 70.2%,總引數約 2B。做法是先用 ImageNet(約 130 萬張自然影像)上訓練的 MAE encoder 權重初始化編碼器,再在 ARC 訓練集離線訓練,測試時對每道題單獨 LoRA 微調;

r/OpenAI top of the day10/3 06:38AI 評分42

為什麼嵌入模型常用 1536 維?

有開發者提問,為什麼嵌入模型常選 1536 維,而不是 1024 或 2048。OpenAI 使用過 1536 維嵌入,其他廠商也提供或推薦這一維度。提問者想知道這是 1024 與 2048 之間經驗性的折中點,還是存在架構或硬體上的便利原因,並希望有實際訓練或設計過嵌入模型的人回答。

Hugging Face blog● 精選10/2 16:19AI 評分65

Ai2 開源 AstaBrief 8B 科學報告生成模型

Ai2 開源了 8B 的科學報告生成模型 AstaBrief,可把研究問題和檢索到的文獻片段直接寫成帶引用的報告。它已在 Asta 的 Generate a report 功能中以 Fast mode 上線,與 Claude 驅動的 Thinking mode 並列:Fast mode 平均 51.1 秒生成一份報告,Thinking mode 為 178.5 秒,快約 3.5 倍。模型基於 Qwen3-8B,用 SFT 加 DPO 訓練,一次成稿,跳過了片段摘要與聚類環節。

Cloudflare blog (AI)10/1 14:04AI 評分63

Workers AI 上線 EuroLLM 與 Apertus 兩款歐洲開源模型

Cloudflare 在 Workers AI 上線兩款由歐洲公共機構訓練的開源模型:覆蓋全部 24 種歐盟官方語言的 EuroLLM,以及瑞士 ETH Zurich、EPFL 等打造的 Apertus,今天即可申請訪問。Apertus 用逾 15 萬億 token、1500 多種語言訓練,40% 訓練資料非英語,架構、權重、資料與方法全部公開,並按 EU AI Act 與 GDPR 處理訓練退出與個人資料。

r/LocalLLaMA top of the day10/3 01:00AI 評分32

宇樹發布 6B 人形機器人基礎模型 UnifoLM-WLA-1.0

宇樹機器人發布通用人形基礎模型 UnifoLM-WLA-1.0,6B 引數,用約 2500 小時真實機器人資料訓練,單個模型覆蓋 64 項任務(10 項全身 + 54 項桌面),支援平行夾爪和兩種靈巧手。架構上以基於 Qwen3-VL 的 UnifoLM-ER-1 具身推理器為起點,加入光流與 VQ-VAE 的未來動態區域預測,用殘差 VQ 離散化末端執行器、手和下肢動作,再疊加 MMDiT 動作專家做連續控制。

r/LocalLLaMA top of the day10/3 12:44AI 評分75

Aleph Alpha 發布 78B MoE 開源模型 Kolibri-1

德國 Aleph Alpha 在 Hugging Face 發布 Kolibri-1,78B 總引數、3.46B 啟用引數,支援最高 100 萬 token 上下文,Apache 2.0 許可。模型用 768 張 B300 訓練 4 周、20T token,語料約 62.5% 英文、23.9% 德文、13.6% 程式碼。目前尚無量化版本,llama.cpp 是否支援該架構未知,社群評測認為效能接近 Qwen 3.5 35B。

llama.cpp releases● 精選10/3 00:57AI 評分68

llama.cpp 新增 /v1/systemone API,支援 laya 等 5 個模型

llama.cpp 發布 b11361,在 server 中新增 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型,並附帶模型轉換指令碼。該版本加入了共享 prompt 字首與視覺輸入支援,新增用於測試的小模型 openjev tiny,文件中明確說明不支援 date_facts。macOS Apple Silicon(arm64)建置正常,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED;