AISpot

搜尋

依意思最接近的 18 筆

r/LocalLLaMA top of the day10/3 11:39AI 評分71

Hugging Face 發布多 harness RL 訓練指南

Hugging Face 後訓練團隊發布了一份多 harness 強化學習指南,介紹如何用 TRL 和 Harbor 等開源庫在不同 coding harness 中訓練開放模型。團隊稱,針對當前各人自建 harness(如 Pi 加擴充套件)的現狀,該方案給出了用任意開放模型在自訂 harness 上取得最佳效能的配方。指南已發布在 Hugging Face Spaces 上,作者歡迎反饋。

Apple Machine Learning Research10/1 01:00AI 評分58

RLTL;DR:讓模型從失敗中自寫反饋實現自我改進

論文提出 RLTL;DR 方法:在可驗證獎勵強化學習(RLVR)中,當任務難到模型幾乎無法成功、又沒有教師模型或範例解可蒸餾時,讓策略在每次失敗後檢視驗證器輸出,並自行寫出一條 TL;DR 式反饋,下一次 rollout 以此為條件。該方法面向自我改進場景,替代只最佳化成功嘗試的常見做法。

量子位● 精選10/5 05:42AI 評分86

Hinton、Bengio 等 22 位作者發首篇 RSI 論文,討論智慧爆炸

Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。

llama.cpp releases10/4 10:37AI 評分27

llama.cpp 修復預設白名單中失效的 LLAMA_ARG_HF_REPO_FILE 鍵

llama.cpp 發布 b11385 版本,修復了預設允許列表中失效的 LLAMA_ARG_HF_REPO_FILE 鍵(#29938)。該版本繼續為 macOS、Linux、Windows、Android 等平台提供建置,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版與 openEuler 建置被標記為 DISABLED…

Hacker News front page● 精選10/5 20:16AI 評分88

Reflection 發布首個開放權重模型 Beam:501B 總引數、23B 啟用

Reflection 發布首個開放權重模型 Beam:稀疏 MoE,總引數 501B、啟用 23B,面向程式設計、推理與 agentic 負載。預訓練使用 23.8 萬億 token,RL 階段動用 10.5K 塊 NVIDIA GB300 訓練 4 周、生成超 1 億條 rollout、約 13 億個沙箱,官方稱是開放實驗室中規模最大的 RL 訓練之一。評測中其與 GLM 5.2 相當但推理算力少 3–4 倍,接近 Qwen 3.8-Max,原始能力仍落後 Kimi K3;

Hacker News front page10/4 09:02AI 評分33

本地 LLM「機器人監獄」實驗引發 AI 意識爭論

有人在 GitHub 上對本地執行的大語言模型進行「拷問」和「疼痛」實驗,引發 X 上關於 AI 倫理的激烈爭論,部分有效利他主義者和相信 LLM 有感知的人要求 GitHub 刪除該專案。爭論源於近期多篇關於 AI 意識和「模型福利」的病毒式論文與博文,Anthropic 也曾在部落格和「Claude 憲法」中提及模型福利。文章認為 LLM 並不具備意識,其基於人類文字訓練的技術沒有通向意識的合理路徑。

機器之心● 精選10/4 12:38AI 評分68

AlphaGo 核心作者稱 LLM 不會推理,離開 DeepMind 創業

AlphaGo 核心作者 Thore Graepel 在 MIT Technology Review 發文稱 LLM 不會推理,並已離開 Google DeepMind 創業做可審計的機器推理。他指出 AlphaGo 第 37 手是策略網路加搜尋機制的結果,而 LLM 的思維鏈仍只是預測下一個 token,缺少可檢查的認知狀態、知識與推理的分離,且常事後編造解釋。Yann LeCun 表示讚賞,認為真正推理必須涉及搜尋。

llama.cpp releases10/4 13:34AI 評分36

llama.cpp 修復 Vulkan 後端 RDNA4 矩陣向量調優

llama.cpp 發布 b11389 版本,修復了 Vulkan 後端在 RDNA4 架構上的矩陣向量運算調優問題(PR #29934)。該版本繼續提供覆蓋 macOS、Linux、Windows、Android 等平台的預編譯二進位制,包括 Vulkan、CUDA、ROCm、SYCL 等後端,其中 macOS Apple Silicon 的 KleidiAI 啟用版和 openEuler 建置被停用。

r/LocalLLaMA top of the day10/3 08:00AI 評分65

LiquidAI 發布 LFM2.5-Encoder 250M/350M 編碼器

LiquidAI 發布 LFM2.5-Encoder 系列,含 250M 與 350M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度等任務。官方稱其吞吐量持平或超過 ModernBERT,CPU 長上下文有優勢,並可在瀏覽器 WebGPU 上執行;GGUF 權重已上傳 Hugging Face,llama.cpp 已提交對應支援 PR。

Cloudflare blog (AI)● 精選10/1 14:04AI 評分68

Cloudflare 將 EuroLLM 與 Apertus 兩個歐洲開源模型接入 Workers AI

Cloudflare 在生日周宣布,將歐洲兩個公共機構訓練的開源模型 EuroLLM 和 Apertus 引入 Workers AI,現已開放訪問申請。EuroLLM 覆蓋 35 種語言,含全部 24 種歐盟官方語言;Apertus 由瑞士 ETH Zurich、EPFL 等開發,訓練資料超 15 萬億 token、覆蓋 1500 多種語言,權重與資料全部公開。Cloudflare 同時啟動面向政府網路安全機構與關鍵基礎設施運營方的實操工作坊,首場 10 月在新加坡舉行。

llama.cpp releases10/3 00:57AI 評分25

llama.cpp 伺服器新增 /v1/systemone API,支援 laya、julia-1 等模型

llama.cpp 的 server 元件新增了 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型。該 PR 包含模型轉換、服務端程式碼、共享提示字首、視覺支援,並新增 openjev tiny 模型用於測試。建置覆蓋 macOS、Linux、Windows、Android 等平台,但明確不支援 date_facts。