AISpot

搜尋

找到 37 筆

機器之心10/5 13:01AI 評分45

曼徹斯特大學提出相容性感知形態學習,實現梯度超材料逆向設計

曼徹斯特大學 Digital Manufacturing Lab 提出相容性感知形態學習(Compatibility-Aware Morphology Learning)框架,把微結構間的邊界幾何相容性直接編碼進低維設計空間,使不同拓撲單胞能夠連續過渡,論文已被 CMAME 接收,程式碼與資料在 GitHub 開源。該框架還結合基於先驗的資料篩選,在進入昂貴多物理場最佳化前先篩掉聲學潛力不足的候選結構,並以力學—聲學協同設計作為驗證案例。

r/LocalLLaMA top of the day10/3 10:00AI 評分12

網友討論對 Kimi K3.5 的期待

有使用者在 Reddit 發帖討論對 Kimi K3.5 的期待,稱 K3 已是令人喜愛的模型,好奇 K3.5 會有多強。帖主回顧稱 K2 已經不錯,K2.5 憑藉持續學習階段提升到全新水平,據其記憶使用了超過 20-25T token。該帖未提供 K3.5 的發布時間、引數或官方資訊。

Hugging Face blog● 精選10/7 13:45AI 評分82

Nemotron 微調後在 IOI 與 IMO 2026 均達金牌水平

NVIDIA 以監督微調、強化學習和反饋式推理專門化 Nemotron 3,在 IOI 2026 與 IMO 2026 雙雙達到金牌水平。IOI 2026 的 Nemotron-3-Ultra-CC 在與人相同的時限和提交限制下取得 535.4/600,高於 361.12 的金牌線和人類最高分 498.27,但屬非官方、無監督基準,未計入官方排名。

Cloudflare blog (AI)● 精選10/1 16:34AI 評分75

Cloudflare 開源決策模型 Clef,並推出 RL 微調平台

Cloudflare 發布兩個自研決策模型 Clef 與 Clef-flash,託管於 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,可本地執行。Clef 在 Jev Decision Index 上排名第一,具備視覺編碼器與 64k 上下文視窗,中位延遲 209.3ms,快於 Jev 的 524.1ms。同時推出強化學習微調產品,供使用者按自身場景微調 Clef。

Apple Machine Learning Research● 精選10/1 01:00AI 評分67

研究質疑自主 MLE agent 是否需要複雜編排框架

一項研究指出,近期自主機器學習工程(MLE)agent 普遍依賴多 agent 編排器、專用檢索子 agent 等複雜框架,但更簡單、僅靠 read、write、bash 原語直接訪問執行環境的 coding agent 路線卻少有人研究。該工作正是要回答:強 agent 做自主 MLE 究竟需要多少這類外圍框架。

Apple Machine Learning Research10/1 01:00AI 評分58

RLTL;DR:讓模型從失敗中自寫反饋實現自我改進

論文提出 RLTL;DR 方法:在可驗證獎勵強化學習(RLVR)中,當任務難到模型幾乎無法成功、又沒有教師模型或範例解可蒸餾時,讓策略在每次失敗後檢視驗證器輸出,並自行寫出一條 TL;DR 式反饋,下一次 rollout 以此為條件。該方法面向自我改進場景,替代只最佳化成功嘗試的常見做法。

Apple Machine Learning Research10/6 01:00AI 評分53

RISED:多環境 agent 訓練的評分標準與自蒸餾方法

論文提出 RISED,用評分標準(rubrics)驅動多環境 agent 訓練的 prompt 組選擇與自蒸餾。作者指出現有課程與資料選擇策略多在環境層面分配訓練,或只依賴區域性 reward 訊號,沒有顯式利用不同環境當前 rollout 之間的關係來挑選 prompt 組。同時各環境學習速度不一,同一 batch 內會並存全失敗與全成功的 rollout 組,這批資料無法獲得 group-relative 獎勵訊號。

OpenAI News● 精選10/7 13:00AI 評分63

ChatGPT for Teens 將新增 College Planner 大學申請規劃

OpenAI 將在 ChatGPT for Teens 中加入 College Planner,把目標院校的申請要求、截止日期、任務和助學金步驟彙總為一份可更新的計劃,首批面向美國 10–12 年級準備申請四年制大學的學生,未來擴充套件到更多國家及兩年制、技術與職業學校。官方公布的早期資料顯示:獲得該體驗的青少年平均多發出約 270 萬條學習相關訊息,一週內近 120 萬青少年使用 Learning Visualizations,超 18 萬使用 Study Mode;

機器之心● 精選10/5 12:54AI 評分70

Sergey Levine:機器人硬體已夠好,難點在決策與資料順序

Sergey Levine 在播客 The Peterman Pod 中表示,機器人硬體已「足夠好」,當前最大挑戰是建立讓機器人理解外部世界的決策迴圈,而非控制身體。他認為正確順序是先積累紮實的具身經驗,再接入影片等其他來源資料,與先用網際網路影片訓練的路線相反;機器人對可靠性的要求高於大語言模型,強化學習尚未解決從 95% 到 100% 的最後一步。

X @OpenAI● 精選10/7 20:03AI 評分72

OpenAI 公布 ChatGPT for Teens 進展並預告 College Planner

OpenAI 公布了面向 18 歲以下使用者的 ChatGPT for Teens 的最新進展,該體驗會自動應用於被識別為未成年人所屬的帳號,保護措施預設開啟。同時預告即將推出的 College Planner,面向計劃就讀美國四年制大學的高中生,把申請要求、截止日期、任務和助學金步驟集中在一起。此外還有新的學習工具,以及對大學顧問和青少年聲音的支援。OpenAI 表示會繼續建置這些工具,並在實踐中評估其保護措施的效果。

NVIDIA blog9/30 18:00AI 評分42

NVIDIA 開放 2027-2028 研究生獎學金申請,最高 6 萬美元

NVIDIA 第 26 屆研究生獎學金專案已面向全球開放申請,每位獲獎博士生最高可獲 6 萬美元資助,並配導師與技術資源支援。申請者須已完成至少一年博士階段學習,研究方向涉及 AI、機器學習、自動駕駛、計算機圖形、機器人、醫療與高效能運算等領域。2027-2028 學年申請截止日期為 2026 年 10 月 30 日,且獲獎者須在 2027 年暑期到 NVIDIA 研究辦公室完成線下實習。該專案自 2002 年啟動以來已發放超過 220 筆資助,總額約 800 萬美元。

Apple Machine Learning Research10/5 01:00AI 評分35

研究用 Wizard of Oz 探針探索使用者自建感知系統

一篇論文指出,設計物具有本體性,會塑造甚至限制人們認為可能或可想像的東西,而讓使用者掌握系統設計與建置的權力是緩解這種封閉的一條路徑。儘管圍繞支援使用者自建的系統的研究已有數十年,但這類系統通常只按可用、有用或技術可行來評估,本體邊界協商的問題一直未被考察。作者為此設計了兩個開放式探針,藉助 Wizard of Oz 技術,讓參與者體驗訓練個性化機器學習系統的過程。

X @OpenAIDevs10/2 23:40AI 評分27

@OpenAIDevs: Your dot learns how you work, keeps context across apps, coordinates Codex tasks, and flags what ne…

OpenAI 開發者帳號發布預告,介紹一款名為 dot 的產品:它會學習使用者的工作方式,跨應用保留上下文,協調 Codex 任務,並標記需要使用者關注的事項。該訊息未披露發布時間、價格、支援平台或具體功能細節。

MLX releases● 精選4/22 02:43AI 評分68

MLX 發布 v0.31.2,擴充套件 CUDA 量化矩陣乘支援

蘋果機器學習框架 MLX 發布 v0.31.2,重點擴充套件 CUDA 後端的量化矩陣乘支援,覆蓋 3/5/6 位量化與 qmm_naive、qmm_sm80 等路徑,並新增 CUDA FFT 支援。該版本還允許 MLX 被多執行緒用於獨立計算,JACCL 成為獨立庫,同時修復多執行緒退出崩潰、safetensors 偏移校驗等問題。

Hacker News front page● 精選10/6 22:20AI 評分78

Google 發布 EmbeddingGemma 2,統一五種模態嵌入

Google 發布 EmbeddingGemma 2,一個把文字、程式碼、影像、影片和音訊對映到同一嵌入空間的多模態嵌入模型。它採用 740M 引數與模組化編碼器,面向端側場景最佳化;藉助 Matryoshka 表示學習支援 768 到 128 維的靈活維度,上下文視窗 8K,是純文字版 EmbeddingGemma 的 4 倍,並以 Apache 2.0 許可開放商用。

r/ClaudeAI top of the day10/3 21:17AI 評分11

使用者稱剛開始學 Claude 就感嘆其能力遠超其他 AI 工具

一名 Reddit 使用者發帖稱自己可能有點跟不上時代,剛開始學習 Claude AI,卻驚訝於它比其他 AI 工具強大得多,認為若正確使用 Claude,可為自己的多項業務節省數千美元的資源成本。帖子未給出具體業務場景、對比物件或節省金額的計算依據。

r/LocalLLaMA top of the day10/3 11:39AI 評分71

Hugging Face 發布多 harness RL 訓練指南

Hugging Face 後訓練團隊發布了一份多 harness 強化學習指南,介紹如何用 TRL 和 Harbor 等開源庫在不同 coding harness 中訓練開放模型。團隊稱,針對當前各人自建 harness(如 Pi 加擴充套件)的現狀,該方案給出了用任意開放模型在自訂 harness 上取得最佳效能的配方。指南已發布在 Hugging Face Spaces 上,作者歡迎反饋。

Hugging Face blog● 精選9/28 01:00AI 評分74

Hugging Face Hub 新增 RL Environments 資料集篩選與框架標籤

Hugging Face Hub 上線 RL Environments 專區:帶 rl-environment 標籤的資料集會在新篩選頁集中展示,環境仍是普通 dataset repo,沒有新倉庫型別、登錄檔或註冊流程。Harbor、Verifiers、OpenEnv、NeMo Gym 四個框架被註冊為 dataset library,頁面顯示對應圖示,Use this dataset 會生成執行命令,同一資料集可帶多個框架標籤。

Hacker News front page10/2 22:25AI 評分71

Ai2 開源 AstaBrief 8B 科學報告生成模型

Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。

Simon Willison10/7 05:47AI 評分33

24 年鑽研 Barnette 猜想者稱它已在 openai/math 被證明

在 Hacker News 關於 openai/math 的討論中,Jake Boggan 稱自己斷續研究了 24 年的 Barnette 猜想似乎已被證明,編號是 problem 180。他早年沉迷圖論,曾搬到布達佩斯跟隨名家學習,期間開始做這個問題,前後投入數千小時,去年夏天還一度以為是自己解出來的。得知結果後,他說不知道該怎麼想,這種感受像聽說前女友突然死於車禍,並猜當晚不少人心情複雜。

Hacker News front page● 精選10/5 20:16AI 評分88

Reflection 發布首個開放權重模型 Beam:501B 總引數、23B 啟用

Reflection 發布首個開放權重模型 Beam:稀疏 MoE,總引數 501B、啟用 23B,面向程式設計、推理與 agentic 負載。預訓練使用 23.8 萬億 token,RL 階段動用 10.5K 塊 NVIDIA GB300 訓練 4 周、生成超 1 億條 rollout、約 13 億個沙箱,官方稱是開放實驗室中規模最大的 RL 訓練之一。評測中其與 GLM 5.2 相當但推理算力少 3–4 倍,接近 Qwen 3.8-Max,原始能力仍落後 Kimi K3;

Google Developers blog● 精選10/6 21:40AI 評分71

EmbeddingGemma 2 開源多模態嵌入模型,768 維統一空間

EmbeddingGemma 2 是一個緊湊的開源多模態嵌入模型,把文字、程式碼、影像、影片和音訊對映到統一的 768 維向量空間。開發者可通過 sentence-transformers 庫選擇性載入模組化模態編碼器,引數量在 270M 到 740M 之間,以最佳化記憶體佔用。模型還採用 Matryoshka 表示學習,支援將維度動態截斷至 128 維,在保持較高檢索效能的同時顯著降低向量資料庫的儲存需求。

TechCrunch AI● 精選10/7 19:00AI 評分94

ChatGPT 上線 Intelligent UI,隨 GPT-6 引入可互動視覺介面

OpenAI 隨新 GPT-6 模型推出名為 Intelligent UI 的新介面,週三起面向 Pro、Plus、Business、Enterprise 使用者全球上線,免費與低價 Go 檔使用者週四可用。ChatGPT 回覆中將大量加入可點選按鈕、任務定製計算器、互動式圖表、可編輯圖形等元素,官方稱目標是讓複雜主題更易學習。使用者可像調整其他個性化設定一樣,減少回覆中的視覺內容。

Hacker News front page10/5 20:22AI 評分45

數學家 Jeremy Avigad 談 AI 衝擊下的數學研究

數學家 Jeremy Avigad 在客座文章中寫道,過去幾個月 AI 已能輕鬆生成一年前足以發表的數學成果,數學家日常工作流程中相當一部分必然改變。他給出三個應對方向,前兩個是解更難的問題、想更大的思想,並指出目前 AI 攻克的開放問題多是把現有技術拼接而成,靠強化學習訓練的系統長於超人式機敏,卻可能缺少創造力與更高層的戰略思考。

r/LocalLLaMA top of the day● 精選10/2 21:16AI 評分80

微軟發布 4B 程式設計智慧體模型 FrogNano

微軟推出 FrogNano-4B-2609,一個面向低視訊記憶體裝置的程式設計智慧體模型,基於 Qwen3.5-4B 後訓練而來。其額外訓練為純文字、聚焦倉庫級軟體工程,用約 1500 個合成 SWE 任務環境和基於可執行測試的獎勵做強化學習,不依賴更強模型的解題軌跡蒸餾。模型需配合 Leaf 工具框架生成結構化工具呼叫,產出的補丁須經人工審查、迴歸測試與安全驗證後才能使用。

The Verge AI10/7 10:00AI 評分63

Common Sense Media 稱 ChatGPT for Teens 存在不可接受風險

Common Sense Media 10 月 7 日發布評估,認定 OpenAI 的 ChatGPT for Teens 構成不可接受的風險。這家專注青少年安全、提供應用與服務評測的非營利機構稱,該功能給出的青少年保護未達到 OpenAI 的承諾:該提醒家長時沒有提醒、危機情境下未提供恰當幫助,且仍會替孩子做作業。ChatGPT for Teens 於今年 8 月推出,帶有面向青少年的護欄,定位是幫助學生學習,相關結論以新聞稿形式發布。

Latent Space● 精選10/2 15:04AI 評分75

Airbnb 稱 60% 程式碼由 AI 編寫,半數客服工單由 AI 解決

Airbnb CTO Ahmad Al-Dahle 披露,公司目前 60% 的程式碼由 AI 生成,功能交付量同比增加近 80%,工程師人均 PR 吞吐量提升約 1.6 倍;約一半客服工單已完全由 AI 處理,與 Q2 財報中近 45% 的數字一致。內部上下文圖譜 Everest 幫助雜貨配送服務在 8 至 9 個月內上線,機場接送僅用約 6 周。Airbnb 採用多模型策略,至少部署 10 個定製模型,主要在開源模型上做後訓練和強化學習。

Qwen blog● 精選9/3 03:00AI 評分77

E-Commerce Bench: Long-Horizon Operations, Multi-Dimensional Evaluation

研究團隊與淘寶天貓合作推出 E-Commerce Bench,讓模型以商家身份在模擬市場中經營網店一整年。智慧體初始資金 10 萬元,可同時開多家店,在每天 600 分鐘的時間預算內完成選品、與供應商砍價、定價上架、管理庫存與現金流等決策。環境基於 6,886 個商品、60 個類目、576 家供應商和 12 種店鋪型別,需求與供應商報價由確定性核心計算,避免隨機噪聲和越獄砍價。評測從利潤、現金流、談判、防欺詐、效率、執行力和長期學習七個維度打分。

The Verge AI10/5 20:28AI 評分52

OpenAI 等實驗室攻克數學難題引發學界反彈

過去一年,OpenAI、Anthropic 等實驗室宣布解決了多個長期懸而未決的數學問題,其中甚至包括一道千禧年大獎難題,進展超出研究人員預期。但這些實驗室以矽谷式的高速推進,本應被慶祝的成果反而招致學界反彈,有數學家要求 OpenAI 證明未使用其工作成果,也有批評指向其行事方式。實驗室表示正在從早期的失誤中學習,承諾能否兌現尚待觀察。

Meta AI blog● 精選10/2 22:11AI 評分77

Meta 發布 Brain2Qwerty v2,非侵入腦電解碼詞準確率達 61%

Meta 發布 Brain2Qwerty v2,這是目前效能最高的端到端非侵入式腦訊號即時句子解碼流程,詞準確率達 61%,遠超其他非侵入方法的 8%,最佳參與者達 78%。模型基於 9 名志願者佩戴 MEG 裝置打字約 10 小時、共約 2.2 萬句資料訓練,採用端到端深度學習直接從原始腦訊號解碼,並微調大語言模型利用語義上下文。Meta 同時開源 v1 與 v2 完整訓練程式碼,合作方 BCBL 發布 v1 資料集。

Hacker News front page10/6 15:45AI 評分42

開發者復盤 vibecoding:上手刺激但缺少手寫程式碼的成就感

一位開發者撰文稱,AI 輔助程式設計(vibecoding)只把樂趣前置:能快速做出可用原型,但重構和維護階段不再有趣,也缺少手寫程式碼帶來的成就感。他把建造的樂趣分為六種,認為 vibecoding 只能滿足「想到點子」「把點子變成現實」和「解決自己的問題」三類,攻堅後的成就感、作品完成的滿足感與學習樂趣都不會自然產生。他仍用 AI 做出了一些手工做不出來的東西,包括即時野火預警系統、Kobo 資料庫遷移助手和即時音準訓練應用,但表示過程不像自己寫小指令碼那樣好玩。