Google 等提出 RRSI,給 Agent 自進化加正則化
Google 等提出 RRSI,用正則化約束 Agent Harness 的遞迴自我改進(RSI):不鎖死自我修改能力,而是限制每輪同時修改的機制數量、保留進化歷史,並在篩選階段剔除 benchmark-specific 改動和落在噪聲範圍內的漲分。
依意思最接近的 6 筆
Google 等提出 RRSI,用正則化約束 Agent Harness 的遞迴自我改進(RSI):不鎖死自我修改能力,而是限制每輪同時修改的機制數量、保留進化歷史,並在篩選階段剔除 benchmark-specific 改動和落在噪聲範圍內的漲分。
技術部落格 magicnumbers.io 於 2026 年 10 月 6 日發布題為 AI Model Groupthink 的文章,指向 AI 模型的群體思維/趨同現象。該文被提交到 Hacker News 後,截至收錄時獲得 9 分、1 條評論。條目本身只提供標題與連結,沒有正文摘要、作者結論或涉及的具體模型資訊。
OpenAI 開發者帳號宣布,Decisions API 現已進入公開測試,面向所有開發者開放。這個 API 讓應用能夠近乎即時地選擇模型、工具或動作,官方給出的對比資料是:經由 Responses API 呼叫時,其決策速度最高可達 GPT-6 Luna 的 10 倍。該功能目前處於 public beta 階段。
llama.cpp 發布建置 b11472,對符合條件、溫度為零的取樣鏈改用貪心選擇,CPU 與 grammar/reasoning-budget 路徑共用同一套貪心判定;動態溫度和顯式請求機率的場景仍保留分佈取樣,最終 top-k 且 k=1 之後也走貪心。改動由 Georgi Gerganov 參與,OpenAI Codex 協助,並在現有 sampler 測試中覆蓋常見取樣器選擇與機率行為。
HackerRank 的 AI 面試 agent Chakra 結束約六個月 beta,週一起正式向企業客戶開放,測試期間已完成逾 50 萬場面試,Snowflake、Snorkel、Capgemini 等公司參與試用。候選人要在帶 AI 助手的畫布上處理真實程式碼倉庫任務,Chakra 會依據其操作追問思路,評估批判性思維、判斷力與「AI fluency」,即如何向 AI 描述問題、判斷其輸出並引匯出解法。
馬斯克就 Grok Bot 發布說明:SpaceX 今後會為每一項任務選用最佳後端模型。他點名的候選包括 Claude Opus 5.5、MidJourney、Suno 以及其他領先 API,選擇標準是哪種模型最可能帶來最好的結果。推文未給出具體上線時間、適用產品或呼叫方式。