AISpot

InnovationEval:前沿模型花數千美元 GPU 仍未復現人類演算法創新

Hacker News front page評測研究

新評測 InnovationEval 顯示,前沿模型無法獨立復現人類研究者近期做出的機器學習演算法創新:在端到端任務中,它們耗費數千美元 GPU 算力,仍未達到人類論文(on-policy self-distillation,SDPO)的水平。測試要求 AI 自主提出一種新的後訓練方法,在短答題與程式碼任務上後訓練 Qwen3-8B,並超過 GRPO 基線。主要結果來自 Claude Fable 5 與 GPT-5.6 Sol;

用真實人類論文作基準、要求端到端產出新後訓練方法,量化了前沿模型在原創 ML 演算法上的失敗,並披露後續模型出現任務記憶,對關注自動化 AI 研究與評測方法的人有參考價值。

原標題:Recent AI models struggled to match a human algorithmic innovation
閱讀原文

評分82 / 82(平均 82,門檻 76)
狀態精選

相關報導

量子位● 精選AI 評分81

PaperBenchX 發布:GPT-6 Astra 完整復現率僅 13.98%

UniPat AI 發布 PaperBenchX,稱其為國際上首個多學科端到端論文結果復現基準,從 93 篇論文建置 93 個復現任務,橫跨電磁、光子、化學、材料、生物、機器人等 12 個研究方向和 10 種領域原生科學環境,含 3168 條專家校驗評分項。在這 93 個任務上,表現最強的 GPT-6 Astra 完整復現率只有 13.98%,建模與執行階段平均得分約 62%,驗證階段僅 42.8%。

Hugging Face blog● 精選AI 評分78

用 ML Intern 幾天做出 6 個模型,9B 改寫器壓到 0.8B

Hugging Face 的 yuvraj sharma 用 HuggingChat 裡的 ML Intern agent,幾天內做出 6 個公開模型,其中把 Qwen-Image 2.1 自帶的 9B 提示改寫器蒸餾成 0.8B 版本,可在 CPU 執行,輸出有效率 99.7%,token 消耗約為教師模型的四分之一。該專案含 9B 模型標註 8,797 條樣本,算力成本 16 美元。

Hacker News front page● 精選AI 評分86

OpenAI 公開內部前沿模型數學成果與 Lean 形式化證明

OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。

Hacker News front pageAI 評分70

UniEvo-VL:多模態模型自蒸餾自我進化訓練配方

arXiv 上提交的 UniEvo-VL 提出一種 on-policy 自蒸餾訓練方法:讓同一個多模態模型分別以學生和教師身份出現,學生只看原始問題,教師額外看到自我批評作為特權資訊,訓練目標是縮小兩者在取樣軌跡上去噪擴散分佈的差異,無需依賴更大的外部教師模型。基於開源 Qwen-image-2512,GenEval 從 0.747 升至 0.808,GenEval2 Soft-TIFA 從 32.97 升至 35.53。

量子位● 精選AI 評分87

Claude Haiku 5.5 發布,跑分逐項超 GPT-6 Luna,價格最高降 90%

Anthropic 發布 Claude Haiku 5.5,官方跑分逐項超過 GPT-6 Luna,成為新的小模型守門員。10 萬 token 以內的請求輸入輸出價格降 90%,超出部分降 50%,但換用新 tokenizer 後同一任務耗費 token 更多,實際省下的錢少於標價折扣。它首次支援 low 到 max 五檔 effort 調節,OSWorld 2.1 上 Low 檔準確率 42.0%、單次成本 $0.07,Max 檔 72.4%、$0.61;