AISpot

LiveNerf 完成 Opus 5.5 十天基線測量

r/ClaudeAI top of the day10/3 18:19社群討論研究模型

LiveNerf 專案已完成 Opus 5.5 的 10 天效能基線,從明天起將收集第 30 天的資料,之後可與基線對比,判斷模型發布後是否被降智。該專案由個人開發者發起,程式碼已開源在 GitHub,目標是獨立追蹤 Opus 5.5 的逐日表現。目前尚無結論性證據,作者稱希望藉此推動 AI 公司提高透明度。

如果你懷疑 Claude 的 Opus 5.5 在發布後被悄悄降智,這個開源專案提供了可復現的逐日效能對比方法,你可以關注其後續資料或自行執行測量。

原標題:Did they nerf Opus 5.5? LiveNerf baseline established: Day 10
閱讀原文

評分72 / 78(平均 75,門檻 76)
狀態未入選

相關報導

r/ClaudeAI top of the day10/2 17:28AI 評分41

r/ClaudeAI 熱議 Opus 5.5 被削弱

Reddit 的 r/ClaudeAI 版塊出現熱帖,多數評論者認為 Opus 5.5 已被削弱(發帖人把 nerfed 誤寫成 nerded)。主流猜測是官方先用新模型拉訂閱、隨後降低算力省成本,同時讓下一代模型顯得更強;少數使用者稱模型仍正常甚至仍是最好的模型,品質下滑感來自上下文堆積、未新開對話。有人貼出 nerf 追蹤基準顯示輕微下滑,但被指仍在正常誤差範圍內;也有評論指出 Opus 5.5 發布當天就會說 load-bearing,不能當作降級訊號。

r/OpenAI top of the day10/3 10:58AI 評分61

使用者實測:Opus 5.5 編碼能力遠超 Astra

一位使用者對比 Astra 與 Opus 5.5 後稱,Opus 5.5 在編碼任務上明顯更強。他用約兩頁 A4 的提示詞、二十多次對話就讓 Opus 5.5 完成了一款包含玩法、畫面、音效與音樂的遊戲,全程未寫一行程式碼;在室內導航任務中,Opus 5.5 的掃描與追蹤準確,而 Astra 開箱即用效果很差,他給出 9/10 對 2/10 的評價。不過 Claude 會頻繁提示工具使用過多或任務未完成,且超出用量限制後完全無法使用。

Hacker News front page● 精選10/3 19:29AI 評分88

Getting the most out of Opus 5.5 in Claude and Claude Code

Anthropic 於 2026 年 9 月發布 Opus 5.5 官方使用指南,作者 Addy Osmani,閱讀時長 9 分鐘。Opus 5.5 相比前代更擅長多步驟長任務,可連續數小時執行大型倉庫改動直至測試通過,且每次回覆前都會自行思考。指南建議一次性交代完整任務並說明完成標準,刪除提示詞中的 think carefully 等語句,在 CLAUDE.md 中寫明何時繼續、何時停下詢問,並讓子代理並行處理審計與遷移。

r/ClaudeAI top of the day10/3 01:47AI 評分40

Opus 5.5 跑 28 分鐘花 6.17 美元生成單檔案

一位使用者用自建 Pi agent 配合 plan mode,以 High 思考檔執行 Opus 5.5,耗時 27 分 45 秒、花費 6.17 美元(主 agent 4.97 美元,design-review agent 1.21 美元),最終產出一個 1,029 行、零依賴的 HTML 檔案。輸出 122,689 tokens,其中 66,163 為思考 tokens;總 tokens 約 600 萬,約 95% 為快取讀取。