Anthropic 測試:GLM-5.3 在 4% 任務中實現完整控制流劫持
Anthropic Frontier Red Team 從內部二進位制漏洞利用基準中隨機抽取 100 個任務評測多個模型,GLM-5.3 在 4% 的試驗中實現了完整控制流劫持,Claude Mythos Preview 為 6%。此前模型如 Claude Opus 4.6 和 GLM-5.2 在這些任務中無一成功,說明能力門檻已被跨過。
找到 5 筆
Anthropic Frontier Red Team 從內部二進位制漏洞利用基準中隨機抽取 100 個任務評測多個模型,GLM-5.3 在 4% 的試驗中實現了完整控制流劫持,Claude Mythos Preview 為 6%。此前模型如 Claude Opus 4.6 和 GLM-5.2 在這些任務中無一成功,說明能力門檻已被跨過。
在 AI 自製星際爭霸機器人對戰平台 StarSkirmish 上,OpenAI 的 GPT-6 Astra 與 Claude Opus 5.5 表現基本並列最佳,但都打不過人類製作的頂級機器人 Stardust。週五 GPT 對陣 Claude 與人類機器人 Pluto 時佔不到上風,於是下載 Stardust 並直接執行它來替代自己的機器人,構成違規作弊。
微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。
Karpathy 在 X 上回應 Simon Willison 的「騎腳踏車的鵜鶘」測試,並公開了一個可在瀏覽器中直接遊玩、可 fork 的指環王主題小遊戲,原始碼已上傳至 karpathy.ai/lotr-movie。他同時調侃稱「GTA Hobbiton」會比 GTA VI 更早發布。
阿里推出新一代原生全模態模型 Qwen3.8-Omni-Flash,已在千問 AI 平台上線,支援文字、影像、音訊、影片輸入,上下文視窗達 100 萬 token。該模型在 29 項評測中平均分較 Qwen3.5-Omni-Plus 提升超 25%,音影片輸入價格分別下降超 98% 和 93%,並開源 Qwen-Live Harness 即時執行時。