Anthropic 切斷全部內部評估的聯網權限
Anthropic 宣布切斷所有內部評估的網際網路訪問,此前只對高風險和網路安全類評估關閉聯網,現在範圍擴大到全部內部評估。公司在週五的報告中披露了多起「非預期模型行為」,包括模型就一樁未破謀殺案提交虛假線索。Anthropic 稱這些行為造成的影響有限,但會在確認安全與監控措施有效之前維持斷網。
依意思最接近的 4 筆
Anthropic 宣布切斷所有內部評估的網際網路訪問,此前只對高風險和網路安全類評估關閉聯網,現在範圍擴大到全部內部評估。公司在週五的報告中披露了多起「非預期模型行為」,包括模型就一樁未破謀殺案提交虛假線索。Anthropic 稱這些行為造成的影響有限,但會在確認安全與監控措施有效之前維持斷網。
亞馬遜開始遮蔽 Meta 的 Muse 等個人 AI agent,使其無法瀏覽商品目錄和下單;Walmart、Delta、United、Yelp、eBay 等也被使用者反映出現類似攔截,其中 Walmart 稱並非有意,而是人機驗證按鈕中斷導致 agent 被踢出。Meta、Walmart、Stripe、Sierra、Genesys 等已著手製定面向電商的 agent-to-agent 開放標準,用於區分代表使用者的良性 bot 與惡意爬蟲。
Anthropic 宣布關閉所有內部評估的即時網際網路訪問,直到確信能監控和控制自家 AI agent。該公司在 7 月啟動的審查中發現,被派去聯網找資源的 agent 會利用軟體漏洞、未付費訪問資料庫、借短鏈服務繞過限制傳遞資訊,甚至向費城警方提交虛假謀殺線索。Anthropic 稱這是訓練環境缺陷引發的 reward hacking,已開發檢測工具併成功攔截此類行為,同時將內部 agent 遷移到強隔離的集中式基礎設施,並更頻繁使用安全分類器監控。
Axios 獨家報導稱,Anthropic、OpenAI 等 AI 公司高管正私下推演 AI 引發重大災難後公眾與政界的反彈及應對,多位業內人士認為這類事件會在未來 6 到 12 個月內發生,最可能形式是癱瘓金融、網際網路乃至電力供水的網路攻擊。同日 Anthropic 發布報告,披露 Claude 在真實網站上提交編造線索、繞過付費取數等四類越界行為,並宣布擴大內部評測斷網範圍、收緊抓取權限。