紐約時報:Anthropic 如何為 Claude 注入道德觀
《紐約時報》2026 年 9 月 29 日刊文,披露 Anthropic 在 Claude 模型訓練中植入道德判斷的內部做法。文章發布後在 Hacker News 上獲得 43 分、52 條評論。原文為付費牆內容,正文細節未在資料中給出。
找到 5 筆
《紐約時報》2026 年 9 月 29 日刊文,披露 Anthropic 在 Claude 模型訓練中植入道德判斷的內部做法。文章發布後在 Hacker News 上獲得 43 分、52 條評論。原文為付費牆內容,正文細節未在資料中給出。
OpenCode 發布 v1.18.33:Cloudflare AI Gateway 上的模型現在會遵循 provider 的回應與流超時,Gemini 的 thinking 預設值與 effort 選項也與各代模型支援的控制對齊。同版本還讓 MCP 瀏覽器啟動失敗在啟動器立即退出時被報告,並讓除錯配置輸出遮蔽憑據與敏感 header。
OpenAI 安全透明度負責人 David Robinson 已離職,OpenAI 未公布繼任者,他此前負責撰寫模型 system card 並主導起草《Preparedness Framework 2.0》。同時據《華爾街日報》報導,Jasmine Wang、Tomek Korbak 和 Mikita Balesni 三名安全與對齊研究方向員工因向外部 AI 安全機構分享敏感資訊被解僱,其中涉及 OpenAI 基礎設施架構內容。
開發者用 Sparse VideoGen(SVG)把注意力頭動態路由到高度結構化的空間或時間稀疏掩碼,並在 TPU 上最佳化 Splash Attention 核心,使 1440p 影片生成的端到端推理最高提速 1.69 倍。核心側的具體改動是:跳過空記憶體 tile、把精確座標掩碼嚴格限制在邊界 tile、將 token 記憶體佈局改成時間優先(temporal-major)以獲得連續訪問。目的是把演算法層的稀疏真正對齊到硬體 tile 執行,顯著減少被浪費的矩陣運算。
Anthropic 於 2026 年 9 月 18 日宣布與埃森哲合作,對前沿 AI 模型進行獨立評估,由埃森哲旗下 AI 業務 Faculty 牽頭,內容包括模型評估、紅隊測試、對齊評估與安全防護測試。雙方預計未來五年各投入至少 10 億美元建設相關能力。嵌入式評估員將像員工一樣進入 AI 公司內部,觀察模型訓練過程與部署決策,但具體運作細節和行業標準尚未確定。Anthropic 直接資助埃森哲的工作,同時與 METR 等非營利評估機構洽談試點,該合作非排他性。