AISpot

搜尋

找到 5 筆

X @karpathy● 精選8/2 04:00AI 評分67

Karpathy 用 Opus 5 把《魔戒》首段渲染成 3D 場景

Karpathy 給 Opus 5 輸入《魔戒》第一段、100 萬 token 預算(約 10 美元),讓它用 three.js 渲染這個故事。Opus 5 執行約 2 小時,寫出 5500 行程式碼,程式化生成了粗糙但可玩的 3D 場景。他指出這類任務沒人願意手工做,但 LLM 有無限耐心,成本近乎免費;同時也暴露 LLM 無法原生高效感知影片或玩遊戲,只能緩慢截圖自查,導致不少瑕疵。

r/ClaudeAI top of the day10/2 22:23AI 評分32

在 Blender 裡用 Claude Opus 5.5 畫草圖比寫提示詞更高效

一位使用者在 Blender 中使用 Claude Opus 5.5 做 blockout 時發現,直接畫出空間意圖比用文字描述形狀更高效,因為文字擅長說明是什麼,卻不擅長表達位置、大小和數量。整個實驗共消耗 33M tokens,API 成本 16.07 美元,執行 48.5 分鐘,貼圖與夜空素材來自 Poly Haven 的 CC0 資源。作者因此不再用文字描述形狀,而是給 Claude 提供繪圖或空間參考。

Google DeepMind blog9/30 16:03AI 評分47

SynthID Bio 為 AI 生成蛋白質嵌入可驗證水印

SynthID Bio 是一項把水印嵌入生物程式碼的概念驗證技術:水印不僅能在數字模型上驗證,也能在合成出的實體蛋白質上驗證,且實驗室測試顯示不損害其生物功能。它按資料型別調整策略——微調蛋白質序列的胺基酸選擇、調整預測 3D 結構的原子座標,並通過微調 AlphaFold 3 擴散網路把水印寫進模型權重。

Kimi blog● 精選10/2 22:11AI 評分65

Kimi Team 發布 PerceptionBench,評估 MLLM 原子視覺感知

Kimi Team 發布 PerceptionBench,一個把視覺感知拆成原子能力來評估的 MLLM 基準。它從 42 個基準的前沿模型失敗中歸納出 10 類原子感知能力,構造併發布 3,000 道已驗證題(內部池 17,000+),60% 來自模型失敗分解,40% 新寫,覆蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR、幻覺。測試 16 個前沿 MLLM,無一達到 60% 準確率,幻覺平均是最弱能力;總分接近的模型在具體感知上可能差異很大。