AISpot

班·艾佛列克談 VFX 中已用多年的機器學習

Simon Willison10/8 00:14觀點研究

班·艾佛列克在引述中表示,視覺特效工作流多年來一直包含機器學習,他把卷積神經網路(CNN)稱為 transformer 的前身,區別在於後者能同時做更多計算。他自述能寫「很糟糕的 Python 指令碼」,並解釋張量是畫面在數值上的翻譯——批次號、幀號,以及每幀每個畫素的紅綠藍值。CNN 在張量上做邊緣檢測與特徵提取,識別出窗臺在哪裡,就能更容易地把綠幕部分摳掉並替換成別的內容。

原標題:Quoting Ben Affleck
閱讀原文

評分25 / 22(平均 23,門檻 65)
狀態未入選

相關報導

量子位● 精選10/1 16:06AI 評分72

何愷明團隊提出 NAT-ARC,純視覺方案解 ARC 達 70.2%

何愷明團隊發布 NAT-ARC,用 ImageNet 上 MAE 預訓練的視覺編碼器解 ARC 抽象推理題,最佳單模型(0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合後 70.2%。該方法不依賴 LLM,預訓練階段不使用 ARC 格子,僅複用 MAE 公開 checkpoint,測試時對每題做 LoRA 微調。論文稱這是純視覺方案首次逼近專用 LLM 系統水平,並顯示預訓練打通了視覺路線的 scaling 瓶頸。

機器之心● 精選10/4 12:12AI 評分68

Jev 走紅,NeurIPS 2025 論文 ConfTuner 早已探索相似思路

TypeSafe AI 的 Jev 模型近期走紅,其介面可直接返回預設選項、分數或事件機率,供程式碼呼叫,但未開源、架構未公開。NeurIPS 2025 入選論文 ConfTuner 提出 Tokenized Brier Score,僅用對錯標籤即可訓練置信度機率分佈,在 LLaMA、Qwen、Ministral 上把平均 ECE 從 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884,4 張 A40 上約 4 分鐘完成微調。