班·艾佛列克談 VFX 中已用多年的機器學習
班·艾佛列克在引述中表示,視覺特效工作流多年來一直包含機器學習,他把卷積神經網路(CNN)稱為 transformer 的前身,區別在於後者能同時做更多計算。他自述能寫「很糟糕的 Python 指令碼」,並解釋張量是畫面在數值上的翻譯——批次號、幀號,以及每幀每個畫素的紅綠藍值。CNN 在張量上做邊緣檢測與特徵提取,識別出窗臺在哪裡,就能更容易地把綠幕部分摳掉並替換成別的內容。
原標題:Quoting Ben Affleck
閱讀原文
| 評分 | 25 / 22(平均 23,門檻 65) |
|---|---|
| 狀態 | 未入選 |
相關報導
何愷明團隊提出 NAT-ARC,純視覺方案解 ARC 達 70.2%
何愷明團隊發布 NAT-ARC,用 ImageNet 上 MAE 預訓練的視覺編碼器解 ARC 抽象推理題,最佳單模型(0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合後 70.2%。該方法不依賴 LLM,預訓練階段不使用 ARC 格子,僅複用 MAE 公開 checkpoint,測試時對每題做 LoRA 微調。論文稱這是純視覺方案首次逼近專用 LLM 系統水平,並顯示預訓練打通了視覺路線的 scaling 瓶頸。
Jev 走紅,NeurIPS 2025 論文 ConfTuner 早已探索相似思路
TypeSafe AI 的 Jev 模型近期走紅,其介面可直接返回預設選項、分數或事件機率,供程式碼呼叫,但未開源、架構未公開。NeurIPS 2025 入選論文 ConfTuner 提出 Tokenized Brier Score,僅用對錯標籤即可訓練置信度機率分佈,在 LLaMA、Qwen、Ministral 上把平均 ECE 從 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884,4 張 A40 上約 4 分鐘完成微調。
llama.cpp b11418:server 支援 Clef 視覺輸入
llama.cpp 發布建置 b11418,其 server 新增對 Clef 的視覺輸入支援(PR #29969),並修復影像 token 上限、abort 與 yield_to_queue 資料變更等問題。
Latent Space 專訪 MIT Alex Zhang:談 RLM 與 agent 叢集
Latent Space 播客本期嘉賓為 MIT 的 Alex Zhang,他是 Recursive Language Models(RLM)的作者,也是 GPU Mode 社群成員。