搜尋
找到 3 筆;也可以試試 語意搜尋
r/OpenAI top of the day10/3 16:48AI 評分23
Uisato Studio 上線 Oscilloscope Diffusion,一種通過擴散模型干預已有影片的新方法:以原影片的運動與形態為起點,重新詮釋其紋理、材質與視覺語言。演示素材來自作者的 TouchDesigner 音訊反應幾何視覺化系列 Oscilloscopes, everywhere(已更新至 v1.2),也可輸入任意影片源。使用者可選擇源影片、用提示詞描述處理方式,並通過精選 LoRA 與可編輯時間線控制結果與原始畫面的接近程度。
Apple Machine Learning Research10/2 01:00AI 評分53
研究證明,離散擴散(含 remasking 與 uniform-state 取樣器)的某一步只有在所寫入位置在已固定 token 條件下相互獨立時,才與訓練分佈一致;任何 per-position 分佈的乘積都無法匹配存在依賴的一組 token。文中指出畫素、音素、詞等常見領域的 token 之間存在固有依賴,而這類取樣器每步會寫入多個 token 位置,每個位置從各自的 per-position 分佈取樣,並依據同一批分佈決定寫入哪些位置。
Google Developers blog10/2 22:21AI 評分45
開發者用 Sparse VideoGen(SVG)把注意力頭動態路由到高度結構化的空間或時間稀疏掩碼,並在 TPU 上最佳化 Splash Attention 核心,使 1440p 影片生成的端到端推理最高提速 1.69 倍。核心側的具體改動是:跳過空記憶體 tile、把精確座標掩碼嚴格限制在邊界 tile、將 token 記憶體佈局改成時間優先(temporal-major)以獲得連續訪問。目的是把演算法層的稀疏真正對齊到硬體 tile 執行,顯著減少被浪費的矩陣運算。