Aria 微調後可按指定爵士鋼琴家風格續寫
研究者在鋼琴 MIDI 上預訓練的 transformer Aria 上做微調,用 12 位爵士鋼琴家的獨奏資料並插入門控交叉注意力層,讓模型按指定鋼琴家風格續寫。用鋼琴家分類器沿生成片段滑動判定,帶條件的續寫有 70% 被認成目標鋼琴家,不帶條件只有 37%,隨機為 8%,而困惑度幾乎分不出兩者(6.82 對 6.96)。僅在生成音樂上訓練的第二個分類器識別真實錄音的準確率達 95%,模型還可標出真實演奏中風格最集中的段落。
用分類器一致率代替困惑度衡量風格條件效果(70% 對 37%),並讓僅用生成資料訓練的分類器以 95% 準確率識別真實錄音,對做音樂生成與風格條件建模的人有參考價值。
原標題:Learning Jazz Pianist Style with Cross-Attention Conditioning
閱讀原文
| 評分 | 72 / 70(平均 71,門檻 76) |
|---|---|
| 狀態 | 未入選 |
相關報導
Sean Parker 將 Stability AI 轉型為音樂 AI 工具
Napster 聯合創始人 Sean Parker 正把 Stability AI 重塑為面向音樂專業人士的 AI 工具公司。兩年前他參與 8000 萬美元救助這家瀕臨崩潰的影像生成初創公司,如今與 CEO Prem Akkaraju 公布新方向。8 月底公司宣布獲得 7600 萬美元融資,投資方包括索尼、華納和環球,三家還授權曲庫用於訓練。
Jev 走紅,NeurIPS 2025 論文 ConfTuner 早已探索相似思路
TypeSafe AI 的 Jev 模型近期走紅,其介面可直接返回預設選項、分數或事件機率,供程式碼呼叫,但未開源、架構未公開。NeurIPS 2025 入選論文 ConfTuner 提出 Tokenized Brier Score,僅用對錯標籤即可訓練置信度機率分佈,在 LLaMA、Qwen、Ministral 上把平均 ECE 從 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884,4 張 A40 上約 4 分鐘完成微調。
ServiceNow 發布 AutoSynthData,為企業 agent 自動生成訓練資料
ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。
Claude Opus 5.5 作曲實測:自定文字樂譜格式並播放
一位使用者測試 Claude Opus 5.5 能否作曲,要求它先設計一套簡單的文字音樂格式,再建置能直接播放的 artifact 並附上範例曲目,目標是《猴島小英雄》初代的水準。成品比預期更貼近猴島主題,但結果出乎意料地好。作者由此猜測,作曲可能像此前的 3D 圖形生成一樣,是文字模型近幾個月才出現的新能力,不過要確認是新能力還是早就有,還需用更多新老模型做對照實驗。
使用者實測 Opus 5.5 程式設計能力遠超 Astra
一位有基礎程式設計經驗的使用者稱,用 Opus 5.5 在約兩打提示詞內完成了一整款遊戲,包括玩法、畫面、音效與音樂,全程未寫一行程式碼;模型還能自寫測試、最佳化速度並修復觀察到的 bug。在室內導航對比中,Opus 5.5 的掃描與追蹤準確,Astra 開箱即用效果差,評分約 2/10 對 9/10。該使用者也指出 Claude 常提示工具使用過多或任務未完成,且超出額度後無法繼續使用。