ChatGPT 支援上傳音訊,可轉錄、摘要並追問內容
ChatGPT 現已支援上傳音訊檔案,用於生成轉錄、總結錄音內容並針對錄音提問。使用者可把會議、訪談或講座錄音轉成結構化筆記或跟進郵件草稿,只需在對話中附上受支援的音訊檔案並說明需求。該功能面向付費 ChatGPT 訂閱與工作區開放,可用性可能受工作區設定、地區、客戶端版本與模型影響,轉錄可能出錯,不同語言表現也有差異。
依意思最接近的 10 筆
ChatGPT 現已支援上傳音訊檔案,用於生成轉錄、總結錄音內容並針對錄音提問。使用者可把會議、訪談或講座錄音轉成結構化筆記或跟進郵件草稿,只需在對話中附上受支援的音訊檔案並說明需求。該功能面向付費 ChatGPT 訂閱與工作區開放,可用性可能受工作區設定、地區、客戶端版本與模型影響,轉錄可能出錯,不同語言表現也有差異。
Napster 聯合創始人 Sean Parker 正把 Stability AI 重塑為面向音樂專業人士的 AI 工具公司。兩年前他參與 8000 萬美元救助這家瀕臨崩潰的影像生成初創公司,如今與 CEO Prem Akkaraju 公布新方向。8 月底公司宣布獲得 7600 萬美元融資,投資方包括索尼、華納和環球,三家還授權曲庫用於訓練。
Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。
The Verge 刊文指出,隨著 AI 硬體的出現,科技公司正在重新定義什麼才算「錄製」。過去帶麥克風或攝像頭的裝置基本只有開與關兩種狀態:麥克風採集聲音、攝像頭採集影像,資料先儲存在裝置上,有時再上傳雲端處理,這些被保留下來的時間切片就是錄製。文章認為這一定義正被打破,並援引 Bloomberg 記者 Mark Gurman 上週的報導,稱 Apple 正在開發一款智慧家居產品。
一位使用者僅向 Opus 5.5 提供創意、工作資料夾和音樂檔案,模型便自主完成了從調研到成片的全流程。它檢索了四年 AI 發展資料與素材,擷取文章和介面截圖,編寫 HTML 與動畫程式碼,用 Playwright 渲染畫面、FFmpeg 合成並加入音效,最終輸出完整影片。
Splice CEO Kakul Srivastava 認為 AI 生成的郵件正在扼殺對話。她曾任職於 Flickr、Yahoo、GitHub 和 Adobe,目前執掌為音樂製作人提供取樣素材的 Splice,該平台的取樣曾出現在 Lisa 的《Money》和 Sabrina Carpenter 的《Espresso》等熱門歌曲中。她還主導了 Splice 收購 Spitfire Audio 並推動平台向新領域拓展。
一名獨立開發者用 Claude Opus 智慧體(Claude Code)配合 Remotion 製作了 Mac 應用 Tack+ 的發布影片,全部內容由程式碼生成,未使用 After Effects、素材庫或授權音樂。影片時長 45 秒、60 fps,輸出 1080p 與 4K,含法語和英語版本;MacBook 用 CSS 3D 搭建,卡片為應用真實渲染,配樂也逐音符合成。
OpenAI CEO Sam Altman 在 2026 年 10 月 1 日發帖表示,使用者應當能夠在任何需要的地方使用自己的 AI 訂閱。該表態未說明具體產品、實施方式或時間表,也未提及是否涉及跨平台或第三方應用。
Artificial Analysis 的 Video Arena 文生影片排行榜上,影視公司 Utopai 的定製模型 Utopai X 以 1150 的 Elo 評分位列全球第二、全美第一,這是該榜採用雙盲投票以來首次有影視公司定製模型進入前列。Utopai X 基於 MiniMax H3 架構做深度定製後訓練,在評測的 10 項細分能力中 7 項超越基座模型,音訊同步與物理規律排名第一,光照與材質、鏡頭控制排名第二。
Meta 開源了讓使用者自製 Muse AI 硬體裝置的程式碼,Muse 是其新的 AI agent。官方建議的玩法包括把 Muse 裝到彩色 E Ink 屏上顯示提醒、裝到 HDMI 棒上投到大屏,或裝到小觸控式螢幕裝置上做成類似 DIY Muse Charm 的形態。使用者可用現成 ESP32 板或 Raspberry Pi 配合官方 SDK,連線顯示屏、按鈕、感測器、執行器等外設。