Whistle 發布 16.9 MB 語音識別模型,CPU 上執行並支援七種語言
Whistle 是一個 16.9 MB 的單檔案端側語音識別模型,無依賴、在 CPU 上執行,與 Needle 共用同一套 C++ 引擎。它支援英語、德語、法語、西班牙語、義大利語、荷蘭語和波蘭語,單次最多處理 30 秒 16 kHz 單聲道音訊,可自動檢測語種,並輸出逐詞時間戳與語音嵌入。
依意思最接近的 23 筆
Whistle 是一個 16.9 MB 的單檔案端側語音識別模型,無依賴、在 CPU 上執行,與 Needle 共用同一套 C++ 引擎。它支援英語、德語、法語、西班牙語、義大利語、荷蘭語和波蘭語,單次最多處理 30 秒 16 kHz 單聲道音訊,可自動檢測語種,並輸出逐詞時間戳與語音嵌入。
阿布扎比技術創新研究院(TII)發布 1.6B 引數的語音識別模型 Falcon-ASR,主打阿拉伯語與阿聯酋方言,同一套權重還支援英語、法語、西班牙語和葡萄牙語。在六個阿拉伯語測試集上,它取得 20.92% 的平均詞錯率,比其所用榜單快照中最佳公開結果 23.17% 低 2.25 個百分點;內部阿聯酋方言評測為 22.73% WER、10.19% CER,比次優的 Qwen3-Omni 低 4.07 個百分點。
Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。
Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。
Google 週二上線 SynthID 驗證網站,任何人可上傳圖片、影片或音訊,檢查是否為 AI 生成。該工具此前只向部分記者、媒體從業者和研究人員開放測試,現已全面開放,支援 JPG、PNG、HEIC、MP4、MP3、WAV 等十餘種格式。SynthID 自 2023 年推出,Google 的 Nano Banana、Veo、Lyria 模型以及 Gemini、Flow、Vids 等生成工具都會為產出加水印,OpenAI、Nvidia、Kakao 也已支援。
Google DeepMind 推出 SynthID Detector,可快速識別影片、音訊和影像中的 SynthID 水印,即使內容經過加濾鏡等編輯後依然有效。使用者還可以使用 Google Chrome、Google 搜尋和 Gemini App 中已有的 AI 識別功能。
ElevenLabs 正式上線 OpenRouter,提供 9 個文字轉語音模型和 2 個語音轉文字模型。已通過 OpenRouter 呼叫語言模型的應用,用同一個 OpenRouter API key 呼叫 POST /api/v1/audio/speech 與 POST /api/v1/audio/transcriptions 即可獲得語音能力,無需另購 ElevenLabs 套餐。
The Verge 刊文指出,隨著 AI 硬體的出現,科技公司正在重新定義什麼才算「錄製」。過去帶麥克風或攝像頭的裝置基本只有開與關兩種狀態:麥克風採集聲音、攝像頭採集影像,資料先儲存在裝置上,有時再上傳雲端處理,這些被保留下來的時間切片就是錄製。文章認為這一定義正被打破,並援引 Bloomberg 記者 Mark Gurman 上週的報導,稱 Apple 正在開發一款智慧家居產品。
SynthID Detector 是 Google DeepMind 推出的檢測工具,上傳檔案即可判斷其中是否含有 SynthID 數字水印,目前支援圖片、影片、音訊三類內容。該水印由採用 SynthID 的生成式 AI 產品在生成時直接嵌入畫素或音訊頻段,人眼不可見,且能抵抗濾鏡、調色與有失真壓縮等常見改動。它不是通用 AI 檢測器,只能識別 Google、Nvidia、OpenAI、Kakao 等合作方模型產出的內容;
ChatGPT 新增音訊檔案上傳功能,可生成轉寫、總結錄音內容並針對內容提問。該功能面向付費 ChatGPT 訂閱與工作空間開放,能把會議、訪談或講座轉成結構化筆記或跟進郵件草稿,使用方式是在對話中附上受支援的音訊檔案並說明需求。官方提示可用性受工作空間設定、地區、客戶端版本與模型影響,轉寫可能出現錯誤,不同語言的表現也有差異。
Google 與貝斯以色列女執事醫療中心(BIDMC)主導的研究首次登上《柳葉刀》主刊:98 名患者在門診就診前使用 Google 研究級診斷 AI 聊天機器人 AMIE,全程由醫生即時監控,沒有一輪對話因安全問題被中斷。臨床醫生反饋,75% 的場景下 AI 生成的摘要幫他們提前做好接診準備,超過半數案例中 AI 輸出改變了診療思路;AMIE 的鑑別診斷與醫生最終確診吻合度達 90%。研究團隊表示,面向患者端大規模落地仍需更大規模臨床試驗。
a16z 合夥人 Olivia Moore 發布消費者 AI 百強應用報告:ChatGPT 仍遙遙領先,Suno、ElevenLabs 等中小產品展現出持久力。報告發現社交、約會、電商、旅遊、金融、健康等類別在百強榜上完全沒有產品入選,美國也僅 2.2% 的家庭為 AI 付費。
Splice CEO Kakul Srivastava 認為 AI 生成的郵件正在扼殺對話。她曾任職於 Flickr、Yahoo、GitHub 和 Adobe,目前執掌為音樂製作人提供取樣素材的 Splice,該平台的取樣曾出現在 Lisa 的《Money》和 Sabrina Carpenter 的《Espresso》等熱門歌曲中。她還主導了 Splice 收購 Spitfire Audio 並推動平台向新領域拓展。
過去幾週,川普試圖給人工智慧改寫稱呼:把 artificial 變成貶義標籤,把他希望加速發展的技術稱為 super,並把反對者稱作 THE ENEMY,一些 AI 界知名人物已跟隨這一說法。他此前曾靠 Little Marco、Crooked Hillary 等綽號打擊對手,並把 fake news 變成對整個媒體的貶稱。The Verge 的報導認為,這次改名嘗試看上去相當做作,在語言上難以成立。
MIT 教授 Sherry Turkle 在 MIT Future Fest 發布新書《Artificial Intimacy》,討論人類為何本能地把機器人和大模型當作有感情的物件。她引用研究稱約 70% 的人與 AI 互動時會保持禮貌,對話超過第一輪後更常說「請」「謝謝」。同校研究員 Pat Pataranutaporn 認為關鍵不是用法對錯,而是「和 AI 對話時我們在變成誰」,他曾在一名 14 歲少年自殺後其母親起訴 Character.AI 的訴訟中擔任專家。
Napster 聯合創始人 Sean Parker 正把 Stability AI 重塑為面向音樂專業人士的 AI 工具公司。兩年前他參與 8000 萬美元救助這家瀕臨崩潰的影像生成初創公司,如今與 CEO Prem Akkaraju 公布新方向。8 月底公司宣布獲得 7600 萬美元融資,投資方包括索尼、華納和環球,三家還授權曲庫用於訓練。
輝達 Inception 計劃的多家初創公司正用 AI 補乳腺癌篩查、風險評估與治療規劃的缺口。iSono Health 的 FDA 許可 ATUSA 可穿戴自動 3D 超聲每側乳房約 2 分鐘完成成像,傳統手持超聲最長需 45 分鐘,其敏感度稱高出 28%,已在加州、德州等地診所商用,並啟動 3200 人臨床研究。Whiterabbit.ai 的 FDA 許可 WRDensity 軟體自動評估乳腺密度,已用於數十萬患者;
Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。
美國北卡羅萊納州 54 歲的 Michael Smith 用 AI 生成歌曲並配合上萬機器人刷量,從音樂流媒體平台竊取數百萬美元,被判 18 個月監禁。美國司法部稱,他是首位因 AI 輔助流媒體欺詐被刑事起訴的美國人。該騙局在 2024 年首次被起訴前已執行七年未被發現,Smith 已認罪。
一名軟體工程師用 Claude Code 搭建 AI 流水線,在一夜 12 小時內檢索 435 萬頁荷蘭東印度公司檔案與舊報紙,發現一份被遺忘的隕石記錄、三隻未記錄的犀牛和未定位的火山噴發。他把 570 萬段文字轉成語義向量檢索,再用每百萬詞僅幾美分的小型決策模型 Jev 初篩(讀 5.9 萬條大象記錄約 3 美元),由 Claude Haiku 精讀並核對原始掃描頁。靈感來自歷史學家 Benjamin Breen 用 Opus 5.5 找到的 1615 年渡渡鳥目擊記錄。
OpenAI 宣布將在歐盟自動為 ChatGPT 生成的文字加水印,其他地區也提供該功能,但預設關閉。這是為遵守 8 月生效的歐盟 AI Act,該法要求 AI 生成內容可被其他工具檢測。OpenAI 的水印方法名為 textGrain,屬專有技術並已發布技術論文:它在用詞中埋入人類難以察覺、也不影響輸出品質的模式,持有金鑰者可用專用檢測器識別。檢測器初期只向有限的研究者與機構開放,其他方需經申請審批逐步加入。
美國北卡羅萊納州 54 歲的 Michael Smith 因用機器人刷 AI 生成歌曲的播放量騙取版稅,被判處 18 個月監禁,並須上繳 800 萬美元版稅。他自 2017 年起建立多達 1 萬個虛假帳號,為自己擁有的數十萬首 AI 歌曲刷出數十億次播放,並把刷量分散到數千首歌以躲避異常檢測。司法部舉例稱,2023 年 4 月他的機器人帳號經家庭套餐刷了 8090 萬次,而同月 Taylor Swift 全曲庫在 YouTube Music 家庭套餐播放僅 930 萬次。
一位開發者撰文稱,AI 輔助程式設計(vibecoding)只把樂趣前置:能快速做出可用原型,但重構和維護階段不再有趣,也缺少手寫程式碼帶來的成就感。他把建造的樂趣分為六種,認為 vibecoding 只能滿足「想到點子」「把點子變成現實」和「解決自己的問題」三類,攻堅後的成就感、作品完成的滿足感與學習樂趣都不會自然產生。他仍用 AI 做出了一些手工做不出來的東西,包括即時野火預警系統、Kobo 資料庫遷移助手和即時音準訓練應用,但表示過程不像自己寫小指令碼那樣好玩。