AISpot

Whistle 發布 16.9 MB 語音識別模型,CPU 上執行並支援七種語言

Hacker News front page10/8 12:59官方公告模型地端推論開發工具

Whistle 是一個 16.9 MB 的單檔案端側語音識別模型,無依賴、在 CPU 上執行,與 Needle 共用同一套 C++ 引擎。它支援英語、德語、法語、西班牙語、義大利語、荷蘭語和波蘭語,單次最多處理 30 秒 16 kHz 單聲道音訊,可自動檢測語種,並輸出逐詞時間戳與語音嵌入。

16.9 MB 單檔案模型在 CPU 上實現 11.1 毫秒首 token 與 1,319 token/s 解碼,並與 Needle 共用同一 C++ 引擎,對在端側或本地部署多語種語音識別的開發者有直接參考價值。

原標題:Whistle: Speech to Text in 16.9 MB
閱讀原文

評分68 / 70(平均 69,門檻 76)
狀態未入選

相關報導

Hugging Face blog10/7 09:21AI 評分64

TII 發布 1.6B 阿拉伯語語音識別模型 Falcon-ASR,主打阿聯酋方言

阿布扎比技術創新研究院(TII)發布 1.6B 引數的語音識別模型 Falcon-ASR,主打阿拉伯語與阿聯酋方言,同一套權重還支援英語、法語、西班牙語和葡萄牙語。在六個阿拉伯語測試集上,它取得 20.92% 的平均詞錯率,比其所用榜單快照中最佳公開結果 23.17% 低 2.25 個百分點;內部阿聯酋方言評測為 22.73% WER、10.19% CER,比次優的 Qwen3-Omni 低 4.07 個百分點。

r/LocalLLaMA top of the day10/2 17:49AI 評分43

Peacebell:個人從零訓練的二戰專用小模型開源

開發者用 11 個月業餘時間從零訓練了二戰主題小語言模型 Peacebell,並開源訓練材料與權重,提供 291M 和 148M 兩個引數版本。訓練資料全部為自建合成資料,基於維基百科等許可材料,作者稱大部分精力花在資料整理與平衡上。291M 版本可在 HuggingFace 免費試用,無需 GPU 即可本地執行,但作者提醒這是初版,長上下文表現較差。同時發布了 WWII 主題基準與排行榜,下一版預計 2027 年發布。

OpenRouter announcements● 精選10/6 20:00AI 評分74

ElevenLabs 上線 OpenRouter,帶來 9 個語音合成與 2 個轉錄模型

ElevenLabs 正式上線 OpenRouter,提供 9 個文字轉語音模型和 2 個語音轉文字模型。已通過 OpenRouter 呼叫語言模型的應用,用同一個 OpenRouter API key 呼叫 POST /api/v1/audio/speech 與 POST /api/v1/audio/transcriptions 即可獲得語音能力,無需另購 ElevenLabs 套餐。

Hacker News front page● 精選10/3 06:43AI 評分85

Aleph Alpha 發布開源主權模型 Kolibri,78B 引數 Apache 2.0

德國 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,Apache 2.0 許可,權重已上 Hugging Face。它採用 MoE 架構,總引數 78.1B,每 token 僅啟用 3.46B,支援德語和英語,原生上下文 262,144 token,知識截止 2026 年 6 月 18 日。模型在德國和芬蘭基礎設施上從零訓練,使用 768 塊 NVIDIA B200,訓練約 24 萬億 token,其中德語佔比超五分之一。

releasebot: ChatGPT● 精選10/5 20:00AI 評分80

ChatGPT 付費版支援上傳音訊,可轉寫並摘要錄音

ChatGPT 新增音訊檔案上傳功能,可生成轉寫、總結錄音內容並針對內容提問。該功能面向付費 ChatGPT 訂閱與工作空間開放,能把會議、訪談或講座轉成結構化筆記或跟進郵件草稿,使用方式是在對話中附上受支援的音訊檔案並說明需求。官方提示可用性受工作空間設定、地區、客戶端版本與模型影響,轉寫可能出現錯誤,不同語言的表現也有差異。