AISpot

搜尋

依意思最接近的 23 筆

Hacker News front page10/8 12:59AI 評分69

Whistle 發布 16.9 MB 語音識別模型,CPU 上執行並支援七種語言

Whistle 是一個 16.9 MB 的單檔案端側語音識別模型,無依賴、在 CPU 上執行,與 Needle 共用同一套 C++ 引擎。它支援英語、德語、法語、西班牙語、義大利語、荷蘭語和波蘭語,單次最多處理 30 秒 16 kHz 單聲道音訊,可自動檢測語種,並輸出逐詞時間戳與語音嵌入。

Hugging Face blog10/7 09:21AI 評分64

TII 發布 1.6B 阿拉伯語語音識別模型 Falcon-ASR,主打阿聯酋方言

阿布扎比技術創新研究院(TII)發布 1.6B 引數的語音識別模型 Falcon-ASR,主打阿拉伯語與阿聯酋方言,同一套權重還支援英語、法語、西班牙語和葡萄牙語。在六個阿拉伯語測試集上,它取得 20.92% 的平均詞錯率,比其所用榜單快照中最佳公開結果 23.17% 低 2.25 個百分點;內部阿聯酋方言評測為 22.73% WER、10.19% CER,比次優的 Qwen3-Omni 低 4.07 個百分點。

X @GoogleDeepMind● 精選10/7 10:03AI 評分85

SynthID Detector 向所有人開放,可檢測多家 AI 生成內容

Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。

X @GoogleDeepMind10/1 13:11AI 評分43

@GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。

TechCrunch AI● 精選10/7 10:00AI 評分83

Google 上線 SynthID 網站,任何人都能驗證 AI 生成內容

Google 週二上線 SynthID 驗證網站,任何人可上傳圖片、影片或音訊,檢查是否為 AI 生成。該工具此前只向部分記者、媒體從業者和研究人員開放測試,現已全面開放,支援 JPG、PNG、HEIC、MP4、MP3、WAV 等十餘種格式。SynthID 自 2023 年推出,Google 的 Nano Banana、Veo、Lyria 模型以及 Gemini、Flow、Vids 等生成工具都會為產出加水印,OpenAI、Nvidia、Kakao 也已支援。

OpenRouter announcements● 精選10/6 20:00AI 評分74

ElevenLabs 上線 OpenRouter,帶來 9 個語音合成與 2 個轉錄模型

ElevenLabs 正式上線 OpenRouter,提供 9 個文字轉語音模型和 2 個語音轉文字模型。已通過 OpenRouter 呼叫語言模型的應用,用同一個 OpenRouter API key 呼叫 POST /api/v1/audio/speech 與 POST /api/v1/audio/transcriptions 即可獲得語音能力,無需另購 ElevenLabs 套餐。

The Verge AI10/6 12:29AI 評分45

AI 硬體正在改寫錄製定義,Apple 智慧家居新品被點名

The Verge 刊文指出,隨著 AI 硬體的出現,科技公司正在重新定義什麼才算「錄製」。過去帶麥克風或攝像頭的裝置基本只有開與關兩種狀態:麥克風採集聲音、攝像頭採集影像,資料先儲存在裝置上,有時再上傳雲端處理,這些被保留下來的時間切片就是錄製。文章認為這一定義正被打破,並援引 Bloomberg 記者 Mark Gurman 上週的報導,稱 Apple 正在開發一款智慧家居產品。

Hacker News front page10/7 10:16AI 評分64

Google DeepMind 上線 SynthID Detector 水印檢測工具

SynthID Detector 是 Google DeepMind 推出的檢測工具,上傳檔案即可判斷其中是否含有 SynthID 數字水印,目前支援圖片、影片、音訊三類內容。該水印由採用 SynthID 的生成式 AI 產品在生成時直接嵌入畫素或音訊頻段,人眼不可見,且能抵抗濾鏡、調色與有失真壓縮等常見改動。它不是通用 AI 檢測器,只能識別 Google、Nvidia、OpenAI、Kakao 等合作方模型產出的內容;

releasebot: ChatGPT● 精選10/5 20:00AI 評分80

ChatGPT 付費版支援上傳音訊,可轉寫並摘要錄音

ChatGPT 新增音訊檔案上傳功能,可生成轉寫、總結錄音內容並針對內容提問。該功能面向付費 ChatGPT 訂閱與工作空間開放,能把會議、訪談或講座轉成結構化筆記或跟進郵件草稿,使用方式是在對話中附上受支援的音訊檔案並說明需求。官方提示可用性受工作空間設定、地區、客戶端版本與模型影響,轉寫可能出現錯誤,不同語言的表現也有差異。

量子位● 精選10/9 02:28AI 評分76

《柳葉刀》主刊研究:Google AMIE 門診輔助,診斷吻合度 90%

Google 與貝斯以色列女執事醫療中心(BIDMC)主導的研究首次登上《柳葉刀》主刊:98 名患者在門診就診前使用 Google 研究級診斷 AI 聊天機器人 AMIE,全程由醫生即時監控,沒有一輪對話因安全問題被中斷。臨床醫生反饋,75% 的場景下 AI 生成的摘要幫他們提前做好接診準備,超過半數案例中 AI 輸出改變了診療思路;AMIE 的鑑別診斷與醫生最終確診吻合度達 90%。研究團隊表示,面向患者端大規模落地仍需更大規模臨床試驗。

TechCrunch AI10/9 11:43AI 評分65

a16z 發布消費者 AI 百強榜:ChatGPT 居首,社交電商等類別空白

a16z 合夥人 Olivia Moore 發布消費者 AI 百強應用報告:ChatGPT 仍遙遙領先,Suno、ElevenLabs 等中小產品展現出持久力。報告發現社交、約會、電商、旅遊、金融、健康等類別在百強榜上完全沒有產品入選,美國也僅 2.2% 的家庭為 AI 付費。

The Verge AI10/3 11:00AI 評分23

Splice CEO 稱 AI 郵件正在扼殺對話

Splice CEO Kakul Srivastava 認為 AI 生成的郵件正在扼殺對話。她曾任職於 Flickr、Yahoo、GitHub 和 Adobe,目前執掌為音樂製作人提供取樣素材的 Splice,該平台的取樣曾出現在 Lisa 的《Money》和 Sabrina Carpenter 的《Espresso》等熱門歌曲中。她還主導了 Splice 收購 Spitfire Audio 並推動平台向新領域拓展。

The Verge AI10/9 10:25AI 評分43

川普力推把 AI 改稱「超級」,多位 AI 大佬跟隨

過去幾週,川普試圖給人工智慧改寫稱呼:把 artificial 變成貶義標籤,把他希望加速發展的技術稱為 super,並把反對者稱作 THE ENEMY,一些 AI 界知名人物已跟隨這一說法。他此前曾靠 Little Marco、Crooked Hillary 等綽號打擊對手,並把 fake news 變成對整個媒體的貶稱。The Verge 的報導認為,這次改名嘗試看上去相當做作,在語言上難以成立。

TechCrunch AI10/9 12:40AI 評分51

MIT 教授 Turkle 出版新書,探討人類為何把 AI 當人對待

MIT 教授 Sherry Turkle 在 MIT Future Fest 發布新書《Artificial Intimacy》,討論人類為何本能地把機器人和大模型當作有感情的物件。她引用研究稱約 70% 的人與 AI 互動時會保持禮貌,對話超過第一輪後更常說「請」「謝謝」。同校研究員 Pat Pataranutaporn 認為關鍵不是用法對錯,而是「和 AI 對話時我們在變成誰」,他曾在一名 14 歲少年自殺後其母親起訴 Character.AI 的訴訟中擔任專家。

TechCrunch AI10/2 17:09AI 評分71

Sean Parker 將 Stability AI 轉型為音樂 AI 工具

Napster 聯合創始人 Sean Parker 正把 Stability AI 重塑為面向音樂專業人士的 AI 工具公司。兩年前他參與 8000 萬美元救助這家瀕臨崩潰的影像生成初創公司,如今與 CEO Prem Akkaraju 公布新方向。8 月底公司宣布獲得 7600 萬美元融資,投資方包括索尼、華納和環球,三家還授權曲庫用於訓練。

NVIDIA blog10/5 09:00AI 評分47

NVIDIA Inception 初創用 AI 補乳腺癌篩查與治療缺口

輝達 Inception 計劃的多家初創公司正用 AI 補乳腺癌篩查、風險評估與治療規劃的缺口。iSono Health 的 FDA 許可 ATUSA 可穿戴自動 3D 超聲每側乳房約 2 分鐘完成成像,傳統手持超聲最長需 45 分鐘,其敏感度稱高出 28%,已在加州、德州等地診所商用,並啟動 3200 人臨床研究。Whiterabbit.ai 的 FDA 許可 WRDensity 軟體自動評估乳腺密度,已用於數十萬患者;

量子位● 精選10/5 00:42AI 評分86

Hinton、Bengio 等 22 位作者發首篇 RSI 論文,討論智慧爆炸

Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。

Ars Technica AI10/7 13:57AI 評分65

美國男子用 AI 歌曲和上萬機器人刷流媒體獲刑 18 個月

美國北卡羅萊納州 54 歲的 Michael Smith 用 AI 生成歌曲並配合上萬機器人刷量,從音樂流媒體平台竊取數百萬美元,被判 18 個月監禁。美國司法部稱,他是首位因 AI 輔助流媒體欺詐被刑事起訴的美國人。該騙局在 2024 年首次被起訴前已執行七年未被發現,Smith 已認罪。

Hacker News front page● 精選10/9 07:36AI 評分76

AI 代理一夜檢索 435 萬頁檔案,挖出被遺忘的隕石記錄

一名軟體工程師用 Claude Code 搭建 AI 流水線,在一夜 12 小時內檢索 435 萬頁荷蘭東印度公司檔案與舊報紙,發現一份被遺忘的隕石記錄、三隻未記錄的犀牛和未定位的火山噴發。他把 570 萬段文字轉成語義向量檢索,再用每百萬詞僅幾美分的小型決策模型 Jev 初篩(讀 5.9 萬條大象記錄約 3 美元),由 Claude Haiku 精讀並核對原始掃描頁。靈感來自歷史學家 Benjamin Breen 用 Opus 5.5 找到的 1615 年渡渡鳥目擊記錄。

Ars Technica AI● 精選10/6 16:50AI 評分82

OpenAI 將在歐盟預設給 ChatGPT 輸出加水印

OpenAI 宣布將在歐盟自動為 ChatGPT 生成的文字加水印,其他地區也提供該功能,但預設關閉。這是為遵守 8 月生效的歐盟 AI Act,該法要求 AI 生成內容可被其他工具檢測。OpenAI 的水印方法名為 textGrain,屬專有技術並已發布技術論文:它在用詞中埋入人類難以察覺、也不影響輸出品質的模式,持有金鑰者可用專用檢測器識別。檢測器初期只向有限的研究者與機構開放,其他方需經申請審批逐步加入。

Hacker News front page10/7 21:33AI 評分52

美國男子用機器人刷 AI 歌曲播放量被判 18 個月

美國北卡羅萊納州 54 歲的 Michael Smith 因用機器人刷 AI 生成歌曲的播放量騙取版稅,被判處 18 個月監禁,並須上繳 800 萬美元版稅。他自 2017 年起建立多達 1 萬個虛假帳號,為自己擁有的數十萬首 AI 歌曲刷出數十億次播放,並把刷量分散到數千首歌以躲避異常檢測。司法部舉例稱,2023 年 4 月他的機器人帳號經家庭套餐刷了 8090 萬次,而同月 Taylor Swift 全曲庫在 YouTube Music 家庭套餐播放僅 930 萬次。

Hacker News front page10/6 10:45AI 評分42

開發者復盤 vibecoding:上手刺激但缺少手寫程式碼的成就感

一位開發者撰文稱,AI 輔助程式設計(vibecoding)只把樂趣前置:能快速做出可用原型,但重構和維護階段不再有趣,也缺少手寫程式碼帶來的成就感。他把建造的樂趣分為六種,認為 vibecoding 只能滿足「想到點子」「把點子變成現實」和「解決自己的問題」三類,攻堅後的成就感、作品完成的滿足感與學習樂趣都不會自然產生。他仍用 AI 做出了一些手工做不出來的東西,包括即時野火預警系統、Kobo 資料庫遷移助手和即時音準訓練應用,但表示過程不像自己寫小指令碼那樣好玩。