AISpot

搜尋

找到 7 筆

Hacker News front page10/4 20:42AI 評分72

斯坦福 Ousterhout 提出 Homa 協議替代 TCP

斯坦福教授 John Ousterhout 在 AI Engineer 演講中提出 Homa,一種面向資料中心的全新傳輸協議,認為 TCP 和 RDMA 正成為 AI 叢集的瓶頸。他指出 AI 負載已從大流量梯度傳輸轉向 KV cache 查詢、屏障同步等小訊息協調,這類訊息對延遲敏感,一旦與大數據流混排就會陷入 incast 佇列,拖高尾延遲並讓 GPU 空轉。Homa 基於訊息而非位元組流,採用接收端驅動的擁塞控制,並用 SRPT 優先排程短訊息。

Gemini API release notes● 精選9/15 01:00AI 評分85

Gemini 3.8 Live 兩款即時語音模型正式可用

Google 於 2026 年 9 月 15 日宣布 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款音訊到音訊模型正式可用(GA),面向 Live API 的即時語音應用。前者是低延遲語音代理與即時對話的預設選項,支援交錯推理、預設非同步函式呼叫和完整會話客戶端內容更新;後者支援即時音訊互動中的後臺推理,適合需要更高後臺推理能力的場景。

Cloudflare blog (AI)● 精選10/1 16:34AI 評分75

Cloudflare 開源決策模型 Clef,並推出 RL 微調平台

Cloudflare 發布兩個自研決策模型 Clef 與 Clef-flash,託管於 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,可本地執行。Clef 在 Jev Decision Index 上排名第一,具備視覺編碼器與 64k 上下文視窗,中位延遲 209.3ms,快於 Jev 的 524.1ms。同時推出強化學習微調產品,供使用者按自身場景微調 Clef。

Qwen blog● 精選9/18 10:30AI 評分79

Qwen3.8-LiveTranslate: Names the speaker. Carries the meaning.

Qwen3.8-LiveTranslate 採用 Interleave 架構,將同傳平均延遲(LAAL)從上一代的 2.8 秒降至 2.3 秒,並新增即時說話人分離、雙語同屏同步輸出與長上下文消歧三項能力。模型基於 Hybrid-MoE 的 Thinker–Talker 雙模組設計,支援 60 種語言的音訊輸入與文字輸出、29 種語言的語音輸出,可通過 DashScope API 接入,會話配置即可啟用說話人分離與原文譯文同步返回,無需單獨呼叫 ASR 介面。

r/LocalLLaMA top of the day10/3 00:18AI 評分27

LocalLLaMA 討論 jev 分類模型的實際使用體驗

r/LocalLLaMA 社群討論過去一週的 jev 模型熱潮是否該翻篇,並分享實際用例。有使用者用 jev 做論文證據定位和倉庫惡意行為掃描,也有使用者將其接入語音桌遊引擎,用 decider 4b 替代 Gemma 雙階段流程後延遲從 4-8 秒降至 2-3 秒。但有人實測 jev 及同類模型準確率持續低於 80%,而 Qwen 3.8 27B 達 95%、100b+ 模型達 100%。

Google Developers blog● 精選10/2 22:21AI 評分68

TPU 上影片擴散模型注意力最佳化提速 1.69 倍

開發者將 Sparse VideoGen(SVG)用於高解析度影片擴散模型,把注意力頭動態路由到結構化空間或時間稀疏掩碼,以緩解自注意力的二次延遲瓶頸。為在 TPU 上把演算法稀疏轉化為實際加速,團隊最佳化 Splash Attention 核心:跳過空記憶體塊、僅在邊界塊做精確座標掩碼、將 token 記憶體佈局改為時間優先以連續訪問。這些最佳化與硬體塊執行對齊後,1440p 影片生成端到端推理最高提速 1.69 倍。