搜尋 關鍵字 語意 找到 7 筆
Hacker News front page10/4 20:42 AI 評分72
斯坦福教授 John Ousterhout 在 AI Engineer 演講中提出 Homa,一種面向資料中心的全新傳輸協議,認為 TCP 和 RDMA 正成為 AI 叢集的瓶頸。他指出 AI 負載已從大流量梯度傳輸轉向 KV cache 查詢、屏障同步等小訊息協調,這類訊息對延遲敏感,一旦與大數據流混排就會陷入 incast 佇列,拖高尾延遲並讓 GPU 空轉。Homa 基於訊息而非位元組流,採用接收端驅動的擁塞控制,並用 SRPT 優先排程短訊息。
Gemini API release notes● 精選 9/15 01:00 AI 評分85
Google 於 2026 年 9 月 15 日宣布 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款音訊到音訊模型正式可用(GA),面向 Live API 的即時語音應用。前者是低延遲語音代理與即時對話的預設選項,支援交錯推理、預設非同步函式呼叫和完整會話客戶端內容更新;後者支援即時音訊互動中的後臺推理,適合需要更高後臺推理能力的場景。
Latent Space● 精選 10/2 07:40 AI 評分82
Earendil 旗下 Pi 發布 1.0 版本,同時推出將 Pi 移植到 TypeScript 的 Pi Durable,兩者均登上 Hacker News 首頁。Pi 1.0 新增原生 MCP、Jev 與影像模型支援、虛擬模型擴充套件、延遲工具載入、Anthropic 模型快取預熱、對話中途系統訊息與新 TUI 主題。
Cloudflare blog (AI)● 精選 10/1 16:34 AI 評分75
Cloudflare 發布兩個自研決策模型 Clef 與 Clef-flash,託管於 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,可本地執行。Clef 在 Jev Decision Index 上排名第一,具備視覺編碼器與 64k 上下文視窗,中位延遲 209.3ms,快於 Jev 的 524.1ms。同時推出強化學習微調產品,供使用者按自身場景微調 Clef。
Qwen blog● 精選 9/18 10:30 AI 評分79
Qwen3.8-LiveTranslate 採用 Interleave 架構,將同傳平均延遲(LAAL)從上一代的 2.8 秒降至 2.3 秒,並新增即時說話人分離、雙語同屏同步輸出與長上下文消歧三項能力。模型基於 Hybrid-MoE 的 Thinker–Talker 雙模組設計,支援 60 種語言的音訊輸入與文字輸出、29 種語言的語音輸出,可通過 DashScope API 接入,會話配置即可啟用說話人分離與原文譯文同步返回,無需單獨呼叫 ASR 介面。
r/LocalLLaMA top of the day10/3 00:18 AI 評分27
r/LocalLLaMA 社群討論過去一週的 jev 模型熱潮是否該翻篇,並分享實際用例。有使用者用 jev 做論文證據定位和倉庫惡意行為掃描,也有使用者將其接入語音桌遊引擎,用 decider 4b 替代 Gemma 雙階段流程後延遲從 4-8 秒降至 2-3 秒。但有人實測 jev 及同類模型準確率持續低於 80%,而 Qwen 3.8 27B 達 95%、100b+ 模型達 100%。
Google Developers blog● 精選 10/2 22:21 AI 評分68
開發者將 Sparse VideoGen(SVG)用於高解析度影片擴散模型,把注意力頭動態路由到結構化空間或時間稀疏掩碼,以緩解自注意力的二次延遲瓶頸。為在 TPU 上把演算法稀疏轉化為實際加速,團隊最佳化 Splash Attention 核心:跳過空記憶體塊、僅在邊界塊做精確座標掩碼、將 token 記憶體佈局改為時間優先以連續訪問。這些最佳化與硬體塊執行對齊後,1440p 影片生成端到端推理最高提速 1.69 倍。