AISpot

搜尋

找到 13 筆

Hugging Face blog9/30 01:00AI 評分46

Hugging Face 發布 Open TTS Leaderboard,用客觀指標評多語言 TTS 與語音克隆

Hugging Face 於 2026 年 9 月 30 日上線 Open TTS Leaderboard,用客觀指標評測開源與多語言 TTS 模型,單次評測從收集投票的數週縮短到數小時。指標包括 WER/CER(用 Qwen3 ASR 轉寫)、H200 批次離線推理的 RTFx、H200 與 CPU 上的流式首音訊延遲 TTFA,以及 WavLM 說話人嵌入的餘弦相似度 SIM。

Kimi blog● 精選10/2 22:11AI 評分65

Kimi 團隊開源 WorldVQA 多模態視覺世界知識基準

Kimi 團隊開源 WorldVQA,一個用 3500 組影像-問題對衡量多模態大模型視覺世界知識事實正確性的基準。資料分 9 大類,36% 中文、64% 英文,並區分常見(Head)與長尾(Tail)知識,全部經過多階段人工校驗。測試顯示前沿模型長尾題準確率常低於 50%,且普遍過度自信:表現最好的 Kimi-K2.5 校準誤差 ECE 為 37.9%、斜率 0.550,距理想值仍有明顯差距。資料集與評測指令碼已開源。

OpenRouter announcements8/21 01:00AI 評分36

OpenRouter 上線影像基準,覆蓋 39 個影像模型

OpenRouter 在 2026 年 8 月 21 日推出 Visual Image Benchmarks,可對比它提供的全部 39 個影像模型(截至 2026 年 8 月)。提示詞分七類:不可能場景、計數、文字、空間關係、否定、編輯、一致性,例如把酒杯倒滿至杯沿、沒有條紋的斑馬。結果以網格展示,可按價格和生成時間排序,提示詞設計成肉眼就能判斷優劣。評測後還能通過 OpenRouter 的影像生成 API 或 Chat 用自己的提示詞試模型,官方稱影片與音訊基準也將推出。

LM Studio blog● 精選8/10 01:00AI 評分89

Meta 發布 30B 開源模型 Muse Glimmer

Meta 發布 30B 開源模型 Muse Glimmer,Apache 2.0 許可,即日起可在 LM Studio Bionic 本地執行,Mac 與 PC 均可。它支援多步 agent 任務、工具呼叫與影像輸入,在 LM Studio 內部評測 BionicBench v0.1 的 18 項任務中完成率 83.3%,高於 Gemma 4 31B 和 Qwen 3.6 27B 的 77.7%。

r/ClaudeAI top of the day10/2 18:21AI 評分30

Opus 5.5 與 Sol 6.1 15 分鐘用 three.js 建布萊德湖城堡

一位使用者用 15 分鐘限時提示,讓 Opus 5.5 和 Sol 6.1 分別用 three.js 建置可旋轉視角的簡化版布萊德湖城堡。Opus 5.5 用時 5 分 46 秒,約 300k 輸入加 18k 輸出 token,估算 API 成本約 1.56 美元;Sol 6.1 用時 11 分 2 秒,約 400k 輸入加 16k 輸出 token,估算約 0.96 美元。Opus 5.5 產出約 27 KB、520 行、3 個 CDN 指令碼;

Simon Willison● 精選9/29 23:20AI 評分73

Anthropic 紅隊:GLM-5.3 在 4% 任務中實現控制流劫持

Anthropic Frontier Red Team 在內部 Binary Exploitation 基準中隨機抽取 100 個任務評估多個模型:GLM-5.3 在 4% 的試驗裡實現了完整控制流劫持,Claude Mythos Preview 為 6%。此前模型 Claude Opus 4.6 與 GLM-5.2 在這些任務中一次都沒有成功。該團隊認為,GLM-5.3 的成績雖低於 Claude Mythos Preview,但一個有意義的能力門檻已被跨過。

Google Developers blog10/2 22:21AI 評分43

MaxText 團隊在 TPU 上從零復現 Olmo 3 7B 預訓練

MaxText 團隊用 JAX/XLA 在 Google Cloud TPU 上從零復現了 Ai2 的 Olmo 3 7B 語言模型,在預訓練與中期訓練階段的所有 held-out 評測上與原版 PyTorch-on-GPU 參考實現精確一致。實現最高達到 57.4% MFU,且在不改動訓練配方的情況下撐過了執行中的叢集縮擴容和跨代 TPU 切換,驗證了基礎設施的可移植性。

Kimi blog● 精選10/2 22:11AI 評分82

Kimi K3 發布:2.8T 引數開放模型,支援 100 萬 token 上下文

Kimi K3 是首個開放的 3T 級模型,2.8T 引數,帶原生視覺能力和 100 萬 token 上下文視窗,今日已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用 max thinking effort,低/高 effort 模式後續推出。完整模型權重將於 2026 年 7 月 27 日前發布。官方稱其整體效能仍落後於 Claude Fable 5 和 GPT 5.6 Sol,但在自家評測套件上達到前沿水平;

X @karpathy● 精選8/2 04:00AI 評分67

Karpathy 用 Opus 5 把《魔戒》首段渲染成 3D 場景

Karpathy 給 Opus 5 輸入《魔戒》第一段、100 萬 token 預算(約 10 美元),讓它用 three.js 渲染這個故事。Opus 5 執行約 2 小時,寫出 5500 行程式碼,程式化生成了粗糙但可玩的 3D 場景。他指出這類任務沒人願意手工做,但 LLM 有無限耐心,成本近乎免費;同時也暴露 LLM 無法原生高效感知影片或玩遊戲,只能緩慢截圖自查,導致不少瑕疵。

Hugging Face blog10/2 05:01AI 評分46

ServiceNow 推出 AutoSynthData,把 Agent 失敗轉成訓練資料

ServiceNow CoreAI 發布 AutoSynthData,用目標模型的失敗案例和更強 teacher 的成功案例定位能力缺口,再自動生成並驗證新的訓練任務。每個任務由 system specification、user prompt 和 verifier 三部分組成:任務要可行、真實、對當前模型有難度,verifier 要一致、可靠且完備。流程先用診斷任務評測目標模型,把發現提煉成能力規格卡片並據此生成新任務,模型變強後課程自動轉向它仍做不好的部分。