Meta 發布 Muse Spark 1.1 多模態推理模型
Meta Superintelligence Labs 推出 Muse Spark 1.1 多模態推理模型,面向 agentic 任務,在工具呼叫、computer use 與編碼上大幅提升,並支援 100 萬 token 上下文管理。新 Meta Model API 開啟公開預覽,模型已在 Meta AI 應用與 meta.ai 以 Thinking 模式上線。
找到 7 筆
Meta Superintelligence Labs 推出 Muse Spark 1.1 多模態推理模型,面向 agentic 任務,在工具呼叫、computer use 與編碼上大幅提升,並支援 100 萬 token 上下文管理。新 Meta Model API 開啟公開預覽,模型已在 Meta AI 應用與 meta.ai 以 Thinking 模式上線。
Kimi 團隊發布 WorldVQA 基準,用 3500 組圖文問答、9 個類別評測多模態大模型的視覺世界知識,並區分常見與長尾知識。前沿模型在長尾視覺知識上準確率常低於 50%。所有被測模型都過度自信,表現最好的 Kimi-K2.5 的 ECE 為 37.9%、Slope 為 0.550;資料集與評測指令碼已開源。
Ollama v0.35.1 通過 /v1/systemone 接入 Cloudflare 開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可同時帶圖片和文字狀態。本次更新還把聯網搜尋上限從每次回答 3 次提升到 10 次,並更新了 llama.cpp 與 MLX 引擎。
Gemini 3.8 Live 加入 Live Avatar,在 Gemini Enterprise 上線,提供近即時視音訊對話並支援 97 種語言。
Kimi Team 發布 PerceptionBench,把視覺感知拆成 10 個原子能力,包含 3,000 道驗證題。16 個前沿 MLLM 無一達到 60% 準確率,感知相關幻覺平均最弱。
該基準用七類挑戰性提示詞測試影像模型能力,覆蓋其提供的 39 個模型,結果以網格展示並可按價格和生成時間排序。
Muse Glimmer 是 Meta Superintelligence Labs 的首個開源模型,30B 多模態、Apache 2.0 許可、128K+ 上下文,現已在 Ollama 上線。Apple Silicon 上可通過 Ollama 的 MLX 引擎執行,DFlash 帶來 1.5–1.8 倍提速,並新增影像輸入支援。