AISpot

全部動態

所有通過初篩的資料,依發布時間排序,時間為倫敦時間。有橘色圓點的是精選。

10月2日星期五 · 8 則

  1. OpenRouter announcements● 精選AI 評分62

    OpenRouter 上線 Model Router Benchmarks 對比頁

    OpenRouter 推出 Model Router Benchmarks 頁面,用多領域基準給各家模型路由器打質量、速度、成本分。頁面用 Router Index 把三項合成 0 到 10 分,預設權重質量 60%、單任務耗時 20%、成本 20%,可拖滑塊調整。列出的路由器都能在 OpenRouter 上直接替換模型試用。

10月1日星期四 · 20 則

  1. Cloudflare blog (AI)● 精選AI 評分66

    Cloudflare 開源決策模型 Clef 與 Clef-flash

    Cloudflare 發布兩個自訓決策模型 Clef 和 Clef-flash,託管在 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,同時推出新的 RL 微調平台。Clef 在 Jev Decision Index 上目前排名第一,中位延遲 209.3ms,低於 Jev 的 524.1ms。它帶視覺編碼器、64k 上下文,可返回帶機率的結構化分類結果。

  2. 量子位● 精選AI 評分80

    Google Gemini 4 Argon 發布,多榜單登頂,價格約 Astra 一半

    Google 發布 Gemini 4 Argon,在 DeepSWE v1.1 得 77.9%,高於 Claude Opus 5.5 的 74.2% 與 GPT-6 Astra 的 74.1%。每百萬輸入 2 美元、輸出 10 美元,優惠期單題成本比 Astra 低約四成,最高支援百萬 Token 輸出。目前僅開放給經過稽核的網路安全團隊。

9月30日星期三 · 11 則

  1. Google DeepMind blog● 精選AI 評分83

    Google 發布 Gemini 4 Argon,輸出上限提至 100 萬 token

    Google DeepMind 發布 Gemini 4 Argon,正通過 Fairwind Program 向受信任的網路安全防禦者分批開放,尚未向開發者、企業與消費者開放。輸出 token 上限從 64K 提升到業界領先的 100 萬,定價為每百萬輸入 token 2 美元、輸出 10 美元,快取輸入為輸入價的 95% 折扣。它在 DeepSWE v1.1 得 77.9%,在 LVBench 得 91.7%。

  2. Claude Code releases● 精選AI 評分76

    Claude Code 更新 v2.1.286,修權限提示與登入問題

    Claude Code 發布 v2.1.286:多條權限請求排隊時會顯示 2 of 5 計數,全屏列表的 N more 行支援滑鼠點選跳轉。修復了 claude --resume/--continue 在大批並行工具呼叫後丟失全部輪次、憑據過期時多個程序重複彈出登入瀏覽器等問題。另改進 commit 流程,提交前會先執行名為 verify 的 skill。

  3. Anthropic ResearchAI 評分55

    研究:機器人已能完成美國 74% 體力任務,但僅 0.3% 有成本優勢

    用 Claude 評估的研究顯示,現有機器人能完成美國 74% 的體力工作任務,佔全部工時 34%,但只在 0.3% 的任務上比人工更便宜。若機器人價格按過去趨勢下降,這一比例要 40 年才達到 10%。過去 50 年裡,機器人暴露度高的崗位工資與就業下降更多。

9月29日星期二 · 11 則

  1. Ollama releases● 精選AI 評分65

    v0.35.1-rc0:Modelfile 新增 CAPABILITY 宣告與 capabilities 欄位

    v0.35.1-rc0 允許在 Modelfile 中宣告 CAPABILITY,並在 create 請求中增加 capabilities 欄位。這些宣告會在 GGUF、safetensors 的建立、繼承與 Modelfile 匯出中保留。排程 System One 請求前須先判定 capability,不再依賴 Qwen 架構與渲染器後設資料匹配;評分仍限 GGUF,MLX 執行時改動另行處理。

  2. Hugging Face blog● 精選AI 評分66

    ProvenanceGuard:為 MCP agent 增加來源感知核驗層

    研究者發布 ProvenanceGuard,一個接在 MCP agent 之後的事後驗證層,逐條判斷答案裡的 claim 是否真由它所指的那個工具來源支援。在醫學 agent 的 361 條 claim 上,專家判定 139 條不應通過,它攔下 138 條,另外把 67 條專家認可的 claim 送去複核或修復。

  3. MLX releases● 精選AI 評分70

    v0.32.3

    MLX 發布 v0.32.3,以 bug 修復和 Metal/CUDA 核心最佳化為主。新增 M5 Ultra 非量化 matmul 調優與 Metal gated delta net 核心,並改善 SDPA D256/D512 的 Metal 視訊記憶體佔用。同時修復整數除零崩潰、GGUF 張量維度校驗等問題。

  4. releasebot: ChatGPTAI 評分55

    ChatGPT 上線 Pages,可把對話變成可協作頁面

    ChatGPT 推出 Pages:可把一段對話直接變成 Page,也能從模板開始或直接在 Space 裡寫。頁面可用 ChatGPT 改寫文字、加圖表或生成互動內容,協作者能共同編輯並留評論,各自用自己的 ChatGPT。Page 沿用 Space 的可見性與分享設定,分享頁面不會讓他人看到你的私人對話或記憶。

更早的動態