AISpot

搜尋

找到 50 筆

量子位● 精選10/2 08:34AI 評分65

openJiuwen X-Router 首發,實測減少 50%+ Token 消耗

openJiuwen 團隊發布自演進模型路由技術 X-Router,在 PinchBench 全量 147 個任務實測中,靜態路由得分 66.3%、成本 $8.25,相比全量呼叫 Kimi-K2-Thinking 的 71.36%、$11.11,成本降低 44.6%。該技術基於五檔複雜度分檔路由,用本地 Qwen3-0.6B 做程序內分類器,支援端雲分級與 Bandit 自演進,並已接入 WorkSwarm 的 MoA 多模型協同。

Hacker News front page10/3 05:22AI 評分46

Anthropic 文章設想 AI 每秒輸出百萬 token

Anthropic 發布一篇思想實驗文章,探討「每秒 100 萬 token」的四種含義:上下文容量、輸入處理速度、聚合吞吐量和單智慧體輸出速度,並強調這不是對任何現有模型的實測。文中以 Claude Opus 5.5 為例,其上下文視窗為 100 萬 token,但單次請求輸出上限遠小於此。文章用互動計算器演示:若單智慧體達到每秒 100 萬 token,1000 個故事結局約 1 秒寫完,但加入 60 秒固定檢查後,端到端加速從 10000 倍降至 132.57 倍。

Latent Space● 精選10/1 07:45AI 評分92

Gemini 4 Argon 發布:輸出上限 1M token,限網路安全預覽

Google DeepMind 發布 Gemini 4 Argon,主打程式設計、企業知識工作與網路防禦,在 19 項基準中 13 項達到 SOTA,並首次實現最高 1M token 輸出(Long Decode Continuation 跨呼叫續寫)。目前僅面向政府使用者與 Fairwind 計劃中的可信網路安全人員開放,開發者、企業與消費者訪問時間未定。標準定價為每百萬輸入/輸出 token 4/20 美元,五折優惠後 2/10 美元,快取輸入再降 95%。

Ollama blog● 精選8/31 01:00AI 評分86

Ollama 雲服務改為按 token 透明計費,Pro 每月 20 美元含 60 美元額度

Ollama 於 2026 年 8 月 31 日宣布 Pro、Max、Team 計劃改用按 token 的透明定價,每個計劃含每月重新整理的用量額度:Pro 每月 20 美元含 60 美元用量,Max 每月 100 美元含 300 美元,Team 每月 500 美元含 1000 美元共享用量且不限席位。免費計劃也提供少量入門模型額度,可充值按量付費使用全部模型。

Google DeepMind blog● 精選9/30 21:01AI 評分92

Google 發布 Gemini 4 Argon,輸出上限提至 1M tokens

Google DeepMind 於 2026 年 9 月 30 日發布前沿模型 Gemini 4 Argon,先通過 Fairwind Program 向受信任的網路安全防禦方開放,隨後逐步擴充套件。其輸出 token 上限從 64K 提升至行業領先的 1M,定價為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,快取輸入享 95% 折扣。

量子位10/3 03:38AI 評分55

Jev 估值 100 億美元,創始人稱日處理破萬億 token

TypeSafe AI 聯合創始人兼 CEO Diogo Almeida 在 Latent Space 訪談中透露,其 System-One 模型 Jev 估值達 100 億美元,日處理量已突破一萬億 token,且夜間流量持續走高,說明大量呼叫來自機器自動化。Jev 1.13.0 在第三方 JevBench v1.2.1 綜合榜以 75.3 分排名第一,發布影片 6 天瀏覽量超 3870 萬。

量子位● 精選10/1 16:02AI 評分92

Google 發布 Gemini 4 Argon,多榜單登頂但僅限安全團隊

Google 於 10 月 1 日突然發布 Gemini 4 Argon,在 DeepSWE v1.1 上以 77.9% 超過 Claude Opus 5.5 和 GPT-6 Astra,Vals Index 以 68.90% 登頂,Text Arena 以 1525 分居首。優惠期單題成本約低四成,每百萬輸入 Token 2 美元、輸出 Token 10 美元,支援百萬 Token 輸出。目前僅開放給經篩選的網路安全團隊,通過 Fairwind 計劃使用,其他訂閱使用者需等待。

r/ClaudeAI top of the day10/2 18:50AI 評分27

DensePack 把文字打包成圖片,為 Claude Code 省約一半 token

開發者發布 DensePack,將 Read 讀取的文字檔案、Bash 輸出、Word 文件和子代理報告打包成圖片供 agent 讀取,聲稱按約 50% 的價格完成同樣的文字 token 化,且後續快取讀取也按這一折扣計費。作者稱已跑過逾 1 萬次基準測試,圖片用獨特配色加兩行圖例,可從圖片逐位元組還原始碼檔案,並保留文字副本作為校驗回退。專案發布兩週獲 8 個 star,已通過 Anthropic 外掛提交的初期階段,最新版本 1.3.3,1.4 計劃支援與其他外掛共用。

r/ClaudeAI top of the day10/2 18:21AI 評分45

Opus 5.5 與 Sol 6.1 限時 15 分鐘生成 three.js 版布萊德湖城堡

一位使用者用同一提示詞讓 Opus 5.5 和 Sol 6.1 在 15 分鐘內用 three.js 建置簡化版布萊德湖城堡,要求可環繞旋轉相機並保持寧靜氛圍。Opus 5.5 用時 5 分 46 秒,約 30 萬輸入加 1.8 萬輸出 token,估算 API 成本約 1.56 美元;Sol 6.1 用時 11 分 2 秒,約 40 萬輸入加 1.6 萬輸出 token,估算成本約 0.96 美元。

Hacker News front page● 精選10/3 11:43AI 評分85

Aleph Alpha 發布開源主權模型 Kolibri,78B 引數 Apache 2.0

德國 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,Apache 2.0 許可,權重已上 Hugging Face。它採用 MoE 架構,總引數 78.1B,每 token 僅啟用 3.46B,支援德語和英語,原生上下文 262,144 token,知識截止 2026 年 6 月 18 日。模型在德國和芬蘭基礎設施上從零訓練,使用 768 塊 NVIDIA B200,訓練約 24 萬億 token,其中德語佔比超五分之一。

Apple Machine Learning Research10/2 01:00AI 評分50

研究指離散擴散模型單步生成依賴條件獨立假設

一項研究分析了離散擴散模型(含 remasking 與 uniform-state 取樣器)的單步生成機制,指出一步生成只有在所寫位置在已固定 token 條件下相互獨立時,才與訓練分佈匹配。研究證明,任何逐位置分佈的乘積都無法匹配存在依賴關係的 token 組,而畫素、音素、詞等常見領域中的 token 本身存在固有依賴。

r/ClaudeAI top of the day10/3 01:47AI 評分38

Opus 5.5 跑 28 分鐘生成單檔案網頁,花費 6.17 美元

一位使用者用自訂 Pi agent 搭配 High 思考檔位的 Opus 5.5,耗時 27 分 45 秒、花費 6.17 美元(主 agent 4.97 美元、設計審查 agent 1.21 美元),產出一個 1029 行、零依賴的 HTML 檔案。輸出 122,689 tokens,其中思考 66,163 tokens;總 token 約 600 萬,約 95% 為快取讀取。

OpenAI Codex changelog● 精選9/22 01:00AI 評分92

GPT-6 Sol 與 Luna 上線 Codex 和 ChatGPT Work

GPT-6 Sol 和 GPT-6 Luna 正陸續登陸 Codex 與 ChatGPT Work,token 價格低於前代 GPT-5.6。Sol 面向複雜編碼與 agentic 工作流,Luna 面向高頻聚焦任務。Plus、Pro、Business、Enterprise、Edu 使用者可逐步獲得,Free 與 Go 使用者可在桌面應用使用 Luna;Enterprise 管理員需手動啟用。ChatGPT 中僅 Work 和 Codex 可用,Chat 不可用;

NVIDIA blog10/1 14:00AI 評分25

輝達稱 Vera Rubin NVL72 每兆瓦吞吐量超 GB300 30 倍

輝達援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量超過 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍。輝達以「高產、耐用、通用」概括 AI 工廠回報邏輯:每兆瓦 token 數決定收益,A100 出貨六年後仍在商用,CoreWeave 已將 2020 年首批裝置的預訂延長至 2029 年。

Ollama releases10/4 15:45AI 評分45

MLX v0.40.0-rc1 對齊發布方 tokenizer 語義

MLX 發布 v0.40.0-rc1,核心改動是讓本地 tokenizer 與模型發布方的語義保持一致,涵蓋預分詞階段順序、切分行為、Unicode 邊界、added token 歸一化和 BPE 合併排序,並統一處理空 added token 與空 Metaspace 輸入。同時新增 Go/Python 共享參考用例,直接拉取缺失模型並在出錯時失敗,另加配置優先順序、位元組回退與並行編碼的迴歸測試。

OpenRouter announcements● 精選9/22 01:00AI 評分78

OpenRouter 推出 Batch API,批次推理半價

OpenRouter 上線 Batch API,把請求打包提交後由服務商在 24 小時內擇時完成,換取約為正常每 token 價格 50% 的折扣,目前已支援 70 多個模型。兩週 beta 期間 23 萬多個批次的中位完成時間為 7 分鐘,90% 在一小時內完成;太平洋時間凌晨 5 點到中午提交明顯更慢。支援 chat completions、responses、messages 和 embeddings,輸入結果保留 30 天,圖片和檔案需用公開 URL。

r/LocalLLaMA top of the day● 精選10/3 12:44AI 評分80

Aleph Alpha 發布 Kolibri-1:78B 引數 MoE 開源模型,Apache 2.0

德國 Aleph Alpha 在 Hugging Face 發布 Kolibri-1,總引數 78B、啟用 3.46B,支援最高 100 萬 token 上下文,採用 Apache 2.0 許可。模型基於 20T token 的英德雙語語料訓練(約 62.5% 英語、23.9% 德語、13.6% 程式碼),在 768 張 B300 叢集上訓練約 4 周。社群討論認為其基準表現接近 Qwen 3.5 35B,適合 96GB 視訊記憶體本地部署,但目前尚無量化版本。

r/LocalLLaMA top of the day10/3 05:10AI 評分40

使用者觀察新模型寫作趨向高資訊密度與生僻詞彙

有使用者在 Reddit 發帖指出,近期開源與閉源新模型(如 GLM 5.3 Flash)的寫作風格正趨向高資訊密度和擴充套件詞彙,用更少字詞表達更多內容,類似 William Gibson 的壓縮文風。作者認為這可能與追求 token 效率有關,但代價是普通讀者難以一眼讀懂,例如輸出中出現 Baudrillardian 這類需要背景知識才能理解的詞。

r/LocalLLaMA top of the day10/3 10:00AI 評分12

網友討論對 Kimi K3.5 的期待

有使用者在 Reddit 發帖討論對 Kimi K3.5 的期待,稱 K3 已是令人喜愛的模型,好奇 K3.5 會有多強。帖主回顧稱 K2 已經不錯,K2.5 憑藉持續學習階段提升到全新水平,據其記憶使用了超過 20-25T token。該帖未提供 K3.5 的發布時間、引數或官方資訊。

Latent Space10/3 09:45AI 評分12

GPT-6.1 Sol 與 Sonnet 5.5 發布,重塑價效比前沿

OpenAI 發布 GPT-6.1 Sol,定價每百萬輸入/輸出 token 2/10 美元,遠低於 Astra 的 10/50 美元,官方稱其在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分。Sonnet 5.5 在 Agent Arena 首秀排名第 3 並在 Chat 類別登頂,Anthropic 模型包攬前三。Codex 用量於 10 月 2 日太平洋時間上午 10 點全球重置。

llama.cpp releases10/3 12:28AI 評分42

llama.cpp 最佳化 lightning indexer 視訊記憶體與多後端支援

llama.cpp 合併多項改動,將 indexer 分數視訊記憶體佔用減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現改為逐頭計算並原地累加為單個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 頭、Metal 以函式常量讀取頭數、Vulkan 按 64 鍵×8 token 分塊並改用 fp16 點積,indexer 改為呼叫 ggml_lightning_indexer 且鍵只讀一次。

Qwen blog● 精選9/18 08:00AI 評分88

阿里發布 Qwen3.8-Omni-Flash 全模態模型,支援 1M 上下文

阿里推出新一代原生全模態模型 Qwen3.8-Omni-Flash,已在千問 AI 平台上線,支援文字、影像、音訊、影片輸入,上下文視窗達 100 萬 token。該模型在 29 項評測中平均分較 Qwen3.5-Omni-Plus 提升超 25%,音影片輸入價格分別下降超 98% 和 93%,並開源 Qwen-Live Harness 即時執行時。

NVIDIA blog● 精選10/2 00:44AI 評分85

OpenAI 上線 GPT-6 Astra Ultrafast,基於 NVIDIA Blackwell

GPT-6 Astra Ultrafast 已在 OpenAI API 上線,並向符合條件的 ChatGPT Work 與 Codex 使用者開放,執行在 NVIDIA Blackwell GPU 上。官方稱其 token 生成速度最高可達 Astra Standard 模式的 8 倍,可縮短 coding agent 的編輯—測試—除錯迴圈,並減少工具呼叫之間的等待。開發者可通過 API 使用,訪問方式、價格與實現細節見 Ultrafast 指南。

Meta AI blog● 精選10/2 22:11AI 評分93

Meta 發布 Muse Spark 1.1 多模態推理模型

Meta Superintelligence Labs 於 2026 年 7 月 9 日發布 Muse Spark 1.1,這是 Muse Spark 的升級版多模態推理模型,面向 agentic 任務,在工具與電腦操作、程式設計和多模態理解上有明顯提升。模型支援 100 萬 token 上下文視窗,可編排多智慧體系統,並已在 Meta AI 應用和 meta.ai 的 Thinking 模式上線。

r/ClaudeAI top of the day10/2 22:23AI 評分40

用草圖代替文字提示,Claude 在 Blender 建模效率提升

一位使用者在 Blender 中使用 Claude Opus 5.5 時發現,直接畫出空間意圖比用文字描述形狀更高效。文字擅長說明物體是什麼,卻難以表達位置、大小和數量,因此他改為提供草圖或空間參考。整個專案共消耗 3300 萬 token,API 成本 16.07 美元,執行 48.5 分鐘。

Anthropic News● 精選9/23 01:00AI 評分85

Anthropic 用 Claude 發現類 CRISPR 新型酶系統

Anthropic 於 2026 年 9 月 23 日宣布,其生命科學研究團隊用 Claude 自主發現了一種與 DNA 重複序列相關的新型酶系統,命名為 array-associated reverse transcriptases(ART)。約 950 個 agent 在 21 小時內消耗 2.1 億 token 掃描 DNA 資料庫,其中一個 agent 注意到某逆轉錄酶基因旁存在重複序列模式,隨後經實驗室驗證確認。

Hacker News front page● 精選10/3 10:36AI 評分79

Aleph Alpha 發布 78B 開源模型 Kolibri

德國 AI 公司 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,總引數 78B、啟用引數 3B,支援最長 1M token 上下文,權重已在 Hugging Face 開放下載,採用 Apache 2.0 許可。該模型為英德雙語 MoE Transformer,面向公共管理、工業與航空航天等受監管領域,在 AIME 2025 上得分 96.9,官方稱其效能可對標啟用引數四倍於己的模型。

r/LocalLLaMA top of the day10/3 07:49AI 評分68

Qwen3.8-Flash-Next 177B 在單張 RTX 5070 上跑出 11-15 tok/s

有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

Google Developers blog● 精選10/2 22:21AI 評分69

Google Antigravity SDK 新增本地 AI 模型支援

Google Antigravity SDK 現已支援在本地執行離線 agentic 工作流,可通過 LiteRT 呼叫 Gemma 4 26B A4B 等模型。該更新支援混合編排架構,由雲端模型擔任輕量規劃器,本地模型在裝置上處理程式碼審計與修補等高 token 消耗任務。SDK 還直接相容 Ollama、vLLM 等 OpenAI 相容推理伺服器,便於建置隱私優先的本地自主工具。

OpenAI News● 精選10/2 17:15AI 評分92

OpenAI 發布 GPT-6 系列模型指南,含三檔定價

OpenAI 於 2026 年 10 月 2 日發布 GPT-6 系列模型指南,該系列包含三款模型:GPT-6 Astra(輸入 $10/輸出 $50 每百萬 token)、GPT-6.1 Sol(輸入 $2/輸出 $10)和 GPT-6 Luna(輸入 $0.1/輸出 $0.5)。指南建議按任務難度匹配模型與推理等級,並利用提示快取(快取輸入最高便宜 95%)和壓縮控制成本,同時提供 Fast 與 Ultrafast 加速模式。

r/LocalLLaMA top of the day10/3 04:12AI 評分43

Strata 搭配 Qwen3.8 Next 在 DDR4 平台跑出 45-70t/s

有使用者報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的慢速平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高。同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,且該使用者認為品質明顯更好,但不推薦 Q2 權重。12GB 和 16GB 顯示卡使用者有類似結果,DDR5 平台則顯著更快。

llama.cpp releases10/5 08:08AI 評分40

llama.cpp 為 4 頭 lightning indexer 新增 CUDA 分塊核心

llama.cpp 合併 b11405 版本更新,為 lightning indexer 在 CUDA 與 ROCm 後端新增分塊核心,針對 4 頭場景最佳化。新核心將鍵以半精度暫存、查詢逐頭載入,每執行緒負責一個鍵對兩個 token,避免點積的跨執行緒歸約;同時把乘積改為 float 計算以防 half2 溢位,並讓每個鍵元素只擴充套件一次供所有頭使用。ROCm 上內層迴圈展開 8 次,gfx908 僅用 63 個 VGPR 無溢位,R9700 上核心提速 36 倍。

Kimi blog● 精選10/2 22:11AI 評分88

Kimi K3 發布:2.8T 引數開源模型,百萬上下文

月之暗面發布 Kimi K3,2.8T 引數,號稱全球首個開源 3T 級模型,具備原生視覺與 100 萬 token 上下文,已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用最高思考強度。官方稱其整體效能仍落後 Claude Fable 5 與 GPT 5.6 Sol,但在自測中達到前沿水平,並優於其他受測模型。完整權重將於 2026 年 7 月 27 日發布,技術報告隨後公布。

機器之心● 精選10/4 12:38AI 評分68

AlphaGo 核心作者稱 LLM 不會推理,離開 DeepMind 創業

AlphaGo 核心作者 Thore Graepel 在 MIT Technology Review 發文稱 LLM 不會推理,並已離開 Google DeepMind 創業做可審計的機器推理。他指出 AlphaGo 第 37 手是策略網路加搜尋機制的結果,而 LLM 的思維鏈仍只是預測下一個 token,缺少可檢查的認知狀態、知識與推理的分離,且常事後編造解釋。Yann LeCun 表示讚賞,認為真正推理必須涉及搜尋。

Hacker News front page10/3 19:23AI 評分50

Meta 的 Muse 靠設計與廣告模式登頂美區 App Store

Meta 的消費級 AI 產品 Muse 已在美國 App Store 榜首停留一段時間。其核心能力(瀏覽器與電腦操作、雲端工作流、定時任務、手機遠端控制)在 Codex、Claude Code 等工具中已存在一年多,Muse 的差異在於把複雜選項抽象為單一聊天介面,並靠廣告而非賣 token 變現,免費額度因此相當寬鬆。作者認為這可能是 agentic AI 首次對普通消費者變得可理解。

Cloudflare blog (AI)● 精選10/1 14:04AI 評分68

Cloudflare 將 EuroLLM 與 Apertus 兩個歐洲開源模型接入 Workers AI

Cloudflare 在生日周宣布,將歐洲兩個公共機構訓練的開源模型 EuroLLM 和 Apertus 引入 Workers AI,現已開放訪問申請。EuroLLM 覆蓋 35 種語言,含全部 24 種歐盟官方語言;Apertus 由瑞士 ETH Zurich、EPFL 等開發,訓練資料超 15 萬億 token、覆蓋 1500 多種語言,權重與資料全部公開。Cloudflare 同時啟動面向政府網路安全機構與關鍵基礎設施運營方的實操工作坊,首場 10 月在新加坡舉行。

r/ClaudeAI top of the day10/3 11:40AI 評分55

handoff-compact:Claude Code 自動壓縮時自動交接並清空上下文

handoff-compact 是一個 Claude Code 外掛,在 autocompact 觸發時不再使用內建摘要,而是讓會話分支寫出一份交接文件(目標、狀態、下一步、決策、排除方案、待解問題、檔案與提交、驗證命令、最近 10 條提示原文),再用它替換原對話,相當於在同一會話中自動完成 handoff + /clear。作者稱長時間無人值守會話中約一半 token 花在上下文已超 200k 的輪次上,既貴又因上下文腐化影響品質。

r/LocalLLaMA top of the day10/2 18:47AI 評分68

Percepta 發布 Spotlight 架構,記憶可無限增長

Percepta 公布新架構 Spotlight,用可讀寫記憶取代注意力機制,宣稱是首個實現記憶無限增長而不增加訪問成本的架構。每個 token 只讀寫少量記憶單元,稀疏度可任意調節,不像 MoE 那樣固定啟用比例。該架構把負責計算的智慧模組與存放知識、流程和狀態的記憶分離,模型權重不隨記憶增長而改變,可自行決定載入與覆寫,從而無需重訓練即可獲得新能力。

X @karpathy● 精選8/2 04:00AI 評分70

Karpathy 用 Opus 5 花 2 小時生成 5500 行程式碼渲染《魔戒》

Karpathy 給 Opus 5 輸入《魔戒》第一段、100 萬 token 預算(約 10 美元),要求用 Three.js 渲染,模型執行約 2 小時後寫出 5500 行程式化渲染程式碼。他認為這類任務標誌 LLM 測試正走出「畫個騎腳踏車的鵜鶘 SVG」階段,因為沒人會花時間做這種高度定製的作品,而 LLM 有無限耐心。他也指出弱點:LLM 無法原生高效地觀看影片或玩遊戲,Opus 5 只能緩慢截圖檢查,多次出錯並留下不少瑕疵。