AISpot

搜尋

找到 22 筆

Kimi blog● 精選10/2 22:11AI 評分82

Kimi K3 發布:2.8T 引數開放模型,支援 100 萬 token 上下文

Kimi K3 是首個開放的 3T 級模型,2.8T 引數,帶原生視覺能力和 100 萬 token 上下文視窗,今日已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用 max thinking effort,低/高 effort 模式後續推出。完整模型權重將於 2026 年 7 月 27 日前發布。官方稱其整體效能仍落後於 Claude Fable 5 和 GPT 5.6 Sol,但在自家評測套件上達到前沿水平;

Claude Code releases● 精選10/2 21:19AI 評分84

Claude Code 2.1.288 修復恢復會話丟失上下文與超時中斷問題

Claude Code 發布 v2.1.288。修復了長對話報「Prompt is too long」卻不自動壓縮、--resume 丟失剛被壓縮恢復的檔案與上下文、恢復的會話不儲存該輪最後回覆,以及回應中途 API 超時導致整輪失敗——非互動會話與子代理現在會從部分回應繼續,僅有思考內容的回應會重試。

Claude Platform release notes● 精選9/22 01:00AI 評分89

September 22, 2026

Anthropic 發布 Claude Opus 5.5,面向長時間執行的 agentic coding 與知識工作,預設 1M token 上下文、128k 最大輸出,每百萬 token 輸入 $4、輸出 $20(Opus 5 為 $5/$25),已上線 Claude API、Amazon Bedrock、AWS、Google Cloud 與 Microsoft Foundry。

X @OpenAIDevs● 精選10/2 23:40AI 評分76

@OpenAIDevs: Your dot learns how you work, keeps context across apps, coordinates Codex tasks, and flags what ne…

OpenAI 開發者帳號發布 dot,它能學習使用者的工作方式、跨應用保留上下文、協調 Codex 任務,並標記需要使用者關注的事項。目前官方只給出這四項能力描述,未公布定價、可用平台與上線時間。

Ollama blog● 精選8/11 01:00AI 評分90

NVIDIA Nemotron 3.5 Lightning 上線 Ollama,可完全本地執行

NVIDIA 的 30B 總引數(3B 啟用)開源模型 Nemotron 3.5 Lightning 已上線 Ollama,可完全在本地裝置執行。它採用混合 MoE 架構,支援最長 1M token 上下文,並用多 token 預測、DFlash 或 DSpark 投機解碼,吞吐達同類開源模型 4 倍、任務完成時間快 30%,面向呼叫工具、跑測試、檢索程式碼庫等長時 agent 任務。

LM Studio blog● 精選9/17 01:00AI 評分68

LM Studio Bionic 支援跨會話引用與內省

LM Studio 的 Bionic 現在可以引用並內省(Introspection)過往會話,在輸入框用 @ 提及即可引用其他會話,跨專案也支援。內省是一組寫在內建 SKILL 裡的漸進披露工具,採用分層設計與截斷策略以節省上下文,能讀取持久化的會話記錄,找回 compaction 時被丟棄的設計決策、環境資訊等細節,因此在耗時數小時的長任務中更能遵守原定計劃。讀取其他會話需經權限彈窗批准,以避免跨會話汙染;讀取當前會話自身的 transcript 則無需批准。

llama.cpp releases10/2 19:55AI 評分50

llama.cpp 為 ggml 緩衝區介面新增 alloc_buffer_n 與 get_alloc_size_n

llama.cpp 的 ggml 後端緩衝區型別介面新增 alloc_buffer_n 與 get_alloc_size_n 方法,並公開 ggml_backend_buft_alloc_buffer_n、ggml_backend_buft_get_alloc_size_n 兩個 API。預設實現負責多緩衝區分割與張量分配,Meta buffer type 提供自訂實現,按裝置建立子上下文並委託給 simple buffer type;

Meta AI blog● 精選10/2 22:11AI 評分81

Meta 發布 Muse Spark 1.1 多模態推理模型,開放 API 公測預覽

Meta Superintelligence Labs 於 7 月 9 日發布 Muse Spark 1.1,是 Muse Spark 的多模態推理升級版,主打 agentic 任務,在工具與計算機使用、編碼、多模態理解上提升明顯。模型可主動管理 100 萬 token 上下文,能作為主代理編排並行子代理,在 OpenCode 中演示了自動截圖定位並修復 bug。

Hacker News front page10/2 22:06AI 評分47

每個 SaaS 業務都將變成圍繞模型的 harness

作者 Shrivu Shankar 認為,每個 SaaS 業務最終都會變成圍繞無狀態 LLM 的 harness,也就是模型之外的基礎設施、介面、上下文與狀態。他給出四階段路徑:無 harness、個人操作 harness、個人編排 harness,最後是 harness 編排個人,核心任務交給雲端後臺 agent,人類只在關鍵處提供品味與判斷。Claude Code、Codex、OpenCode、LangGraph 被他列為狹義 harness 的例子;

LM Studio blog● 精選9/18 01:00AI 評分82

Inco AI 開源 Splash 引擎,最佳化 Apple Silicon 本地推理

Inco AI 發布開源推理引擎 Splash,專為在 Apple Silicon 上本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,已整合進 LM Studio Bionic 1.1.5 及以上版本。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四個併發請求合計吞吐 170 tokens/s,是次快引擎的 3.9 倍。

Claude blog● 精選6/18 01:00AI 評分81

Claude Code 新增 artifacts,可生成即時共享網頁

Claude Code 從 2026 年 6 月 18 日起支援 artifacts,能把會話進展生成為可即時更新、可分享的互動式網頁,如 PR 走查、儀表盤和發布清單。它基於程式碼庫、聯結器和對話上下文建置,同一連結自動發布新版本並保留版本歷史。該功能目前以 beta 形式面向 Claude Team 和 Enterprise 組織,可通過 CLI 和桌面應用使用,頁面預設僅作者可見,且只能組織內認證成員檢視。

r/ClaudeAI top of the day10/3 01:29AI 評分29

使用者求助:如何把 Claude 用到極致並搭建自動化生活系統

一名大學生在 Reddit 發帖,稱自己每天用 Claude Pro 和 Claude Code,但感覺只發揮了其能力的一小部分。他列舉了當前用法:用 Claude Code 無程式設計背景搭建 DuckDB 分析資料庫、連線 Gmail/Calendar/GitHub/Drive/Notion、用 Otter 錄音後讓 Claude 提取要點,同時抱怨反覆重述上下文、未用 Claude Projects、Cowork、定時任務和 Chrome 擴充套件。

X @karpathy7/21 17:53AI 評分47

Karpathy 分享用語音長談餵給 LLM 的工作模式

Karpathy 說他常用一種「長時間語音漫談」的方式與 LLM 協作:當懶得打字、又需要給模型更多上下文時,就切到 /voice 連續說上約 10 分鐘,內容雜亂、意識流、允許錯別字。他有時會先宣告「已切換到語音識別,抱歉有錯字」,有時把它變成幾輪小訪談。他發現 LLM 很擅長重建這種長而不連貫的漫談,複述出來的思路往往比原話更清晰,從而減少後續糾正。

Kimi blog● 精選10/2 22:11AI 評分65

Kimi Team 發布 PerceptionBench,評估 MLLM 原子視覺感知

Kimi Team 發布 PerceptionBench,一個把視覺感知拆成原子能力來評估的 MLLM 基準。它從 42 個基準的前沿模型失敗中歸納出 10 類原子感知能力,構造併發布 3,000 道已驗證題(內部池 17,000+),60% 來自模型失敗分解,40% 新寫,覆蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR、幻覺。測試 16 個前沿 MLLM,無一達到 60% 準確率,幻覺平均是最弱能力;總分接近的模型在具體感知上可能差異很大。

Meta AI blog10/2 22:11AI 評分45

Meta 發布 Brain2Qwerty v2,無創即時把腦訊號解碼成句子

Meta 發布 Brain2Qwerty v2,無需手術植入,即可從非侵入式 MEG 腦訊號即時解碼出連貫句子,詞準確率達 61%,遠高於其他無創方法的 8%,最佳受試者達 78%,其中過半句子錯誤不超過一個詞。模型用 9 名志願者、每人佩戴 MEG 邊打字邊記錄 10 小時、共約 22,000 句的資料訓練,採用端到端深度學習直接從原始腦訊號解碼,並微調大語言模型利用語義上下文。

r/ClaudeAI top of the day10/2 17:28AI 評分41

r/ClaudeAI 熱議 Opus 5.5 被削弱

Reddit 的 r/ClaudeAI 版塊出現熱帖,多數評論者認為 Opus 5.5 已被削弱(發帖人把 nerfed 誤寫成 nerded)。主流猜測是官方先用新模型拉訂閱、隨後降低算力省成本,同時讓下一代模型顯得更強;少數使用者稱模型仍正常甚至仍是最好的模型,品質下滑感來自上下文堆積、未新開對話。有人貼出 nerf 追蹤基準顯示輕微下滑,但被指仍在正常誤差範圍內;也有評論指出 Opus 5.5 發布當天就會說 load-bearing,不能當作降級訊號。

Google DeepMind blog9/23 17:00AI 評分57

Google 為 Private AI Compute 加入伺服器端加密持久記憶

Google 在 2026 年 9 月 23 日宣布為 Private AI Compute 平台加入伺服器端持久記憶:加密資料存在雲端專用儲存,解密金鑰只儲存在使用者裝置上,模型需要時通過端到端加密通道在 secure enclave 內臨時解密處理。此前該平台是無狀態的,任務一結束就清除全部上下文。Google 同時發布伺服器軟體的防篡改公開記錄,供裝置在傳送資料前驗證,並給出由一家網路安全公司完成的獨立審計結果。