搜尋
找到 36 筆
Ollama releases● 精選9/25 16:22AI 評分86
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行,無需手動切換。用法與以往一致,例如 ollama pull qwen3.8 後 ollama run qwen3.8。該版本目前為預發布版(v0.40.0-rc0,變更範圍 v0.34.4 到 v0.40.0-rc0),官方稱預發布期間會測試並啟用更多模型,尚未說明具體支援清單與效能差異。
Ollama blog● 精選8/11 01:00AI 評分90
NVIDIA 的 30B 總引數(3B 啟用)開源模型 Nemotron 3.5 Lightning 已上線 Ollama,可完全在本地裝置執行。它採用混合 MoE 架構,支援最長 1M token 上下文,並用多 token 預測、DFlash 或 DSpark 投機解碼,吞吐達同類開源模型 4 倍、任務完成時間快 30%,面向呼叫工具、跑測試、檢索程式碼庫等長時 agent 任務。
Google Developers blog9/22 01:00AI 評分50
2026 年 9 月 22 日起,Google AI 訂閱使用者在 Colab 中獲得高階權益:優先使用更快的加速器和更強的機器;Google AI Ultra 訂閱者還解鎖後臺不間斷執行和 Premium GPU 訪問,長時間訓練不必一直開著瀏覽器標籤。已有 Colab 訂閱內容不變,Google AI 訂閱權益可以疊加。
OpenRouter announcements● 精選9/8 01:00AI 評分67
OpenRouter 發布 beta 版 openrouter:shell 服務端工具與 Files API,任何支援工具呼叫的模型都能在託管 Linux 容器裡執行命令並讀寫檔案。它相容 OpenAI 的 shell 工具(Responses API)和 Anthropic 的 bash 工具(Messages API),其中 bash 預設由你的應用本地執行,把 engine 設為 openrouter 才會在服務端沙箱執行。
Kimi blog● 精選10/2 22:11AI 評分65
Kimi 發布 Agent Swarm,Kimi K2.5 最多可並行部署 100 個子代理、執行 1500 次以上工具呼叫,出結果比序列執行快 4.5 倍。它不只是多代理協作,而是讓模型自行組建有分工的組織:自己決定何時並行、招誰、如何委派,適合大規模檢索、批次下載、多檔案處理與多視角分析。
OpenAI News10/1 18:00AI 評分21
先進 AI 可能對突破性想法背後的日常工作影響最大。文章探討執行環節為何可能塑造下一輪經濟與進步速度。
Kimi blog● 精選10/2 22:11AI 評分83
Kimi K2.6 已開源,可通過 Kimi.ai、Kimi App、API 和 Kimi Code 使用,主打長程編碼、長時間執行與 agent swarm。官方稱其在內部 Kimi Code Bench 上較 K2.5 顯著提升:一個案例是在 Mac 上用 Zig 實現並最佳化推理,4000+ 次工具呼叫、連續執行 12 小時、14 輪迭代後吞吐從約 15 升至約 193 tokens/sec,比 LM Studio 快約 20%;
The Verge AI10/2 22:08AI 評分46
Meta 開源了讓使用者自己動手製作 Muse 硬體裝置的程式碼,這些裝置執行 Meta 新的 AI 智慧體 Muse。官方稱可用現成的 ESP32 開發板,或用 Raspberry Pi 搭配其 SDK,再連線螢幕、按鈕、感測器、執行器等外設。Meta 舉例的玩法包括:用彩色電子墨水屏顯示提醒、把 Muse 裝進 HDMI 棒投到大屏、或裝在小觸屏上做出類似 DIY Muse Charm 的裝置。
Google Developers blog10/2 22:21AI 評分64
Google Antigravity SDK 現在支援在本地離線執行 agentic 工作流,可通過 LiteRT 執行 Gemma 4 26B A4B 等模型。SDK 還提供對 Ollama、vLLM 等 OpenAI 相容推理服務的開箱支援,便於搭建隱私優先的本地工具。官方描述的混合編排方式是:雲端模型只做輕量規劃器,程式碼審計、打補丁這類消耗大量 token 的任務交由裝置上的本地模型處理。
Mistral AI news9/10 01:00AI 評分42
Mistral 與 Cloudera 於 2026 年 9 月 10 日宣布合作,把 Mistral 模型整合進 Cloudera 混合資料平台,企業可在私有云、公有云、本地乃至完全氣隙環境中執行推理。企業還能在受控環境裡用自有專有資料訓練定製模型,並以開放權重方式擁有模型與資料。Cloudera 稱其平台上執行著客戶自管的 30 EB 資料,合作面向金融、製造、電信等受監管行業,核心是讓資料、智慧、算力與運營留在客戶手中。
Claude Platform release notes● 精選9/22 01:00AI 評分89
Anthropic 發布 Claude Opus 5.5,面向長時間執行的 agentic coding 與知識工作,預設 1M token 上下文、128k 最大輸出,每百萬 token 輸入 $4、輸出 $20(Opus 5 為 $5/$25),已上線 Claude API、Amazon Bedrock、AWS、Google Cloud 與 Microsoft Foundry。
Ollama blog● 精選8/10 01:00AI 評分92
Muse Glimmer 現已在 Ollama 上線,這是 Meta Superintelligence Labs 發布的首個開放模型。它是 30B 多模態模型,專為本地執行的 agent 工作負載設計,上下文 128K 以上,採用 Apache 2.0 許可,可直接驅動 Claude Code、Codex、Pi、OpenClaw 等。
Cloudflare blog (AI)● 精選10/1 16:34AI 評分66
Cloudflare 在 Workers AI 上發布自研決策模型 Clef 與 Clef-flash,並以 Apache 2.0 許可在 Hugging Face 完全開源、可本地執行,同時推出可把 Clef 微調到自家場景的強化學習產品。
Claude Platform release notes9/24 01:00AI 評分56
Anthropic 自 2026-09-24 起,對在任何輸出前被拒、且 stop_details.category 為 bio、frontier_llm、reasoning_extraction 的請求恢復計費,按執行該請求的模型費率收取,所有平台適用;其他類別的輸出前拒答仍不計費,fallback credit 不變。流式輸出中途的拒答此前已在計費。
LM Studio blog● 精選8/10 01:00AI 評分89
Meta 發布 30B 開源模型 Muse Glimmer,Apache 2.0 許可,即日起可在 LM Studio Bionic 本地執行,Mac 與 PC 均可。它支援多步 agent 任務、工具呼叫與影像輸入,在 LM Studio 內部評測 BionicBench v0.1 的 18 項任務中完成率 83.3%,高於 Gemma 4 31B 和 Qwen 3.6 27B 的 77.7%。
MLX releases● 精選4/22 02:43AI 評分74
MLX 發布 v0.31.2,把 CUDA 後端的量化矩陣乘擴充套件到了 3/5/6-bit、int4 與浮點量化(qmm_naive、qmm_sm80),並新增 GatherQMM 和 CUDA FFT。框架現在支援多執行緒執行獨立計算:CommandEncoder、ThreadLocalStream 改為執行緒本地,Scheduler::enqueue 執行緒安全,JACCL 拆分為獨立庫。
Ollama blog● 精選8/25 01:00AI 評分80
Ollama 現在可作為第三方閘道器接入 Claude Desktop,開發者在 Ollama 中開啟 Claude 開關即可自動完成配置。連線後可選任意 Ollama 模型,包括本地執行的開放模型與 Ollama 雲端模型,也能隨時切回 Anthropic 模型;在 Ollama 裡關閉 Claude 即恢復原有設定。
NVIDIA blog● 精選10/2 14:00AI 評分72
NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;
LM Studio blog● 精選8/17 01:00AI 評分68
LM Studio 的 Bionic 現已支援按 Agent Skills 標準(SKILL.md 檔案)使用、安裝和建立技能。在對話裡輸入 @ 可調出技能選擇器,Bionic 會讀取技能檔案再決定如何執行;也可以給一個網址讓它安裝,或把現成的 SKILL.md 放進 Settings > Skills。它還能複用你在 Codex、Claude Code 等應用裡已有的技能,在 Settings > Skills > Skills from other apps 中逐條開關。
OpenAI Codex changelog● 精選9/29 01:00AI 評分88
GPT-6.1 Sol 現已在 Codex 和 ChatGPT Work 中提供,官方稱其複雜工作的表現接近 Astra,但成本低於 Astra。它適合程式碼、應用和文件類可重複、長時間執行的任務,呼叫模型名為 gpt-6.1-sol。可用性取決於你的套餐、客戶端和工作區設定,具體支援情況需查閱 Models 文件來對比與選擇模型。
LM Studio blog● 精選8/27 01:00AI 評分61
Bionic 新增 shell 命令審批模式 Auto Review:命令先經 Shell Judge 做確定性分析,解析 AST、提取 ShellCapability 能力並匹配已知安全命令,通過即直接執行,不呼叫 LLM。無法判定的命令再交給 Shell Reviewer 子 agent,結合主會話記錄決定是否放行,支援 sh、bash、zsh 與 PowerShell。據作者自身使用資料,當前版本可自動批准約 82% 的命令;
LM Studio blog● 精選9/18 01:00AI 評分82
Inco AI 發布開源推理引擎 Splash,專為在 Apple Silicon 上本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,已整合進 LM Studio Bionic 1.1.5 及以上版本。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四個併發請求合計吞吐 170 tokens/s,是次快引擎的 3.9 倍。
NVIDIA blog● 精選10/2 00:44AI 評分86
GPT-6 Astra Ultrafast 已上線,執行在 NVIDIA Blackwell GPU 上,面向 OpenAI 內部以及符合條件的 ChatGPT Work 和 Codex 使用者開放,token 生成速度最高可達 Astra Standard 模式的 8 倍。開發者今天就能通過 API 呼叫,接入方式、定價與實現細節見官方 Ultrafast 指南。更快的生成可縮短 coding agent 的編輯—測試—除錯迴圈,減少工具呼叫之間的等待時間。
DeepSeek news● 精選10/2 22:11AI 評分87
DeepSeek 發布 V4.1-Flash:552B MoE、原生多模態,已上線 DeepSeek API(模型名 deepseek-flash),舊版 V4-Flash 與 V4-Flash-Vision-Exp 退役。新因果編碼器–解碼器架構只有 8B 輸入、16B 輸出啟用引數,KV 快取降至上一代的 1/4 HBM 與 1/8 SSD,官方稱多方測試顯示其在效能、成本、速度和總執行時間上超過 V4-Pro,V4-Pro 將逐步淘汰。
OpenCode releases● 精選9/30 23:39AI 評分67
OpenCode 發布 v1.18.34 bugfix 版本。模型請求現在會帶上帶名稱空間的會話與父會話身份標頭;本地編譯的 macOS 二進位制會被重新簽名,以便在 macOS 27 及以上可靠執行,macOS CLI 發布二進位制則用 Developer ID 簽名。另有 3 位社群貢獻者提交修復,包括更正文件中 GPT 6.1 Sol 的快取價格、在 /status 對話方塊用 path.sep 提取外掛名。
Claude blog9/15 01:00AI 評分40
Anthropic 於 2026 年 9 月 15 日為 Claude for Small Business 推出 43 個工作流和 27 個新整合,接入 Shopify、Salesforce、Stripe、Zapier 等工具,該產品自 5 月上線以來安裝量已超 90 萬次。新工作流把 Claude 從後臺運營擴充套件到獲客、回覆諮詢和撰寫提案,並可在 Claude Cowork 桌面應用中按計劃自動執行,預設傳送、發布或付款前需使用者批准。
Google Developers blog10/2 22:21AI 評分43
MaxText 團隊用 JAX/XLA 在 Google Cloud TPU 上從零復現了 Ai2 的 Olmo 3 7B 語言模型,在預訓練與中期訓練階段的所有 held-out 評測上與原版 PyTorch-on-GPU 參考實現精確一致。實現最高達到 57.4% MFU,且在不改動訓練配方的情況下撐過了執行中的叢集縮擴容和跨代 TPU 切換,驗證了基礎設施的可移植性。
Ollama releases● 精選9/24 05:45AI 評分70
v0.34.4 發布,更新了 llama.cpp、MLX 和 XGrammar,Qwen 3.8 的提示處理在 Apple Silicon 上更快,Gemma 4 會為每張圖片自動選擇最佳解析度以保留更多高畫質細節。思考模型的結構化輸出改為單次推理完成,速度更快也更可靠;同時修復了本地模型庫很大時偶發的 model not found 報錯,以及 macOS 應用在檢測 ChatGPT 或 Codex 是否執行時無回應的問題。
Hacker News front page10/2 21:39AI 評分63
技術與人權研究者 Roya Pakzad 發布對比測試,用世界銀行全球公共採購資料庫任務,分別以英文(美國)和波斯語(伊朗)在網頁版 Muse、Claude Cowork Opus 5.5、GPT 6.1 Sol 上執行。權限差異明顯:GPT 只在開頭請求一次網站訪問並提供允許所有相關網站選項,Claude 兩個任務各請求 9 次,Muse 到第四步才請求。
r/LocalLLaMA top of the day● 精選10/2 21:16AI 評分80
微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。
TechCrunch AI10/2 18:48AI 評分57
白宮本週把扎克伯格、貝索斯、馬斯克和 Anthropic 的 Dario Amodei 等主要科技公司 CEO 聚到同一場合,簽署一份 AI 安全承諾,川普稱這份承諾具有道德約束力。川普還簽署行政令,正式把 AI 改稱為超級智慧。與此同時,Meta 和 OpenAI 正讓自己的 AI 產品顯得更親和。原文未披露承諾的具體條款、完整簽署方名單或執行方式。
r/ClaudeAI top of the day10/2 17:52AI 評分30
Reddit r/ClaudeAI 使用者 Efistoffeles 只給 Opus 5.5 一句提示詞,要求它用 JavaScript 逐幀畫出自己對一張 19 美元瑞安航空機票的看法,模型一次生成成功,耗時約 8 分鐘,程式碼以 Claude artifact 形式公開、可直接執行。評論區認為這段動畫像真實的瑞安航空降落,甚至有人誤以為飛機墜毀,作者回應“技術上算降落了”。他還在評論中表示,19 美元機票在歐盟相當常見。
Claude blog● 精選8/26 01:00AI 評分81
Claude in Chrome 於 2026 年 8 月 26 日正式可用,覆蓋所有付費 Claude 方案,並支援 Claude 在瀏覽器中自主執行操作,不再需要逐步批准。它可讀取當前頁面、輸入文字、點選連結、跨標籤頁導航和填表,並使用你已有的登入狀態訪問內部儀表盤、遺留系統和供應商門戶。每次操作前由安全分類器校驗是否安全且符合你的請求,也可在設定中關閉自動批准。
Apple Machine Learning Research● 精選10/1 01:00AI 評分68
2026-10-01 發布的文章追問強 agent 在自主 ML 工程中究竟需要多少 harness。它指出,近期自主 MLE agent 在公開排行榜取得顯著進展,但現代 MLE agent 常建立在多 agent 編排器、專用檢索子 agent 等越來越複雜的裝置上;動機包括長週期進展停滯與 LLM 原語有限。相比之下,讓 LLM 通過 read、write、bash 直接訪問執行環境的更原始但改進的 coding agent,在領域內受到的關注很少。
Google Developers blog10/2 22:21AI 評分45
開發者用 Sparse VideoGen(SVG)把注意力頭動態路由到高度結構化的空間或時間稀疏掩碼,並在 TPU 上最佳化 Splash Attention 核心,使 1440p 影片生成的端到端推理最高提速 1.69 倍。核心側的具體改動是:跳過空記憶體 tile、把精確座標掩碼嚴格限制在邊界 tile、將 token 記憶體佈局改成時間優先(temporal-major)以獲得連續訪問。目的是把演算法層的稀疏真正對齊到硬體 tile 執行,顯著減少被浪費的矩陣運算。
Meta AI blog10/2 22:11AI 評分46
匹茲堡大學 HERL 實驗室聯合 ATDev 推進 RAMMP 輔助機器人專案(7 月 27 日發布),用 Meta 開源的 DINO、DINOv3 和 SAM 視覺模型做環境感知,專案獲美國 ARPA-H 最高 4150 萬美元資助。美國約有 550 萬輪椅使用者,每年逾 10 萬起輪椅相關傷害送進急診。團隊把模型最佳化到電池供電的邊緣裝置上執行:降低記憶體佔用、按需使用低精度、控制解析度與批處理,以犧牲少量邊界精度換取即時性與穩定性。