AI 設計的開源加速卡 openTPU 跑通十餘款模型
一個由 AI 設計的開源 AI 加速器 openTPU 已在真實 PCIe 卡上跑通十餘款模型的真實權重,輸出與 bit-exact 模擬器逐位一致。硬體是 Xilinx Kintex-7 xc7k480t 加兩路 DDR3,LFM2.5-230M int8 解碼 59.0 tok/s、4-bit 達 85.8 tok/s;解碼受 DRAM 頻寬限制,實測跑到峰值的 82%-94%。
依意思最接近的 24 筆
一個由 AI 設計的開源 AI 加速器 openTPU 已在真實 PCIe 卡上跑通十餘款模型的真實權重,輸出與 bit-exact 模擬器逐位一致。硬體是 Xilinx Kintex-7 xc7k480t 加兩路 DDR3,LFM2.5-230M int8 解碼 59.0 tok/s、4-bit 達 85.8 tok/s;解碼受 DRAM 頻寬限制,實測跑到峰值的 82%-94%。
llama.cpp 發布 b11451 建置,主要變更是修復 OpenCL 後端在 Adreno GPU 上 xmem GEMM 的越界讀取(OOB read)問題,對應 PR #30041。
Anthropic 宣布 Claude Startups 計劃擴充套件,面向更多創始人開放。入選成員可獲得一年 Claude Team 訂閱、API 額度、創業常用工具的專屬優惠,以及與 Anthropic 應用 AI 團隊的 office hours。官方未披露擴充套件後的名額、申請門檻與地區範圍。
OpenAI 兌現 28 天連更承諾的第 1 天更新:GPT-6 Astra 與 GPT-6.1 Sol 預設速度提升約 50%,輸出從 30 TPS 提到 50 TPS,使用者無需操作、兩小時內生效,並覆蓋 OpenCode、Pi、Amp、Devin 等通過 Sign in with ChatGPT 接入的合作伙伴。
巴克萊銀行擴大與 Anthropic 的戰略合作,在全行部署 Claude 以加速軟體開發、改造遺留系統並提升運營效率。巴克萊預計到 2026 年底 Claude Code 覆蓋 50% 開發者,2027 年覆蓋多數軟體工程師。已上線的 Colleague Knowledge Assistant 基於 Claude 的 RAG 架構,超 1.6 萬名員工使用、處理逾 100 萬次搜尋;全球市場業務每天用 Claude 處理約 12 萬封郵件。
OpenAI 公布與 AI 合同平台 Ironclad 的研究合作,GPT-6 Astra 成為首個用 Ironclad 任務訓練的前沿模型。雙方與 Ironclad 使用者共同定義了 11 項法律、商務與採購任務,如搭建保密協議、採購審批流程和可複用條款,每項任務熟練使用者約需 30 到 40 分鐘,評估標準為 8 到 50 條。
物理學家 Matthew Schwartz 發布開源工具 BootLoops,作為 LLM 的科研 harness,用於定量科學中的精確計算。他發現當前模型不擅長像人類科學家一樣工作,但擅長特定「Claude 形狀」的問題,於是讓 Claude 自主尋找適配其能力的問題,結果連線到生態學、群體遺傳學等十幾個領域。BootLoops 可搭配任意模型使用,Schwartz 與領域專家合作,將其引導向各領域真正關心的問題。
llama.cpp 發布 b11384 版本,官網為 llama.app,並附 GitHub 建置證明。該版本提供 macOS、iOS、Linux、Android、Windows 及 openEuler 的預編譯包,涵蓋 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 與 Snapdragon 的 CPU、Adreno GPU、Hexagon NPU 等後端。
ggml 修復了 CLAMP 運算元在非連續檢視上的定址錯誤,涉及 CPU 與 CUDA 後端。CUDA 此前按 ggml_nelements 做平坦處理、忽略檢視 stride,CPU 則把第 j 行按 j*nb01 定址、忽略 nb02/nb03;現在兩者都改為遵循 dims 1..3 的 stride,且 CUDA 的 supports_op 要求行連續,與 Metal 一致。
輝達《State of AI in Telecommunications》報告顯示,89% 受訪者認為開源模型與軟體對公司 AI 戰略重要。運營商看重開源模型的可信任、可控與可定製,用於自主網路、客服等關鍵負載,並把閉源模型留給價值最高的場景;輝達同時發布 300 億引數的 Nemotron 3 Large Telco Model(由 AdaptKey 在開源電信資料集上微調),並提供基於 NeMo 的端到端微調流程。
Cloudflare 發布兩個自研決策模型 Clef 與 Clef-flash,託管於 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,可本地執行。Clef 在 Jev Decision Index 上排名第一,具備視覺編碼器與 64k 上下文視窗,中位延遲 209.3ms,快於 Jev 的 524.1ms。同時推出強化學習微調產品,供使用者按自身場景微調 Clef。
Anthropic 於 10 月 6 日 SF Tech Week 活動上宣布擴大 Claude for Startups 計劃:符合條件的企業可免費使用一年 Claude Team 付費方案,含最多 5 個高階席位,並獲 1000 美元 API 額度。此外還能接入 Claude Marketplace 建置外掛,並預約 Anthropic Applied AI 團隊的線上辦公時間。申請門檻為成立五年內的公司,或近兩年獲得過融資的公司,通過專案頁面申請即可。
llama.cpp 發布 b11382 版本,為 WebGPU 後端的 fill/set_rows 操作加入 f16 支援(PR #29897)。該版本同時更新了覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 的多平台建置產物,包括 Apple Silicon、CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 以及 Snapdragon 的 CPU、Adreno GPU 與 Hexagon NPU…
Anthropic 正在擴充套件 Claude Startups 計劃,為創業公司新增兩項支援:可預約 Anthropic 應用 AI 團隊的線上 office hours,以及參加 Founder House、駭客松與 meetup 等 Claude Startups 活動,活動名額視場地而定。申請條件是成立不滿五年、或在過去兩年內獲得融資的創業公司,官方文章給出了申請入口。
OpenAI CEO Sam Altman 就外界對 OpenAI 與 Cerebras 合作關係的猜測作出回應,稱 Cerebras 是緊密合作夥伴,雙方有深度合作,共同推進速度前沿。該表態未披露合作的具體內容、規模或時間安排。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構將自動改用 MLX 執行。可用模型包括 qwen3.8、gemma4、qwen3.6、qwen3.5,決策模型 Nimble、tev1、clef、clef-flash 也已登陸 MLX,官方稱會繼續測試並啟用更多模型。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構將自動改用 MLX 執行。官方範例為 ollama pull qwen3.8 與 ollama run qwen3.8;預發布期間會繼續測試並啟用更多模型。
Cloudflare 的決策模型現已在 Ollama 上可用,可通過 ollama pull 直接拉取。該系列模型用於影像分類、給 bug 報告打標籤、把支援工單路由到對應團隊。提供兩個版本:Clef(27B)和 Clef Flash(9B),拉取命令分別為 ollama pull clef 與 ollama pull clef-flash。
Ollama 發布 v0.35.1,通過 /v1/systemone 介面支援 Cloudflare 新開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可在文字 state 之外附帶圖片,所有問題共享該狀態並聯合打分。同一版本把聯網搜尋上限從每次回應 3 次提高到 10 次,Modelfile 新增 CAPABILITY 宣告,並更新了 llama.cpp 與 MLX 引擎。
OpenAI 開發者帳號 @OpenAIDevs 在 X 上發布了一篇文章,正文僅給出文章連結 https://x.com/i/article/2106076978206175232,未附任何文字說明。發布時間為 2026 年 10 月 2 日,具體內容需開啟連結檢視。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。官方範例為 ollama pull qwen3.8 與 ollama run qwen3.8,其他可用模型還包括 gemma4、qwen3.6 和 qwen3.5;決策模型 Nimble、tev1、clef、clef-flash 也已支援 MLX,並新增嵌入模型 embeddinggemma-2 支援。官方表示會繼續測試並啟用更多模型。
SemiAnalysis 對 Anthropic、OpenAI 等多家 AI 訂閱計劃做限額實測,結論是同等價位下 Anthropic 訂閱的 API 等價價值是 OpenAI 的 5 倍以上。同一 200 美元/月的 Claude 計劃,其等價價值隨模型與工作負載(輸入、快取寫入、快取讀取、輸出)不同而大幅變化,因此不存在孤立的價值數字。訂閱僅佔 Anthropic 總收入約 10%,卻消耗超過 40% 的推理算力,並把混合每兆瓦收入拉低約 3600 萬美元。
一名 Reddit 使用者發帖稱自己可能有點跟不上時代,剛開始學習 Claude AI,卻驚訝於它比其他 AI 工具強大得多,認為若正確使用 Claude,可為自己的多項業務節省數千美元的資源成本。帖子未給出具體業務場景、對比物件或節省金額的計算依據。
llama.cpp 合併 PR #28531,在共享記憶體為 32KB 的三星 GPU 上停用 Vulkan 後端的大矩陣乘分塊(large matmul tile),以規避該硬體配置下的問題。該改動由 Claude Opus 輔助完成,並附有建置證明連結。