NVIDIA 收購 Hugging Face,llama.cpp 承諾保持硬體無關
NVIDIA 已收購 Hugging Face。llama.cpp 作者 Georgi Gerganov 表示,NVIDIA 工程師已參與該專案程式碼庫一年多,並提供開發測試硬體;今後 llama.cpp/ggml 將繼續堅持硬體無關原則,所有後端的開發與支援仍由社群驅動,對所有人開放。他認為有 NVIDIA 和 Hugging Face 團隊支援,專案長期目標更易實現。
找到 38 筆
NVIDIA 已收購 Hugging Face。llama.cpp 作者 Georgi Gerganov 表示,NVIDIA 工程師已參與該專案程式碼庫一年多,並提供開發測試硬體;今後 llama.cpp/ggml 將繼續堅持硬體無關原則,所有後端的開發與支援仍由社群驅動,對所有人開放。他認為有 NVIDIA 和 Hugging Face 團隊支援,專案長期目標更易實現。
Meta 為 Muse 推出開源硬體專案 Muse Gadgets,提供 ESP32 Device SDK 與 Linux Device SDK,可讓自建裝置接入 Muse 的顯示、按鈕、感測器與執行器。SDK 與韌體以 Apache 2.0 許可開源,官方同時列出樹莓派 5、Waveshare ESP32-S3、M5Stack StickS3 等範例專案,並預告 Muse on your TV 即將推出。
Reddit 的 r/LocalLLaMA 版塊一則帖子下,使用者討論用低成本硬體本地跑大模型。有人稱 2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器最省錢,可讓 Qwen 3.8 Flash 跑到 15 tok/s 以上;也有人表示雙 7900XTX 不到 2000 美元即可支援 27B Q8 模型超過 220k 上下文。
Fadell 在 MIT Future Fest 上表示,Rabbit R1、Humane Ai Pin 和 Limitless 掛墜這批第一代 AI 硬體失敗,是因為沒有解決任何真實需求,只是對極客有趣的技術。他指出全球不到 0.01% 的人用過人類助理,多數消費者並不知道助理是什麼,建立信任需要數年。
Meta 開源了讓使用者自製 Muse AI 硬體裝置的程式碼,Muse 是其新的 AI agent。官方建議的玩法包括把 Muse 裝到彩色 E Ink 屏上顯示提醒、裝到 HDMI 棒上投到大屏,或裝到小觸控式螢幕裝置上做成類似 DIY Muse Charm 的形態。使用者可用現成 ESP32 板或 Raspberry Pi 配合官方 SDK,連線顯示屏、按鈕、感測器、執行器等外設。
Meta 於 10 月 3 日推出開源專案 Muse Gadgets,提供開源韌體與 Linux SDK,讓開發者用 Raspberry Pi、ESP32 等低成本硬體連線其個人 AI 代理 Muse,可接顯示器、按鈕、感測器等。官方範例包括給 Muse 加彩色電子墨水屏,或做成插入電視 HDMI 口的棒狀裝置,並開設 Discord 頻道支援。Meta 還自製了 USB-C 供電的 Muse Home Link,量產 5000 臺,向 Muse 訂閱者免費贈送,數週後發貨。
The Verge 刊文指出,隨著 AI 硬體的出現,科技公司正在重新定義什麼才算「錄製」。過去帶麥克風或攝像頭的裝置基本只有開與關兩種狀態:麥克風採集聲音、攝像頭採集影像,資料先儲存在裝置上,有時再上傳雲端處理,這些被保留下來的時間切片就是錄製。文章認為這一定義正被打破,並援引 Bloomberg 記者 Mark Gurman 上週的報導,稱 Apple 正在開發一款智慧家居產品。
Sergey Levine 在播客 The Peterman Pod 中表示,機器人硬體已「足夠好」,當前最大挑戰是建立讓機器人理解外部世界的決策迴圈,而非控制身體。他認為正確順序是先積累紮實的具身經驗,再接入影片等其他來源資料,與先用網際網路影片訓練的路線相反;機器人對可靠性的要求高於大語言模型,強化學習尚未解決從 95% 到 100% 的最後一步。
愛爾蘭一所公立繼續教育學院的教師發帖,稱已獲得資金建成一個小型 AI 實驗室,硬體配置尚可,目標是讓學生學到使用 ChatGPT 之外的實用技能,因此向社群徵集教學方向建議。帖子未透露具體硬體型號、課程安排或學生人數。
一篇題為 The Nintendo 64 Partner-N64 Development Kit 的文章在 Hacker News 上被分享,連結指向 behindthecode.ca,討論區僅有 1 條評論,得 16 分。內容圍繞任天堂 64 的 Partner-N64 開發套件展開,屬於遊戲主機硬體與開發歷史的回顧資料。
一個由 AI 設計的開源 AI 加速器 openTPU 已在真實 PCIe 卡上跑通十餘款模型的真實權重,輸出與 bit-exact 模擬器逐位一致。硬體是 Xilinx Kintex-7 xc7k480t 加兩路 DDR3,LFM2.5-230M int8 解碼 59.0 tok/s、4-bit 達 85.8 tok/s;解碼受 DRAM 頻寬限制,實測跑到峰值的 82%-94%。
Google Beam 正式向美國、加拿大、英國、法國、德國和日本六國客戶發貨,由 18 家渠道合作伙伴負責部署支援,硬體形態為 HP Dimension with Google Beam,相容 Google Meet 和 Zoom。Google 一項為期八週的內部研究顯示,使用 Beam 的團隊連線感提升 50%,反饋被清晰理解的程度提升 33%,後續會議需求下降 21%。
Nvidia 宣布自 2026 年 10 月 2 日起,2019 年發布的 Shield TV Pro 立即漲價 100 美元,從 199.99 美元升至 299.99 美元。Nvidia 發言人向 Ars 確認,漲價源於包括記憶體在內的元器件成本在全行業大幅上漲。該裝置搭載 Tegra X1+ 處理器,支援 AI 畫質提升與幾乎全部媒體格式的硬體解碼,非 Pro 版本已停產。
有使用者在討論區提問,為什麼嵌入模型常選擇 1536 維,而非 1024 或 2048。提問者已理解 64/128/256/512 等硬體友好倍數的意義,但好奇 1536=3×512 這一具體選擇的原因。OpenAI 曾使用 1536 維嵌入,其他廠商也提供或推薦該維度。提問者想知道這是 1024 與 2048 之間經驗性的折中點,還是存在架構或硬體上的特殊便利,並希望有實際訓練或設計嵌入模型的人回答。
llama.cpp 現在可以通過 ggml RPC 後端,把推理任務分散到異構裝置上共同完成,即同一次推理可由不同型別的硬體一起承擔。llama.cpp 作者 Georgi Gerganov 說明,這一能力目前仍是進階設定,但會隨時間逐步降低使用門檻,讓普通使用者也能用上。原文未給出支援的具體硬體組合、效能表現或可用版本。
近期出現一批極窄用途的推理執行時,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 與 vLLM 擅長的通用性,只針對少數模型甚至單一硬體家族(如 Strix Halo)做最佳化。作者認為通用執行時負責相容、過擬合執行時負責極致效能將成為常態,並有助於智慧的民主化與去中心化,讓現有硬體在特定配置下榨出最大輸出。
LM Studio 官方帳號宣布 Splash 引擎已開源,程式碼託管在 GitHub 的 incoai/splash 倉庫。官方僅給出倉庫連結,未披露該引擎的具體功能、支援的模型格式或硬體要求。
輝達在 2026 年 6 月推出 Nvidia Halos for Robotics,把面向自動駕駛的 Halos 安全架構擴充套件到機器人領域。Halos 於 2025 年發布,用硬體和軟體工具幫開發者為自動駕駛汽車等自主系統設定安全護欄,機器人版則覆蓋倉庫自主移動機器人、工廠內人形機器人乃至手術機器人。輝達機器人生態與邊緣計算負責人 Amit Goel 表示,隨著 AI 模型與機器人硬體能力提升,安全被視為下一個瓶頸。
Claude 官方帳號發布了一條簡短訊息,稱 Claude Code 與一臺攝像頭在 Old Street 被整夜執行。原文未說明具體任務、硬體配置、執行結果或任何資料,僅給出這一場景描述。
llama.cpp 合併 PR #28531,在共享記憶體為 32KB 的三星 GPU 上停用 Vulkan 後端的大矩陣乘分塊(large matmul tile),以規避該硬體配置下的問題。該改動由 Claude Opus 輔助完成,並附有建置證明連結。
Ollama 官方帳號發布 Clef Flash 與 Clef 兩個模型,均已上線 Ollama 模型庫,地址分別為 ollama.com/library/clef-flash 和 ollama.com/library/clef。使用者可通過 Ollama 直接拉取執行,但原文未披露模型引數規模、量化版本與硬體要求等細節。
有開發者轉發並評論稱,蘋果已提供名為 MLX 的工具,可在蘋果硬體上高效執行 AI 模型。該帖未給出具體模型、效能資料或版本資訊,僅以「Let's go!」表達對 MLX 的看好。
開發者 awnihannun 稱,Qwen 27B dense 模型在 M5 Max 上實現 105 tok/s 的輸出速度。該資料針對本地推理場景,反映 Apple Silicon 新晶片在消費級硬體上執行中等規模稠密模型的效能表現,具體測試條件與量化方式未在原文說明。
開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。
llama.cpp 作者 Georgi Gerganov(@ggerganov)稱,llama.cpp 出現在了 10 月 7 日 Windows 活動的主舞臺上。他表示軟體與硬體棧終於走到一起,社群過去多年的努力得到體現,並期待更多使用者擁抱本地 AI。推文未說明該活動的具體內容,也未提及 llama.cpp 在其中的展示形式。
階躍終端將於 10 月 13 日在上海舉辦“Ready Builder One”發表會,推出首款大模型原生智慧體手機 STEPX Neo。據官方資訊,該機在模型、系統、硬體層面均為智慧體原生打造,發表會還將公布階躍終端在生態合作方面的最新進展。
TechCrunch Disrupt 2026 將於 10 月 13 日至 15 日在舊金山 Moscone West 舉行,官方公布了主舞臺 Disrupt Stage 的全部演講陣容。Cerebras CEO Andrew Feldman 將討論 AI 能否繼續 scaling,Amazon 的 Panos Panay 談智慧手機之後並會帶上新硬體,Replit CEO Amjad Masad 談 AI 讓軟體開發門檻消失後軟體與開發者的去向。
Google AI Edge 推出 ML Drift,一個面向端側 AI 與機器學習推理的高效能通用 GPU 計算框架。它把 OpenGL ES、OpenCL、Metal、WebGPU 等底層硬體與圖形計算 API 抽象掉,讓開發者無需直接處理這些介面,就能在移動端與桌面端建置即時互動式 ML 體驗,覆蓋從複雜影片特效到生成式 AI 的場景。
Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。該模型在文字之外,把程式碼、影像、音訊與影片統一對映到同一個共享向量空間,可用於在裝置本地完成跨模態檢索與相似度計算。官方目前只給出這一定位,未公布引數規模、上下文長度、適配硬體與開源許可等細節。
一名使用者為 Qwen3.8 27B 搭建 RAG 搜尋節點,在 AliExpress 購買迷你主機,商家標稱 Intel N150 與 DDR4/DDR5,實際發貨為 2018 年的 Core i3-7020U(2 核 4 執行緒)加 DDR3 1600MHz。賣家還把 New_N150 寫進 BIOS 版本字串偽裝型號。該主機效能不足以支撐向量檢索,使用者已發起信用卡拒付。
開發者 @gruberbuilds 用 Claude 建置了一個基於物理的奧尼爾圓柱體空間棲息地模擬,可在瀏覽器中漫遊。該圓柱寬 6.4 公里、長 32 公里,位於地月 L5 點,每 113.5 秒自轉一週,陽光來自反射鏡,重力來自旋轉。頁面需 WebGPU 支援,若瀏覽器未提供圖形介面卡,需在 Chrome 或 Edge 中開啟硬體加速並重啟。
Reddit 的 r/LocalLLaMA 版塊一則帖子被版主以違反第 3 條規則為由刪除,評論區仍在討論 8GB 視訊記憶體加 16GB 記憶體的低配硬體如何跑本地模型。有使用者提到 32GB 記憶體加 12GB 視訊記憶體可執行 LFM2.5,也有人建議 Ling 3.0 tiny 或 Gemma 配合 mmap。另有評論稱專家快取即將進入 llama.cpp,未來或支援從磁碟流式載入專家。
Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯而非執行時崩潰。它要求跨記憶體空間的資料移動顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期據此接受或拒絕放置方案。
蘇格蘭愛丁堡的 Danu Robotics 完成 500 萬美元 late-seed 融資,其 AI 回收分揀機器人 H.E.R.O. 開始推向市場。該機器人用夾爪而非吸盤抓取物品,並靠 AI 持續改進軟體;公司已有 50 萬美元簽約合同、兩家大客戶意向書,銷售管道中超過 200 家客戶。創始人 Amy Ma 估算,單條分揀線每年可增收 48.5 萬美元,而初始投入 16 萬美元、年維護 2.4 萬美元。下一步是讓機器人更小更便攜,用於商場、醫院、機場等就地回收。
開發者將 Sparse VideoGen(SVG)用於高解析度影片擴散模型,把注意力頭動態路由到結構化空間或時間稀疏掩碼,以緩解自注意力的二次延遲瓶頸。為在 TPU 上把演算法稀疏轉化為實際加速,團隊最佳化 Splash Attention 核心:跳過空記憶體塊、僅在邊界塊做精確座標掩碼、將 token 記憶體佈局改為時間優先以連續訪問。這些最佳化與硬體塊執行對齊後,1440p 影片生成端到端推理最高提速 1.69 倍。
Google 公布 Private AI Compute 新架構,將在雲端加入持久化記憶層,實現跨裝置連續 AI 助手體驗,同時保持端側級別的隱私標準。資料加密存放在雲端專用儲存中,解密金鑰僅保留在使用者裝置上,Google 自身也無法讀取;模型需要呼叫時通過端到端加密通道進入硬體隔離的安全飛地,臨時解密、寫入新上下文後立即重新加密。此前該平台及業界同類方案均為無狀態,任務結束即清除上下文。
Hark 正式發布 AI 個人助理 Hark Pro,可免費使用,重度使用者另有訂閱檔。其底層是專門為操作電腦訓練的模型,能接入信箱、日曆、硬碟與信用卡等,替使用者完成數字任務;介面為全屏,中央是對話方塊,另有 prompt 資訊流與可定製 panels 小儀表盤。演示中它主動提醒待批費用、待回郵件與會議,並提議代訂機票,還曾替人完成加州 DMV 的車輛註冊續期,且會在小視窗展示瀏覽網頁的過程以建立信任。公司計劃 2027 年推出配套的 AI 原生硬體。
正行創新在 APRCE 2026 發布面向零售開放場景「人機協作」的 Physical AI 解決方案,推出雙足人形機器人 H1 與輪臂式搬運理貨機器人 C1,無需改造貨架與動線即可部署。官方稱機器人可自主完成 99% 的任務,自研輕量級世界動作模型 SLM-0.5 在 LIBERO 基準平均任務成功率 98.6%,推理速度較主流方案提升 24 倍。方案計劃 2027 年正式商業化,客戶可直接採購或按 RaaS 訂閱,覆蓋硬體、軟體、運維與升級,目前正與連鎖零售企業聯合測試。