llama.cpp CUDA 重做 top-k 選擇:大行數改用 radix
llama.cpp 的 CUDA 後端重做 top-k 演算法選擇,大行數場景改用按行網格的 radix select 替代 CUB 逐行 DeviceTopKKernel,在 qwen4exp 34,816 tokens 上啟動次數從 1,671,253 次降到 2,329 次,耗時從 5,761.8 ms 降到 941.8 ms。
依意思最接近的 12 筆
llama.cpp 的 CUDA 後端重做 top-k 演算法選擇,大行數場景改用按行網格的 radix select 替代 CUB 逐行 DeviceTopKKernel,在 qwen4exp 34,816 tokens 上啟動次數從 1,671,253 次降到 2,329 次,耗時從 5,761.8 ms 降到 941.8 ms。
k10s 是 Go 與 Bubble Tea 寫的可點選 Kubernetes 終端 UI:滑鼠可點選行與面板,ctrl+p 統一搜尋資源型別與物件,啟動時不註冊任何 watch,informers 按需懶載入。它內建 AI,ctrl+a 用自然語言提問時會自動注入當前 context、名稱空間、資源型別與選中物件,回答針對該物件;同時相容 k9s 風格的 plugins.yaml 自訂動作。
llama.cpp 發布 b11505,修復 Vulkan 後端 TOP_K 運算元在 +inf/NaN 輸入和 k=1 負值時的錯誤。原 bucket search 從 [0, 0xFF800000) 起算,+inf 與 NaN 永不被計數,可致 NVIDIA 上掛起或裝置丟失、AMD 上索引錯誤,並漏掉真實 top 值。
HackerRank 的 AI 面試 agent Chakra 結束約六個月 beta,週一起正式向企業客戶開放,測試期間已完成逾 50 萬場面試,Snowflake、Snorkel、Capgemini 等公司參與試用。候選人要在帶 AI 助手的畫布上處理真實程式碼倉庫任務,Chakra 會依據其操作追問思路,評估批判性思維、判斷力與「AI fluency」,即如何向 AI 描述問題、判斷其輸出並引匯出解法。
ICANN 是負責分配網路頂級域名的機構,本輪時隔多年再次開放申請,共收到 1615 份申請,來自 481 個申請方。AI 是最集中的題材:Meta 與 OpenAI 等 10 家公司申請 .agent,包含 OpenAI 在內的 7 家申請 .agi,6 家申請 .asi,OpenAI 三個字尾均有提交。頂級域名即網址末尾的字尾,如 .com、.org 與 .pizza;目前公布的只是申請名單,能否獲批尚無定論。
Mistral AI 稱 Mistral Large 4 在 AutomationBench 上完成 657 個業務工作流,成績領先 Kimi K3、MiMo-V2.6-Pro 與 DeepSeek V4 Pro。該基準的任務跑在模擬辦公應用中,涵蓋 Gmail、Google Sheets、Slack 與 Salesforce 四個工具。帖文未披露具體分數、評測日期與配置細節。
Hark 正式發布 AI 個人助理 Hark Pro,可免費使用,重度使用者另有訂閱檔。其底層是專門為操作電腦訓練的模型,能接入信箱、日曆、硬碟與信用卡等,替使用者完成數字任務;介面為全屏,中央是對話方塊,另有 prompt 資訊流與可定製 panels 小儀表盤。演示中它主動提醒待批費用、待回郵件與會議,並提議代訂機票,還曾替人完成加州 DMV 的車輛註冊續期,且會在小視窗展示瀏覽網頁的過程以建立信任。公司計劃 2027 年推出配套的 AI 原生硬體。
a16z 第七版《百強 AI 消費者應用》報告首次新增月收入榜單,Meshy 位列第 31 名,是榜上唯一的 AI 3D 公司。該榜單依據資料分析公司 YipitData 追蹤的美國消費者銀行卡消費資料排名,同榜還有 OpenAI、Anthropic、Canva、Superhuman、Higgsfield。
白宮召集扎克伯格、貝索斯、馬斯克、Anthropic 的 Dario Amodei 等主要科技 CEO 簽署 AI 安全承諾,川普稱其具有道德約束力。川普同時簽署行政令,正式將 AI 重新命名為超級智慧。與此同時,Meta 和 OpenAI 正為 AI 產品換上更友好的形象,但消費者中僅 2% 願意為此付費。
一個由 AI 設計的開源 AI 加速器 openTPU 已在真實 PCIe 卡上跑通十餘款模型的真實權重,輸出與 bit-exact 模擬器逐位一致。硬體是 Xilinx Kintex-7 xc7k480t 加兩路 DDR3,LFM2.5-230M int8 解碼 59.0 tok/s、4-bit 達 85.8 tok/s;解碼受 DRAM 頻寬限制,實測跑到峰值的 82%-94%。
馬斯克在 X 上表示,Grok 4.7 在 AA Cyber Index 上排名第一。該帖未給出具體分數、測試範圍或與第二名的差距,也未說明該指數的評測方式與更新日期。
Kyojin 引擎基於 ExLlamaV3 為 AMD Strix Halo(gfx1151、ROCm)打造,讓 GLM-5.3-Flash 與 MiMo-V2.6-Flash 兩個 300B 級 MoE 模型分別裝進單臺 128GB 迷你主機。實測在 Ryzen AI Max+ 395 上,GLM 預填充 580 tok/s、解碼 26-30 tok/s,MiMo 解碼最高 44 tok/s(程式碼場景)。