X @awnihannun9/3 17:07AI 評分46
Qwen 27B 在 M5 Max 上輸出達 105 tok/s
開發者 awnihannun 稱,Qwen 27B dense 模型在 M5 Max 上實現 105 tok/s 的輸出速度。該資料針對本地推理場景,反映 Apple Silicon 新晶片在消費級硬體上執行中等規模稠密模型的效能表現,具體測試條件與量化方式未在原文說明。
找到 2 筆;也可以試試 語意搜尋
開發者 awnihannun 稱,Qwen 27B dense 模型在 M5 Max 上實現 105 tok/s 的輸出速度。該資料針對本地推理場景,反映 Apple Silicon 新晶片在消費級硬體上執行中等規模稠密模型的效能表現,具體測試條件與量化方式未在原文說明。
開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。