AISpot

搜尋

依意思最接近的 2 筆

Hacker News front page10/3 05:22AI 評分41

百萬 token 每秒只是思想實驗,序列瓶頸仍在

一篇 2026 年 10 月 3 日發布的思想實驗文章指出,每秒一百萬 token 可指四種不同含義:上下文容量、輸入處理速度、聚合吞吐量和單 agent 輸出速度,其中只有最後一種才是真正的寫作速度。文章用計算器演示:100 萬輸出 token 在 100 token/秒下需 2 小時 46 分 40 秒,在 100 萬 token/秒下僅 1 秒;但若寫作後加一次 60 秒的固定檢查,端到端加速從 10000 倍降到 132.57 倍,檢查佔 98.7% 時間。

r/LocalLLaMA top of the day10/3 19:24AI 評分65

專精推理引擎興起,放棄通用性換極致效能

一批極窄用途的推理執行時正在出現,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 和 vLLM 擅長的通用性,只針對少數模型、有時甚至只針對一個硬體家族(如 Strix Halo)做最佳化。作者認為未來通用執行時負責相容性、一次性專精執行時負責最大效能將成為常態,這也有助於智慧的民主化與去中心化,並壓榨現有硬體的更多產出。