AISpot

搜尋

找到 4 筆;也可以試試 語意搜尋

llama.cpp releases● 精選10/5 17:58AI 評分82

llama.cpp v0.6.0 發布:新增擴充套件 batch API 與 GLM-5.3-Flash 支援

llama.cpp 發布 v0.6.0,新增 llama_batch_ext 擴充套件 batch API,支援混合 token/embedding 輸入與 MTP、deepstack 狀態嵌入。本次加入 320B 的 GLM-5.3-Flash(GLM5-Next)文字+視覺混合模型、Clef 決策模型,以及 Qwen4Exp 的 MTP 投機解碼,官方稱在 DGX Spark 上解碼約快 1.5 倍。

X @Zai_org9/17 08:05AI 評分55

智譜稱 GLM-5.3 參與搭建自身推理基礎設施

智譜分享 GLM-5.3 如何幫助建置並最佳化為 GLM-5.3-Flash 提供服務的推理基礎設施。該系統從首次成功執行到具備生產可用性不到兩週,端到端吞吐量達到初始基線的三倍。關鍵在於密集反饋:本地正確性測試、執行軌跡、微基準與端到端測量,使團隊能針對假設做定向驗證,而非只依賴聚合效能指標。

r/LocalLLaMA top of the day10/3 05:10AI 評分40

使用者觀察新模型寫作趨向高資訊密度與生僻詞彙

有使用者在 Reddit 發帖指出,近期開源與閉源新模型(如 GLM 5.3 Flash)的寫作風格正趨向高資訊密度和擴充套件詞彙,用更少字詞表達更多內容,類似 William Gibson 的壓縮文風。作者認為這可能與追求 token 效率有關,但代價是普通讀者難以一眼讀懂,例如輸出中出現 Baudrillardian 這類需要背景知識才能理解的詞。