無 LLM agent 的 Jev 診斷管線:105 次通過 76.2%
一個不含 LLM agent 的 Jev 驅動診斷管線,在 SREGym-Lite 的 21 個故障、105 次診斷中通過 80 次(76.2%),中位診斷時間 14.6 秒。管線先用程式化收集器讀取 Kubernetes 物件、事件、近期 Pod 日誌與資源用量,按元件彙總後交給 Jev,由它在給定選項中選出可能根因、判斷元件是源頭還是下游受害者,並挑出關鍵證據,再組裝成診斷報告。Jev 全程只做選擇,不生成命令也不寫報告;
給出無 LLM agent 診斷管線的完整實測資料:通過率 76.2%、中位耗時 14.6 秒、推理成本 0.15 美元,並公開實現,對做自動化故障診斷的 SRE 與 AIOps 開發者有參考價值。
原標題:Jev-Driven SRE Diagnosis: What Worked and What Failed
閱讀原文
| 評分 | 62 / 68(平均 65,門檻 76) |
|---|---|
| 狀態 | 未入選 |
相關報導
LocalLLaMA 討論 jev 分類模型的實際使用體驗
r/LocalLLaMA 社群討論過去一週的 jev 模型熱潮是否該翻篇,並分享實際用例。有使用者用 jev 做論文證據定位和倉庫惡意行為掃描,也有使用者將其接入語音桌遊引擎,用 decider 4b 替代 Gemma 雙階段流程後延遲從 4-8 秒降至 2-3 秒。但有人實測 jev 及同類模型準確率持續低於 80%,而 Qwen 3.8 27B 達 95%、100b+ 模型達 100%。
llama.cpp 新增 Decision 模型支援
llama.cpp 最新建置已加入 Decision 模型支援,新增 /v1/systemone 端點,可在本地進行 Jev 風格推理,兼顧效率與隱私。目前支援多個開源模型,官方表示後續還會增加更多模型。
Jev 估值 100 億美元,創始人稱日處理破萬億 token
TypeSafe AI 聯合創始人兼 CEO Diogo Almeida 在 Latent Space 訪談中透露,其 System-One 模型 Jev 估值達 100 億美元,日處理量已突破一萬億 token,且夜間流量持續走高,說明大量呼叫來自機器自動化。Jev 1.13.0 在第三方 JevBench v1.2.1 綜合榜以 75.3 分排名第一,發布影片 6 天瀏覽量超 3870 萬。
Jev 走紅,NeurIPS 2025 論文 ConfTuner 早已探索相似思路
TypeSafe AI 的 Jev 模型近期走紅,其介面可直接返回預設選項、分數或事件機率,供程式碼呼叫,但未開源、架構未公開。NeurIPS 2025 入選論文 ConfTuner 提出 Tokenized Brier Score,僅用對錯標籤即可訓練置信度機率分佈,在 LLaMA、Qwen、Ministral 上把平均 ECE 從 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884,4 張 A40 上約 4 分鐘完成微調。
Karpathy 分享理解 LLM 輸出的技巧:從 ASD-STE100 到解釋影片
Karpathy 認為,隨著 LLM 能力提升,人類工作將更多轉向監督與理解模型輸出,而 LLM 本身也能在這方面提供幫助。他給出的遞進式技巧包括:要求模型用航空維護文件規範 ASD-STE100 寫作、生成圖表、輸出 HTML 互動網頁,以及製作定製解釋影片,例如用 ElevenLabs API 生成 3b1b 風格影片。他強調可以要求模型產出大型、定製、用完即棄的軟體產物,如網頁應用和影片直譯器。