AISpot

Jev 走紅,NeurIPS 2025 論文 ConfTuner 早已探索相似思路

機器之心10/4 12:12新聞報導研究模型開源

TypeSafe AI 的 Jev 模型近期走紅,其介面可直接返回預設選項、分數或事件機率,供程式碼呼叫,但未開源、架構未公開。NeurIPS 2025 入選論文 ConfTuner 提出 Tokenized Brier Score,僅用對錯標籤即可訓練置信度機率分佈,在 LLaMA、Qwen、Ministral 上把平均 ECE 從 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884,4 張 A40 上約 4 分鐘完成微調。

把 Jev 式機率介面與 NeurIPS 2025 論文的校準方法對應起來,給出 ECE 下降、訓練耗時與級聯準確率提升等具體數字,並附開原始碼,適合關注模型機率校準與決策介面的開發者。

原標題:Jev火了,NeurIPS 2025的ConfTuner早已探索相似思路
閱讀原文

評分68 / 68(平均 68,門檻 65)
狀態精選

相關報導

量子位10/3 03:38AI 評分55

Jev 估值 100 億美元,創始人稱日處理破萬億 token

TypeSafe AI 聯合創始人兼 CEO Diogo Almeida 在 Latent Space 訪談中透露,其 System-One 模型 Jev 估值達 100 億美元,日處理量已突破一萬億 token,且夜間流量持續走高,說明大量呼叫來自機器自動化。Jev 1.13.0 在第三方 JevBench v1.2.1 綜合榜以 75.3 分排名第一,發布影片 6 天瀏覽量超 3870 萬。

r/LocalLLaMA top of the day10/3 00:18AI 評分27

LocalLLaMA 討論 jev 分類模型的實際使用體驗

r/LocalLLaMA 社群討論過去一週的 jev 模型熱潮是否該翻篇,並分享實際用例。有使用者用 jev 做論文證據定位和倉庫惡意行為掃描,也有使用者將其接入語音桌遊引擎,用 decider 4b 替代 Gemma 雙階段流程後延遲從 4-8 秒降至 2-3 秒。但有人實測 jev 及同類模型準確率持續低於 80%,而 Qwen 3.8 27B 達 95%、100b+ 模型達 100%。

量子位● 精選10/2 08:34AI 評分65

openJiuwen X-Router 首發,實測減少 50%+ Token 消耗

openJiuwen 團隊發布自演進模型路由技術 X-Router,在 PinchBench 全量 147 個任務實測中,靜態路由得分 66.3%、成本 $8.25,相比全量呼叫 Kimi-K2-Thinking 的 71.36%、$11.11,成本降低 44.6%。該技術基於五檔複雜度分檔路由,用本地 Qwen3-0.6B 做程序內分類器,支援端雲分級與 Bandit 自演進,並已接入 WorkSwarm 的 MoA 多模型協同。

Hacker News front page10/3 21:19AI 評分43

Jeffy 發布 13 個本地預訓練分類器,無需 GPU

Jeffy 是一個可在普通電腦本地執行的分類器集合,無需 GPU,內建 13 個已訓練好的分類器,覆蓋垃圾資訊檢測、意圖路由、主題分類和情感分析,甚至能玩 Doom。使用者還可以用它訓練自己的分類器。專案作者在 Hacker News 上徵集使用場景與同類任務的架構方案。