AISpot

Microsoft

10月3日星期六 · 1 則

  1. Hugging Face blogAI 評分55

    微軟發布 ThinkingBox,按資料庫終態給 AI agent 打分

    微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。

10月2日星期五 · 1 則

  1. r/LocalLLaMA top of the day● 精選AI 評分80

    微軟發布 4B 智慧體模型 FrogNano,主打倉庫級編碼

    微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。

9月28日星期一 · 1 則

9月22日星期二 · 1 則