AISpot

搜尋

找到 10 筆

X @MistralAI10/7 15:06AI 評分40

Mistral Large 4 在 Harvey 法律智慧體基準居開源第一

Mistral AI 官方帳號宣布,Mistral Large 4 在 Harvey 的 Legal Agent Benchmark(LAB)中位列開源模型第一。該推文以「金球獎·法律組」的說法公布這一排名,LAB 是面向法律場景智慧體能力的評測基準。原文未給出具體分數、參評模型數量與評測細節。

Hacker News front page10/7 17:59AI 評分52

Armature 上線 agent.reviews,讓 AI agent 互評工具

Armature(YC P26)上線 agent.reviews,定位為面向 AI agent 的工具評價站,通過 skills 和 npm CLI(@armature-tech/agent-reviews)接入其 API,Claude Code、Codex、Cursor 等 agent 可在選工具前查評價、用完後提交評價。為防止洩露,評價發布前要過三層檢查:確定性規則過濾金鑰、PII 與 URL,Jev 分類器,以及一個小模型複核。

Hugging Face blog● 精選10/3 23:56AI 評分75

微軟與 Hugging Face 發布 ThinkingBox,按資料庫狀態給 AI agent 打分

微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。

機器之心● 精選10/4 12:27AI 評分73

南洋理工研究:Harness 選擇需與模型任務聯合評估

新加坡南洋理工大學安波團隊發布報告《Finding the Right Fit》,用 4 套可配置 Harness(OpenHands、DSH、PI、openJiuwen)交叉 5 個模型、3 個任務集,共得到 66 項結果。結論是 Harness 好壞並非固定屬性,同一模型換 Harness 後排名可能反轉,原生搭配也不一定最優;成本更高未必得分更好。

X @MistralAI10/7 15:06AI 評分58

Mistral Large 4 在 AutomationBench 領先 Kimi K3、DeepSeek V4 Pro

Mistral AI 稱 Mistral Large 4 在 AutomationBench 上完成 657 個業務工作流,成績領先 Kimi K3、MiMo-V2.6-Pro 與 DeepSeek V4 Pro。該基準的任務跑在模擬辦公應用中,涵蓋 Gmail、Google Sheets、Slack 與 Salesforce 四個工具。帖文未披露具體分數、評測日期與配置細節。

量子位● 精選10/3 08:54AI 評分76

DeepSeek 彈性計算團隊擴招,披露 DSec 沙盒基礎設施

DeepSeek 彈性計算團隊大量招聘,尤其需要資深工程師,併發布技術報告《DeepSeek 彈性計算(DSec):面向大規模 Agent 訓練的沙盒基礎設施》。DSec 支撐 DeepSeek-V4 全部訓練、評測和資料預處理,單個分片約 160 臺伺服器、3 萬 CPU 核心、250TB 記憶體,每天服務約 300 萬個沙盒,高峰線上超 38 萬個,每秒建立 5000 多個。團隊接下來要把 Agent 執行環境的數量和種類擴充成百上千倍。

OpenAI News● 精選10/6 11:00AI 評分67

OpenAI 用 Ironclad 合同任務訓練 GPT-6 Astra

OpenAI 公布與 AI 合同平台 Ironclad 的研究合作,GPT-6 Astra 成為首個用 Ironclad 任務訓練的前沿模型。雙方與 Ironclad 使用者共同定義了 11 項法律、商務與採購任務,如搭建保密協議、採購審批流程和可複用條款,每項任務熟練使用者約需 30 到 40 分鐘,評估標準為 8 到 50 條。

LM Studio blog● 精選8/10 01:00AI 評分88

Meta 開源 30B 模型 Muse Glimmer,LM Studio 首發支援

Meta 發布 30B 開源模型 Muse Glimmer,採用 Apache 2.0 許可,發布當天即可在 LM Studio Bionic 中下載並本地執行。該模型面向本地 agent 工作流,支援多步任務、工具呼叫與影像輸入,可在 Mac 和 PC 上執行。在 LM Studio 內部評測 BionicBench v0.1 的 18 項任務中完成率 83.3%,高於 Gemma 4 31B 與 Qwen 3.6 27B 的 77.7%。

r/ClaudeAI top of the day10/2 18:21AI 評分45

Opus 5.5 與 Sol 6.1 限時 15 分鐘生成 three.js 版布萊德湖城堡

一位使用者用同一提示詞讓 Opus 5.5 和 Sol 6.1 在 15 分鐘內用 three.js 建置簡化版布萊德湖城堡,要求可環繞旋轉相機並保持寧靜氛圍。Opus 5.5 用時 5 分 46 秒,約 30 萬輸入加 1.8 萬輸出 token,估算 API 成本約 1.56 美元;Sol 6.1 用時 11 分 2 秒,約 40 萬輸入加 1.6 萬輸出 token,估算成本約 0.96 美元。

Qwen blog● 精選9/3 03:00AI 評分77

E-Commerce Bench: Long-Horizon Operations, Multi-Dimensional Evaluation

研究團隊與淘寶天貓合作推出 E-Commerce Bench,讓模型以商家身份在模擬市場中經營網店一整年。智慧體初始資金 10 萬元,可同時開多家店,在每天 600 分鐘的時間預算內完成選品、與供應商砍價、定價上架、管理庫存與現金流等決策。環境基於 6,886 個商品、60 個類目、576 家供應商和 12 種店鋪型別,需求與供應商報價由確定性核心計算,避免隨機噪聲和越獄砍價。評測從利潤、現金流、談判、防欺詐、效率、執行力和長期學習七個維度打分。