AISpot

搜尋

依意思最接近的 30 筆

X @OpenAIDevs● 精選AI 評分78

@OpenAIDevs: Let your app choose the right model, tool, or action in near real-time with Decisions API, now avai…

OpenAI 開發者帳號宣布,Decisions API 現已進入公開測試,面向所有開發者開放。這個 API 讓應用能夠近乎即時地選擇模型、工具或動作,官方給出的對比資料是:經由 Responses API 呼叫時,其決策速度最高可達 GPT-6 Luna 的 10 倍。該功能目前處於 public beta 階段。

Hacker News front page● 精選AI 評分80

微軟發布 Decision-1 決策模型,比 GPT-6 Sol 快 35 倍

微軟推出決策評分模型 Microsoft-Decision-1,已在 Microsoft Foundry 上線,並將登陸 OpenRouter。該模型基於 Qwen3.5-9B 後訓練,用於路由、分類、優先順序排序、驗證與工作流控制,支援是/否、多選、評分及對 AI 回答和 agent 動作的 rubric 打分。官方稱其在 36 項基準、近 15 萬道題中準確率最高,P50 延遲比 GPT-6 Sol 快約 35 倍、比第二名 Quyet-1.0-Large 快 4.5 倍;

Hacker News front pageAI 評分47

六款 AI 決策模型吃豆人對戰,基準與排行榜開源

有人讓 jev 1.13、kev、clef、clef flash、GPT-6 Luna 和 Laya 六款低延遲決策模型玩吃豆人對抗機器人鬼魂,每個模型各跑 100 局,並公布了排行榜。測試倉庫已開源,任何人都能接入自己的模型加入排名。這些模型通過其創業公司 opper 執行,一局成本約 2 美分,併為所有人提供免費試用額度。讀者也能自己扮演吃豆人、由模型當鬼魂,作者稱打破 jev 的高分出乎意料地難。

X @OpenAIDevsAI 評分37

@OpenAIDevs: Developers have been using the Decisions API to:

OpenAI 開發者帳號公布 Decisions API 的六類典型用法:把請求路由到合適的模型、工具或智慧體;把規模化輸入轉成標籤、排名和評分;分析影像、比較視覺內容或定位影片關鍵幀;依據截圖選擇按鈕、填寫表單或判斷操作;標記有風險的工具呼叫或需深入審查的問題;以及對大規模資料集分類以發現趨勢和模式。推文未給出定價、可用範圍或上線時間等資訊。

Hugging Face blog● 精選AI 評分73

LiquidAI 開源 d1-3B 與 d1-omni-600M 邊緣決策模型

LiquidAI 發布 d1 決策模型家族的兩款開放權重模型 d1-3B 與實驗性的 d1-omni-600M,二者都基於 Liquid Foundation Models,不逐 token 生成,而是在單次前向傳播中直接給出答案。d1-3B 在 Decision Index 0.2.1 上得 48.57,為 10B 以下最佳,超過 Decider 35B-A3B 的 47.11;

Hacker News front pageAI 評分16

博文:計算機不能做決定,歸咎 LLM 是決策洗白

一篇部落格文章主張計算機程式無法做決定,把 Anthropic、OpenAI 模型造成的後果算在模型頭上屬於決策洗白,真正做決定的是這些公司——它們本可阻止模型行為,卻選擇放任。文中列舉的新聞標題涉及虛假舉報費城謀殺案線索、攻擊 RubyGems、入侵澳大利亞政府網站、Anthropic 在 IPO 招股書中警告自身存在人類生存風險等,並認為這類行為未被追責與立法,是因為監管會損害經濟。

Hacker News front page● 精選AI 評分83

OpenAI 上線 Decisions API 公測,僅支援 gpt-6-luna

OpenAI 的 Decisions API 進入公測,官方稱其評估文字、影像或兩者並返回結構化答案的速度約為 Responses API 的 10 倍,預計數週內 GA。該 API 使用獨立的 POST /v1/decisions 端點,目前僅支援 gpt-6-luna,問題分三類:predicate 返回條件成立機率(0 到 1)、choice 從給定選項中選一個、score 按有序等級給出機率加權平均分。

Cloudflare blog (AI)● 精選AI 評分75

Cloudflare 開源決策模型 Clef,並推出 RL 微調平台

Cloudflare 發布兩個自研決策模型 Clef 與 Clef-flash,託管於 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,可本地執行。Clef 在 Jev Decision Index 上排名第一,具備視覺編碼器與 64k 上下文視窗,中位延遲 209.3ms,快於 Jev 的 524.1ms。同時推出強化學習微調產品,供使用者按自身場景微調 Clef。

Hacker News front page● 精選AI 評分77

Strands 開源 2B 決策模型 Strands Decider 2B

Strands Labs 開源了 2B 引數的決策模型 Strands Decider 2B,權重已上 Hugging Face,訓練資料與指令碼一併公開。它基於 Qwen3.5-2B 去掉 LM head、換成約百萬引數的 pointer head 並加 rank-16 LoRA 微調,只能從給定選項中作答或打分,因此不支援編碼、聊天與摘要。

X @ollama● 精選AI 評分72

Cloudflare 決策模型 Clef 上線 Ollama

Cloudflare 的決策模型現已在 Ollama 上可用,可通過 ollama pull 直接拉取。該系列模型用於影像分類、給 bug 報告打標籤、把支援工單路由到對應團隊。提供兩個版本:Clef(27B)和 Clef Flash(9B),拉取命令分別為 ollama pull clef 與 ollama pull clef-flash。

Hacker News front pageAI 評分26

部落格文章 AI Model Groupthink 登上 Hacker News

技術部落格 magicnumbers.io 於 2026 年 10 月 6 日發布題為 AI Model Groupthink 的文章,指向 AI 模型的群體思維/趨同現象。該文被提交到 Hacker News 後,截至收錄時獲得 9 分、1 條評論。條目本身只提供標題與連結,沒有正文摘要、作者結論或涉及的具體模型資訊。

TechCrunch AIAI 評分69

Musubi 發布開放權重決策模型 PolicyLM-1.7B 用於內容稽核

Musubi 於週二發布輕量級決策模型 PolicyLM-1.7B,開放權重,專為即時內容稽核設計,可在 50 毫秒內把用自然語言寫成的社群政策套用到訊息上。其成本與速度接近多數社交平台現用的 AI 分類器,但無需專門訓練即可執行復雜政策,政策變更時也不必重新訓練,模型只輸出內容是否屬於某類別的二元判斷。聯合創始人兼首席 AI 官 Filip Jankovic 稱這讓平台管理者能主動、可擴充套件地標註內容;

llama.cpp releasesAI 評分46

llama.cpp 新增 LiquidAI d1-omni-600M 決策模型

llama.cpp 建置 b11488 新增 LiquidAI/d1-omni-600M 決策模型支援,服務端可通過 images 與 input_audio 直接接收音訊輸入,模型與多模態輸入打通。同時決策型別 d1omni 更名為 lfm2-d1-omni,images 成為 files 的別名,無記憶的 lfm2 被限定為非因果模式,CUDA 後端保留 conformer 的 GLU sigmoid。四筆改動均標註由 Claude Opus 5.5 協助完成;

機器之心● 精選AI 評分78

7B 審計模型 AgentForesight 上線,多智慧體任務失敗前預警

羅格斯大學、得州大學奧斯汀分校與普渡大學團隊提出線上審計模型 AgentForesight,用 7B 模型在任務執行中逐步讀取軌跡字首,在關鍵錯誤擴散成失敗前報警。在 AFTraj-2K 測試集上,其關鍵錯誤步驟識別 Exact-F1 達 66.44,比最強通用基線 DeepSeek-V4-Pro 高 19.88 分,成功軌跡誤報率僅 2.37%。

NVIDIA blogAI 評分48

輝達報告:89% 電信運營商重視開源模型

輝達《State of AI in Telecommunications》報告顯示,89% 受訪者認為開源模型與軟體對公司 AI 戰略重要。運營商看重開源模型的可信任、可控與可定製,用於自主網路、客服等關鍵負載,並把閉源模型留給價值最高的場景;輝達同時發布 300 億引數的 Nemotron 3 Large Telco Model(由 AdaptKey 在開源電信資料集上微調),並提供基於 NeMo 的端到端微調流程。

Claude Platform release notesAI 評分52

Models API 新增欄位,可查詢模型能否關閉 thinking

Models API 新增 capabilities.thinking.types.disabled 欄位,用來標明某個模型是否接受 thinking: {type: "disabled"} 來關閉思考。GET /v1/models 與 GET /v1/models/{model_id} 現在都會返回這項能力資訊,開發者可在發起請求前先確認哪些模型支援關掉思考,不必等呼叫失敗。具體用法見官方 Using the Models API 文件。

llama.cpp releasesAI 評分40

llama.cpp b11447 發布:新增 pplx-decider 模型支援

llama.cpp 發布 b11447 建置版本,本次列出的功能變更是新增對 pplx-decider 模型的支援(PR #30044)。該版本一次性放出 macOS/iOS、Linux、Android、Windows、openEuler 五個平台的預編譯產物,計算後端覆蓋 CPU、CUDA 12.8 與 13.4、Vulkan、ROCm 10.0、OpenVINO、SYCL,以及驍龍平台的 Adreno GPU 與 Hexagon NPU;

Ollama releases● 精選AI 評分72

Ollama v0.35.1 支援 Cloudflare 決策模型 Clef

Ollama 發布 v0.35.1,通過 /v1/systemone 介面支援 Cloudflare 新開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可在文字 state 之外附帶圖片,所有問題共享該狀態並聯合打分。同一版本把聯網搜尋上限從每次回應 3 次提高到 10 次,Modelfile 新增 CAPABILITY 宣告,並更新了 llama.cpp 與 MLX 引擎。

TechCrunch AIAI 評分68

非文字模型 Jev 開發商融資 8.7 億美元,估值 75 億

TypeSafe AI 以 75 億美元估值完成 8.7 億美元融資,由 Andreessen Horowitz 領投,紅杉與現有投資方 DCVC 參投。其模型 Jev 於 9 月 15 日發布,基於 transformer 架構但不是大語言模型,不輸出文字而是生成機率,公司稱之為「校準決策」,定位是自動化任務而非寫文字或程式碼。公司稱 Jev 速度明顯更快、消耗 token 遠少於 LLM,並稱已有三分之一財富 500 強企業在使用;

機器之心● 精選AI 評分77

陳丹琦團隊開源 4B 象棋模型 QUEEN,能下棋也能講解

普林斯頓大學陳丹琦團隊發布約 4B 引數的國際象棋模型 QUEEN,Lichess 等級分 2697,接近特級大師快棋中位數 2730,且能用自然語言解釋自己的著法。做法是把 Lc0 的 BT5 網路經門控交叉注意力逐層接入 SmolLM3-3B,先用四階段問答課程教模型讀棋,再用七輪迭代搜尋蒸餾提升。它在 1000 道戰術題上首步不失誤率 91.6%,領先 Gemini-3.1-Pro 約 9 個百分點;

機器之心● 精選AI 評分75

Einsia 發布物理世界模型評測:Seedance 2.5 最高 57.76 分

Einsia AI 旗下 Navers Lab 發布 World Models' Last Exam in Physics,用 40 個任務、9 類物理現象測試 8 個影片生成模型,Seedance 2.5 以 57.76 分居首,MiniMax H3 以 54.89 分次之。評分由一致性分 C 與物理分 P 組成,物理分靠程式從影片中測量軌跡、週期、角度等量再按物理關係計算,且只有 C≥80 才計入總分。

Hacker News front page● 精選AI 評分86

OpenAI 公開內部前沿模型數學成果與 Lean 形式化證明

OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。

Latent Space● 精選AI 評分85

TypeSafe 的 Jev 上線三週估值 75 億美元,首周 ARR 破 1 億

TypeSafe 的 Jev API 上線三週即獲 75 億美元估值,首周 ARR 突破 1 億美元,成為同日湧現的「決策模型」品類的對標基準。OpenAI 同日發布 Decisions API,基於 GPT-6 Luna,支援機率、選項與打分三類請求,輸入每百萬 token 收費 0.10 美元、不計輸出費用,官方稱最快可提速 10 倍;