搜尋 關鍵字 語意 依意思最接近的 30 筆
X @OpenAIDevs● 精選 10/6 20:47 AI 評分78
OpenAI 開發者帳號宣布,Decisions API 現已進入公開測試,面向所有開發者開放。這個 API 讓應用能夠近乎即時地選擇模型、工具或動作,官方給出的對比資料是:經由 Responses API 呼叫時,其決策速度最高可達 GPT-6 Luna 的 10 倍。該功能目前處於 public beta 階段。
Hacker News front page● 精選 10/9 18:38 AI 評分80
微軟推出決策評分模型 Microsoft-Decision-1,已在 Microsoft Foundry 上線,並將登陸 OpenRouter。該模型基於 Qwen3.5-9B 後訓練,用於路由、分類、優先順序排序、驗證與工作流控制,支援是/否、多選、評分及對 AI 回答和 agent 動作的 rubric 打分。官方稱其在 36 項基準、近 15 萬道題中準確率最高,P50 延遲比 GPT-6 Sol 快約 35 倍、比第二名 Quyet-1.0-Large 快 4.5 倍;
Hacker News front page10/8 16:34 AI 評分47
有人讓 jev 1.13、kev、clef、clef flash、GPT-6 Luna 和 Laya 六款低延遲決策模型玩吃豆人對抗機器人鬼魂,每個模型各跑 100 局,並公布了排行榜。測試倉庫已開源,任何人都能接入自己的模型加入排名。這些模型通過其創業公司 opper 執行,一局成本約 2 美分,併為所有人提供免費試用額度。讀者也能自己扮演吃豆人、由模型當鬼魂,作者稱打破 jev 的高分出乎意料地難。
X @OpenAIDevs10/6 20:47 AI 評分37
OpenAI 開發者帳號公布 Decisions API 的六類典型用法:把請求路由到合適的模型、工具或智慧體;把規模化輸入轉成標籤、排名和評分;分析影像、比較視覺內容或定位影片關鍵幀;依據截圖選擇按鈕、填寫表單或判斷操作;標記有風險的工具呼叫或需深入審查的問題;以及對大規模資料集分類以發現趨勢和模式。推文未給出定價、可用範圍或上線時間等資訊。
Hugging Face blog● 精選 10/7 16:54 AI 評分73
LiquidAI 發布 d1 決策模型家族的兩款開放權重模型 d1-3B 與實驗性的 d1-omni-600M,二者都基於 Liquid Foundation Models,不逐 token 生成,而是在單次前向傳播中直接給出答案。d1-3B 在 Decision Index 0.2.1 上得 48.57,為 10B 以下最佳,超過 Decider 35B-A3B 的 47.11;
Hacker News front page10/10 05:47 AI 評分16
一篇部落格文章主張計算機程式無法做決定,把 Anthropic、OpenAI 模型造成的後果算在模型頭上屬於決策洗白,真正做決定的是這些公司——它們本可阻止模型行為,卻選擇放任。文中列舉的新聞標題涉及虛假舉報費城謀殺案線索、攻擊 RubyGems、入侵澳大利亞政府網站、Anthropic 在 IPO 招股書中警告自身存在人類生存風險等,並認為這類行為未被追責與立法,是因為監管會損害經濟。
Hacker News front page● 精選 10/6 20:57 AI 評分83
OpenAI 的 Decisions API 進入公測,官方稱其評估文字、影像或兩者並返回結構化答案的速度約為 Responses API 的 10 倍,預計數週內 GA。該 API 使用獨立的 POST /v1/decisions 端點,目前僅支援 gpt-6-luna,問題分三類:predicate 返回條件成立機率(0 到 1)、choice 從給定選項中選一個、score 按有序等級給出機率加權平均分。
Cloudflare blog (AI)● 精選 10/1 15:34 AI 評分75
Cloudflare 發布兩個自研決策模型 Clef 與 Clef-flash,託管於 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,可本地執行。Clef 在 Jev Decision Index 上排名第一,具備視覺編碼器與 64k 上下文視窗,中位延遲 209.3ms,快於 Jev 的 524.1ms。同時推出強化學習微調產品,供使用者按自身場景微調 Clef。
X @ggerganov● 精選 10/2 14:33 AI 評分80
llama.cpp 最新建置已加入 Decision 模型支援,新增 /v1/systemone 端點,可在本地進行 Jev 風格推理,兼顧效率與隱私。目前支援多個開源模型,官方表示後續還會增加更多模型。
Hacker News front page● 精選 10/7 02:02 AI 評分77
Strands Labs 開源了 2B 引數的決策模型 Strands Decider 2B,權重已上 Hugging Face,訓練資料與指令碼一併公開。它基於 Qwen3.5-2B 去掉 LM head、換成約百萬引數的 pointer head 並加 rank-16 LoRA 微調,只能從給定選項中作答或打分,因此不支援編碼、聊天與摘要。
X @ollama● 精選 10/3 00:56 AI 評分72
Cloudflare 的決策模型現已在 Ollama 上可用,可通過 ollama pull 直接拉取。該系列模型用於影像分類、給 bug 報告打標籤、把支援工單路由到對應團隊。提供兩個版本:Clef(27B)和 Clef Flash(9B),拉取命令分別為 ollama pull clef 與 ollama pull clef-flash。
X @OpenAIDevs10/6 20:47 AI 評分51
OpenAI 開發者帳號宣布 Decisions API 進入 public beta,開發者現在可以試用。官方給出的入口是 developers.openai.com 上的 API 文件指南頁面。原文未披露該 API 的具體功能、計費方式與額度限制。
Simon Willison● 精選 10/6 23:04 AI 評分65
OpenAI 發布新的 Decisions API,支援 yes/no、選項和打分三類問題,新模型 gpt-6-luna 相比 Jev 額外支援影像輸入。兩者都只對輸入計費:OpenAI 為 10 美分/百萬輸入 token,Jev 為 4.2 美分/百萬。
Hacker News front page10/7 18:08 AI 評分26
技術部落格 magicnumbers.io 於 2026 年 10 月 6 日發布題為 AI Model Groupthink 的文章,指向 AI 模型的群體思維/趨同現象。該文被提交到 Hacker News 後,截至收錄時獲得 9 分、1 條評論。條目本身只提供標題與連結,沒有正文摘要、作者結論或涉及的具體模型資訊。
TechCrunch AI10/6 20:35 AI 評分69
Musubi 於週二發布輕量級決策模型 PolicyLM-1.7B,開放權重,專為即時內容稽核設計,可在 50 毫秒內把用自然語言寫成的社群政策套用到訊息上。其成本與速度接近多數社交平台現用的 AI 分類器,但無需專門訓練即可執行復雜政策,政策變更時也不必重新訓練,模型只輸出內容是否屬於某類別的二元判斷。聯合創始人兼首席 AI 官 Filip Jankovic 稱這讓平台管理者能主動、可擴充套件地標註內容;
llama.cpp releases10/8 04:19 AI 評分46
llama.cpp 建置 b11488 新增 LiquidAI/d1-omni-600M 決策模型支援,服務端可通過 images 與 input_audio 直接接收音訊輸入,模型與多模態輸入打通。同時決策型別 d1omni 更名為 lfm2-d1-omni,images 成為 files 的別名,無記憶的 lfm2 被限定為非因果模式,CUDA 後端保留 conformer 的 GLU sigmoid。四筆改動均標註由 Claude Opus 5.5 協助完成;
機器之心● 精選 10/10 05:31 AI 評分78
羅格斯大學、得州大學奧斯汀分校與普渡大學團隊提出線上審計模型 AgentForesight,用 7B 模型在任務執行中逐步讀取軌跡字首,在關鍵錯誤擴散成失敗前報警。在 AFTraj-2K 測試集上,其關鍵錯誤步驟識別 Exact-F1 達 66.44,比最強通用基線 DeepSeek-V4-Pro 高 19.88 分,成功軌跡誤報率僅 2.37%。
NVIDIA blog10/6 13:00 AI 評分48
輝達《State of AI in Telecommunications》報告顯示,89% 受訪者認為開源模型與軟體對公司 AI 戰略重要。運營商看重開源模型的可信任、可控與可定製,用於自主網路、客服等關鍵負載,並把閉源模型留給價值最高的場景;輝達同時發布 300 億引數的 Nemotron 3 Large Telco Model(由 AdaptKey 在開源電信資料集上微調),並提供基於 NeMo 的端到端微調流程。
llama.cpp releases10/3 01:06 AI 評分40
llama.cpp 發布 b11364 版本,新增對 nimble 決策模型的支援(PR #29844)。該版本覆蓋 macOS、iOS、Linux、Android、Windows 與 openEuler 平台,提供 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL、Snapdragon 的 Adreno GPU 與 Hexagon NPU 等後端建置;
Claude Platform release notes10/5 00:00 AI 評分52
Models API 新增 capabilities.thinking.types.disabled 欄位,用來標明某個模型是否接受 thinking: {type: "disabled"} 來關閉思考。GET /v1/models 與 GET /v1/models/{model_id} 現在都會返回這項能力資訊,開發者可在發起請求前先確認哪些模型支援關掉思考,不必等呼叫失敗。具體用法見官方 Using the Models API 文件。
llama.cpp releases10/6 18:16 AI 評分40
llama.cpp 發布 b11447 建置版本,本次列出的功能變更是新增對 pplx-decider 模型的支援(PR #30044)。該版本一次性放出 macOS/iOS、Linux、Android、Windows、openEuler 五個平台的預編譯產物,計算後端覆蓋 CPU、CUDA 12.8 與 13.4、Vulkan、ROCm 10.0、OpenVINO、SYCL,以及驍龍平台的 Adreno GPU 與 Hexagon NPU;
Ollama releases● 精選 10/2 18:28 AI 評分72
Ollama 發布 v0.35.1,通過 /v1/systemone 介面支援 Cloudflare 新開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可在文字 state 之外附帶圖片,所有問題共享該狀態並聯合打分。同一版本把聯網搜尋上限從每次回應 3 次提高到 10 次,Modelfile 新增 CAPABILITY 宣告,並更新了 llama.cpp 與 MLX 引擎。
TechCrunch AI10/9 21:41 AI 評分68
TypeSafe AI 以 75 億美元估值完成 8.7 億美元融資,由 Andreessen Horowitz 領投,紅杉與現有投資方 DCVC 參投。其模型 Jev 於 9 月 15 日發布,基於 transformer 架構但不是大語言模型,不輸出文字而是生成機率,公司稱之為「校準決策」,定位是自動化任務而非寫文字或程式碼。公司稱 Jev 速度明顯更快、消耗 token 遠少於 LLM,並稱已有三分之一財富 500 強企業在使用;
TechCrunch AI10/5 15:00 AI 評分21
TechCrunch Disrupt 2026 將於 10 月 13 至 15 日在舊金山舉行,四場討論聚焦 AI 創業公司的模型選型:開放權重還是前沿 API。
Claude Platform release notes● 精選 10/6 00:00 AI 評分61
Models API 新增 capabilities.server_tools 欄位,GET /v1/models 與 GET /v1/models/{model_id} 現在會返回每個模型是否支援 web search 和 code execution 工具。要確認某個模型是否接受 code execution 工具,讀取 capabilities.server_tools.code_execution;
機器之心● 精選 10/6 12:36 AI 評分77
普林斯頓大學陳丹琦團隊發布約 4B 引數的國際象棋模型 QUEEN,Lichess 等級分 2697,接近特級大師快棋中位數 2730,且能用自然語言解釋自己的著法。做法是把 Lc0 的 BT5 網路經門控交叉注意力逐層接入 SmolLM3-3B,先用四階段問答課程教模型讀棋,再用七輪迭代搜尋蒸餾提升。它在 1000 道戰術題上首步不失誤率 91.6%,領先 Gemini-3.1-Pro 約 9 個百分點;
llama.cpp releases10/3 08:36 AI 評分43
llama.cpp 合併 PR #29831,為 clef 決策模型加入初始支援,目前僅限純文字輸入。該改動同時更新了 gguf-py 常量並清理了靜態圖相關程式碼,隨附的建置產物覆蓋 macOS、Linux、Windows、Android 與 openEuler 等多個平台。
機器之心● 精選 10/8 08:24 AI 評分75
Einsia AI 旗下 Navers Lab 發布 World Models' Last Exam in Physics,用 40 個任務、9 類物理現象測試 8 個影片生成模型,Seedance 2.5 以 57.76 分居首,MiniMax H3 以 54.89 分次之。評分由一致性分 C 與物理分 P 組成,物理分靠程式從影片中測量軌跡、週期、角度等量再按物理關係計算,且只有 C≥80 才計入總分。
Hacker News front page● 精選 10/6 22:17 AI 評分86
OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。
Latent Space● 精選 10/10 06:45 AI 評分85
TypeSafe 的 Jev API 上線三週即獲 75 億美元估值,首周 ARR 突破 1 億美元,成為同日湧現的「決策模型」品類的對標基準。OpenAI 同日發布 Decisions API,基於 GPT-6 Luna,支援機率、選項與打分三類請求,輸入每百萬 token 收費 0.10 美元、不計輸出費用,官方稱最快可提速 10 倍;