AISpot

搜尋

依意思最接近的 26 筆

Hugging Face blog● 精選10/7 17:54AI 評分73

LiquidAI 開源 d1-3B 與 d1-omni-600M 邊緣決策模型

LiquidAI 發布 d1 決策模型家族的兩款開放權重模型 d1-3B 與實驗性的 d1-omni-600M,二者都基於 Liquid Foundation Models,不逐 token 生成,而是在單次前向傳播中直接給出答案。d1-3B 在 Decision Index 0.2.1 上得 48.57,為 10B 以下最佳,超過 Decider 35B-A3B 的 47.11;

X @OpenAIDevs● 精選10/6 21:47AI 評分78

@OpenAIDevs: Let your app choose the right model, tool, or action in near real-time with Decisions API, now avai…

OpenAI 開發者帳號宣布,Decisions API 現已進入公開測試,面向所有開發者開放。這個 API 讓應用能夠近乎即時地選擇模型、工具或動作,官方給出的對比資料是:經由 Responses API 呼叫時,其決策速度最高可達 GPT-6 Luna 的 10 倍。該功能目前處於 public beta 階段。

X @OpenAIDevs10/6 21:47AI 評分37

@OpenAIDevs: Developers have been using the Decisions API to:

OpenAI 開發者帳號公布 Decisions API 的六類典型用法:把請求路由到合適的模型、工具或智慧體;把規模化輸入轉成標籤、排名和評分;分析影像、比較視覺內容或定位影片關鍵幀;依據截圖選擇按鈕、填寫表單或判斷操作;標記有風險的工具呼叫或需深入審查的問題;以及對大規模資料集分類以發現趨勢和模式。推文未給出定價、可用範圍或上線時間等資訊。

機器之心● 精選10/5 12:40AI 評分72

新基準 VA-Bench 測 12 個多模態模型,完整任務成功率約一半

VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。

Hacker News front page● 精選10/7 03:02AI 評分77

Strands 開源 2B 決策模型 Strands Decider 2B

Strands Labs 開源了 2B 引數的決策模型 Strands Decider 2B,權重已上 Hugging Face,訓練資料與指令碼一併公開。它基於 Qwen3.5-2B 去掉 LM head、換成約百萬引數的 pointer head 並加 rank-16 LoRA 微調,只能從給定選項中作答或打分,因此不支援編碼、聊天與摘要。

TechCrunch AI10/6 21:35AI 評分69

Musubi 發布開放權重決策模型 PolicyLM-1.7B 用於內容稽核

Musubi 於週二發布輕量級決策模型 PolicyLM-1.7B,開放權重,專為即時內容稽核設計,可在 50 毫秒內把用自然語言寫成的社群政策套用到訊息上。其成本與速度接近多數社交平台現用的 AI 分類器,但無需專門訓練即可執行復雜政策,政策變更時也不必重新訓練,模型只輸出內容是否屬於某類別的二元判斷。聯合創始人兼首席 AI 官 Filip Jankovic 稱這讓平台管理者能主動、可擴充套件地標註內容;

Hacker News front page10/6 23:51AI 評分70

UniEvo-VL:多模態模型自蒸餾自我進化訓練配方

arXiv 上提交的 UniEvo-VL 提出一種 on-policy 自蒸餾訓練方法:讓同一個多模態模型分別以學生和教師身份出現,學生只看原始問題,教師額外看到自我批評作為特權資訊,訓練目標是縮小兩者在取樣軌跡上去噪擴散分佈的差異,無需依賴更大的外部教師模型。基於開源 Qwen-image-2512,GenEval 從 0.747 升至 0.808,GenEval2 Soft-TIFA 從 32.97 升至 35.53。

Cloudflare blog (AI)● 精選10/1 16:34AI 評分75

Cloudflare 開源決策模型 Clef,並推出 RL 微調平台

Cloudflare 發布兩個自研決策模型 Clef 與 Clef-flash,託管於 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,可本地執行。Clef 在 Jev Decision Index 上排名第一,具備視覺編碼器與 64k 上下文視窗,中位延遲 209.3ms,快於 Jev 的 524.1ms。同時推出強化學習微調產品,供使用者按自身場景微調 Clef。

Hacker News front page● 精選10/6 21:57AI 評分83

OpenAI 上線 Decisions API 公測,僅支援 gpt-6-luna

OpenAI 的 Decisions API 進入公測,官方稱其評估文字、影像或兩者並返回結構化答案的速度約為 Responses API 的 10 倍,預計數週內 GA。該 API 使用獨立的 POST /v1/decisions 端點,目前僅支援 gpt-6-luna,問題分三類:predicate 返回條件成立機率(0 到 1)、choice 從給定選項中選一個、score 按有序等級給出機率加權平均分。

X @GoogleDeepMind● 精選10/6 17:04AI 評分73

@GoogleDeepMind: Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings.

Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。該模型在文字之外,把程式碼、影像、音訊與影片統一對映到同一個共享向量空間,可用於在裝置本地完成跨模態檢索與相似度計算。官方目前只給出這一定位,未公布引數規模、上下文長度、適配硬體與開源許可等細節。

X @ollama● 精選10/3 01:56AI 評分72

Cloudflare 決策模型 Clef 上線 Ollama

Cloudflare 的決策模型現已在 Ollama 上可用,可通過 ollama pull 直接拉取。該系列模型用於影像分類、給 bug 報告打標籤、把支援工單路由到對應團隊。提供兩個版本:Clef(27B)和 Clef Flash(9B),拉取命令分別為 ollama pull clef 與 ollama pull clef-flash。

Hacker News front page10/7 19:08AI 評分26

部落格文章 AI Model Groupthink 登上 Hacker News

技術部落格 magicnumbers.io 於 2026 年 10 月 6 日發布題為 AI Model Groupthink 的文章,指向 AI 模型的群體思維/趨同現象。該文被提交到 Hacker News 後,截至收錄時獲得 9 分、1 條評論。條目本身只提供標題與連結,沒有正文摘要、作者結論或涉及的具體模型資訊。

NVIDIA blog10/6 14:00AI 評分48

輝達報告:89% 電信運營商重視開源模型

輝達《State of AI in Telecommunications》報告顯示,89% 受訪者認為開源模型與軟體對公司 AI 戰略重要。運營商看重開源模型的可信任、可控與可定製,用於自主網路、客服等關鍵負載,並把閉源模型留給價值最高的場景;輝達同時發布 300 億引數的 Nemotron 3 Large Telco Model(由 AdaptKey 在開源電信資料集上微調),並提供基於 NeMo 的端到端微調流程。

Ollama releases● 精選10/2 19:28AI 評分72

Ollama v0.35.1 支援 Cloudflare 決策模型 Clef

Ollama 發布 v0.35.1,通過 /v1/systemone 介面支援 Cloudflare 新開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可在文字 state 之外附帶圖片,所有問題共享該狀態並聯合打分。同一版本把聯網搜尋上限從每次回應 3 次提高到 10 次,Modelfile 新增 CAPABILITY 宣告,並更新了 llama.cpp 與 MLX 引擎。

TechCrunch AI● 精選10/6 15:33AI 評分90

Mistral 發布 1T 引數多模態模型 Mistral Large 4

法國 AI 實驗室 Mistral 於週二發布 1 萬億引數多模態模型 Mistral Large 4(ML4),暱稱 Le Chonk。它暫不是開放權重模型,只能通過公開的 guardrail 端點訪問,Mistral 計劃三週內完成安全測試後放出權重。該模型全程用自家算力訓練,僅 4000 塊 Nvidia GPU,官方稱比中國競爭對手少兩到三倍。基準結果未公布,最佳化場景包括網路安全、金融和晶片設計;三星上月以 210 億歐元估值領投其 D 輪。

Claude Platform release notes10/5 01:00AI 評分52

Models API 新增欄位,可查詢模型能否關閉 thinking

Models API 新增 capabilities.thinking.types.disabled 欄位,用來標明某個模型是否接受 thinking: {type: "disabled"} 來關閉思考。GET /v1/models 與 GET /v1/models/{model_id} 現在都會返回這項能力資訊,開發者可在發起請求前先確認哪些模型支援關掉思考,不必等呼叫失敗。具體用法見官方 Using the Models API 文件。

llama.cpp releases10/6 19:16AI 評分40

llama.cpp b11447 發布:新增 pplx-decider 模型支援

llama.cpp 發布 b11447 建置版本,本次列出的功能變更是新增對 pplx-decider 模型的支援(PR #30044)。該版本一次性放出 macOS/iOS、Linux、Android、Windows、openEuler 五個平台的預編譯產物,計算後端覆蓋 CPU、CUDA 12.8 與 13.4、Vulkan、ROCm 10.0、OpenVINO、SYCL,以及驍龍平台的 Adreno GPU 與 Hexagon NPU;

Hacker News front page● 精選10/3 10:36AI 評分79

Aleph Alpha 發布 78B 開源模型 Kolibri

德國 AI 公司 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,總引數 78B、啟用引數 3B,支援最長 1M token 上下文,權重已在 Hugging Face 開放下載,採用 Apache 2.0 許可。該模型為英德雙語 MoE Transformer,面向公共管理、工業與航空航天等受監管領域,在 AIME 2025 上得分 96.9,官方稱其效能可對標啟用引數四倍於己的模型。

Hacker News front page● 精選10/3 11:43AI 評分85

Aleph Alpha 發布開源主權模型 Kolibri,78B 引數 Apache 2.0

德國 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,Apache 2.0 許可,權重已上 Hugging Face。它採用 MoE 架構,總引數 78.1B,每 token 僅啟用 3.46B,支援德語和英語,原生上下文 262,144 token,知識截止 2026 年 6 月 18 日。模型在德國和芬蘭基礎設施上從零訓練,使用 768 塊 NVIDIA B200,訓練約 24 萬億 token,其中德語佔比超五分之一。

Hacker News front page● 精選10/6 17:03AI 評分85

Google 發布 EmbeddingGemma 2,740M 引數開源端側多模態嵌入模型

Google DeepMind 發布 EmbeddingGemma 2,一個 Apache 2.0 許可、740M 引數的開源端側多模態嵌入模型,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到同一嵌入空間。它按需模組化:純文字最低 270M 引數,另有 170M 視覺與 300M 音訊編碼器;MRL 支援把 768 維向量截斷到 128 維,本地儲存最多省 6 倍。

TechCrunch AI10/6 17:35AI 評分48

Mirror Particle 要用世界模型預測人類行為

舊金山成立兩年的 Mirror Particle 認為用 LLM 角色扮演目標人群來預測人類行為的方法行不通,改為從零訓練模擬人類動因、並追蹤其隨時間變化的世界模型。它結合客戶資料、時事、流行文化與社交媒體建模人群,重點看真實發生的「已顯現行為」而非問卷自述。公司已完成天使輪、接近敲定首輪風投,將參加 TechCrunch Disrupt 2026 的 Startup Battlefield 200。初期面向市場研究與品牌產品策略;

Google DeepMind blog● 精選10/6 20:57AI 評分85

Google 發布 740M 引數開源多模態嵌入模型 EmbeddingGemma 2

Google DeepMind 發布 EmbeddingGemma 2,一個 740M 引數、Apache 2.0 許可的開源多模態嵌入模型,可把文字、程式碼、影像、音訊、影片對映到同一嵌入空間。它基於 Gemma 4 架構,可拆分出 270M 純文字、170M 視覺與 300M 音訊編碼器,並用 MRL 把輸出向量從 768 維截斷到 128 維,本地向量庫儲存最多省 6 倍。