AISpot

搜尋

找到 25 筆

Hugging Face blog9/29 16:30AI 評分53

NVIDIA 開源 Kumo Tabular 表格基礎模型,四個基準第一

NVIDIA 發布開源表格基礎模型 Kumo Tabular,28M 至 215M 三檔引數,OpenMDW-1.1 許可可商用。它在 TabArena、BeyondArena、TALENT、ScoringBench 四個基準排名第一。給定帶標籤的表格,單次前向即輸出分類機率或迴歸數值,無需訓練、調參和特徵工程。

Hugging Face blog● 精選10/2 16:19AI 評分65

Ai2 開源 8B 科學報告生成模型 AstaBrief

Ai2 開源 AstaBrief 8B,一個把研究問題與檢索到的文獻片段轉成帶引用報告的小模型,基座是 Qwen3-8B。在 Asta 的 Fast mode 中它平均 51.1 秒生成一篇報告,Claude 驅動的 Thinking mode 為 178.5 秒,約快 3.5 倍。模型權重、訓練資料與示例工作流均已開放。

Cloudflare blog (AI)● 精選10/1 16:34AI 評分66

Cloudflare 開源決策模型 Clef 與 Clef-flash

Cloudflare 發布兩個自訓決策模型 Clef 和 Clef-flash,託管在 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,同時推出新的 RL 微調平台。Clef 在 Jev Decision Index 上目前排名第一,中位延遲 209.3ms,低於 Jev 的 524.1ms。它帶視覺編碼器、64k 上下文,可返回帶機率的結構化分類結果。

Kimi blog● 精選10/2 22:11AI 評分82

Kimi K3 發布:2.8T 引數開源模型,100 萬 token 上下文

Kimi K3 發布,是首個開源 3T 級模型:2.8T 引數、原生視覺、100 萬 token 上下文,已在 Kimi.ai、Kimi Work、Kimi Code 與 Kimi API 上線,預設最高思考強度。官方稱其整體效能仍落後 Claude Fable 5 與 GPT 5.6 Sol,但在評測集上達到前沿水平。完整權重將於 2026 年 7 月 27 日放出。

Hacker News front page10/2 22:25AI 評分62

Ai2 開源 AstaBrief 8B,報告生成提速約 3.5 倍

Ai2 開源 AstaBrief 8B,一個把研究問題與文獻片段寫成帶引用報告的小模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練。它已在 Asta 中作為 Fast 模式上線,平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式(178.5 秒)快約 3.5 倍。模型權重、訓練資料和示例工作流同時開放,可在自有基礎設施本地執行。

Kimi blog● 精選10/2 22:11AI 評分65

Kimi 團隊開源 WorldVQA,評測多模態模型視覺世界知識

Kimi 團隊發布 WorldVQA 基準,用 3500 組圖文問答、9 個類別評測多模態大模型的視覺世界知識,並區分常見與長尾知識。前沿模型在長尾視覺知識上準確率常低於 50%。所有被測模型都過度自信,表現最好的 Kimi-K2.5 的 ECE 為 37.9%、Slope 為 0.550;資料集與評測指令碼已開源。

Ollama blog● 精選8/11 01:00AI 評分90

NVIDIA Nemotron 3.5 Lightning 上架 Ollama,支援 MLX 本地執行

NVIDIA 的 30B 開源模型 Nemotron 3.5 Lightning 已在 Ollama 上線,可完全在本地裝置執行,每 token 僅啟用 3B 引數。它支援最長 1M token 上下文,靠推測解碼實現最高 4 倍吞吐。用 ollama launch 即可接入 Claude Code、OpenCode,Apple Silicon 對應 30b-mlx 版本。

Latent Space10/2 15:04AI 評分51

Airbnb 稱 60% 程式碼由 AI 編寫,半數客服工單由 AI 解決

Airbnb CTO Ahmad Al-Dahle 披露,公司 60% 的程式碼已由 AI 編寫,約一半客服工單由 AI 解決,工程師 PR 吞吐量提升約 1.6 倍,功能交付量同比增近 80%。內部 context graph「Everest」讓機場接送服務約 6 周完成開發,雜貨配送用了 8 到 9 個月。Airbnb 自稱為多模型公司,至少部署 10 個定製模型,後訓練與強化學習主要在開源模型上做。

MLX LM releases● 精選2/12 18:40AI 評分84

v0.30.7

MLX 發布 v0.30.7。本次新增 GLM5 與 Qwen3.5(無視覺版)支援、LongCat MLA、Mistral 與 LFM2 的工具呼叫解析,修復 Kimi Linear 和 DeepSeek V3.2 的索引器與權重載入,並加快 DeepSeek V3.2 生成。

MLX releases● 精選9/29 01:37AI 評分70

v0.32.3

MLX 發布 v0.32.3,以 bug 修復和 Metal/CUDA 核心最佳化為主。新增 M5 Ultra 非量化 matmul 調優與 Metal gated delta net 核心,並改善 SDPA D256/D512 的 Metal 視訊記憶體佔用。同時修復整數除零崩潰、GGUF 張量維度校驗等問題。

MLX releases● 精選8/25 11:58AI 評分70

v0.32.2

MLX v0.32.2 發布:NAX 裝置新增 head_dim 256 的融合全注意力路徑,量化 MOE matmul 跳過多餘的 simdgroup 計算。同時修復 divmod 浮點商截斷、median 丟棄 NaN、量化切片陣列等問題,並限制 GGUF 後設資料讀取邊界。

Anthropic Research● 精選9/29 01:00AI 評分81

GLM-5.3 and the spread of advanced cyber capabilities

Anthropic 分析稱智譜 GLM-5.3 能自主完成端到端網路攻擊利用,其安全防護在模擬測試中 64% 至 100% 可被簡單手法繞過。NIST CAISI 稱 GLM-5.3 是迄今最具網路攻擊能力的開放權重模型,落後美國前沿約四個月。GLM-5.3 任何人可下載,而無實質防護限制。