AISpot

搜尋

依意思最接近的 30 筆

量子位● 精選10/9 03:11AI 評分81

位元組 Seed 發現 DeepSeek-V4 準確率隨輸入位置週期性波動

位元組 Seed 團隊發現,DeepSeek-V4 系列在 128K 長上下文檢索中的準確率會隨目標資訊的位置以 4 個 Token 為週期起伏,同一條資訊換個位置最多相差 40.2 個百分點,V4-Pro-Base 也有 34.8 個百分點。原因指向其為省記憶體採用的分塊 KV Cache 壓縮:資訊在壓縮視窗內所處相位不同,檢索能力就出現系統性差異,團隊稱之為相位敏感性,並用基於 Qwen3-0.6B 自訓的多種分塊壓縮模型復現了同樣的週期。

X @MistralAI10/7 10:06AI 評分58

Mistral Large 4 在 AutomationBench 領先 Kimi K3、DeepSeek V4 Pro

Mistral AI 稱 Mistral Large 4 在 AutomationBench 上完成 657 個業務工作流,成績領先 Kimi K3、MiMo-V2.6-Pro 與 DeepSeek V4 Pro。該基準的任務跑在模擬辦公應用中,涵蓋 Gmail、Google Sheets、Slack 與 Salesforce 四個工具。帖文未披露具體分數、評測日期與配置細節。

機器之心● 精選10/4 07:21AI 評分72

DeepSeek Harness 更新,加入 Claude Code Mods 相容層

DeepSeek Harness 發布 v0.2.1-alpha.1,新增實驗性 Claude Code Mods 相容層,讓按 Claude Code Mods 介面編寫的擴充套件有機會接入 DSH 外掛系統執行。官方稱該相容層主要用於驗證 Mods API 能力,大致屬於 DSH 外掛能力的子集,暫不提供完整實用相容性;diff、agents-md、sec-default 和 telemetry 仍標註為不可執行。

量子位● 精選10/3 03:54AI 評分76

DeepSeek 彈性計算團隊擴招,披露 DSec 沙盒基礎設施

DeepSeek 彈性計算團隊大量招聘,尤其需要資深工程師,併發布技術報告《DeepSeek 彈性計算(DSec):面向大規模 Agent 訓練的沙盒基礎設施》。DSec 支撐 DeepSeek-V4 全部訓練、評測和資料預處理,單個分片約 160 臺伺服器、3 萬 CPU 核心、250TB 記憶體,每天服務約 300 萬個沙盒,高峰線上超 38 萬個,每秒建立 5000 多個。團隊接下來要把 Agent 執行環境的數量和種類擴充成百上千倍。

Hacker News front page● 精選10/6 09:06AI 評分91

Mistral Large 4 發布:1T 引數原生多模態,API 今日可用

Mistral AI 發布 Mistral Large 4(代號 Le Chonk),總引數 1T、啟用 49B,原生多模態,即日起通過 API 向所有人開放,開放權重版本將於 10 月底發布。官方稱其是歐美聚合基準上最好的開放權重模型,在網路安全、製造、金融等關鍵負載上達到 SOTA,視覺 grounding 超過閉源前沿模型。該模型端到端在歐洲打造,可通過 Mistral 自有的 Mistral Cloud 基礎設施部署,目前正與網路安全夥伴私下合作。

Latent Space● 精選10/1 02:45AI 評分92

Gemini 4 Argon 發布:輸出上限 1M token,限網路安全預覽

Google DeepMind 發布 Gemini 4 Argon,主打程式設計、企業知識工作與網路防禦,在 19 項基準中 13 項達到 SOTA,並首次實現最高 1M token 輸出(Long Decode Continuation 跨呼叫續寫)。目前僅面向政府使用者與 Fairwind 計劃中的可信網路安全人員開放,開發者、企業與消費者訪問時間未定。標準定價為每百萬輸入/輸出 token 4/20 美元,五折優惠後 2/10 美元,快取輸入再降 95%。

X @MistralAI10/7 10:06AI 評分40

Mistral Large 4 在 Harvey 法律智慧體基準居開源第一

Mistral AI 官方帳號宣布,Mistral Large 4 在 Harvey 的 Legal Agent Benchmark(LAB)中位列開源模型第一。該推文以「金球獎·法律組」的說法公布這一排名,LAB 是面向法律場景智慧體能力的評測基準。原文未給出具體分數、參評模型數量與評測細節。

X @GoogleDeepMind● 精選10/7 10:03AI 評分85

SynthID Detector 向所有人開放,可檢測多家 AI 生成內容

Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。

Gemini API release notes10/7 20:00AI 評分47

Gemini API 關停 deep-research-pro-preview-12-2025,10 月 23 日生效

Gemini API 的 Deep Research agent deep-research-pro-preview-12-2025 已被棄用,將於 2026 年 10 月 23 日關停,呼叫方需遷移到新版本。官方給出兩個替代:deep-research-preview-04-2026 主打速度與效率,適合把結果流式返回客戶端 UI;deep-research-max-preview-04-2026 追求最大全面性,面向自動化上下文收集與綜合。

量子位● 精選10/1 11:02AI 評分92

Google 發布 Gemini 4 Argon,多榜單登頂但僅限安全團隊

Google 於 10 月 1 日突然發布 Gemini 4 Argon,在 DeepSWE v1.1 上以 77.9% 超過 Claude Opus 5.5 和 GPT-6 Astra,Vals Index 以 68.90% 登頂,Text Arena 以 1525 分居首。優惠期單題成本約低四成,每百萬輸入 Token 2 美元、輸出 Token 10 美元,支援百萬 Token 輸出。目前僅開放給經篩選的網路安全團隊,通過 Fairwind 計劃使用,其他訂閱使用者需等待。

X @MistralAI10/6 14:03AI 評分30

Mistral Large 4 被官方稱為網路安全最強模型之一

Mistral AI 官方稱 Mistral Large 4 是全球網路安全能力最強的 AI 模型之一。這一表述發布於 2026 年 10 月 6 日,僅來自其官方社交帳號,沒有附帶基準測試成績、具體安全任務範圍、發布時間、定價或開放方式。因此目前無法判斷它與同類模型在網路安全場景中的實際差距。

Hacker News front page● 精選10/6 09:15AI 評分91

Mistral Large 4 發布:1.05T 引數開放權重多模態模型

Mistral 於 10 月 6 日公開預覽 Mistral Large 4:開放權重、通用多模態模型,採用細粒度 MoE 架構,49B 啟用引數、1.05T 總引數,配 1.6B 視覺編碼器,上下文 1M。定價為輸入每百萬 tokens 0.68 美元、快取輸入 0.07 美元、輸出 2.09 美元,頁面同時列出 1.36、0.14、4.18 的對照價格。功能含結構化輸出、函式呼叫、文件問答、字首補全、Chat Completions、批處理與 Agents 內建工具。

X @MistralAI● 精選10/6 09:06AI 評分91

Mistral 發布 Large 4:1T 引數原生多模態,API 已上線

Mistral 推出 Mistral Large 4(代號 Le Chonk),1T 總引數、49B 啟用,原生多模態,即日起通過 API 向所有人開放。官方稱其是美國和歐洲聚合基準上表現最好的開放權重模型,在網路防禦、製造與金融等關鍵負載上達到 SOTA,視覺 grounding 超過閉源前沿模型。模型在歐洲端到端打造,可通過 Mistral Cloud 在歐洲部署,正與網路安全夥伴私下合作;開放權重將於 10 月底發布。

X @GoogleDeepMind10/1 07:43AI 評分57

@GoogleDeepMind: As AI accelerates scientific discovery, we’re helping researchers keep pace by quickly authenticati…

Google DeepMind 發布了一套可快速驗證生物設計是否內建安全防護的工具,並以開放形式供研究使用。該工具面向科研人員,目的是在 AI 加速科學發現的同時不拖慢關鍵研究進度。官方未披露具體工具名稱、技術細節與適用限制。

X @GoogleDeepMind● 精選10/6 12:04AI 評分80

@GoogleDeepMind: At 740M parameters, it’s competitive across benchmarks – even outperforming some specialist models …

Google DeepMind 推出 EmbeddingGemma 2 嵌入模型,740M 引數在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型以 Apache 2.0 許可發布,權重已上線 Hugging Face 與 Kaggle。開發者可用它為應用加入多模態檢索,例如用語音備忘錄定位影片片段,也可與 Gemma 4 搭配實現端側私有 RAG。

Hacker News front page● 精選10/6 12:03AI 評分85

Google 發布 EmbeddingGemma 2,740M 引數開源端側多模態嵌入模型

Google DeepMind 發布 EmbeddingGemma 2,一個 Apache 2.0 許可、740M 引數的開源端側多模態嵌入模型,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到同一嵌入空間。它按需模組化:純文字最低 270M 引數,另有 170M 視覺與 300M 音訊編碼器;MRL 支援把 768 維向量截斷到 128 維,本地儲存最多省 6 倍。

TechCrunch AI● 精選10/6 10:33AI 評分90

Mistral 發布 1T 引數多模態模型 Mistral Large 4

法國 AI 實驗室 Mistral 於週二發布 1 萬億引數多模態模型 Mistral Large 4(ML4),暱稱 Le Chonk。它暫不是開放權重模型,只能通過公開的 guardrail 端點訪問,Mistral 計劃三週內完成安全測試後放出權重。該模型全程用自家算力訓練,僅 4000 塊 Nvidia GPU,官方稱比中國競爭對手少兩到三倍。基準結果未公布,最佳化場景包括網路安全、金融和晶片設計;三星上月以 210 億歐元估值領投其 D 輪。

Hacker News front page● 精選10/6 09:25AI 評分92

Mistral 發布 Mistral Large 4 預覽,權重月底開放

Mistral 於 10 月 6 日開啟 Mistral Large 4 公開預覽,可在 Mistral Studio 呼叫 API,權重本月底放出。模型為 1 萬億引數原生多模態、49B 啟用引數,在歐洲自有資料中心用 3800 張 NVIDIA Grace Blackwell GPU 從零訓練。官方稱其在 Artificial Analysis Cyber Index 位列全球前五,漏洞復現並修補測試得 82% 為所有模型最高,Cybench 解決 93%;

X @GoogleDeepMind● 精選10/6 12:04AI 評分73

@GoogleDeepMind: Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings.

Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。該模型在文字之外,把程式碼、影像、音訊與影片統一對映到同一個共享向量空間,可用於在裝置本地完成跨模態檢索與相似度計算。官方目前只給出這一定位,未公布引數規模、上下文長度、適配硬體與開源許可等細節。

Ollama releases● 精選10/5 21:53AI 評分79

Ollama v0.40.0 在 Apple Silicon 上預設用 MLX 執行模型

Ollama 發布 v0.40.0:在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。本次納入 MLX 的模型包括 qwen3.8、gemma4、qwen3.6、qwen3.5,決策模型 Nimble、tev1、clef、clef-flash 也已支援。可用 ollama pull / run qwen3.8 拉取與執行,官方稱將繼續啟用更多模型。

Ollama releases● 精選10/4 19:54AI 評分75

Ollama v0.40.0:Apple Silicon 預設用 MLX 跑模型

Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構將自動改用 MLX 執行。可用模型包括 qwen3.8、gemma4、qwen3.6、qwen3.5,決策模型 Nimble、tev1、clef、clef-flash 也已登陸 MLX,官方稱會繼續測試並啟用更多模型。

X @GoogleDeepMind10/1 13:11AI 評分43

@GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。

機器之心10/8 09:30AI 評分51

Vidu Q4 Preview 發布:0.09 元/秒起,支援 15 張參考圖

生數科技推出影片模型 Vidu Q4 Preview,是其面向創作者的首個預覽版本,首發價格 0.09 元/秒起,同樣預算最高可生成 5 倍內容。該版本主打人物演繹、鏡頭語言與複雜視效,支援最多 15 張參考圖、3 段參考音訊輸入,以及 2K、4K 畫質輸出。官方資料顯示其圖生影片速度約為同類模型的 2 倍,5 秒影片最快約 110 秒完成,正式版上線時間尚未公布。

X @OpenAIDevs● 精選10/6 16:47AI 評分78

@OpenAIDevs: Let your app choose the right model, tool, or action in near real-time with Decisions API, now avai…

OpenAI 開發者帳號宣布,Decisions API 現已進入公開測試,面向所有開發者開放。這個 API 讓應用能夠近乎即時地選擇模型、工具或動作,官方給出的對比資料是:經由 Responses API 呼叫時,其決策速度最高可達 GPT-6 Luna 的 10 倍。該功能目前處於 public beta 階段。