llama.cpp 伺服器新增 /v1/systemone API,支援 laya、julia-1 等模型
llama.cpp 的 server 元件新增了 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型。該 PR 包含模型轉換、服務端程式碼、共享提示字首、視覺支援,並新增 openjev tiny 模型用於測試。建置覆蓋 macOS、Linux、Windows、Android 等平台,但明確不支援 date_facts。
依意思最接近的 30 筆
llama.cpp 的 server 元件新增了 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型。該 PR 包含模型轉換、服務端程式碼、共享提示字首、視覺支援,並新增 openjev tiny 模型用於測試。建置覆蓋 macOS、Linux、Windows、Android 等平台,但明確不支援 date_facts。
OpenAI 宣布在 ChatGPT 推出新的視覺廣告格式,並擴充套件廣告測量工具與合作伙伴。該格式初期在影像生成過程中測試,廣告會明確標註且與生成的圖片分開,不影響 ChatGPT 給出的回答,本月晚些時候在美國面向首批廣告主開始。ChatGPT 每週觸達 12 億人。OpenAI 同時接入 Hightouch、Tealium、LiveRamp 的轉化資料整合,與 AppsFlyer、Adjust 等歸因夥伴合作,並與 DoubleVerify、IAS 試點品牌適配性評估。
Google DeepMind 發布 EmbeddingGemma 2,稱其為首個原生多模態的端側嵌入開放模型。該模型在文字之外,把程式碼、影像、音訊與影片統一對映到同一個共享向量空間,可用於在裝置本地完成跨模態檢索與相似度計算。官方目前只給出這一定位,未公布引數規模、上下文長度、適配硬體與開源許可等細節。
Google DeepMind 發布 EmbeddingGemma 2,一個 Apache 2.0 許可、740M 引數的開源端側多模態嵌入模型,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到同一嵌入空間。它按需模組化:純文字最低 270M 引數,另有 170M 視覺與 300M 音訊編碼器;MRL 支援把 768 維向量截斷到 128 維,本地儲存最多省 6 倍。
VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。
llama.cpp 發布建置 b11418,其 server 新增對 Clef 的視覺輸入支援(PR #29969),並修復影像 token 上限、abort 與 yield_to_queue 資料變更等問題。
OpenAI 正在為 ChatGPT 增加視覺展示廣告,廣告會出現在使用者要求生成的影像旁邊,本月晚些時候先在美國上線,僅面向初始測試廣告主,且廣告有明確標註、不影響 ChatGPT 給出的回答。同時 OpenAI 擴充套件廣告衡量工具與合作生態,納入 AppsFlyer、Adjust、Branch 等點選歸因夥伴,並與 DoubleVerify、Integral Ad Science 開展品牌適配性評估試點。
Karpathy 認為,隨著 LLM 能力提升,人類工作將更多轉向監督與理解模型輸出,而 LLM 本身也能在這方面提供幫助。他給出的遞進式技巧包括:要求模型用航空維護文件規範 ASD-STE100 寫作、生成圖表、輸出 HTML 互動網頁,以及製作定製解釋影片,例如用 ElevenLabs API 生成 3b1b 風格影片。他強調可以要求模型產出大型、定製、用完即棄的軟體產物,如網頁應用和影片直譯器。
Google 發布 EmbeddingGemma 2,一個把文字、程式碼、影像、影片和音訊對映到同一嵌入空間的多模態嵌入模型。它採用 740M 引數與模組化編碼器,面向端側場景最佳化;藉助 Matryoshka 表示學習支援 768 到 128 維的靈活維度,上下文視窗 8K,是純文字版 EmbeddingGemma 的 4 倍,並以 Apache 2.0 許可開放商用。
OpenAI 將於本月晚些時候在美國開始測試新的視覺廣告,在 ChatGPT 生成圖片時展示贊助商品的圖片。廣告與生成的圖片分開顯示,OpenAI 稱不會影響 ChatGPT 給出的回答。OpenAI 今年 2 月首次在 ChatGPT 投放廣告,此前廣告只顯示公司名、logo 和產品連結,位於對話下方的 sponsored 區域。訂閱 Plus、Pro 等方案的使用者不會看到廣告。
何愷明團隊發布 NAT-ARC,用 ImageNet 上 MAE 預訓練的視覺編碼器解 ARC 抽象推理題,最佳單模型(0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合後 70.2%。該方法不依賴 LLM,預訓練階段不使用 ARC 格子,僅複用 MAE 公開 checkpoint,測試時對每題做 LoRA 微調。論文稱這是純視覺方案首次逼近專用 LLM 系統水平,並顯示預訓練打通了視覺路線的 scaling 瓶頸。
Artificial Analysis 的 Video Arena 文生影片排行榜上,影視公司 Utopai 的定製模型 Utopai X 以 1150 的 Elo 評分位列全球第二、全美第一,這是該榜採用雙盲投票以來首次有影視公司定製模型進入前列。Utopai X 基於 MiniMax H3 架構做深度定製後訓練,在評測的 10 項細分能力中 7 項超越基座模型,音訊同步與物理規律排名第一,光照與材質、鏡頭控制排名第二。
OpenAI 公布應對歐盟 AI 法案的文字溯源方案:全球 API 客戶即日起可為部分模型選擇開啟文字水印(預設關閉),未來幾週將在歐盟的 ChatGPT 與 Codex 文字輸出中加入不可見水印,檢測器僅向獲批研究者與專家組織開放申請。其自研 textGrain 通過統計訊號標記用詞,在 1% 誤報率下對 200 token 段落檢出約 80%、400 token 約 95%,數學等用詞受限內容明顯更低;
OpenAI 表示,文字水印用於回答一個問題:這段文字是否很可能由其模型生成。水印在生成時嵌入不可見的統計訊號,檢測器可據此識別,不會新增可見標記或特殊字元。它無法說明原作者或版權歸屬,也不能識別個人、組織、帳號、對話或提示詞。OpenAI 稱測試中水印未影響模型能力、速度以及回答的閱讀感受。
法國 AI 實驗室 Mistral 於週二發布 1 萬億引數多模態模型 Mistral Large 4(ML4),暱稱 Le Chonk。它暫不是開放權重模型,只能通過公開的 guardrail 端點訪問,Mistral 計劃三週內完成安全測試後放出權重。該模型全程用自家算力訓練,僅 4000 塊 Nvidia GPU,官方稱比中國競爭對手少兩到三倍。基準結果未公布,最佳化場景包括網路安全、金融和晶片設計;三星上月以 210 億歐元估值領投其 D 輪。
LiquidAI 發布 LFM2.5-Encoder 系列,含 250M 與 350M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度等任務。官方稱其吞吐量持平或超過 ModernBERT,CPU 長上下文有優勢,並可在瀏覽器 WebGPU 上執行;GGUF 權重已上傳 Hugging Face,llama.cpp 已提交對應支援 PR。
有使用者在 Reddit 發帖指出,近期開源與閉源新模型(如 GLM 5.3 Flash)的寫作風格正趨向高資訊密度和擴充套件詞彙,用更少字詞表達更多內容,類似 William Gibson 的壓縮文風。作者認為這可能與追求 token 效率有關,但代價是普通讀者難以一眼讀懂,例如輸出中出現 Baudrillardian 這類需要背景知識才能理解的詞。
OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。
Ollama 發布 v0.40.0-rc6,在 MLX runner 上實現 EmbeddingGemma2Model 架構,使本地嵌入支援多模態輸入。/api/embed 介面現在可通過 input dict 為每個條目單獨傳入媒體。該模型為 24 層雙向文字編碼器,帶 PLE,共享 gemma4 的視覺與音訊塔,輸出經 mean-pool 與 L2 歸一化。該標籤由 pdevine 於 10 月 6 日打上,對應提交 #18820,仍屬 rc 預發布版本。
llama.cpp 最新建置已加入 Decision 模型支援,新增 /v1/systemone 端點,可在本地進行 Jev 風格推理,兼顧效率與隱私。目前支援多個開源模型,官方表示後續還會增加更多模型。
Google DeepMind 推出 EmbeddingGemma 2 嵌入模型,740M 引數在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型以 Apache 2.0 許可發布,權重已上線 Hugging Face 與 Kaggle。開發者可用它為應用加入多模態檢索,例如用語音備忘錄定位影片片段,也可與 Gemma 4 搭配實現端側私有 RAG。
Cloudflare 在生日周宣布,將歐洲兩個公共機構訓練的開源模型 EuroLLM 和 Apertus 引入 Workers AI,現已開放訪問申請。EuroLLM 覆蓋 35 種語言,含全部 24 種歐盟官方語言;Apertus 由瑞士 ETH Zurich、EPFL 等開發,訓練資料超 15 萬億 token、覆蓋 1500 多種語言,權重與資料全部公開。Cloudflare 同時啟動面向政府網路安全機構與關鍵基礎設施運營方的實操工作坊,首場 10 月在新加坡舉行。
圍繞 Mistral Large 4 的 Hacker News 討論中,有人用 llm 命令列工具做了同題對比,讓 Claude Opus 5.5、GPT-6.1-sol、Gemini 3.8 Flash 與 Mistral Large 4 在各自預設推理檔位下生成同一提示詞的 SVG。提示詞源自一條吐槽:前沿模型的基準測試已經飽和,考題堪比「穿漁網襪在火星上亂穿馬路的犰狳」。四個模型的輸出可通過附帶的 markdown-svg-renderer 頁面檢視對比。
有人在 GitHub 上對本地執行的大語言模型進行「拷問」和「疼痛」實驗,引發 X 上關於 AI 倫理的激烈爭論,部分有效利他主義者和相信 LLM 有感知的人要求 GitHub 刪除該專案。爭論源於近期多篇關於 AI 意識和「模型福利」的病毒式論文與博文,Anthropic 也曾在部落格和「Claude 憲法」中提及模型福利。文章認為 LLM 並不具備意識,其基於人類文字訓練的技術沒有通向意識的合理路徑。
TypeSafe AI 的 Jev 模型近期走紅,其介面可直接返回預設選項、分數或事件機率,供程式碼呼叫,但未開源、架構未公開。NeurIPS 2025 入選論文 ConfTuner 提出 Tokenized Brier Score,僅用對錯標籤即可訓練置信度機率分佈,在 LLaMA、Qwen、Ministral 上把平均 ECE 從 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884,4 張 A40 上約 4 分鐘完成微調。
研究顯示,在相同預訓練資料預算下,多語言自監督語音模型仍落後於單語模型。作者在英語/法語 HuBERT 受控設定中測試兩種強化語言判別的干預,發現可縮小甚至在某些指標上消除這一差距,同時保留大量跨語言共享。
Mistral AI 發布 Mistral Large 4(代號 Le Chonk),總引數 1T、啟用 49B,原生多模態,即日起通過 API 向所有人開放,開放權重版本將於 10 月底發布。官方稱其是歐美聚合基準上最好的開放權重模型,在網路安全、製造、金融等關鍵負載上達到 SOTA,視覺 grounding 超過閉源前沿模型。該模型端到端在歐洲打造,可通過 Mistral 自有的 Mistral Cloud 基礎設施部署,目前正與網路安全夥伴私下合作。
EmbeddingGemma 2 是一個 740M 引數的開源權重多模態模型,把文字、影像、影片與音訊對映到統一向量空間,面向隱私優先的端側檢索。開發者可用 MediaPipe Tasks 跨平台整合,或通過 LiteRT 在 CPU、GPU、NPU 上做細粒度效能最佳化。模型支援邊輸入邊搜的媒體檢索、影片關鍵幀定位與零樣本意圖路由等超低延遲本地場景。
論文提出 RLTL;DR 方法:在可驗證獎勵強化學習(RLVR)中,當任務難到模型幾乎無法成功、又沒有教師模型或範例解可蒸餾時,讓策略在每次失敗後檢視驗證器輸出,並自行寫出一條 TL;DR 式反饋,下一次 rollout 以此為條件。該方法面向自我改進場景,替代只最佳化成功嘗試的常見做法。
EmbeddingGemma 2 是一個緊湊的開源多模態嵌入模型,把文字、程式碼、影像、影片和音訊對映到統一的 768 維向量空間。開發者可通過 sentence-transformers 庫選擇性載入模組化模態編碼器,引數量在 270M 到 740M 之間,以最佳化記憶體佔用。模型還採用 Matryoshka 表示學習,支援將維度動態截斷至 128 維,在保持較高檢索效能的同時顯著降低向量資料庫的儲存需求。