搜尋
依意思最接近的 20 筆
llama.cpp releasesAI 評分45
llama.cpp 新版本 b11536 讓 server 的 GET /models 直接返回每個模型的訓練上下文長度(context_length),資料取自 GGUF 後設資料,無需載入模型或請求 Hugging Face Hub。新增的 common_get_gguf_n_ctx_train 只讀後設資料、相容 u32 與 u64,檔案缺失或無效時返回 0,router 列表因此可離線攜帶該欄位。
Claude Platform release notes● 精選AI 評分88
Anthropic 推出 Claude Haiku 5.5(claude-haiku-5-5),面向高併發與低延遲場景。該模型提供 1M token 上下文視窗、128k 最大輸出 token,並支援通過 effort 引數調節的自適應思考。已在 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry 上線。
Hacker News front pageAI 評分68
JetBrains AI 團隊發文介紹其語義程式碼搜尋平台 Air Context 的 RAG 流水線,已投入生產環境。首篇聚焦解析、分塊與向量化:固定行數分塊會把 import 與函式體等無關程式碼混在一起,導致檢索錯誤,因此需按原始碼結構(如 Java 的 import、類定義、欄位與方法)劃分語義完整的塊。
量子位AI 評分46
量子位發文吐槽,Fable、Sol 等與 Coding 沾邊的模型普遍輸出「15/15 全綠」「單腿啞火」這類黑話。文中分析,除 Coding 過擬合外,更主要的原因是廠商為省 Token 把思維鏈壓縮成「穴居人語」,OpenAI 最早這麼做,同樣一句話的 Token 消耗比白話文少 70%;Claude 自 Opus 4.6 起也開始如此。作者稱最新 Opus 5.5 語言能力回升明顯,而 Gemini 因輸出風格正常、排版層級清晰,被社群視為少數還能正常溝通的 AI。
機器之心● 精選AI 評分72
維吉尼亞理工、威斯康辛大學麥迪遜分校與達特茅斯學院團隊在 NeurIPS 2026 提出 SAGE,用結構訊號引導長程推理的後訓練。方法以符號閉包分析(SCA)解釋探索偏差與累積偏差,訓練時用代數稀疏化和雙曲結構引導重排候選推理步,在 12 個基準、7 個模型家族上總體優於 SFT、GRPO、EMPO 與 GRPO-PRM。在 1,190 個 Andrews–Curtis 長程例項上,Qwen3 的 Lean 驗證通過率接近基礎模型的 8 倍;
Hugging Face blog● 精選AI 評分78
Hugging Face 的 yuvraj sharma 用 HuggingChat 裡的 ML Intern agent,幾天內做出 6 個公開模型,其中把 Qwen-Image 2.1 自帶的 9B 提示改寫器蒸餾成 0.8B 版本,可在 CPU 執行,輸出有效率 99.7%,token 消耗約為教師模型的四分之一。該專案含 9B 模型標註 8,797 條樣本,算力成本 16 美元。
Hugging Face blog● 精選AI 評分70
Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。
X @ollamaAI 評分42
Ollama 模型庫新增 Google DeepMind 的 embeddinggemma-2 頁面,地址為 ollama.com/library/embeddinggemma-2,使用者可通過 Ollama 拉取該嵌入模型。該條目由 Ollama 官方帳號發布,指向 Google DeepMind 的這一模型。原文未給出模型規模、上下文長度、許可證或效能資料等細節。
r/LocalLLaMA top of the dayAI 評分75
開發者 roofkid 發布 Ninfer 4080,在 RTX 4080 16GB 上以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,實測最高 prefill 2720 tok/s、生成 262 tok/s。專案採用 DFlash2 推測解碼與 KV 壓縮,程式碼已在 GitHub 開源並提供 Docker 映象。
X @GoogleDeepMind● 精選AI 評分80
Google DeepMind 推出 EmbeddingGemma 2 嵌入模型,740M 引數在多項基準上具備競爭力,甚至超過部分引數量兩倍以上的專用模型。模型以 Apache 2.0 許可發布,權重已上線 Hugging Face 與 Kaggle。開發者可用它為應用加入多模態檢索,例如用語音備忘錄定位影片片段,也可與 Gemma 4 搭配實現端側私有 RAG。
r/OpenAI top of the dayAI 評分38
有使用者反映,用 GPT-6 Astra 處理 10 萬字元以上、生成 70 多頁文件時,模型會先執行 30 到 40 分鐘,隨後直接報 5 小時用量限制錯誤,不輸出任何內容。使用者只能新建對話、稍微縮小任務重試,並稱 ChatGPT 與 Gemini 估算這類大規模執行每次 API 等效算力成本約 3 到 5 美元。該使用者質疑 OpenAI 為何不在任務開始前提示拆分,導致算力被浪費。
llama.cpp releasesAI 評分42
llama.cpp 發布 b11443 建置,其中提交 #30017 把各模型重複的 nextn 行裁剪邏輯合併為 llm_graph_context 上的 crop_before_nextn() 與 crop_after_nextn() 兩個共享 helper。
r/LocalLLaMA top of the dayAI 評分65
LiquidAI 發布 LFM2.5-Encoder 系列,含 250M 與 350M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度等任務。官方稱其吞吐量持平或超過 ModernBERT,CPU 長上下文有優勢,並可在瀏覽器 WebGPU 上執行;GGUF 權重已上傳 Hugging Face,llama.cpp 已提交對應支援 PR。
X @ollama● 精選AI 評分65
Google DeepMind 的 EmbeddingGemma 2 已上線 Ollama,執行 ollama pull embeddinggemma-2 即可拉取。訊息由 Ollama 官方帳號在 10 月 6 日發布,官方稱該模型面向消費級裝置,並且是多模態模型。原文未披露模型體積、上下文長度與具體支援的模態等細節。
Hacker News front pageAI 評分75
一份 50 篇材料、約 1300 題的新基準(Telegraph Test,程式碼與資料已開源)顯示,只需一句小寫指令讓模型用 1866 年跨大西洋電纜時代的電報體(cablese)撰寫壓縮記錄,輸出 token 可省 40%–49%,而下游模型讀取這些記錄的準確率不低於明文(恢復比 0.99–1.10)。GLM-5.3-Flash 自身省 48.4%,qwen3.8-27b 省 48.9%,gemma-4-31b 省 40.4%;
Hacker News front pageAI 評分71
Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。
llama.cpp releasesAI 評分46
llama.cpp 新版修復了請求指定繁忙 id_slot 時的上下文錯亂問題。此前這類請求仍會先在該 slot 上執行 prompt cache 更新,若 RAM 快取命中更好的匹配,就會把新上下文載入仍在生成中的 slot,導致生成在錯誤上下文上繼續;現在繁忙 slot 會原樣返回,請求排隊等待(#30295)。
X @GoogleDeepMindAI 評分43
Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。
X @samaAI 評分25
OpenAI CEO Sam Altman 在 2026 年 10 月 1 日發帖表示,使用者應當能夠在任何需要的地方使用自己的 AI 訂閱。該表態未說明具體產品、實施方式或時間表,也未提及是否涉及跨平台或第三方應用。
Hacker News front page● 精選AI 評分85
Google DeepMind 發布 EmbeddingGemma 2,一個 Apache 2.0 許可、740M 引數的開源端側多模態嵌入模型,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到同一嵌入空間。它按需模組化:純文字最低 270M 引數,另有 170M 視覺與 300M 音訊編碼器;MRL 支援把 768 維向量截斷到 128 維,本地儲存最多省 6 倍。