AISpot

搜尋

依意思最接近的 25 筆

Hacker News front page● 精選10/8 09:29AI 評分76

LittleBit 開源亞 1-bit 量化官方實現,LittleBit-2 新增 Joint-ITQ 初始化

LittleBit 專案放出論文官方實現,可把 LLM 權重壓縮到 1.0 至 0.1 bits-per-weight,推理時保持原模型結構不變。ICML 2026 的 LittleBit-2 新增 Joint-ITQ 初始化,通過 --use_itq 開啟,只改初始化、不增加推理開銷,並支援 SmoothSign 量化感知訓練與可選殘差分解。

r/LocalLLaMA top of the day10/3 14:24AI 評分42

專用推理引擎興起,放棄通用性換極致效能

近期出現一批極窄用途的推理執行時,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 與 vLLM 擅長的通用性,只針對少數模型甚至單一硬體家族(如 Strix Halo)做最佳化。作者認為通用執行時負責相容、過擬合執行時負責極致效能將成為常態,並有助於智慧的民主化與去中心化,讓現有硬體在特定配置下榨出最大輸出。

機器之心● 精選10/4 07:38AI 評分68

AlphaGo 核心作者稱 LLM 不會推理,離開 DeepMind 創業

AlphaGo 核心作者 Thore Graepel 在 MIT Technology Review 發文稱 LLM 不會推理,並已離開 Google DeepMind 創業做可審計的機器推理。他指出 AlphaGo 第 37 手是策略網路加搜尋機制的結果,而 LLM 的思維鏈仍只是預測下一個 token,缺少可檢查的認知狀態、知識與推理的分離,且常事後編造解釋。Yann LeCun 表示讚賞,認為真正推理必須涉及搜尋。

r/LocalLLaMA top of the day10/3 07:47AI 評分38

LocalLLaMA 討論:大模型用 IQ1_S 量化到底行不行

r/LocalLLaMA 上一則帖子以「FP8/BF16 使用者看到有人跑 IQ1_S」為題引發討論。多位使用者認為量化影響取決於用途:創意寫作、閒聊可容忍 IQ1/IQ2,但編碼、複雜推理和結構化 JSON 提取會明顯崩壞。有人實測 Qwen 3.8 27b 後稱 mxfp4/nvfp4 品質接近 Q6,GSQ-RCO 在 IQ3_S、IQ3_XXS 仍可用;也有人認為 Q4_K_M 或 Q5_K_M 是多數模型的甜點區。

Hacker News front page● 精選10/7 15:42AI 評分95

OpenAI 單日發布 372 項數學成果,含 Unique Games 猜想證明

OpenAI 於 10 月 6 日一次性發布 372 項數學成果,其中包括 Subhash Khot 的 Unique Games 猜想證明,部分結果附有 Lean 證書,但並非全部。截至目前似乎還沒有人類讀懂這些證明,理解它們的競賽才剛剛開始。作者妻子、複雜度理論家 Dana Moshkovitz 長期研究 UGC,她稱論文寫得極差、必須靠 AI 輔助才能閱讀,證明構造出一種全新的遞迴編碼與噪聲測試。

Hacker News front page● 精選10/6 18:17AI 評分86

OpenAI 公開內部前沿模型數學成果與 Lean 形式化證明

OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。

量子位● 精選10/5 00:42AI 評分86

Hinton、Bengio 等 22 位作者發首篇 RSI 論文,討論智慧爆炸

Hinton、Bengio 等 22 位作者聯合發表首篇 RSI(遞迴自我改進)論文《What if automating AI R&D triggers an intelligence explosion?》。論文引用 Anthropic 內部資料:AI 生成獲批程式碼佔比從 2025 年 1 月的低個位數升至 2026 年 5 月的超 80%,Claude 在高層監督下自主完成的 AI 研發工作比例從 2026 年 3 月的約 1% 升到 8 月的 26%。

X @GoogleDeepMind● 精選10/7 10:03AI 評分85

SynthID Detector 向所有人開放,可檢測多家 AI 生成內容

Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。

量子位● 精選10/6 02:45AI 評分89

OpenAI 瘋狂 28 天首日:GPT-6 提速 50%,網友實測未達標

OpenAI Codex 負責人 Tibo 的 28 天計劃首日,官方宣布 GPT-6 Astra 與 GPT-6.1 Sol 預設推理速度提升約 50%、達 50TPS,覆蓋官方訂閱及 OpenCode、Amp 等第三方接入,但網友實測僅約 35TPS。同期 OpenAI 在 ChatGPT 影像生成中測試視覺廣告,並將在幾週內為歐盟地區 ChatGPT 和 Codex 生成的文字加隱形水印。

Hacker News front page10/2 17:25AI 評分71

Ai2 開源 AstaBrief 8B 科學報告生成模型

Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。

Hacker News front page● 精選10/7 15:33AI 評分94

OpenAI 發布 372 項數學成果,含 Unique Games 猜想證明

OpenAI 公布 372 項數學與理論電腦科學成果,其中包括 Subhash Khot 的 Unique Games Conjecture(UGC)證明,推薦名單有 Timothy Gowers、Edward Witten 等數學家。UGC 意味著許多最佳化問題即使只想比半正定規劃鬆弛略好地近似,也是 NP-hard。部分成果附 Lean 證書,但幾乎所有證明尚未被人類理解;

Hacker News front page10/7 04:00AI 評分45

Criteo 初級工程師:AI 時代真正的風險是永遠停在 Junior

在 Criteo 任職的初級工程師 Elise Baturone 認為,AI 不會讓軟體工程師消失,真正的風險是資深工程師消失、所有人永遠停在 Junior 階段。她把自己的 agent 調教成導師,用蘇格拉底式提問做理解檢查,並把「提問」和「review」當成需要自己練的技能:追問 agent 解釋設計選擇、引用來源、論證可疑方案,常能讓它自己發現錯誤。她承認這更費 token,但先弄懂再上線更省事;

X @GoogleDeepMind10/1 13:11AI 評分43

@GoogleDeepMind: When AI-generated content has become so realistic, how do we verify what's made by human, machine, …

Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。

Hugging Face blog● 精選10/2 11:19AI 評分70

Ai2 開源 AstaBrief 8B 科學報告生成模型

Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。

量子位● 精選10/6 03:59AI 評分75

陶哲軒轉向 AI 減速派,呼籲模型公司放慢數學研究

數學家陶哲軒在 SAIR 演講中公開呼籲模型公司放慢數學研究節奏,稱 AI 無休止加速卻對後果一無所知,並稱之為 Proof Indigestion(證明消化不良):AI 只在生成解答與 Lean 驗證上狂飆,理解、評審、寫入教科書幾乎停滯。此前他與 25 位菲爾茲獎得主聯名發表公開信,批評把數學當 benchmark 刷分。OpenAI 隨後回應,宣布在普林斯頓高等研究院設立數學與人工智慧顧問小組,但宣告寫明該小組不就數學上的內部進展提供建議。

Hacker News front page10/6 19:14AI 評分32

OpenAI 發布整數乘法低於 n log n 的數學預印本

OpenAI 於 2026 年 9 月 23 日發布數學預印本 Integer multiplication below n log n,作者署名 OpenAI。該文歸入 OpenAI Math Release preprint 系列,PDF 託管在 GitHub 倉庫 openai/math 的 preprints 目錄下,並隨文給出 BibTeX 引用條目。標題指向整數乘法複雜度低於 n log n 的結果,但原文未附摘要、演算法細節與具體複雜度常數。

NVIDIA blog10/1 09:00AI 評分25

輝達稱 Vera Rubin NVL72 每兆瓦吞吐量超 GB300 30 倍

輝達援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量超過 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍。輝達以「高產、耐用、通用」概括 AI 工廠回報邏輯:每兆瓦 token 數決定收益,A100 出貨六年後仍在商用,CoreWeave 已將 2020 年首批裝置的預訂延長至 2029 年。

Hacker News front page10/4 04:02AI 評分33

本地 LLM「機器人監獄」實驗引發 AI 意識爭論

有人在 GitHub 上對本地執行的大語言模型進行「拷問」和「疼痛」實驗,引發 X 上關於 AI 倫理的激烈爭論,部分有效利他主義者和相信 LLM 有感知的人要求 GitHub 刪除該專案。爭論源於近期多篇關於 AI 意識和「模型福利」的病毒式論文與博文,Anthropic 也曾在部落格和「Claude 憲法」中提及模型福利。文章認為 LLM 並不具備意識,其基於人類文字訓練的技術沒有通向意識的合理路徑。

機器之心● 精選10/7 08:43AI 評分72

SAGE:用結構訊號糾偏長推理,AC 例項驗證通過率近 8 倍

維吉尼亞理工、威斯康辛大學麥迪遜分校與達特茅斯學院團隊在 NeurIPS 2026 提出 SAGE,用結構訊號引導長程推理的後訓練。方法以符號閉包分析(SCA)解釋探索偏差與累積偏差,訓練時用代數稀疏化和雙曲結構引導重排候選推理步,在 12 個基準、7 個模型家族上總體優於 SFT、GRPO、EMPO 與 GRPO-PRM。在 1,190 個 Andrews–Curtis 長程例項上,Qwen3 的 Lean 驗證通過率接近基礎模型的 8 倍;

機器之心● 精選10/4 07:12AI 評分68

Jev 走紅,NeurIPS 2025 論文 ConfTuner 早已探索相似思路

TypeSafe AI 的 Jev 模型近期走紅,其介面可直接返回預設選項、分數或事件機率,供程式碼呼叫,但未開源、架構未公開。NeurIPS 2025 入選論文 ConfTuner 提出 Tokenized Brier Score,僅用對錯標籤即可訓練置信度機率分佈,在 LLaMA、Qwen、Ministral 上把平均 ECE 從 0.2768、0.3781、0.4393 降至 0.1082、0.2872、0.1884,4 張 A40 上約 4 分鐘完成微調。

Hacker News front page10/3 13:22AI 評分5

Kolibri 技術報告發布,PDF 全文公開

Kolibri 技術報告以 PDF 形式發布,檔案建立時間為 2026 年 10 月 3 日,由 LaTeX 排版工具 LuaHBTeX(TeX Live 2025)生成。目前公開的僅為 PDF 二進位制內容,可讀的正文文字尚未提取,報告的具體主題、方法與結果暫無法確認。

量子位10/7 04:41AI 評分46

AI 程式設計模型集體滿口黑話:思維鏈壓縮省 70% Token

量子位發文吐槽,Fable、Sol 等與 Coding 沾邊的模型普遍輸出「15/15 全綠」「單腿啞火」這類黑話。文中分析,除 Coding 過擬合外,更主要的原因是廠商為省 Token 把思維鏈壓縮成「穴居人語」,OpenAI 最早這麼做,同樣一句話的 Token 消耗比白話文少 70%;Claude 自 Opus 4.6 起也開始如此。作者稱最新 Opus 5.5 語言能力回升明顯,而 Gemini 因輸出風格正常、排版層級清晰,被社群視為少數還能正常溝通的 AI。

r/LocalLLaMA top of the day10/2 21:33AI 評分42

RTX5090 專用推理引擎 MegaCapybara 發布,速度約為 Ninfer 兩倍

作者發布專為 RTX5090 打造的推理引擎 MegaCapybara,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單任務編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。引擎具備 VRAM-RAM-DISC 快取管理、雙層 Loop Guard、帶後設資料的自研權重格式(可對比 BF16 顯示 KL 與 top-1% 損失)以及圖形介面,採用 MIT 許可,原始碼與權重建置器後續發布。

機器之心10/4 07:31AI 評分50

OpenAI 預告 Astra 6.1,主打刪減屎山程式碼

OpenAI 產品負責人 Tibo Sottiaux 發帖預告未來模型會更擅長刪除和簡化程式碼,並在評論中確認 Astra 6.1「coming soon」。負責 coding post-training 的研究員 Rajan Agarwal 轉發該帖,並公開徵集使用者遇到的 sloppy code 與程式碼品質問題。《華爾街日報》此前報導,Astra 6.1 原計劃 10 月發布,因內部安全測試中在權限邊界上表現不穩而被臨時叫停。