AISpot

模型

近期事件

  1. 1
    熱度 1.12 個來源 · 3 則10/3 12:44
  2. 2
  3. 3
    熱度 1.02 個來源 · 2 則10/3 16:36
  4. 4
    熱度 0.83 個來源 · 4 則10/3 01:56
  5. 5
    熱度 0.72 個來源 · 2 則10/2 22:25

10月4日星期日 · 1 則

  1. 量子位AI 評分44

    Meshy 不到兩年 ARR 從 100 萬漲到 1 億美元

    AI 3D 生成公司 Meshy 披露,其 ARR 從 100 萬美元增長至 1 億美元,用時不到兩年,比 HeyGen 的 29 個月更快。增長來自三層收入:個人訂閱、企業 API(三七互娛、網易遊戲、Nexon 等已接入生產管線)以及 3D 列印硬體生態(拓竹、創想三維等)。Meshy 7.1 將幾何生成解析度從 2048³ 提升至 4096³,並推出即時互動架構 Mora。

10月3日星期六 · 24 則

  1. r/ClaudeAI top of the dayAI 評分20

    Reddit 討論 Fable 5.5 下週發布預期

    r/ClaudeAI 使用者 Minemax03 發帖詢問,若 Fable 5.5 下週發布,效能會有多大提升。評論普遍擔心 Anthropic 會削弱當前 Opus 5.5,多人稱 Opus 5.5 是目前最好的 coding agent 體驗,也有人認為 Fable 5.5 價格是 Opus 5.5 的兩倍,除非效能大幅躍升否則難言划算。另有使用者提到官方已發放一次性額度重置,需在 10 月 22 日前使用,因此不認為該日期前會再重置或發布 Fable 5.5。

  2. r/LocalLLaMA top of the dayAI 評分5

    新模型僅用笑話訓練,效果自帶笑點

    有開發者發布了一個完全用笑話訓練的新模型,具體名稱、引數規模與訓練資料量均未披露。該帖由使用者 simonbreak 發布,正文只有一句“笑話自己會寫”,沒有給出下載地址、評測結果或使用方式。目前只能確認訓練語料限定為笑話,其他細節和限制未知。

  3. r/ClaudeAI top of the dayAI 評分75

    LiveNerf 完成 Opus 5.5 十天基線測量

    LiveNerf 專案已完成 Opus 5.5 的 10 天效能基線,從明天起將收集第 30 天的資料,之後可與基線對比,判斷模型發布後是否被降智。該專案由個人開發者發起,程式碼已開源在 GitHub,目標是獨立追蹤 Opus 5.5 的逐日表現。目前尚無結論性證據,作者稱希望藉此推動 AI 公司提高透明度。

  4. r/OpenAI top of the day● 精選AI 評分80

    OpenAI 發布 GPT-6 系列模型指南

    OpenAI 發布了 GPT-6 系列的模型指南,內容涵蓋模型選擇、推理強度(reasoning effort)與工具使用。該指南面向使用 GPT-6 系列的開發者,幫助其在具體場景中決定選哪個模型、投入多少推理算力以及如何呼叫工具。原文未披露具體模型型號、引數或發布時間等細節。

  5. r/LocalLLaMA top of the dayAI 評分75

    Aleph Alpha 發布 78B MoE 開源模型 Kolibri-1

    德國 Aleph Alpha 在 Hugging Face 發布 Kolibri-1,78B 總引數、3.46B 啟用引數,支援最高 100 萬 token 上下文,Apache 2.0 許可。模型用 768 張 B300 訓練 4 周、20T token,語料約 62.5% 英文、23.9% 德文、13.6% 程式碼。目前尚無量化版本,llama.cpp 是否支援該架構未知,社群評測認為效能接近 Qwen 3.5 35B。

  6. r/OpenAI top of the dayAI 評分61

    使用者實測:Opus 5.5 編碼能力遠超 Astra

    一位使用者對比 Astra 與 Opus 5.5 後稱,Opus 5.5 在編碼任務上明顯更強。他用約兩頁 A4 的提示詞、二十多次對話就讓 Opus 5.5 完成了一款包含玩法、畫面、音效與音樂的遊戲,全程未寫一行程式碼;在室內導航任務中,Opus 5.5 的掃描與追蹤準確,而 Astra 開箱即用效果很差,他給出 9/10 對 2/10 的評價。不過 Claude 會頻繁提示工具使用過多或任務未完成,且超出用量限制後完全無法使用。

  7. Hacker News front pageAI 評分72

    Aleph Alpha 發布 Kolibri:78B 總參 3B 啟用開源權重模型

    德國 Aleph Alpha 於 2026 年 10 月 3 日發布 Kolibri,一個英德雙語 MoE Transformer,總引數 78B、啟用 3B,支援最長 1M token 上下文,權重已在 Hugging Face 以 Apache 2.0 許可開放下載。它面向公共管理、工業與航空航天等受監管領域,針對德語、推理、數學與 agentic 行為做了專門最佳化,官方稱其品質與服務成本處於帕累托前沿,數學、程式碼、長上下文等基準可對標啟用引數最多四倍於己的模型。

  8. r/LocalLLaMA top of the dayAI 評分22

    使用者討論對 Kimi K3.5 的期待

    有使用者在 Reddit 發帖討論對 Kimi K3.5 的期待,並回顧了 Kimi 系列模型的進展。發帖人稱 Kimi K2 已經不錯,K2.5 通過持續學習階段提升到全新水平,據其記憶使用了超過 20-25T tokens;他同時表示 K3 是令人驚歎的模型,因此好奇 K3.5 會有多強。帖子未給出 K3.5 的發布時間、引數或功能細節。

  9. Latent Space● 精選AI 評分85

    GPT-6.1 Sol 發布,Sonnet 5.5 登頂 Agent Arena

    OpenAI 發布 GPT-6.1 Sol,定價 $2/$10 每百萬輸入/輸出 token,比 Astra 的 $10/$50 便宜約 80%,在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分。Sonnet 5.5 在 Agent Arena 首秀排第 3 並在 Chat 類別登頂,Anthropic 包攬前三;Sol 每任務中位成本 $0.56,比 GPT-6 Sol 便宜 39%。

  10. r/ClaudeAI top of the dayAI 評分58

    Opus 5.5 新 Skill 把 PDF 變成動畫互動網頁書

    有人用 Opus 5.5 加一個 Skill 把 PDF 轉成帶動畫、旁白和互動測驗的網頁書,流程是 PDF→書籍規劃→分鏡→旁白→動畫與測驗→網頁書。目前只靠 Opus 5.5,沒有接入影像模型,直接喂 PDF 效果已相當好;作者計劃加入影像模型以支援繪本和人文紀錄片。專案已開源(MIT),並提供了線上書架。

  11. r/LocalLLaMA top of the dayAI 評分62

    LiquidAI 發布 LFM2.5-Encoder 350M 多語言編碼器

    LiquidAI 發布 LFM2.5-Encoder,含 350M 與 230M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度任務。官方稱其吞吐量追平或超過 ModernBERT,CPU 長上下文更強,並可通過 WebGPU 在瀏覽器執行;GGUF 權重已發布,llama.cpp 支援 PR 已提交。

  12. r/LocalLLaMA top of the dayAI 評分73

    gufo 分支讓 Qwen3.6 35B A3B 在 Strix Halo 上跑出 3095tok/s 預填充

    開發者 nubela 發布了 gufo 的分支 gufo-Qwen3.6-35B-A3B-Q6dense,在 Strix Halo 上實現 3095 tok/s 預填充和 190 tok/s 解碼,目標是 3000 tok/s 預填充與 150 tok/s 解碼。該分支為追求速度而非智慧的負載設計,作者自行量化了模型並以 Apache 2.0 許可發布,使用 unsloth 的 GGUF 也可執行但效能較低。

  13. Hacker News front pageAI 評分41

    百萬 token 每秒只是思想實驗,序列瓶頸仍在

    一篇 2026 年 10 月 3 日發布的思想實驗文章指出,每秒一百萬 token 可指四種不同含義:上下文容量、輸入處理速度、聚合吞吐量和單 agent 輸出速度,其中只有最後一種才是真正的寫作速度。文章用計算器演示:100 萬輸出 token 在 100 token/秒下需 2 小時 46 分 40 秒,在 100 萬 token/秒下僅 1 秒;但若寫作後加一次 60 秒的固定檢查,端到端加速從 10000 倍降到 132.57 倍,檢查佔 98.7% 時間。

  14. r/LocalLLaMA top of the dayAI 評分33

    新模型寫作風格趨向高資訊密度與生僻詞彙

    有使用者觀察到,近期開源與閉源模型(如 GLM 5.3 Flash)的寫作風格正趨向高資訊密度和更豐富的詞彙,用更少的詞表達更多內容,類似 William Gibson 的壓縮文風。作者認為這可能與 token 效率最佳化有關,但代價是普通讀者難以一眼讀懂,例如模型會使用 Baudrillardian 這類生僻詞。

  15. 量子位AI 評分29

    Jev 估值 100 億美元,創始人稱日處理破萬億 token

    TypeSafe AI 聯合創始人兼 CEO Diogo Almeida 在 Latent Space 訪談中透露,Jev 日處理量已突破一萬億 token,且夜間流量持續走高,說明大量呼叫來自機器自動化。他稱 Jev 發布影片 6 天瀏覽量達 3870 萬,在 JevBench v1.2.1 綜合榜以 75.3 分排名第一,公司估值 100 億美元。他強調可靠性比速度和成本更重要,並稱即便給十億美元也不會從零預訓練大模型。

  16. r/ClaudeAI top of the dayAI 評分15

    使用者對比 Opus 5.5 與 Astra:Minecraft 模組品質差距明顯

    一位理論物理博士生在 Reddit 發帖稱,Anthropic 提供 50% 折扣後他以 100 美元訂閱了 20x 方案,此前是 OpenAI 的 200 美元訂閱使用者。他用 Astra 生成的 Justice League Minecraft 模組品質很差,而 Opus 5.5 生成的飛行動畫流暢、平衡性好,還能一次性完成論文圖表和審稿回覆。他認為 Fable 比 Astra Ultra 或 Pro 稍弱,但 Ultra Pro 用處不大,已決定立即切換。

  17. r/ClaudeAI top of the dayAI 評分40

    Opus 5.5 跑 28 分鐘花 6.17 美元生成單檔案

    一位使用者用自建 Pi agent 配合 plan mode,以 High 思考檔執行 Opus 5.5,耗時 27 分 45 秒、花費 6.17 美元(主 agent 4.97 美元,design-review agent 1.21 美元),最終產出一個 1,029 行、零依賴的 HTML 檔案。輸出 122,689 tokens,其中 66,163 為思考 tokens;總 tokens 約 600 萬,約 95% 為快取讀取。

  18. r/LocalLLaMA top of the dayAI 評分32

    宇樹發布 6B 人形機器人基礎模型 UnifoLM-WLA-1.0

    宇樹機器人發布通用人形基礎模型 UnifoLM-WLA-1.0,6B 引數,用約 2500 小時真實機器人資料訓練,單個模型覆蓋 64 項任務(10 項全身 + 54 項桌面),支援平行夾爪和兩種靈巧手。架構上以基於 Qwen3-VL 的 UnifoLM-ER-1 具身推理器為起點,加入光流與 VQ-VAE 的未來動態區域預測,用殘差 VQ 離散化末端執行器、手和下肢動作,再疊加 MMDiT 動作專家做連續控制。

10月2日星期五 · 15 則

  1. r/LocalLLaMA top of the dayAI 評分27

    開發者開源二戰主題小模型 Peacebell,291M 與 148M 兩版

    開發者 Wayne Workman 用 11 個月業餘時間從零訓練了專注二戰資訊的小語言模型 Peacebell,已開源權重與訓練材料,含 291M 和 148M 兩個引數版本。148M 版是為參加 HuggingFace 限制 150M 以內模型規模的榜單而做,同時發布了 WWII 主題基準 ww2bench,題目不公開以防進入訓練資料。模型可在 CPU 上執行,作者提供了定製 vLLM fork,並稱其長上下文表現較差,下一版預計 2027 年發布。

  2. r/LocalLLaMA top of the dayAI 評分47

    RTX PRO 6000 實測 Qwen3.8 三版本:DFlash2 提速 2.8 倍

    在單張 RTX PRO 6000 Blackwell 96GB 上,Qwen3.8-27B 用 DFlash2 草稿模型把 Spec-Bench 單使用者解碼從 75 tok/s 提到 210 tok/s,約 2.8 倍;NVFP4 比 BF16 快 2.2 倍。三款檢查點中 Flash-Next 預填充 22.4 秒、27B 為 97 秒,長上下文召回三者均滿分,BFCL 工具呼叫 27B 以 73.3% 領先。

  3. Hacker News front pageAI 評分62

    Ai2 開源 AstaBrief 8B 科學報告模型與訓練資料

    Ai2 開源 AstaBrief 8B:一個把研究問題與檢索到的文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練,權重、訓練資料和一份可從自己 PDF 生成報告的範例工作流一併放出。它已作為 Asta 的 Generate a report 功能中的 Fast mode 上線,與 Claude 驅動的 Thinking mode 並存;

  4. Meta AI blog● 精選AI 評分81

    Meta 發布 Muse Spark 1.1 多模態推理模型,開放 API 公測預覽

    Meta Superintelligence Labs 於 7 月 9 日發布 Muse Spark 1.1,是 Muse Spark 的多模態推理升級版,主打 agentic 任務,在工具與計算機使用、編碼、多模態理解上提升明顯。模型可主動管理 100 萬 token 上下文,能作為主代理編排並行子代理,在 OpenCode 中演示了自動截圖定位並修復 bug。

  5. Kimi blog● 精選AI 評分83

    Kimi K2.6 開源,主打長程編碼與 agent swarm

    Kimi K2.6 已開源,可通過 Kimi.ai、Kimi App、API 和 Kimi Code 使用,主打長程編碼、長時間執行與 agent swarm。官方稱其在內部 Kimi Code Bench 上較 K2.5 顯著提升:一個案例是在 Mac 上用 Zig 實現並最佳化推理,4000+ 次工具呼叫、連續執行 12 小時、14 輪迭代後吞吐從約 15 升至約 193 tokens/sec,比 LM Studio 快約 20%;

  6. Kimi blog● 精選AI 評分82

    Kimi K3 發布:2.8T 引數開放模型,支援 100 萬 token 上下文

    Kimi K3 是首個開放的 3T 級模型,2.8T 引數,帶原生視覺能力和 100 萬 token 上下文視窗,今日已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用 max thinking effort,低/高 effort 模式後續推出。完整模型權重將於 2026 年 7 月 27 日前發布。官方稱其整體效能仍落後於 Claude Fable 5 和 GPT 5.6 Sol,但在自家評測套件上達到前沿水平;

  7. Kimi blog● 精選AI 評分65

    Kimi 推出 Agent Swarm,最多並行排程 100 個子代理

    Kimi 發布 Agent Swarm,Kimi K2.5 最多可並行部署 100 個子代理、執行 1500 次以上工具呼叫,出結果比序列執行快 4.5 倍。它不只是多代理協作,而是讓模型自行組建有分工的組織:自己決定何時並行、招誰、如何委派,適合大規模檢索、批次下載、多檔案處理與多視角分析。

  8. DeepSeek news● 精選AI 評分87

    DeepSeek 發布 V4.1-Flash:552B MoE,KV 快取降至上代 1/4

    DeepSeek 發布 V4.1-Flash:552B MoE、原生多模態,已上線 DeepSeek API(模型名 deepseek-flash),舊版 V4-Flash 與 V4-Flash-Vision-Exp 退役。新因果編碼器–解碼器架構只有 8B 輸入、16B 輸出啟用引數,KV 快取降至上一代的 1/4 HBM 與 1/8 SSD,官方稱多方測試顯示其在效能、成本、速度和總執行時間上超過 V4-Pro,V4-Pro 將逐步淘汰。

  9. TechCrunch AIAI 評分45

    Sean Parker 把 Stability AI 重塑為音樂 AI 工具商

    Sean Parker 正把 Stability AI 改造成面向音樂專業人士的 AI 工具商。兩年前他參與了對這家瀕臨崩潰的影像生成公司的 8000 萬美元救助,CEO 由 Prem Akkaraju 出任;今年 8 月底公司宣布 7600 萬美元新融資,投資方包括索尼、華納和環球,三家同時授權曲庫用於訓練。

  10. r/LocalLLaMA top of the day● 精選AI 評分80

    微軟發布 4B 智慧體模型 FrogNano,主打倉庫級編碼

    微軟發布 FrogNano-4B-2609,一個面向算力有限開發者的 4B 智慧體模型,Hugging Face 上已有 GGUF 量化版本。它由 Qwen3.5-4B 派生,沿用 32 層混合 Gated DeltaNet 與門控注意力架構,後訓練為純文字、聚焦倉庫級軟體工程,用強化學習在約 1500 個 TaskPilot 生成的合成 SWE 環境上訓練,獎勵來自可執行測試,配套五工具的 Leaf harness。與行為蒸餾不同,它不訓練強模型的解題軌跡。

更早的內容