AISpot

評測

10月3日星期六 · 2 則

  1. r/LocalLLaMA top of the dayAI 評分75

    TensorSharp 讓 176B MoE 模型跑在 16GB 視訊記憶體筆記本上

    開源推理引擎 TensorSharp 在 RTX 3080 Laptop(16GB 視訊記憶體)、32GB 記憶體加 SSD 的普通筆記本上跑起了 Qwen3.8 Flash Next 176B,無需 128GB 以上記憶體工作站或多 GPU。它靠量化加 MoE 感知的統一排程,協調視訊記憶體、記憶體、SSD 與快取分層。

  2. r/LocalLLaMA top of the dayAI 評分51

    Qwen3.8-Flash-Next 177B 在單張 RTX 5070 12GB 上跑到 11–15 tok/s

    有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上跑 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話 14–15 tok/s,比原方案約 7 tok/s 提升明顯。一次長編碼提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

10月2日星期五 · 5 則

  1. r/LocalLLaMA top of the dayAI 評分47

    RTX PRO 6000 實測 Qwen3.8 三版本:DFlash2 提速 2.8 倍

    在單張 RTX PRO 6000 Blackwell 96GB 上,Qwen3.8-27B 用 DFlash2 草稿模型把 Spec-Bench 單使用者解碼從 75 tok/s 提到 210 tok/s,約 2.8 倍;NVFP4 比 BF16 快 2.2 倍。三款檢查點中 Flash-Next 預填充 22.4 秒、27B 為 97 秒,長上下文召回三者均滿分,BFCL 工具呼叫 27B 以 73.3% 領先。

  2. r/ClaudeAI top of the dayAI 評分55

    使用者用 Claude Opus 5.5 把 100 分鐘遊戲錄影剪成 50 分鐘成片

    一位業餘創作者用 Claude Opus 5.5 完成了整段影片剪輯:自動同步音畫、生成轉錄並據此把 100 分鐘素材剪到 50 分鐘、去除停頓、平衡音量、新增箭頭縮放閃回等效果,還把遊戲棋盤做成獨立畫面並生成動畫箭頭和 YouTube Shorts。整個過程不到一天,幾乎無需人工指導,且完全在 DaVinci 和 Premiere 之外完成。作者認為這不能替代優秀剪輯師的直覺,但對業餘創作者來說效果驚人。

  3. Hacker News front pageAI 評分63

    三款 AI agent 多語言實測:權限請求與註冊行為差異明顯

    技術與人權研究者 Roya Pakzad 發布對比測試,用世界銀行全球公共採購資料庫任務,分別以英文(美國)和波斯語(伊朗)在網頁版 Muse、Claude Cowork Opus 5.5、GPT 6.1 Sol 上執行。權限差異明顯:GPT 只在開頭請求一次網站訪問並提供允許所有相關網站選項,Claude 兩個任務各請求 9 次,Muse 到第四步才請求。

  4. r/ClaudeAI top of the dayAI 評分30

    Opus 5.5 與 Sol 6.1 15 分鐘用 three.js 建布萊德湖城堡

    一位使用者用 15 分鐘限時提示,讓 Opus 5.5 和 Sol 6.1 分別用 three.js 建置可旋轉視角的簡化版布萊德湖城堡。Opus 5.5 用時 5 分 46 秒,約 300k 輸入加 18k 輸出 token,估算 API 成本約 1.56 美元;Sol 6.1 用時 11 分 2 秒,約 400k 輸入加 16k 輸出 token,估算約 0.96 美元。Opus 5.5 產出約 27 KB、520 行、3 個 CDN 指令碼;

  5. Apple Machine Learning ResearchAI 評分33

    強化語種判別可縮小多語言語音模型的單語差距

    多語言自監督語音模型在總預訓練資料預算相同的情況下,表現仍不如單語模型。研究發現,在預訓練階段強化模型區分語言的能力,可縮小這一多語言差距,並在部分連續語音學與更高層語言學指標上將其消除,同時保留大量跨語言資訊共享。實驗採用受控的英語/法語 HuBERT 設定,測試了兩種強化語言判別的干預手段,其中一種是輔助語言任務。

10月1日星期四 · 1 則

  1. Apple Machine Learning Research● 精選AI 評分68

    強 coding agent 做自主 ML 工程需要多少 harness

    2026-10-01 發布的文章追問強 agent 在自主 ML 工程中究竟需要多少 harness。它指出,近期自主 MLE agent 在公開排行榜取得顯著進展,但現代 MLE agent 常建立在多 agent 編排器、專用檢索子 agent 等越來越複雜的裝置上;動機包括長週期進展停滯與 LLM 原語有限。相比之下,讓 LLM 通過 read、write、bash 直接訪問執行環境的更原始但改進的 coding agent,在領域內受到的關注很少。