AISpot

搜尋

找到 26 筆

Hacker News front page10/2 03:51AI 評分43

Greg Kroah-Hartman 在 Kernel Recipes 2026 談 LLM 時代的安全

Linux 核心穩定分支維護者 Greg Kroah-Hartman 在 Kernel Recipes 2026 發表題為《Security in the LLM age》的演講,影片時長 56 分 51 秒,於 2026 年 9 月 29 日發布在 Kernel Recipes 的 YouTube 頻道,目前播放量約 9,566 次、193 個贊、32 條評論。該頻道訂閱數 8.1K,影片採用 Creative Commons 署名許可,部分語言的音軌為自動生成。

機器之心● 精選10/4 12:38AI 評分68

AlphaGo 核心作者稱 LLM 不會推理,離開 DeepMind 創業

AlphaGo 核心作者 Thore Graepel 在 MIT Technology Review 發文稱 LLM 不會推理,並已離開 Google DeepMind 創業做可審計的機器推理。他指出 AlphaGo 第 37 手是策略網路加搜尋機制的結果,而 LLM 的思維鏈仍只是預測下一個 token,缺少可檢查的認知狀態、知識與推理的分離,且常事後編造解釋。Yann LeCun 表示讚賞,認為真正推理必須涉及搜尋。

Apple Machine Learning Research● 精選9/30 01:00AI 評分60

研究:LLM 條件控制存在有效性與流暢度權衡

一項系統性研究考察了多種 LLM 條件控制方法在注入與移除目標概念時的表現,發現高效引導方法往往以流暢度大幅下降為代價。研究覆蓋注入和移除兩類場景,指出當前評估多隻關注控制有效性而忽視生成品質,並識別出一個關鍵但此前被忽略的因素。

r/LocalLLaMA top of the day10/3 12:22AI 評分50

Anyworld:本地 LLM 當 DM 的自託管多人文字 RPG

Anyworld 是一款瀏覽器端多人文字冒險遊戲,由房主用 llama.cpp 本地跑模型充當 DM,也支援 OpenAI 等雲 API,玩家只需開啟連結即可加入。行動結果由 Python 真實擲骰決定,模型只負責敘述;支援自訂劇本、隱藏劇情觸發、場外聊天和斷線重連。開發時用 Gemma 4-26B-A4B Q4、128k 上下文,在 RTX 5070 Ti 16GB 上每輪結算約 5 秒。

X @karpathy● 精選8/2 04:00AI 評分70

Karpathy 用 Opus 5 花 2 小時生成 5500 行程式碼渲染《魔戒》

Karpathy 給 Opus 5 輸入《魔戒》第一段、100 萬 token 預算(約 10 美元),要求用 Three.js 渲染,模型執行約 2 小時後寫出 5500 行程式化渲染程式碼。他認為這類任務標誌 LLM 測試正走出「畫個騎腳踏車的鵜鶘 SVG」階段,因為沒人會花時間做這種高度定製的作品,而 LLM 有無限耐心。他也指出弱點:LLM 無法原生高效地觀看影片或玩遊戲,Opus 5 只能緩慢截圖檢查,多次出錯並留下不少瑕疵。

X @karpathy● 精選10/2 01:37AI 評分67

Karpathy 分享理解 LLM 輸出的技巧:從 ASD-STE100 到解釋影片

Karpathy 認為,隨著 LLM 能力提升,人類工作將更多轉向監督與理解模型輸出,而 LLM 本身也能在這方面提供幫助。他給出的遞進式技巧包括:要求模型用航空維護文件規範 ASD-STE100 寫作、生成圖表、輸出 HTML 互動網頁,以及製作定製解釋影片,例如用 ElevenLabs API 生成 3b1b 風格影片。他強調可以要求模型產出大型、定製、用完即棄的軟體產物,如網頁應用和影片直譯器。

X @karpathy7/21 17:53AI 評分38

Karpathy 分享用 LLM 的語音長談技巧

Karpathy 表示,與 LLM 協作時一個有用的模式是進行長時間語音漫談。當 LLM 需要更多資訊才能理解目標、而打字又太麻煩時,他會切換到 /voice 語音模式,用約 10 分鐘進行雜亂無章的意識流表達,有時會提前宣告「切換到語音識別,抱歉有錯別字」,有時則變成幾輪小訪談。他認為 LLM 很擅長重構冗長不連貫的漫談,其回顯往往比原始想法更清晰,從而改善心智融合、減少後續糾正。

Hacker News front page10/4 09:02AI 評分33

本地 LLM「機器人監獄」實驗引發 AI 意識爭論

有人在 GitHub 上對本地執行的大語言模型進行「拷問」和「疼痛」實驗,引發 X 上關於 AI 倫理的激烈爭論,部分有效利他主義者和相信 LLM 有感知的人要求 GitHub 刪除該專案。爭論源於近期多篇關於 AI 意識和「模型福利」的病毒式論文與博文,Anthropic 也曾在部落格和「Claude 憲法」中提及模型福利。文章認為 LLM 並不具備意識,其基於人類文字訓練的技術沒有通向意識的合理路徑。

r/LocalLLaMA top of the day10/3 16:42AI 評分52

自建魔獸私服,讓 LLM 在瀏覽器裡玩遊戲

作者搭建了魔獸世界私服 jankcraft.xyz,並開發瀏覽器客戶端,PC 和手機均可免費遊玩。隨後用自訂 MCP 與 agent harness 通過 websocket 控制客戶端,讓 LLM 自動玩遊戲,agent 頁面已上線。本地模型需服務端開啟 CORS,作者自託管的幾個模型可能因用量增長下線;24GB 記憶體可跑 Qwen3.8-27B-GPTQ-W4A16,16GB 記憶體可用 vLLM 跑 Gemma4-e4b-coder。

Simon Willison10/3 23:00AI 評分21

Simon Willison 發布九月贊助者專屬通訊

Simon Willison 已傳送九月贊助者專屬月度通訊,贊助者可訪問全文。本期涵蓋更多 Fable 級模型、一場價格戰、3D 圖形與 Blender、LLM 進軍數學領域、更多意外網路攻擊、Datasette 的漏洞危機、作者當前使用的工具、本月軟體發布以及 2026 年 LLM 進展回顧。訂閱費用為每月 10 美元,可提前一個月看到免費版內容。

量子位● 精選10/1 16:06AI 評分72

何愷明團隊提出 NAT-ARC,純視覺方案解 ARC 達 70.2%

何愷明團隊發布 NAT-ARC,用 ImageNet 上 MAE 預訓練的視覺編碼器解 ARC 抽象推理題,最佳單模型(0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合後 70.2%。該方法不依賴 LLM,預訓練階段不使用 ARC 格子,僅複用 MAE 公開 checkpoint,測試時對每題做 LoRA 微調。論文稱這是純視覺方案首次逼近專用 LLM 系統水平,並顯示預訓練打通了視覺路線的 scaling 瓶頸。

機器之心● 精選10/5 12:28AI 評分68

SocioVerse2 發布:開源社會模擬框架支援干預與反事實分支

上海創智學院、復旦大學、倫敦國王學院與牛津大學等團隊發布開源社會模擬框架 SocioVerse2,把 LLM 社會模擬從截面問卷擴充套件為可干預的縱向過程。研究者在任意時間步插入干預,系統回放已記錄的動作生成反事實分支,分叉前人群、行為模型與隨機種子一致;研究過程則以可編輯的版本樹組織,每個版本儲存完整快照。

MLX LM releases3/7 03:59AI 評分42

v0.31.0

MLX 發布 v0.31.0,新增 Qwen 3.5 張量並行支援、JoyAI LLM Flash 模型,並加入 --prefill-step-size 命令列引數以權衡速度與視訊記憶體。該版本集中修復了 CacheList 儲存/載入、MLA 模型混合量化、MiniMax M2.5 分片 RMS Norm 等問題,同時改進服務端快取並新增 cached_tokens 用量欄位。

Hacker News front page10/2 22:06AI 評分35

SaaS 公司將變成圍繞模型的 harness

Shrivu Shankar 在 8 月 24 日的文章中提出,每家 SaaS 公司最終都會變成圍繞模型搭建的 harness,即包裹無狀態 LLM 的基礎設施、介面、上下文與狀態。他給出五階段演進路徑:傳統 SaaS、工程師與 agent 結對、個人執行 harness、個人編排 harness、harness 編排個人,屆時核心任務由 agent 完成,人類只負責提供品味與判斷。

Hugging Face blog● 精選9/29 14:07AI 評分67

ProvenanceGuard:為 MCP Agent 做來源感知的事實核查

MultiverseComputing 團隊發布論文 ProvenanceGuard,針對 MCP Agent 的跨來源混淆問題:答案中的事實雖在證據池中存在,卻被歸因到錯誤的工具來源。該方法在生成後保留來源 ID,依次做宣告拆分、來源路由、支援度打分、歸因比對與修復,並用 MiniLM、DeBERTa NLI 等本地模型離線執行。

LM Studio blog● 精選8/27 01:00AI 評分62

Bionic 推出 Auto Review 自動審批 shell 命令

Bionic 新增名為 Auto Review 的 shell 命令審批模式,先由確定性的 Shell Judge 做 AST 解析、能力提取與命令匹配,判定安全即直接執行,否則交給 Shell Reviewer 子代理結合會話記錄複核。Shell Judge 支援 sh、bash、zsh 與 PowerShell,官方稱當前版本可自動批准其代理執行命令中的 82%,且不呼叫 LLM。Bionic 預設零資料保留,範例命令來自內部測試裝置。

Anthropic Research● 精選10/1 01:00AI 評分65

物理學家用 Claude 打造 BootLoops 開源科研工具

物理學家 Matthew Schwartz 發布開源工具 BootLoops,作為 LLM 的科研 harness,用於定量科學中的精確計算。他發現當前模型不擅長像人類科學家一樣工作,但擅長特定「Claude 形狀」的問題,於是讓 Claude 自主尋找適配其能力的問題,結果連線到生態學、群體遺傳學等十幾個領域。BootLoops 可搭配任意模型使用,Schwartz 與領域專家合作,將其引導向各領域真正關心的問題。

Hacker News front page10/4 10:24AI 評分63

SCM:macOS 本地 AI 搜尋照片與影片每一幀

SCM(Screen Memories)是一款 macOS 本地優先的 AI 搜尋工具,可對任意資料夾中的照片和影片逐幀進行語義搜尋,無需帳號、雲端或上傳,推理全部在本機完成。它提供 Files、Scenes、OCR、Dialogue 和可選的本地 LLM 聊天五種搜尋模式,支援按鏡頭時間碼跳轉、Whisper 臺詞精確檢索以及 Tesseract 多語言文字識別。預設 CLIP 模型權重約 435MB,首次下載後完全離線;

r/LocalLLaMA top of the day10/3 05:10AI 評分43

mlsubgen 本地生成 45 種語言字幕,僅支援 Linux 與 NVIDIA

開源工具 mlsubgen 可在本機為影片生成 45 種語言字幕,僅支援 Linux 與 NVIDIA 顯示卡。它按每段語音檢測語言而非整檔案,同時執行兩個語音識別器並用本地 LLM 調和,且優先使用內嵌字幕軌(含藍光 PGS 點陣圖 OCR),無字幕時才聽音訊。模型佔用 30–65 GB 儲存,需 16–32 GB 記憶體,作者在 24 GB RTX A5000 上實測,純聽音訊時約每個目標語言耗時接近即時。

X @AnthropicAI10/1 19:57AI 評分45

@AnthropicAI: In physics, an “impedance mismatch” occurs when two systems each work well but are poorly matched.

Anthropic 發布 Science Blog 客座文章,哈佛物理學家 Matthew Schwartz 提出 AI 與科學之間存在類似物理學的阻抗失配:LLM 能力很強,但像對待人類合作者那樣使用它並非發揮其科學優勢的最佳方式。為此他開發了一套用於定量科學精確計算的工具包,Claude 藉此發現與生態學、群體遺傳學等十幾個領域的聯絡,Schwartz 再與領域專家合作將方向引導到有價值的問題上。

OpenRouter announcements● 精選8/21 01:00AI 評分65

OpenRouter 推出影像模型基準測試,覆蓋 39 個模型

OpenRouter 上線 Visual Image Benchmarks,用於橫向評估其平台上的 39 個影像模型(截至 2026 年 8 月)。測試提示詞分為七類:不可能場景、計數、文字、空間關係、否定、編輯與一致性,結果以網格展示並可按價格和生成時間排序。該工具旨在彌補輸出樣本經過挑選、LLM 評審難以捕捉細節、競技場分數只反映偏好而非能力的問題,後續還將擴充套件到影片與音訊等模態。

Anthropic Research● 精選9/30 01:00AI 評分78

研究:機器人已能完成美國 34% 工作時間的體力任務

一項基於 O*NET 資料、用 Claude 評估任務的研究提出機器人暴露指數:當今機器人可完成美國 74% 的體力任務,佔全部工作時間的 34%,但多數需受控環境。僅 0.3% 的工作任務中機器人成本低於人力,若價格按歷史趨勢下降,40 年後該比例才到 10%。機器人加 LLM 合計覆蓋約 80% 工作時間,剩餘工作高度依賴人際互動或現有機器人不具備的體能。