AISpot

搜尋

找到 8 筆

Hacker News front page10/7 02:27AI 評分65

無 LLM agent 的 Jev 診斷管線:105 次通過 76.2%

一個不含 LLM agent 的 Jev 驅動診斷管線,在 SREGym-Lite 的 21 個故障、105 次診斷中通過 80 次(76.2%),中位診斷時間 14.6 秒。管線先用程式化收集器讀取 Kubernetes 物件、事件、近期 Pod 日誌與資源用量,按元件彙總後交給 Jev,由它在給定選項中選出可能根因、判斷元件是源頭還是下游受害者,並挑出關鍵證據,再組裝成診斷報告。Jev 全程只做選擇,不生成命令也不寫報告;

r/LocalLLaMA top of the day10/3 16:42AI 評分52

自建魔獸私服,讓 LLM 在瀏覽器裡玩遊戲

作者搭建了魔獸世界私服 jankcraft.xyz,並開發瀏覽器客戶端,PC 和手機均可免費遊玩。隨後用自訂 MCP 與 agent harness 通過 websocket 控制客戶端,讓 LLM 自動玩遊戲,agent 頁面已上線。本地模型需服務端開啟 CORS,作者自託管的幾個模型可能因用量增長下線;24GB 記憶體可跑 Qwen3.8-27B-GPTQ-W4A16,16GB 記憶體可用 vLLM 跑 Gemma4-e4b-coder。

Hacker News front page10/7 13:04AI 評分75

研究:LLM 用 1866 年電報體壓縮記錄可省近半 token

一份 50 篇材料、約 1300 題的新基準(Telegraph Test,程式碼與資料已開源)顯示,只需一句小寫指令讓模型用 1866 年跨大西洋電纜時代的電報體(cablese)撰寫壓縮記錄,輸出 token 可省 40%–49%,而下游模型讀取這些記錄的準確率不低於明文(恢復比 0.99–1.10)。GLM-5.3-Flash 自身省 48.4%,qwen3.8-27b 省 48.9%,gemma-4-31b 省 40.4%;

Hugging Face blog● 精選9/29 14:07AI 評分67

ProvenanceGuard:為 MCP Agent 做來源感知的事實核查

MultiverseComputing 團隊發布論文 ProvenanceGuard,針對 MCP Agent 的跨來源混淆問題:答案中的事實雖在證據池中存在,卻被歸因到錯誤的工具來源。該方法在生成後保留來源 ID,依次做宣告拆分、來源路由、支援度打分、歸因比對與修復,並用 MiniLM、DeBERTa NLI 等本地模型離線執行。

Hacker News front page10/2 22:06AI 評分35

SaaS 公司將變成圍繞模型的 harness

Shrivu Shankar 在 8 月 24 日的文章中提出,每家 SaaS 公司最終都會變成圍繞模型搭建的 harness,即包裹無狀態 LLM 的基礎設施、介面、上下文與狀態。他給出五階段演進路徑:傳統 SaaS、工程師與 agent 結對、個人執行 harness、個人編排 harness、harness 編排個人,屆時核心任務由 agent 完成,人類只負責提供品味與判斷。

Apple Machine Learning Research10/6 01:00AI 評分53

RISED:多環境 agent 訓練的評分標準與自蒸餾方法

論文提出 RISED,用評分標準(rubrics)驅動多環境 agent 訓練的 prompt 組選擇與自蒸餾。作者指出現有課程與資料選擇策略多在環境層面分配訓練,或只依賴區域性 reward 訊號,沒有顯式利用不同環境當前 rollout 之間的關係來挑選 prompt 組。同時各環境學習速度不一,同一 batch 內會並存全失敗與全成功的 rollout 組,這批資料無法獲得 group-relative 獎勵訊號。

OpenAI News10/6 13:00AI 評分44

Jump Trading 用 GPT-6 Astra 讓 agent 承擔數天級量化研究

Jump Trading 的 LLM 研發負責人 Lucas Baker 表示,引入 OpenAI GPT-6 Astra 後,可交給 agent 的量化研究工作流在規模與複雜度上大幅提升,從日常寫程式碼擴充套件到需要執行數天、跨多資料來源的完整分析。過去需要頻繁人工指導與干預,現在團隊只需定義安全、可監控的環境與明確目標,讓 agent 自行尋找路徑,並在長任務中自我評估、遞迴改進。在受監管的金融行業,agent 產出的交易訊號仍按普通訊號處理,需人工稽核並納入嚴格控制的執行環境。

LM Studio blog● 精選8/27 01:00AI 評分62

Bionic 推出 Auto Review 自動審批 shell 命令

Bionic 新增名為 Auto Review 的 shell 命令審批模式,先由確定性的 Shell Judge 做 AST 解析、能力提取與命令匹配,判定安全即直接執行,否則交給 Shell Reviewer 子代理結合會話記錄複核。Shell Judge 支援 sh、bash、zsh 與 PowerShell,官方稱當前版本可自動批准其代理執行命令中的 82%,且不呼叫 LLM。Bionic 預設零資料保留,範例命令來自內部測試裝置。