AISpot

官方公告

近期事件

  1. 1
    熱度 1.44 個來源 · 4 則10/3 00:03
  2. 2
    熱度 1.44 個來源 · 4 則10/2 23:40
  3. 3
    熱度 1.13 個來源 · 3 則10/3 01:45
  4. 4
    熱度 1.12 個來源 · 3 則10/3 12:44
  5. 5
    熱度 0.92 個來源 · 2 則10/3 16:36

10月3日星期六 · 22 則

  1. Hugging Face blogAI 評分55

    微軟發布 ThinkingBox,按資料庫終態給 AI agent 打分

    微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。

  2. Simon WillisonAI 評分25

    Simon Willison 發布九月贊助者專屬通訊

    Simon Willison 已傳送九月贊助者專屬月度通訊,贊助者可立即訪問。本期涵蓋更多 Fable 級模型、一場價格戰、3D 圖形與 Blender、LLM 進軍數學、更多意外網路攻擊、Datasette 漏洞危機、作者當前使用工具、本月軟體發布及 2026 年 LLM 進展回顧。訂閱費為每月 10 美元,可提前一個月看到免費版內容。

  3. Hacker News front pageAI 評分65

    Vx 發布:把 CPU、GPU、NPU 記憶體寫進型別系統的語言

    Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯。它要求跨記憶體空間顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期校驗放置是否可行。

  4. Hacker News front pageAI 評分6

    YC 公司 RetailReady 招聘實施崗,年薪 10 萬至 14 萬美元

    RetailReady(YC W24)正在招聘實施崗,薪資 10 萬至 14 萬美元,股權 0.02% 至 0.06%,工作地點舊金山,需每月出差至客戶倉庫約 50% 時間,僅限美國公民或持美國簽證者。該公司做 AI 供應鏈合規引擎,已融資 660 萬美元,客戶超 50 家,過去 12 個月營收增長 4 倍,團隊 12 人,面試為 15 分鐘初聊、30 分鐘小組面、創始人面。

  5. Hacker News front pageAI 評分21

    EventMaxxer:讓 agent 批次申請活動並整理表格

    EventMaxxer 是一個開源工具,讓 coding agent 根據你的目標、地點和日期自動發現匹配的 meetup、會議、工作坊、晚宴和駭客松,並批次申請免費活動。它把結果同步到 Google Sheets 或 CSV,按日期排序,記錄報名狀態、出席決定和備註,還支援自動恢復被限流的任務。需要 agent 有可用的已登入瀏覽器,可選本地 runner 要求 macOS/Linux 上的 Python 3.9+,Google Sheets 需要聯結器。

  6. r/OpenAI top of the dayAI 評分23

    Oscilloscope Diffusion 發布,可用擴散模型改造影片

    Uisato Studio 上線 Oscilloscope Diffusion,一種通過擴散模型干預已有影片的新方法:以原影片的運動與形態為起點,重新詮釋其紋理、材質與視覺語言。演示素材來自作者的 TouchDesigner 音訊反應幾何視覺化系列 Oscilloscopes, everywhere(已更新至 v1.2),也可輸入任意影片源。使用者可選擇源影片、用提示詞描述處理方式,並通過精選 LoRA 與可編輯時間線控制結果與原始畫面的接近程度。

  7. r/OpenAI top of the day● 精選AI 評分80

    OpenAI 發布 GPT-6 系列模型指南

    OpenAI 發布了 GPT-6 系列的模型指南,內容涵蓋模型選擇、推理強度(reasoning effort)與工具使用。該指南面向使用 GPT-6 系列的開發者,幫助其在具體場景中決定選哪個模型、投入多少推理算力以及如何呼叫工具。原文未披露具體模型型號、引數或發布時間等細節。

  8. Hacker News front pageAI 評分15

    YC 系 Great Question 招加拿大遠端產品工程師

    AI 使用者研究平台 Great Question(YC W21)正在加拿大遠端招聘首位產品工程師,年薪 15 萬至 18 萬加元,要求 6 年以上經驗。崗位為全棧方向,技術棧以 Rails 與 TypeScript 為主,工作內容涵蓋影片流、即時語音 agent、agentic 搜尋等,並明確要求日常使用 Claude Code、Codex、Cursor 等 agentic 編碼工具。該崗位僅限美國公民或持美國簽證者申請。

  9. Hacker News front pageAI 評分72

    Aleph Alpha 發布 Kolibri:78B 總參 3B 啟用開源權重模型

    德國 Aleph Alpha 於 2026 年 10 月 3 日發布 Kolibri,一個英德雙語 MoE Transformer,總引數 78B、啟用 3B,支援最長 1M token 上下文,權重已在 Hugging Face 以 Apache 2.0 許可開放下載。它面向公共管理、工業與航空航天等受監管領域,針對德語、推理、數學與 agentic 行為做了專門最佳化,官方稱其品質與服務成本處於帕累托前沿,數學、程式碼、長上下文等基準可對標啟用引數最多四倍於己的模型。

  10. Hacker News front pageAI 評分70

    Offrun:一個工作區管理所有 coding agent

    Offrun 是一個統一工作區,用來管理多個 coding agent,並加入第二 agent 做 peer review:在你檢視 diff 之前先審閱,發現的問題會出現在聊天裡,此時改動尚未提交。你可以要求修復,修復內容會先進入訊息框供你確認,不會自動合併。它執行在你自己的 agent 帳號上,不需要額外訂閱,也不會在 pull request 上放機器人。

  11. r/LocalLLaMA top of the dayAI 評分62

    LiquidAI 發布 LFM2.5-Encoder 350M 多語言編碼器

    LiquidAI 發布 LFM2.5-Encoder,含 350M 與 230M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度任務。官方稱其吞吐量追平或超過 ModernBERT,CPU 長上下文更強,並可通過 WebGPU 在瀏覽器執行;GGUF 權重已發布,llama.cpp 支援 PR 已提交。

  12. Hacker News front pageAI 評分37

    Cloudflare 推出 OHTTP Gateway 自服務測試版

    Cloudflare 今年秋季推出 OHTTP Gateway,作為付費附加元件讓客戶在自有域名上接收 OHTTP 流量,現已開放等待名單。OHTTP 通過中繼與閘道器兩跳分離,使應用後端看不到使用者 IP;此前已用 Cloudflare 保護伺服器的客戶無法使用其 OHTTP Relay,現在可改用第三方中繼加 Cloudflare 閘道器。閘道器執行在 Cloudflare 全球邊緣網路,可減少中繼到閘道器及閘道器到源的延遲。

  13. Hacker News front pageAI 評分25

    Google Maps Scraper MCP 上線,agent 可直查商戶資料

    Google Maps Scraper MCP 是一個遠端 Model Context Protocol 伺服器,讓相容的 AI agent 直接搜尋商戶並拿到結構化結果。它通過 https://gmapscrawl.com/api/mcp 提供無狀態 Streamable HTTP 介面,用 Bearer API key 認證,單次最多返回 20 家商戶的地址、聯絡方式、評分與評論數。

  14. r/LocalLLaMA top of the dayAI 評分30

    MegaCapybara 發布:RTX5090 上跑 Qwen3.8 27B 的推理引擎

    MegaCapybara 是專為 RTX5090 打造的推理引擎,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單路編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。它自帶權重格式與後設資料,載入前會展示各量化設定相對 BF16 的 KL 與 top-1% 損失,並支援智慧 VRAM-RAM-DISC 快取、Loop Guard 與圖形介面。採用 MIT 許可,原始碼與權重建置器稍後發布。

  15. TechCrunch AIAI 評分43

    Meta 開源 Muse Gadgets,可自建硬體接入 Muse

    Meta 推出開源專案 Muse Gadgets,開發者可用官方開源韌體和 Linux SDK 自製硬體連線其個人 AI 助手 Muse,支援樹莓派、ESP32 等開發板,接入螢幕、按鈕、感測器與執行器。Meta 還免費發放 5000 臺 Muse Home Link(USB-C 供電,讓 Muse 連線家庭網路並控制智慧音箱、電視),限 Muse 訂閱者先到先得,預計數週內發貨。

10月2日星期五 · 18 則

  1. X @OpenAIDevs● 精選AI 評分76

    @OpenAIDevs: Your dot learns how you work, keeps context across apps, coordinates Codex tasks, and flags what ne…

    OpenAI 開發者帳號發布 dot,它能學習使用者的工作方式、跨應用保留上下文、協調 Codex 任務,並標記需要使用者關注的事項。目前官方只給出這四項能力描述,未公布定價、可用平台與上線時間。

  2. X @OpenAIDevsAI 評分17

    @OpenAIDevs

    OpenAI 開發者帳號 @OpenAIDevs 在 2026 年 10 月 2 日發布了一條 X 帖子,正文只有一個指向 X 文章(x.com/i/article/2106076978206175232)的連結,沒有附帶任何文字說明。目前公開可見的資訊僅此一條連結,文章的具體內容、涉及的產品或發布時間均未在帖子正文中披露。

  3. r/LocalLLaMA top of the dayAI 評分27

    開發者開源二戰主題小模型 Peacebell,291M 與 148M 兩版

    開發者 Wayne Workman 用 11 個月業餘時間從零訓練了專注二戰資訊的小語言模型 Peacebell,已開源權重與訓練材料,含 291M 和 148M 兩個引數版本。148M 版是為參加 HuggingFace 限制 150M 以內模型規模的榜單而做,同時發布了 WWII 主題基準 ww2bench,題目不公開以防進入訓練資料。模型可在 CPU 上執行,作者提供了定製 vLLM fork,並稱其長上下文表現較差,下一版預計 2027 年發布。

  4. Hacker News front pageAI 評分62

    Ai2 開源 AstaBrief 8B 科學報告模型與訓練資料

    Ai2 開源 AstaBrief 8B:一個把研究問題與檢索到的文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練,權重、訓練資料和一份可從自己 PDF 生成報告的範例工作流一併放出。它已作為 Asta 的 Generate a report 功能中的 Fast mode 上線,與 Claude 驅動的 Thinking mode 並存;

  5. Google Developers blogAI 評分43

    MaxText 團隊在 TPU 上從零復現 Olmo 3 7B 預訓練

    MaxText 團隊用 JAX/XLA 在 Google Cloud TPU 上從零復現了 Ai2 的 Olmo 3 7B 語言模型,在預訓練與中期訓練階段的所有 held-out 評測上與原版 PyTorch-on-GPU 參考實現精確一致。實現最高達到 57.4% MFU,且在不改動訓練配方的情況下撐過了執行中的叢集縮擴容和跨代 TPU 切換,驗證了基礎設施的可移植性。

  6. Google Developers blogAI 評分45

    TPU 上最佳化稀疏注意力,1440p 影片生成推理提速 1.69 倍

    開發者用 Sparse VideoGen(SVG)把注意力頭動態路由到高度結構化的空間或時間稀疏掩碼,並在 TPU 上最佳化 Splash Attention 核心,使 1440p 影片生成的端到端推理最高提速 1.69 倍。核心側的具體改動是:跳過空記憶體 tile、把精確座標掩碼嚴格限制在邊界 tile、將 token 記憶體佈局改成時間優先(temporal-major)以獲得連續訪問。目的是把演算法層的稀疏真正對齊到硬體 tile 執行,顯著減少被浪費的矩陣運算。

  7. Google Developers blogAI 評分64

    Google Antigravity SDK 新增本地模型與 Ollama 支援

    Google Antigravity SDK 現在支援在本地離線執行 agentic 工作流,可通過 LiteRT 執行 Gemma 4 26B A4B 等模型。SDK 還提供對 Ollama、vLLM 等 OpenAI 相容推理服務的開箱支援,便於搭建隱私優先的本地工具。官方描述的混合編排方式是:雲端模型只做輕量規劃器,程式碼審計、打補丁這類消耗大量 token 的任務交由裝置上的本地模型處理。

  8. Meta AI blog● 精選AI 評分81

    Meta 發布 Muse Spark 1.1 多模態推理模型,開放 API 公測預覽

    Meta Superintelligence Labs 於 7 月 9 日發布 Muse Spark 1.1,是 Muse Spark 的多模態推理升級版,主打 agentic 任務,在工具與計算機使用、編碼、多模態理解上提升明顯。模型可主動管理 100 萬 token 上下文,能作為主代理編排並行子代理,在 OpenCode 中演示了自動截圖定位並修復 bug。

  9. Meta AI blogAI 評分46

    匹茲堡大學在輔助機器人中用 Meta 的 DINOv3 與 SAM

    匹茲堡大學 HERL 實驗室聯合 ATDev 推進 RAMMP 輔助機器人專案(7 月 27 日發布),用 Meta 開源的 DINO、DINOv3 和 SAM 視覺模型做環境感知,專案獲美國 ARPA-H 最高 4150 萬美元資助。美國約有 550 萬輪椅使用者,每年逾 10 萬起輪椅相關傷害送進急診。團隊把模型最佳化到電池供電的邊緣裝置上執行:降低記憶體佔用、按需使用低精度、控制解析度與批處理,以犧牲少量邊界精度換取即時性與穩定性。

  10. Meta AI blogAI 評分45

    Meta 發布 Brain2Qwerty v2,無創即時把腦訊號解碼成句子

    Meta 發布 Brain2Qwerty v2,無需手術植入,即可從非侵入式 MEG 腦訊號即時解碼出連貫句子,詞準確率達 61%,遠高於其他無創方法的 8%,最佳受試者達 78%,其中過半句子錯誤不超過一個詞。模型用 9 名志願者、每人佩戴 MEG 邊打字邊記錄 10 小時、共約 22,000 句的資料訓練,採用端到端深度學習直接從原始腦訊號解碼,並微調大語言模型利用語義上下文。

  11. Kimi blog● 精選AI 評分83

    Kimi K2.6 開源,主打長程編碼與 agent swarm

    Kimi K2.6 已開源,可通過 Kimi.ai、Kimi App、API 和 Kimi Code 使用,主打長程編碼、長時間執行與 agent swarm。官方稱其在內部 Kimi Code Bench 上較 K2.5 顯著提升:一個案例是在 Mac 上用 Zig 實現並最佳化推理,4000+ 次工具呼叫、連續執行 12 小時、14 輪迭代後吞吐從約 15 升至約 193 tokens/sec,比 LM Studio 快約 20%;

  12. Kimi blog● 精選AI 評分82

    Kimi K3 發布:2.8T 引數開放模型,支援 100 萬 token 上下文

    Kimi K3 是首個開放的 3T 級模型,2.8T 引數,帶原生視覺能力和 100 萬 token 上下文視窗,今日已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用 max thinking effort,低/高 effort 模式後續推出。完整模型權重將於 2026 年 7 月 27 日前發布。官方稱其整體效能仍落後於 Claude Fable 5 和 GPT 5.6 Sol,但在自家評測套件上達到前沿水平;

  13. Kimi blog● 精選AI 評分65

    Kimi 團隊開源 WorldVQA 多模態視覺世界知識基準

    Kimi 團隊開源 WorldVQA,一個用 3500 組影像-問題對衡量多模態大模型視覺世界知識事實正確性的基準。資料分 9 大類,36% 中文、64% 英文,並區分常見(Head)與長尾(Tail)知識,全部經過多階段人工校驗。測試顯示前沿模型長尾題準確率常低於 50%,且普遍過度自信:表現最好的 Kimi-K2.5 校準誤差 ECE 為 37.9%、斜率 0.550,距理想值仍有明顯差距。資料集與評測指令碼已開源。

  14. Kimi blog● 精選AI 評分65

    Kimi 推出 Agent Swarm,最多並行排程 100 個子代理

    Kimi 發布 Agent Swarm,Kimi K2.5 最多可並行部署 100 個子代理、執行 1500 次以上工具呼叫,出結果比序列執行快 4.5 倍。它不只是多代理協作,而是讓模型自行組建有分工的組織:自己決定何時並行、招誰、如何委派,適合大規模檢索、批次下載、多檔案處理與多視角分析。

  15. Kimi blog● 精選AI 評分65

    Kimi Team 發布 PerceptionBench,評估 MLLM 原子視覺感知

    Kimi Team 發布 PerceptionBench,一個把視覺感知拆成原子能力來評估的 MLLM 基準。它從 42 個基準的前沿模型失敗中歸納出 10 類原子感知能力,構造併發布 3,000 道已驗證題(內部池 17,000+),60% 來自模型失敗分解,40% 新寫,覆蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR、幻覺。測試 16 個前沿 MLLM,無一達到 60% 準確率,幻覺平均是最弱能力;總分接近的模型在具體感知上可能差異很大。

更早的內容