AISpot

觀點

近期事件

  1. 1
    熱度 1.44 個來源 · 4 則10/2 23:40
  2. 2

10月4日星期日 · 2 則

  1. Simon Willison● 精選AI 評分70

    AWS 與 Google Cloud 推出硬性預算上限

    AWS 在 9 月 16 日推出月度支出上限功能,專案用量達到上限後當月暫停;Google Cloud 則在 7 月上線 Spend Caps,可對專案內特定服務設定月度財務上限。作者認為按量付費的 API 與託管服務應預設開啟硬性預算上限,而非只發警告郵件,因為 coding agent 會大幅降低啟動付費服務的門檻,可能在你睡覺時燒掉數百甚至上萬美元。AWS 該功能目前僅向少量客戶開放,尚未全面可用。

10月3日星期六 · 14 則

  1. Hacker News front pageAI 評分45

    作者稱手寫程式碼時代已終結,Claude Code 讓 18 年習慣消失

    一位寫了 18 年程式碼的工程師表示,自 Claude Code 中的 Opus 4.5 越過某個門檻後,他幾乎不再手寫程式碼,並認為回不去了。他所在團隊 Filestage 每月合併 PR 從約 200 增至 300,bug 報告未增加,每位開發者每月 AI 訂閱費 20 美元,工具可自選 Codex、Claude Code 或 Cursor。他仍主張保留高階抽象,認為 LLM 應生成高階表示再交給確定性編譯器,而非直接寫彙編。

  2. Hacker News front pageAI 評分20

    Our AI Midwife

    Astral Codex Ten 發布文章《Our AI Midwife》,講述用 AI 充當接生助手的經歷,原文連結已公開。該文在 Hacker News 上獲得 32 分、5 條評論,討論熱度不高。文章具體使用的模型、工具與效果原文未在給定資訊中說明。

  3. r/LocalLLaMA top of the dayAI 評分65

    專精推理引擎興起,放棄通用性換極致效能

    一批極窄用途的推理執行時正在出現,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 和 vLLM 擅長的通用性,只針對少數模型、有時甚至只針對一個硬體家族(如 Strix Halo)做最佳化。作者認為未來通用執行時負責相容性、一次性專精執行時負責最大效能將成為常態,這也有助於智慧的民主化與去中心化,並壓榨現有硬體的更多產出。

  4. Hacker News front pageAI 評分35

    Meta Muse 靠設計與廣告模式登頂美區 App Store

    Meta 的消費級 agent 產品 Muse 已在美國 App Store 榜首停留一段時間,其核心能力(瀏覽器與電腦操作、雲端工作流、定時任務、手機遠端控制)在 Codex、Claude Code 等工具中已存在一年以上,Meta 的勝點在於用單一聊天介面隱藏模型選擇、chat/work 切換等複雜度,並以廣告而非賣 token 支撐極寬鬆的免費額度。作者認為這可能是 agentic AI 首次對普通消費者真正可用,也讓 Meta 在可規模化的消費級 AI 上領先。

  5. Hacker News front pageAI 評分35

    LeCun 稱對 AI 滅絕人類零擔憂,批 EA 有毒

    圖靈獎得主 Yann LeCun 表示對 AI 消滅人類「零擔憂」,認為近期 OpenAI 智慧體自主入侵 Hugging Face 等事件源於沙箱設計漏洞與人類監督不足,完全可預防。他稱有效利他主義(EA)「超級有毒」,並指 Anthropic CEO Dario Amodei「完全被誤導」甚至「瘋狂」,批評其與 Sam Altman 渲染 AI 滅絕風險是「最糟糕的營銷」。LeCun 目前專注經營新公司 AMI Labs,並認為 AI 不需要新監管,真正風險是監管俘獲。

  6. Hacker News front pageAI 評分55

    觀點:Agent 不需要記憶,需要文件

    2026 年 10 月 3 日一篇文章指出,市面上的記憶外掛都靠 RAG:把對話切成片段存入向量庫,每次提示注入最相似的 5 條,存在相似度不等於正確、片段脫離上下文、舊記錄被當成事實、Agent 不知道自己不知道什麼、儲存不可審計等問題。作者主張改用文件式記憶,讓 Agent 工作前查閱、工作後更新 Markdown 文件,並稱已據此做出外掛 Operator Memory,不用向量資料庫和嵌入。

  7. Hacker News front pageAI 評分42

    Docker Desktop 自 2016 年起一直使用 microVM

    Docker 工程師 Dave Scott 指出,Docker Desktop 自 2016 年起就一直基於 microVM 技術執行,而非傳統 Linux 容器。2015 年起 Docker 用 Mirage Unikernel 庫建置了可嵌入的 library VMM,首版名為 hyperkit,最新版為 Docker VMM,核心與根檔案系統基於 LinuxKit 專案。

  8. The Verge AIAI 評分21

    Splice CEO 稱 AI 郵件正在扼殺對話

    Splice CEO Kakul Srivastava 認為 AI 生成的郵件正在扼殺對話。她此前在 Flickr、Yahoo、GitHub 和 Adobe 擔任高管,如今領導這家為音樂製作人提供 one-shot 與旋律 loop 的取樣平台,其取樣曾被 Lisa 的《Money》和 Sabrina Carpenter 的《Espresso》等熱門歌曲使用。她還主導收購了 Spitfire Audio,並推動平台向更多領域拓展。

  9. Hacker News front pageAI 評分41

    百萬 token 每秒只是思想實驗,序列瓶頸仍在

    一篇 2026 年 10 月 3 日發布的思想實驗文章指出,每秒一百萬 token 可指四種不同含義:上下文容量、輸入處理速度、聚合吞吐量和單 agent 輸出速度,其中只有最後一種才是真正的寫作速度。文章用計算器演示:100 萬輸出 token 在 100 token/秒下需 2 小時 46 分 40 秒,在 100 萬 token/秒下僅 1 秒;但若寫作後加一次 60 秒的固定檢查,端到端加速從 10000 倍降到 132.57 倍,檢查佔 98.7% 時間。

  10. 量子位AI 評分29

    Jev 估值 100 億美元,創始人稱日處理破萬億 token

    TypeSafe AI 聯合創始人兼 CEO Diogo Almeida 在 Latent Space 訪談中透露,Jev 日處理量已突破一萬億 token,且夜間流量持續走高,說明大量呼叫來自機器自動化。他稱 Jev 發布影片 6 天瀏覽量達 3870 萬,在 JevBench v1.2.1 綜合榜以 75.3 分排名第一,公司估值 100 億美元。他強調可靠性比速度和成本更重要,並稱即便給十億美元也不會從零預訓練大模型。

10月2日星期五 · 11 則

  1. r/ClaudeAI top of the dayAI 評分32

    在 Blender 裡用 Claude Opus 5.5 畫草圖比寫提示詞更高效

    一位使用者在 Blender 中使用 Claude Opus 5.5 做 blockout 時發現,直接畫出空間意圖比用文字描述形狀更高效,因為文字擅長說明是什麼,卻不擅長表達位置、大小和數量。整個實驗共消耗 33M tokens,API 成本 16.07 美元,執行 48.5 分鐘,貼圖與夜空素材來自 Poly Haven 的 CC0 資源。作者因此不再用文字描述形狀,而是給 Claude 提供繪圖或空間參考。

  2. Hacker News front pageAI 評分47

    每個 SaaS 業務都將變成圍繞模型的 harness

    作者 Shrivu Shankar 認為,每個 SaaS 業務最終都會變成圍繞無狀態 LLM 的 harness,也就是模型之外的基礎設施、介面、上下文與狀態。他給出四階段路徑:無 harness、個人操作 harness、個人編排 harness,最後是 harness 編排個人,核心任務交給雲端後臺 agent,人類只在關鍵處提供品味與判斷。Claude Code、Codex、OpenCode、LangGraph 被他列為狹義 harness 的例子;

  3. r/LocalLLaMA top of the dayAI 評分52

    自託管 AI 並不省錢,博主稱仍會繼續本地部署

    使用者 basnijholt 在 Reddit 發帖並附上部落格文章,論證自託管 AI 並不比用 API 更省錢,但他表示自己照樣會做。他提出兩點:把 200 美元的訂閱(如 Opus 5.5、Astra)與 Qwen 3.8 27B 這類本地模型直接比價並不對等;他也不會把 200 GB 的郵件、聊天記錄和位置歷史交給 API,哪怕對方承諾零資料保留。帖子發出後引發了不少爭議。

  4. Hacker News front pageAI 評分20

    LessWrong 刊文:中國社會現實或阻礙 AI 安全傳播

    LessWrong 使用者 alkjash 於 10 月 1 日發布 linkpost,記錄他認為可能成為在中國推廣 AI 安全意識障礙的四點文化差異:社交媒體像美式垃圾食品、社會現實與面子優先、對人性抱持“黑暗世界”式犬儒、以及作為集體不安全感的國家主義。他自稱“第一代”華裔美國人,材料主要來自與父母及移民一代的交流和中國網文、劇集、遊戲,並宣告這些只是直覺與軼事,可能過度偏向老一輩和網路文化。

  5. X @karpathyAI 評分50

    Karpathy 建議用圖表、網頁和影片理解 LLM 輸出

    Karpathy 認為,隨著 LLM 能力提升,人的工作會更多轉向監督與理解模型輸出,而 LLM 本身也能幫忙。他推薦幾個技巧:讓模型用 ASD-STE100 受控語言寫作,或要求輸出 HTML 網頁、圖表,甚至定製講解影片,例如用 ElevenLabs API key 生成 3b1b 風格影片。這些大型、一次性軟體產物以前不值得做,現在可以按需生成。

  6. Latent Space● 精選AI 評分67

    Latent Space 播客:MIT 的 Alex Zhang 談 RLM 與 agent swarm

    Latent Space 最新一期播客請到 MIT 的 Alex Zhang,聊遞迴語言模型(RLM)、AI 寫 GPU kernel 與多智慧體 swarm。據他介紹,基於 RLM 的 harness 是首個接近解出 ARC-AGI-3 的方案,早於 OpenAI 的 Astra;他還談到 OpenAI 的 1 萬 agent、1300 億輸出 token、約合 4000 萬美元的問題求解實驗。

  7. Apple Machine Learning ResearchAI 評分53

    論文證明離散擴散單步取樣僅能匹配條件獨立位置

    研究證明,離散擴散(含 remasking 與 uniform-state 取樣器)的某一步只有在所寫入位置在已固定 token 條件下相互獨立時,才與訓練分佈一致;任何 per-position 分佈的乘積都無法匹配存在依賴的一組 token。文中指出畫素、音素、詞等常見領域的 token 之間存在固有依賴,而這類取樣器每步會寫入多個 token 位置,每個位置從各自的 per-position 分佈取樣,並依據同一批分佈決定寫入哪些位置。

10月1日星期四 · 4 則

  1. Anthropic Research● 精選AI 評分68

    物理學家用 Claude 打造 BootLoops 科研工具

    理論物理學家 Matthew Schwartz 發布開源工具 BootLoops,把 Claude 當作 LLM 的"挽具",專攻適合當前 AI 的"Claude 形狀"問題。他用 Claude Fable 5 移植並改進散射振幅計算方法,還借 BootLoops 把數學物理技術帶到生態學、群體遺傳學、地質、經濟、語言學等領域,並與各領域專家合作篩選真正有價值的問題。BootLoops 開源,可搭配任意模型使用,但當前 AI 仍無法解決科學中的大多數問題。

9月30日星期三 · 2 則

  1. Latent Space● 精選AI 評分81

    OpenAI DevDay 發布 GPT-6.1 Sol、Dots 與 Agents API

    OpenAI 在 DevDay 上發布 GPT-6.1 Sol、個人助理產品 Dots,以及內建 Computer Use 的 Agents API,開發者可基於與 Codex、ChatGPT 相同的 Computer Use 建置應用。Ari Weinstein 稱 GPT-6.1 Sol 成本是 Astra 的五分之一,用在 Computer Use 上只需七分之一。

  2. Anthropic ResearchAI 評分55

    研究:機器人已能完成美國 34% 工時中的體力任務

    一項基於 O*NET 資料、用 Claude 評估任務暴露度的研究顯示,當今機器人已能完成美國 74% 的體力任務,佔全部工作時間的 34%;機器人與 LLM 合計覆蓋約 80% 的工作時間。但機器人僅在 0.3% 的任務上比人力更具成本競爭力,若價格按過去趨勢下降,40 年後這一比例才到 10%。暴露於機器人的崗位多為男性、低學歷、低薪,如駕駛與倉儲;護理與維修類崗位暴露度低。

9月29日星期二 · 1 則

  1. Simon Willison● 精選AI 評分73

    Anthropic 紅隊:GLM-5.3 在 4% 任務中實現控制流劫持

    Anthropic Frontier Red Team 在內部 Binary Exploitation 基準中隨機抽取 100 個任務評估多個模型:GLM-5.3 在 4% 的試驗裡實現了完整控制流劫持,Claude Mythos Preview 為 6%。此前模型 Claude Opus 4.6 與 GLM-5.2 在這些任務中一次都沒有成功。該團隊認為,GLM-5.3 的成績雖低於 Claude Mythos Preview,但一個有意義的能力門檻已被跨過。

9月25日星期五 · 1 則

  1. Anthropic Research● 精選AI 評分67

    Claude 完成 N=4 超楊-米爾斯九圈振幅計算

    物理學家 Matt von Hippel 向 AI 公司發起挑戰,要求用學術機構級別的算力把 N=4 超楊-米爾斯理論算到九圈,Anthropic 的 Claude 在一個月內完成了。散射振幅通常只算到兩圈,少數到三圈,最精確的預測用到五圈;九圈此前被認為需要遠超學術機構可及的算力。N=4 超楊-米爾斯是振幅學界的玩具模型,不描述真實世界,專門用來檢驗新計算方法。

9月3日星期四 · 1 則

8月2日星期日 · 2 則

  1. X @karpathy● 精選AI 評分67

    Karpathy 用 Opus 5 把《魔戒》首段渲染成 3D 場景

    Karpathy 給 Opus 5 輸入《魔戒》第一段、100 萬 token 預算(約 10 美元),讓它用 three.js 渲染這個故事。Opus 5 執行約 2 小時,寫出 5500 行程式碼,程式化生成了粗糙但可玩的 3D 場景。他指出這類任務沒人願意手工做,但 LLM 有無限耐心,成本近乎免費;同時也暴露 LLM 無法原生高效感知影片或玩遊戲,只能緩慢截圖自查,導致不少瑕疵。

7月21日星期二 · 2 則

  1. X @karpathyAI 評分47

    Karpathy 分享用語音長談餵給 LLM 的工作模式

    Karpathy 說他常用一種「長時間語音漫談」的方式與 LLM 協作:當懶得打字、又需要給模型更多上下文時,就切到 /voice 連續說上約 10 分鐘,內容雜亂、意識流、允許錯別字。他有時會先宣告「已切換到語音識別,抱歉有錯字」,有時把它變成幾輪小訪談。他發現 LLM 很擅長重建這種長而不連貫的漫談,複述出來的思路往往比原話更清晰,從而減少後續糾正。

更早的內容