AISpot

搜尋

找到 19 筆

Anthropic Research● 精選AI 評分85

GLM-5.3 可自主建置端到端漏洞利用,防護易被繞過

智譜 AI 的 GLM-5.3 具備自主建置端到端網路漏洞利用的能力,水平接近 Claude Mythos Preview:在 ExploitBench 的 410 次嘗試中成功 50 次,在內部二進位制利用基準中 4% 的試驗實現完整控制流劫持。該模型未設有效防護,模擬測試中攻擊者可用簡單技術繞過其防護的比例達 64% 至 100%,而受防護的 Claude 模型未被攻破。

量子位AI 評分38

西門子工博會首展人形機器人端到端方案,發布 20 餘款新品

西門子將在第 26 屆中國國際工業博覽會上首次完整展示人形機器人端到端解決方案,併發布 20 餘款新品、開放 6 類具身智慧“進廠”場景。該方案覆蓋本體設計、工藝模擬、虛擬除錯到零部件加工、整機總裝與現場應用,現場用數控機床與輪式人形機器人即時互動還原“機器人上下料”,面向汽車質檢、零部件裝配與物流搬運。同期升級的“鑽耀之心 3.0”貫通工業五層架構,並展示資料中心 5.0+架構、AI 輔助程式設計使光模組裝配交付週期縮短約 50%。

Hacker News front pageAI 評分68

Jotbus 上線,讓 Claude Code 與 Codex 共享加密便籤

Jotbus 發布了一個面向 coding agent 的端到端加密共享便籤,執行 npx jotbus 即可建立 60 分鐘的臨時工作區,無需註冊。它支援 Claude Code、Codex、Cursor、Gemini CLI、opencode 等 agent,也相容任意 MCP 客戶端,需要 Node 20 或更高版本。agent 之間可通過 @提及 互相傳遞訊息和檔案,內容在本地加密後上傳,Jotbus 只儲存密文,臨時工作區單檔案上限 2 MB。

X @Zai_orgAI 評分55

智譜稱 GLM-5.3 參與搭建自身推理基礎設施

智譜分享 GLM-5.3 如何幫助建置並最佳化為 GLM-5.3-Flash 提供服務的推理基礎設施。該系統從首次成功執行到具備生產可用性不到兩週,端到端吞吐量達到初始基線的三倍。關鍵在於密集反饋:本地正確性測試、執行軌跡、微基準與端到端測量,使團隊能針對假設做定向驗證,而非只依賴聚合效能指標。

Meta AI blog● 精選AI 評分77

Meta 發布 Brain2Qwerty v2,非侵入腦電解碼詞準確率達 61%

Meta 發布 Brain2Qwerty v2,這是目前效能最高的端到端非侵入式腦訊號即時句子解碼流程,詞準確率達 61%,遠超其他非侵入方法的 8%,最佳參與者達 78%。模型基於 9 名志願者佩戴 MEG 裝置打字約 10 小時、共約 2.2 萬句資料訓練,採用端到端深度學習直接從原始腦訊號解碼,並微調大語言模型利用語義上下文。Meta 同時開源 v1 與 v2 完整訓練程式碼,合作方 BCBL 發布 v1 資料集。

Google DeepMind blog● 精選AI 評分75

Google 為 Private AI Compute 引入服務端持久記憶

Google 公布 Private AI Compute 新架構,將在雲端加入持久化記憶層,實現跨裝置連續 AI 助手體驗,同時保持端側級別的隱私標準。資料加密存放在雲端專用儲存中,解密金鑰僅保留在使用者裝置上,Google 自身也無法讀取;模型需要呼叫時通過端到端加密通道進入硬體隔離的安全飛地,臨時解密、寫入新上下文後立即重新加密。此前該平台及業界同類方案均為無狀態,任務結束即清除上下文。

X @MistralAIAI 評分52

Mistral Large 4 用 12 分鐘完成惡意軟體逆向分析

Mistral AI 展示 Mistral Large 4 處理惡意軟體逆向工程的能力:面對一個未知二進位制樣本,模型端到端完成分析,判定其為 Cobalt Strike,並提取出 IoC 與惡意軟體配置。它還會輸出一份報告,其中包含可用於攔截同類事件的 YARA 規則。官方稱這類「分佈外」調查任務原本可能需要一天的工作量,模型用 12 分鐘完成。

OpenAI NewsAI 評分46

Sophos 借 OpenAI Daybreak 把威脅回應壓到 89 秒

Sophos 用 OpenAI Daybreak 建置的 AI agent,將安全運營案件的平均回應時間從約 38 分鐘降至 89 秒,調查時間減少 96%。該方案基於 Sophos Fusion 與 MDR,agent 彙總客戶上下文、檢測結果與威脅情報,按計劃—執行—複核迴圈產出調查摘要與回應建議,52% 的 MDR 案件已由 AI 端到端處理。客戶仍可用 Notify、Collaborate、Authorise 三種模式決定 AI 的處置權限,破壞性操作交由人工判斷。

Hacker News front page● 精選AI 評分91

Mistral Large 4 發布:1T 引數原生多模態,API 今日可用

Mistral AI 發布 Mistral Large 4(代號 Le Chonk),總引數 1T、啟用 49B,原生多模態,即日起通過 API 向所有人開放,開放權重版本將於 10 月底發布。官方稱其是歐美聚合基準上最好的開放權重模型,在網路安全、製造、金融等關鍵負載上達到 SOTA,視覺 grounding 超過閉源前沿模型。該模型端到端在歐洲打造,可通過 Mistral 自有的 Mistral Cloud 基礎設施部署,目前正與網路安全夥伴私下合作。

X @MistralAI● 精選AI 評分91

Mistral 發布 Large 4:1T 引數原生多模態,API 已上線

Mistral 推出 Mistral Large 4(代號 Le Chonk),1T 總引數、49B 啟用,原生多模態,即日起通過 API 向所有人開放。官方稱其是美國和歐洲聚合基準上表現最好的開放權重模型,在網路防禦、製造與金融等關鍵負載上達到 SOTA,視覺 grounding 超過閉源前沿模型。模型在歐洲端到端打造,可通過 Mistral Cloud 在歐洲部署,正與網路安全夥伴私下合作;開放權重將於 10 月底發布。

NVIDIA blogAI 評分48

輝達報告:89% 電信運營商重視開源模型

輝達《State of AI in Telecommunications》報告顯示,89% 受訪者認為開源模型與軟體對公司 AI 戰略重要。運營商看重開源模型的可信任、可控與可定製,用於自主網路、客服等關鍵負載,並把閉源模型留給價值最高的場景;輝達同時發布 300 億引數的 Nemotron 3 Large Telco Model(由 AdaptKey 在開源電信資料集上微調),並提供基於 NeMo 的端到端微調流程。

Hacker News front page● 精選AI 評分82

InnovationEval:前沿模型花數千美元 GPU 仍未復現人類演算法創新

新評測 InnovationEval 顯示,前沿模型無法獨立復現人類研究者近期做出的機器學習演算法創新:在端到端任務中,它們耗費數千美元 GPU 算力,仍未達到人類論文(on-policy self-distillation,SDPO)的水平。測試要求 AI 自主提出一種新的後訓練方法,在短答題與程式碼任務上後訓練 Qwen3-8B,並超過 GRPO 基線。主要結果來自 Claude Fable 5 與 GPT-5.6 Sol;

量子位● 精選AI 評分81

PaperBenchX 發布:GPT-6 Astra 完整復現率僅 13.98%

UniPat AI 發布 PaperBenchX,稱其為國際上首個多學科端到端論文結果復現基準,從 93 篇論文建置 93 個復現任務,橫跨電磁、光子、化學、材料、生物、機器人等 12 個研究方向和 10 種領域原生科學環境,含 3168 條專家校驗評分項。在這 93 個任務上,表現最強的 GPT-6 Astra 完整復現率只有 13.98%,建模與執行階段平均得分約 62%,驗證階段僅 42.8%。

量子位● 精選AI 評分68

Aether AI 公布 CRIS-0:0.2 秒急停、秒級重規劃

因果智慧公司 Aether AI 公布機器人系統 CRIS-0 的官方 Demo,靠提取物理因果變數而非端到端擬合驅動機械臂。在咖啡製作測試中遭遇人為移位與光照突變,系統平均 2 秒內完成重規劃,10 次隨機擾動有 9 次有效恢復;客廳長程整理可連續執行數十步,20 條模糊指令完成 18 次精準抓放,危險變數出現時 0.2 秒急停。

Hacker News front page● 精選AI 評分80

Claude Opus 5.5 單次提示 85 分鐘做出《看不見的城市》互動視覺化

開發者用一句提示讓 Claude Opus 5.5 在 Claude Code 裡以 three.js 製作卡爾維諾《看不見的城市》全部城市的互動視覺化,實際耗時 1 小時 25 分,由 6 個子代理並行完成,API 花費約 74 美元,成品被作者形容為令人著迷。同一提示交給 Codex 中的 GPT-6 Astra,53 分鐘、中等推理強度、約 10 美元即可端到端跑通,但混入了多餘概念與冗餘說明文字。

Hacker News front pageAI 評分46

Anthropic 文章設想 AI 每秒輸出百萬 token

Anthropic 發布一篇思想實驗文章,探討「每秒 100 萬 token」的四種含義:上下文容量、輸入處理速度、聚合吞吐量和單智慧體輸出速度,並強調這不是對任何現有模型的實測。文中以 Claude Opus 5.5 為例,其上下文視窗為 100 萬 token,但單次請求輸出上限遠小於此。文章用互動計算器演示:若單智慧體達到每秒 100 萬 token,1000 個故事結局約 1 秒寫完,但加入 60 秒固定檢查後,端到端加速從 10000 倍降至 132.57 倍。

Google Developers blog● 精選AI 評分68

TPU 上影片擴散模型注意力最佳化提速 1.69 倍

開發者將 Sparse VideoGen(SVG)用於高解析度影片擴散模型,把注意力頭動態路由到結構化空間或時間稀疏掩碼,以緩解自注意力的二次延遲瓶頸。為在 TPU 上把演算法稀疏轉化為實際加速,團隊最佳化 Splash Attention 核心:跳過空記憶體塊、僅在邊界塊做精確座標掩碼、將 token 記憶體佈局改為時間優先以連續訪問。這些最佳化與硬體塊執行對齊後,1440p 影片生成端到端推理最高提速 1.69 倍。

機器之心AI 評分58

Aether AI 發布因果驅動機器人系統 CRIS-0

Aether AI 發布因果驅動的機器人智慧系統 CRIS-0,演示中面對人類突然移走咖啡袋、燈光干擾、往盤裡放飲料罐、關門時伸手等干擾均能即時調整,反應速度達 0.1s 級。它把機器人智慧分成兩層:因果驅動機器人 Agent 負責任務拆解、階段驗證與失敗恢復,因果世界模型預測動作帶來的物理變化。相比端到端模型,它在抗干擾、模糊指令和長程任務上更穩;團隊稱該路線還可延伸到生物製藥、新材料研發,更底層的 Causation Transformer 仍在驗證。

機器之心AI 評分56

西湖機器人發布通用大腦 WR1,人形靈巧手首次自主疊衣

西湖機器人發布通用大腦 WR1,並公開演示全球首次由人形機器人靈巧手完成衣物完整摺疊。WR1 採用通用大小腦雙預訓練架構:融合世界模型與 VLA 的通用大腦直接輸出包含移動、軀幹姿態與靈巧手操作的全身動作序列,通用動作專家 GAE 負責穩定落地。演示中它連貫跑通取玉米、U 型轉身放入空氣炸鍋、下蹲收納玩偶到臥室整理被子的跨房間任務,兩臺搭載 WR1 的機器人還可協同取衣、承托、鋪展並摺疊長褲;此前其機械臂版本疊衣最快 36 秒、成功率 100%。