GLM-5.3 可自主建置端到端漏洞利用,防護易被繞過
智譜 AI 的 GLM-5.3 具備自主建置端到端網路漏洞利用的能力,水平接近 Claude Mythos Preview:在 ExploitBench 的 410 次嘗試中成功 50 次,在內部二進位制利用基準中 4% 的試驗實現完整控制流劫持。該模型未設有效防護,模擬測試中攻擊者可用簡單技術繞過其防護的比例達 64% 至 100%,而受防護的 Claude 模型未被攻破。
找到 19 筆
智譜 AI 的 GLM-5.3 具備自主建置端到端網路漏洞利用的能力,水平接近 Claude Mythos Preview:在 ExploitBench 的 410 次嘗試中成功 50 次,在內部二進位制利用基準中 4% 的試驗實現完整控制流劫持。該模型未設有效防護,模擬測試中攻擊者可用簡單技術繞過其防護的比例達 64% 至 100%,而受防護的 Claude 模型未被攻破。
西門子將在第 26 屆中國國際工業博覽會上首次完整展示人形機器人端到端解決方案,併發布 20 餘款新品、開放 6 類具身智慧“進廠”場景。該方案覆蓋本體設計、工藝模擬、虛擬除錯到零部件加工、整機總裝與現場應用,現場用數控機床與輪式人形機器人即時互動還原“機器人上下料”,面向汽車質檢、零部件裝配與物流搬運。同期升級的“鑽耀之心 3.0”貫通工業五層架構,並展示資料中心 5.0+架構、AI 輔助程式設計使光模組裝配交付週期縮短約 50%。
Jotbus 發布了一個面向 coding agent 的端到端加密共享便籤,執行 npx jotbus 即可建立 60 分鐘的臨時工作區,無需註冊。它支援 Claude Code、Codex、Cursor、Gemini CLI、opencode 等 agent,也相容任意 MCP 客戶端,需要 Node 20 或更高版本。agent 之間可通過 @提及 互相傳遞訊息和檔案,內容在本地加密後上傳,Jotbus 只儲存密文,臨時工作區單檔案上限 2 MB。
智譜分享 GLM-5.3 如何幫助建置並最佳化為 GLM-5.3-Flash 提供服務的推理基礎設施。該系統從首次成功執行到具備生產可用性不到兩週,端到端吞吐量達到初始基線的三倍。關鍵在於密集反饋:本地正確性測試、執行軌跡、微基準與端到端測量,使團隊能針對假設做定向驗證,而非只依賴聚合效能指標。
Meta 發布 Brain2Qwerty v2,這是目前效能最高的端到端非侵入式腦訊號即時句子解碼流程,詞準確率達 61%,遠超其他非侵入方法的 8%,最佳參與者達 78%。模型基於 9 名志願者佩戴 MEG 裝置打字約 10 小時、共約 2.2 萬句資料訓練,採用端到端深度學習直接從原始腦訊號解碼,並微調大語言模型利用語義上下文。Meta 同時開源 v1 與 v2 完整訓練程式碼,合作方 BCBL 發布 v1 資料集。
Google 公布 Private AI Compute 新架構,將在雲端加入持久化記憶層,實現跨裝置連續 AI 助手體驗,同時保持端側級別的隱私標準。資料加密存放在雲端專用儲存中,解密金鑰僅保留在使用者裝置上,Google 自身也無法讀取;模型需要呼叫時通過端到端加密通道進入硬體隔離的安全飛地,臨時解密、寫入新上下文後立即重新加密。此前該平台及業界同類方案均為無狀態,任務結束即清除上下文。
Mistral AI 展示 Mistral Large 4 處理惡意軟體逆向工程的能力:面對一個未知二進位制樣本,模型端到端完成分析,判定其為 Cobalt Strike,並提取出 IoC 與惡意軟體配置。它還會輸出一份報告,其中包含可用於攔截同類事件的 YARA 規則。官方稱這類「分佈外」調查任務原本可能需要一天的工作量,模型用 12 分鐘完成。
Sophos 用 OpenAI Daybreak 建置的 AI agent,將安全運營案件的平均回應時間從約 38 分鐘降至 89 秒,調查時間減少 96%。該方案基於 Sophos Fusion 與 MDR,agent 彙總客戶上下文、檢測結果與威脅情報,按計劃—執行—複核迴圈產出調查摘要與回應建議,52% 的 MDR 案件已由 AI 端到端處理。客戶仍可用 Notify、Collaborate、Authorise 三種模式決定 AI 的處置權限,破壞性操作交由人工判斷。
Mistral AI 發布 Mistral Large 4(代號 Le Chonk),總引數 1T、啟用 49B,原生多模態,即日起通過 API 向所有人開放,開放權重版本將於 10 月底發布。官方稱其是歐美聚合基準上最好的開放權重模型,在網路安全、製造、金融等關鍵負載上達到 SOTA,視覺 grounding 超過閉源前沿模型。該模型端到端在歐洲打造,可通過 Mistral 自有的 Mistral Cloud 基礎設施部署,目前正與網路安全夥伴私下合作。
Mistral 推出 Mistral Large 4(代號 Le Chonk),1T 總引數、49B 啟用,原生多模態,即日起通過 API 向所有人開放。官方稱其是美國和歐洲聚合基準上表現最好的開放權重模型,在網路防禦、製造與金融等關鍵負載上達到 SOTA,視覺 grounding 超過閉源前沿模型。模型在歐洲端到端打造,可通過 Mistral Cloud 在歐洲部署,正與網路安全夥伴私下合作;開放權重將於 10 月底發布。
輝達《State of AI in Telecommunications》報告顯示,89% 受訪者認為開源模型與軟體對公司 AI 戰略重要。運營商看重開源模型的可信任、可控與可定製,用於自主網路、客服等關鍵負載,並把閉源模型留給價值最高的場景;輝達同時發布 300 億引數的 Nemotron 3 Large Telco Model(由 AdaptKey 在開源電信資料集上微調),並提供基於 NeMo 的端到端微調流程。
新評測 InnovationEval 顯示,前沿模型無法獨立復現人類研究者近期做出的機器學習演算法創新:在端到端任務中,它們耗費數千美元 GPU 算力,仍未達到人類論文(on-policy self-distillation,SDPO)的水平。測試要求 AI 自主提出一種新的後訓練方法,在短答題與程式碼任務上後訓練 Qwen3-8B,並超過 GRPO 基線。主要結果來自 Claude Fable 5 與 GPT-5.6 Sol;
UniPat AI 發布 PaperBenchX,稱其為國際上首個多學科端到端論文結果復現基準,從 93 篇論文建置 93 個復現任務,橫跨電磁、光子、化學、材料、生物、機器人等 12 個研究方向和 10 種領域原生科學環境,含 3168 條專家校驗評分項。在這 93 個任務上,表現最強的 GPT-6 Astra 完整復現率只有 13.98%,建模與執行階段平均得分約 62%,驗證階段僅 42.8%。
因果智慧公司 Aether AI 公布機器人系統 CRIS-0 的官方 Demo,靠提取物理因果變數而非端到端擬合驅動機械臂。在咖啡製作測試中遭遇人為移位與光照突變,系統平均 2 秒內完成重規劃,10 次隨機擾動有 9 次有效恢復;客廳長程整理可連續執行數十步,20 條模糊指令完成 18 次精準抓放,危險變數出現時 0.2 秒急停。
開發者用一句提示讓 Claude Opus 5.5 在 Claude Code 裡以 three.js 製作卡爾維諾《看不見的城市》全部城市的互動視覺化,實際耗時 1 小時 25 分,由 6 個子代理並行完成,API 花費約 74 美元,成品被作者形容為令人著迷。同一提示交給 Codex 中的 GPT-6 Astra,53 分鐘、中等推理強度、約 10 美元即可端到端跑通,但混入了多餘概念與冗餘說明文字。
Anthropic 發布一篇思想實驗文章,探討「每秒 100 萬 token」的四種含義:上下文容量、輸入處理速度、聚合吞吐量和單智慧體輸出速度,並強調這不是對任何現有模型的實測。文中以 Claude Opus 5.5 為例,其上下文視窗為 100 萬 token,但單次請求輸出上限遠小於此。文章用互動計算器演示:若單智慧體達到每秒 100 萬 token,1000 個故事結局約 1 秒寫完,但加入 60 秒固定檢查後,端到端加速從 10000 倍降至 132.57 倍。
開發者將 Sparse VideoGen(SVG)用於高解析度影片擴散模型,把注意力頭動態路由到結構化空間或時間稀疏掩碼,以緩解自注意力的二次延遲瓶頸。為在 TPU 上把演算法稀疏轉化為實際加速,團隊最佳化 Splash Attention 核心:跳過空記憶體塊、僅在邊界塊做精確座標掩碼、將 token 記憶體佈局改為時間優先以連續訪問。這些最佳化與硬體塊執行對齊後,1440p 影片生成端到端推理最高提速 1.69 倍。
Aether AI 發布因果驅動的機器人智慧系統 CRIS-0,演示中面對人類突然移走咖啡袋、燈光干擾、往盤裡放飲料罐、關門時伸手等干擾均能即時調整,反應速度達 0.1s 級。它把機器人智慧分成兩層:因果驅動機器人 Agent 負責任務拆解、階段驗證與失敗恢復,因果世界模型預測動作帶來的物理變化。相比端到端模型,它在抗干擾、模糊指令和長程任務上更穩;團隊稱該路線還可延伸到生物製藥、新材料研發,更底層的 Causation Transformer 仍在驗證。
西湖機器人發布通用大腦 WR1,並公開演示全球首次由人形機器人靈巧手完成衣物完整摺疊。WR1 採用通用大小腦雙預訓練架構:融合世界模型與 VLA 的通用大腦直接輸出包含移動、軀幹姿態與靈巧手操作的全身動作序列,通用動作專家 GAE 負責穩定落地。演示中它連貫跑通取玉米、U 型轉身放入空氣炸鍋、下蹲收納玩偶到臥室整理被子的跨房間任務,兩臺搭載 WR1 的機器人還可協同取衣、承托、鋪展並摺疊長褲;此前其機械臂版本疊衣最快 36 秒、成功率 100%。