聯想天禧 TianxiCode 登頂 SWE-bench-Live,問題解決率 71%
聯想天禧 AI 自研程式碼智慧體框架 TianxiCode 配合 DeepSeek-v4.1-Flash,在 SWE-bench-Live(Lite 分榜)以 71% 的問題解決率位列全球第一,並通過官方 Verified 核驗。該評測基於真實 GitHub 專案問題與可復現執行環境,官方會審查全鏈路智慧體執行軌跡並排查答案、測試用例洩露。
原標題:联想天禧自研代码智能体TianxiCode斩获SWE-bench-Live全球第一
閱讀原文
| 評分 | 45 / 48(平均 46,門檻 65) |
|---|---|
| 狀態 | 未入選 |
相關報導
Airbnb 稱 60% 程式碼由 AI 編寫,半數客服工單由 AI 解決
Airbnb CTO Ahmad Al-Dahle 披露,公司目前 60% 的程式碼由 AI 生成,功能交付量同比增加近 80%,工程師人均 PR 吞吐量提升約 1.6 倍;約一半客服工單已完全由 AI 處理,與 Q2 財報中近 45% 的數字一致。內部上下文圖譜 Everest 幫助雜貨配送服務在 8 至 9 個月內上線,機場接送僅用約 6 周。Airbnb 採用多模型策略,至少部署 10 個定製模型,主要在開源模型上做後訓練和強化學習。
OpenCode v1.18.35 發布:修復 xAI 工具結果圖片傳遞
OpenCode 發布 v1.18.35,核心改進是新增 canonical redirects,並提供 JSON 與 Markdown 兩種格式的 agent 可讀統計資料。本次修復讓 xAI 的工具呼叫結果可以攜帶受支援的圖片,不支援的圖片格式會被跳過,做法是把 @ai-sdk/xai 升級到 3.0.139。文件方面,Zen 文件新增 Fledge Alpha Free,生態外掛列表加入 opencode-supabase,該版本同時致謝 3 位社群貢獻者。
DeepSeek Harness 更新,加入 Claude Code Mods 相容層
DeepSeek Harness 發布 v0.2.1-alpha.1,新增實驗性 Claude Code Mods 相容層,讓按 Claude Code Mods 介面編寫的擴充套件有機會接入 DSH 外掛系統執行。官方稱該相容層主要用於驗證 Mods API 能力,大致屬於 DSH 外掛能力的子集,暫不提供完整實用相容性;diff、agents-md、sec-default 和 telemetry 仍標註為不可執行。
開發者復盤 vibecoding:上手刺激但缺少手寫程式碼的成就感
一位開發者撰文稱,AI 輔助程式設計(vibecoding)只把樂趣前置:能快速做出可用原型,但重構和維護階段不再有趣,也缺少手寫程式碼帶來的成就感。他把建造的樂趣分為六種,認為 vibecoding 只能滿足「想到點子」「把點子變成現實」和「解決自己的問題」三類,攻堅後的成就感、作品完成的滿足感與學習樂趣都不會自然產生。他仍用 AI 做出了一些手工做不出來的東西,包括即時野火預警系統、Kobo 資料庫遷移助手和即時音準訓練應用,但表示過程不像自己寫小指令碼那樣好玩。
PaperBenchX 發布:GPT-6 Astra 完整復現率僅 13.98%
UniPat AI 發布 PaperBenchX,稱其為國際上首個多學科端到端論文結果復現基準,從 93 篇論文建置 93 個復現任務,橫跨電磁、光子、化學、材料、生物、機器人等 12 個研究方向和 10 種領域原生科學環境,含 3168 條專家校驗評分項。在這 93 個任務上,表現最強的 GPT-6 Astra 完整復現率只有 13.98%,建模與執行階段平均得分約 62%,驗證階段僅 42.8%。