搜尋
依意思最接近的 8 筆
Hacker News front page10/8 12:20AI 評分72
StepFun 的旗艦模型 Step 5 Preview 已在 OpenRouter 上線,採用稀疏 MoE 架構(啟用 27B、總引數 600B),支援 100 萬 token 上下文,主打跨大型程式碼庫與文件的多步 agentic 任務,於 2026 年 10 月 8 日發布。定價為每百萬 token 輸入 1 美元、輸出 2.70 美元,快取命中率約 93.5%,實際加權平均輸入價約 0.096 美元。
量子位10/7 22:15AI 評分37
階躍終端將於 10 月 13 日在上海舉辦“Ready Builder One”發表會,推出首款大模型原生智慧體手機 STEPX Neo。據官方資訊,該機在模型、系統、硬體層面均為智慧體原生打造,發表會還將公布階躍終端在生態合作方面的最新進展。
X @sama10/1 15:18AI 評分25
OpenAI CEO Sam Altman 在 2026 年 10 月 1 日發帖表示,使用者應當能夠在任何需要的地方使用自己的 AI 訂閱。該表態未說明具體產品、實施方式或時間表,也未提及是否涉及跨平台或第三方應用。
Hugging Face blog● 精選10/3 18:56AI 評分75
微軟聯合 Hugging Face 推出 ThinkingBox 基準,通過 Hugging Face 提供,不看 agent 的回覆文字和工具呼叫,只檢查它留在後端資料庫裡的最終狀態與副作用,每個任務重複跑 20 次。在 507 個有狀態業務流程、12 個模型、121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨收尾且無工具報錯。
Hugging Face blog● 精選10/2 11:19AI 評分70
Ai2 開源了 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,已作為 Asta 的 Fast 模式上線。官方稱 Fast 模式平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式 178.5 秒快約 3.5 倍。模型權重、訓練資料與範例工作流一併開放,機構可在自有基礎設施上本地生成報告。
Hugging Face blog10/2 00:01AI 評分58
ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。
r/ClaudeAI top of the day10/3 13:49AI 評分63
一位使用者僅向 Opus 5.5 提供創意、工作資料夾和音樂檔案,模型便自主完成了從調研到成片的全流程。它檢索了四年 AI 發展資料與素材,擷取文章和介面截圖,編寫 HTML 與動畫程式碼,用 Playwright 渲染畫面、FFmpeg 合成並加入音效,最終輸出完整影片。
Hacker News front page10/2 17:25AI 評分71
Ai2 於 2026 年 10 月 2 日開源 AstaBrief 8B,一個把研究問題與檢索文獻片段轉成帶引用報告的模型,基於 Qwen3-8B 訓練,採用 SFT 加 DPO 而非強化學習。它已作為 Asta 的 Fast 模式上線,與 Claude 驅動的 Thinking 模式並列,整條流水線平均每份報告 51.1 秒,比 Thinking 模式的 178.5 秒快約 3.5 倍。