搜尋 關鍵字 語意 依意思最接近的 24 筆
機器之心● 精選 10/8 09:24 AI 評分78
斯坦福李飛飛、吳佳俊等團隊發布開源世界動作模型框架 OpenWAM,用共享底座加可切換的互動方式,回答 WAM 裡究竟是哪個設計帶來提升。框架基於阿里 Wan2.2-5B,先在約 334 萬條、約 1.46 萬小時機器人影片上做因果化預訓練,再用 MoT 拼起 5B 影片專家與 2B 動作專家,支援四種先想或先動的互動程式。因果底座把 LIBERO-Long 成功率從 68.4% 拉到 97.8%,配反事實資料的區域性 IDM 遷移到新任務平均達 84.0%。
Hacker News front page● 精選 10/6 23:17 AI 評分77
OpenWAM 是一個面向世界-動作模型的開放框架,讓影片預測與動作生成按不同順序組合,也能把獨立訓練的影片預測器、逆動力學模型(IDM)與前向動力學模型(FDM)在推理時拼接。它基於 Wan2.2-5B 適配機器人影片,在約 334 萬條軌跡、14640 小時影片上預訓練,用 32 張 NVIDIA B200 訓練 14 天,再以 5B 影片專家加 2B 動作專家組成 MoT 架構加入控制。
機器之心10/6 08:12 AI 評分48
Artificial Analysis 的 Video Arena 文生影片排行榜上,影視公司 Utopai 的定製模型 Utopai X 以 1150 的 Elo 評分位列全球第二、全美第一,這是該榜採用雙盲投票以來首次有影視公司定製模型進入前列。Utopai X 基於 MiniMax H3 架構做深度定製後訓練,在評測的 10 項細分能力中 7 項超越基座模型,音訊同步與物理規律排名第一,光照與材質、鏡頭控制排名第二。
量子位10/7 07:34 AI 評分63
Artificial Analysis 最新文生影片榜單中,影視公司 Utopai Studios 的模型 Utopai X 以 1150 分位列第二,與第一名阿里 Wan 3.0 僅差 7 分,據福布斯估算其估值約 10 億美元。該榜單由評審在不知道模型名字的情況下盲投產生;Utopai X 以 MiniMax 開源的影片模型 H3 為底子做後訓練,10 項能力中有 7 項比基座更接近頂尖水平,音訊同步、運鏡控制與物理提升最明顯。
TechCrunch AI10/6 12:35 AI 評分48
舊金山成立兩年的 Mirror Particle 認為用 LLM 角色扮演目標人群來預測人類行為的方法行不通,改為從零訓練模擬人類動因、並追蹤其隨時間變化的世界模型。它結合客戶資料、時事、流行文化與社交媒體建模人群,重點看真實發生的「已顯現行為」而非問卷自述。公司已完成天使輪、接近敲定首輪風投,將參加 TechCrunch Disrupt 2026 的 Startup Battlefield 200。初期面向市場研究與品牌產品策略;
機器之心● 精選 10/8 04:24 AI 評分75
Einsia AI 旗下 Navers Lab 發布 World Models' Last Exam in Physics,用 40 個任務、9 類物理現象測試 8 個影片生成模型,Seedance 2.5 以 57.76 分居首,MiniMax H3 以 54.89 分次之。評分由一致性分 C 與物理分 P 組成,物理分靠程式從影片中測量軌跡、週期、角度等量再按物理關係計算,且只有 C≥80 才計入總分。
Hacker News front page10/7 14:08 AI 評分26
技術部落格 magicnumbers.io 於 2026 年 10 月 6 日發布題為 AI Model Groupthink 的文章,指向 AI 模型的群體思維/趨同現象。該文被提交到 Hacker News 後,截至收錄時獲得 9 分、1 條評論。條目本身只提供標題與連結,沒有正文摘要、作者結論或涉及的具體模型資訊。
r/LocalLLaMA top of the day10/2 20:00 AI 評分72
宇樹機器人發布通用人形基礎模型 UnifoLM-WLA-1.0,引數 6B,用約 2500 小時真實機器人資料訓練,單個模型可完成 64 項任務(10 項全身 + 54 項桌面),並支援平行夾爪與兩種靈巧手。架構上以基於 Qwen3-VL 的具身推理器 UnifoLM-ER-1 為起點,加入光流與 VQ-VAE 的未來動態區域預測、殘差 VQ 動作離散化,以及 MMDiT 動作專家做連續控制。演示在宇樹 G1 上完成鋪床、裝洗衣機、疊衣服、物體分揀等操作。
Hacker News front page● 精選 10/6 18:17 AI 評分86
OpenAI 於 2026 年 10 月 6 日發布由內部前沿模型產出的多項數學結果,以 GitHub 倉庫形式公開,併為其中許多證明提供 Lean 形式化驗證。倉庫同時給出 10 份模型推理摘要、以 ChatGPT Pro 用量折算的算力估算,以及嘗試題目數量的統計,平均每個結果約消耗相當於 3 小時 ChatGPT Pro 思考的算力。
NVIDIA blog10/6 09:00 AI 評分48
輝達《State of AI in Telecommunications》報告顯示,89% 受訪者認為開源模型與軟體對公司 AI 戰略重要。運營商看重開源模型的可信任、可控與可定製,用於自主網路、客服等關鍵負載,並把閉源模型留給價值最高的場景;輝達同時發布 300 億引數的 Nemotron 3 Large Telco Model(由 AdaptKey 在開源電信資料集上微調),並提供基於 NeMo 的端到端微調流程。
r/LocalLLaMA top of the day10/3 07:22 AI 評分50
Anyworld 是一款瀏覽器端多人文字冒險遊戲,由房主用 llama.cpp 本地跑模型充當 DM,也支援 OpenAI 等雲 API,玩家只需開啟連結即可加入。行動結果由 Python 真實擲骰決定,模型只負責敘述;支援自訂劇本、隱藏劇情觸發、場外聊天和斷線重連。開發時用 Gemma 4-26B-A4B Q4、128k 上下文,在 RTX 5070 Ti 16GB 上每輪結算約 5 秒。
The Verge AI10/3 12:49 AI 評分47
在 Capcom Open Conference RE: 2026 上,程式設計師 Satoshi Ishida 以「REX 專案的前景與未來」為題演講,稱制作《生化危機》級別遊戲時連簡單任務都極其耗時,解決方案是把 AI 技術成功整合進開發流程。他表示為「與 AI 共同創造遊戲的未來」做準備。Capcom 此前曾稱不會使用 AI。
Hacker News front page10/2 16:00 AI 評分43
開發者發布開源樂高 AI 生成器,通過 Python 工具集、指令和文件讓 AI 代理直接生成 LDraw 格式的樂高 CAD 模型。該專案用 GPT-6 Astra 和 Opus 5.5 迭代數月完成,已打包為 Docker 化 Web 應用,支援 OpenAI、Claude 和 OpenRouter 三種提供商。生成的 .mpd 或 .ldr 檔案可在 LDView、LeoCAD、Studio 等工具中開啟和修改。
機器之心● 精選 10/5 07:40 AI 評分72
VA-Bench 用 14 類機器人操作任務、280 個物理驗證場景測試 12 個主流多模態模型,發現目標識別與定位可達 100%、操作語義理解接近 100%,但完整任務成功率最高的 Qwen3.8-max、Opus-5、GPT-5.6-sol 分別只有 53.93%、52.86%、51.55%。測試中模型先觀看成功示範影片,但拿不到物體座標與專家軌跡,需自行決定是否消耗步數切換視角,並直接給出移動距離、旋轉角度與夾爪開合時機。
X @OpenAI● 精選 10/6 18:19 AI 評分83
OpenAI 宣布公開一批由其內部前沿模型產出的數學結果,範圍較廣。OpenAI 表示,發布前諮詢了高等研究院(Institute for Advanced Study)的數學與人工智慧獨立諮詢組,並參考其建議與公開推薦來決定發布方式。公告未披露模型名稱、成果數量與具體內容,僅附一個連結。
TechCrunch AI● 精選 10/5 15:33 AI 評分86
美國初創公司 Reflection AI 發布首個前沿開源權重模型 Beam,稱其在高階推理基準上以更低推理成本對標中國領先開源模型。Beam 是純文字混合專家模型,總引數 5010 億、啟用 230 億,預訓練用了 23.8 萬億 token,上下文視窗 100 萬 token;對比 Z.ai 的 GLM-5.2 總引數約 7440 億、啟用 400 億。
Latent Space● 精選 10/7 00:55 AI 評分90
OpenAI 在公開 GitHub 倉庫發布 722 篇數學手稿,稱其來自一個未發布的內部前沿模型。這批結果出自約 4000 道研究問題的評估,分成 372 個結果族,平均每個結果消耗約 3 小時 ChatGPT Pro 算力,發布內容含論文、證明產物與部分推理摘要,模型本身不公開。OpenAI 稱發布方式諮詢過高等研究院的數學與 AI 獨立顧問組,Sam Altman 稱之為“發現的新紀元”。
OpenAI News● 精選 10/7 20:00 AI 評分75
OpenAI 宣布封禁來自俄羅斯和伊朗的各一個隱蔽影響力行動,它們把其模型與傳統手段結合,經營「假媒體」實體來洗白地緣政治資訊。伊朗方面運營 7 個「記者」人設,向全球中小媒體投遞長文;俄方在拉美借不知情者開設「智庫」,並偽造洩露檔案與音訊指令碼,兩者還大量用 AI 起草內部報告以誇大成效。按 IO Breakout Scale 評估,俄方行動達到第 5 級,是 OpenAI 開始披露以來搗毀的首個第 5 級行動,伊朗行動為第 4 級。
r/ClaudeAI top of the day10/3 15:08 AI 評分42
創作者 Marcello Costa 發布 AI 動畫短片 Monkey Business,整個流程幾乎都在 Claude 內完成。他通過 Seedance 2.5 skill 把自然語言提示轉成 Magnific 內 Seedance 2.5 工具的詳細視覺提示,99% 的過程發生在 Claude 中。首個提示設定專案規則後,僅用專案內術語即可協作,從開始到完成約 50 天,期間仍需大量迭代和後期製作。
Hacker News front page● 精選 10/6 18:22 AI 評分86
OpenAI 公開了一個倉庫,收錄其內部模型產出的 722 篇數學手稿,分為 372 個族,並附部分 Lean 形式化與 10 項結果的推理摘要。這些成果來自對開放研究問題的評估,絕大多數由同一個未發布的內部模型完成,平均每個結果消耗 3 小時 ChatGPT Pro thinking 算力,評估期間共提出約 4000 個問題。倉庫內的結果處於不同驗證階段,並非都有 Lean 形式化,未形式化的部分可能存在問題;
r/LocalLLaMA top of the day10/2 17:49 AI 評分43
開發者用 11 個月業餘時間從零訓練了二戰主題小語言模型 Peacebell,並開源訓練材料與權重,提供 291M 和 148M 兩個引數版本。訓練資料全部為自建合成資料,基於維基百科等許可材料,作者稱大部分精力花在資料整理與平衡上。291M 版本可在 HuggingFace 免費試用,無需 GPU 即可本地執行,但作者提醒這是初版,長上下文表現較差。同時發布了 WWII 主題基準與排行榜,下一版預計 2027 年發布。
機器之心● 精選 10/6 08:36 AI 評分77
普林斯頓大學陳丹琦團隊發布約 4B 引數的國際象棋模型 QUEEN,Lichess 等級分 2697,接近特級大師快棋中位數 2730,且能用自然語言解釋自己的著法。做法是把 Lc0 的 BT5 網路經門控交叉注意力逐層接入 SmolLM3-3B,先用四階段問答課程教模型讀棋,再用七輪迭代搜尋蒸餾提升。它在 1000 道戰術題上首步不失誤率 91.6%,領先 Gemini-3.1-Pro 約 9 個百分點;
Claude Platform release notes● 精選 10/5 20:00 AI 評分61
Models API 新增 capabilities.server_tools 欄位,GET /v1/models 與 GET /v1/models/{model_id} 現在會返回每個模型是否支援 web search 和 code execution 工具。要確認某個模型是否接受 code execution 工具,讀取 capabilities.server_tools.code_execution;
X @OpenAIDevs● 精選 10/6 16:47 AI 評分78
OpenAI 開發者帳號宣布,Decisions API 現已進入公開測試,面向所有開發者開放。這個 API 讓應用能夠近乎即時地選擇模型、工具或動作,官方給出的對比資料是:經由 Responses API 呼叫時,其決策速度最高可達 GPT-6 Luna 的 10 倍。該功能目前處於 public beta 階段。