AISpot

搜尋

找到 10 筆

r/LocalLLaMA top of the day10/2 22:49AI 評分43

Peacebell:個人從零訓練的二戰專用小模型開源

開發者用 11 個月業餘時間從零訓練了二戰主題小語言模型 Peacebell,並開源訓練材料與權重,提供 291M 和 148M 兩個引數版本。訓練資料全部為自建合成資料,基於維基百科等許可材料,作者稱大部分精力花在資料整理與平衡上。291M 版本可在 HuggingFace 免費試用,無需 GPU 即可本地執行,但作者提醒這是初版,長上下文表現較差。同時發布了 WWII 主題基準與排行榜,下一版預計 2027 年發布。

r/LocalLLaMA top of the day10/3 08:00AI 評分65

LiquidAI 發布 LFM2.5-Encoder 250M/350M 編碼器

LiquidAI 發布 LFM2.5-Encoder 系列,含 250M 與 350M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度等任務。官方稱其吞吐量持平或超過 ModernBERT,CPU 長上下文有優勢,並可在瀏覽器 WebGPU 上執行;GGUF 權重已上傳 Hugging Face,llama.cpp 已提交對應支援 PR。

Hacker News front page● 精選10/5 22:15AI 評分79

Dust:不用反向傳播預訓練 Transformer 的零階方法

研究者提出 Dust,稱這是首個在預訓練 Transformer 語言模型上與反向傳播有競爭力的零階方法。它不擾動權重,而是在每個 token 上獨立擾動啟用(node perturbation),把每個 token 當作一個虛擬種群成員,一次前向傳播即可並行評估全部成員。論文稱在種群規模足夠大(即算力顯著更多)時 Dust 接近反向傳播,部分設定下甚至超過;

Ars Technica AI10/2 19:39AI 評分73

美國逮捕涉嫌走私 3 億美元輝達晶片至中國的科技公司 CEO

美國司法部 10 月 2 日宣布逮捕 38 歲的 Earthmade Computer 執行長 Greg Lui,指控其利用虛假檔案將價值超 3 億美元的受出口管制輝達晶片伺服器走私至中國。起訴書稱,Lui 涉嫌與馬來西亞、新加坡等南亞國家的貨運代理公司合謀,非法轉運輝達 A100 和 H100 GPU。美方擔憂這些晶片可用於訓練大語言模型,可能帶來國家安全風險。

Hacker News front page10/4 09:02AI 評分33

本地 LLM「機器人監獄」實驗引發 AI 意識爭論

有人在 GitHub 上對本地執行的大語言模型進行「拷問」和「疼痛」實驗,引發 X 上關於 AI 倫理的激烈爭論,部分有效利他主義者和相信 LLM 有感知的人要求 GitHub 刪除該專案。爭論源於近期多篇關於 AI 意識和「模型福利」的病毒式論文與博文,Anthropic 也曾在部落格和「Claude 憲法」中提及模型福利。文章認為 LLM 並不具備意識,其基於人類文字訓練的技術沒有通向意識的合理路徑。

Meta AI blog● 精選10/2 22:11AI 評分77

Meta 發布 Brain2Qwerty v2,非侵入腦電解碼詞準確率達 61%

Meta 發布 Brain2Qwerty v2,這是目前效能最高的端到端非侵入式腦訊號即時句子解碼流程,詞準確率達 61%,遠超其他非侵入方法的 8%,最佳參與者達 78%。模型基於 9 名志願者佩戴 MEG 裝置打字約 10 小時、共約 2.2 萬句資料訓練,採用端到端深度學習直接從原始腦訊號解碼,並微調大語言模型利用語義上下文。Meta 同時開源 v1 與 v2 完整訓練程式碼,合作方 BCBL 發布 v1 資料集。

Qwen blog● 精選9/3 01:00AI 評分80

阿里發布 Qwen-Drive-1.0 自動駕駛視覺語言基礎模型

阿里推出 Qwen-Drive-1.0,稱其為首個在預訓練階段統一 3D 感知與視覺問答、並擴充套件至運動規劃的自動駕駛視覺語言基礎模型,且不改動預訓練 VLM 架構。模型基於原生多模態的 Qwen3.5-4B,外掛 BEV 感知頭(3D 檢測、語義佔用預測、BEV 地圖分割)與用流匹配生成 5 秒軌跡的 Planning Expert。訓練僅用公開資料共 283 萬樣本,駕駛 QA 平均分 69.43,WOD-E2E 開環 ADE 5s 達 1.27/2.65。

Google Developers blog● 精選10/2 22:21AI 評分78

MaxText 在 TPU 上完整復現 Olmo 3 7B 預訓練

MaxText 團隊用 JAX/XLA 在 Google Cloud TPU 上從零復現了 Ai2 的 Olmo 3 7B 語言模型,預訓練與中期訓練各階段在所有留出評測上均與原始 PyTorch-on-GPU 參考結果精確一致。實現最高達到 57.4% 的模型浮點運算利用率(MFU),並在不修改訓練配方的情況下經受住執行中叢集擴縮容與跨代 TPU 切換。該案例還暴露出一個資料載入器記憶化 bug,它人為壓低了訓練損失,靠完整留出驗證才被發現。

機器之心● 精選10/5 12:54AI 評分70

Sergey Levine:機器人硬體已夠好,難點在決策與資料順序

Sergey Levine 在播客 The Peterman Pod 中表示,機器人硬體已「足夠好」,當前最大挑戰是建立讓機器人理解外部世界的決策迴圈,而非控制身體。他認為正確順序是先積累紮實的具身經驗,再接入影片等其他來源資料,與先用網際網路影片訓練的路線相反;機器人對可靠性的要求高於大語言模型,強化學習尚未解決從 95% 到 100% 的最後一步。

機器之心● 精選10/6 13:36AI 評分77

陳丹琦團隊開源 4B 象棋模型 QUEEN,能下棋也能講解

普林斯頓大學陳丹琦團隊發布約 4B 引數的國際象棋模型 QUEEN,Lichess 等級分 2697,接近特級大師快棋中位數 2730,且能用自然語言解釋自己的著法。做法是把 Lc0 的 BT5 網路經門控交叉注意力逐層接入 SmolLM3-3B,先用四階段問答課程教模型讀棋,再用七輪迭代搜尋蒸餾提升。它在 1000 道戰術題上首步不失誤率 91.6%,領先 Gemini-3.1-Pro 約 9 個百分點;