搜尋
找到 3 筆;也可以試試 語意搜尋
Hugging Face blog● 精選10/6 07:44AI 評分65
阿聯酋 TII 發布 Falcon-Emirati-7B,一個基於 Falcon-H1-Arabic 的方言專用模型,目標是用阿聯酋阿拉伯語的理解與生成方式覆蓋詞彙、語氣和文化語境。底座 Falcon-H1-Arabic 採用 Mamba 與 Transformer 注意力並行的混合架構,家族含 3B、7B、34B 三檔,上下文視窗最高 128K 與 256K token。
Google Developers blog● 精選10/2 22:21AI 評分78
MaxText 團隊用 JAX/XLA 在 Google Cloud TPU 上從零復現了 Ai2 的 Olmo 3 7B 語言模型,預訓練與中期訓練各階段在所有留出評測上均與原始 PyTorch-on-GPU 參考結果精確一致。實現最高達到 57.4% 的模型浮點運算利用率(MFU),並在不修改訓練配方的情況下經受住執行中叢集擴縮容與跨代 TPU 切換。該案例還暴露出一個資料載入器記憶化 bug,它人為壓低了訓練損失,靠完整留出驗證才被發現。
Qwen blog● 精選9/20 13:00AI 評分80
阿里開源 Qwen-Image-2.1,將文生圖與影像編輯統一到單一模型,視覺生成元件僅 7B 引數,原生支援生成和編輯透明影像。該模型最多可接受 10 張參考圖,支援圈選、塗抹和獨立掩碼三種區域性編輯方式,並提升人像身份與商品一致性。採用混合粒度注意力架構,KV cache 複用輸入影像與編輯指令以降低視訊記憶體佔用,權重已在 GitHub、Hugging Face 和 ModelScope 發布。