TII 發布 Falcon-Emirati-7B,專為阿聯酋方言適配
阿聯酋 TII 發布 Falcon-Emirati-7B,一個基於 Falcon-H1-Arabic 的方言專用模型,目標是用阿聯酋阿拉伯語的理解與生成方式覆蓋詞彙、語氣和文化語境。底座 Falcon-H1-Arabic 採用 Mamba 與 Transformer 注意力並行的混合架構,家族含 3B、7B、34B 三檔,上下文視窗最高 128K 與 256K token。
公開了方言專用模型的完整資料配方:原生方言文字、文化類 MSA 語料與受術語表約束的合成資料三類混用,對關注阿拉伯語模型與方言適配資料策略的開發者有參考價值。
原標題:Falcon-Emirati: When an LLM Learns the Dialect, the Culture, and the Nuance
閱讀原文
| 評分 | 66 / 65(平均 65,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
Cloudflare 將 EuroLLM 與 Apertus 兩個歐洲開源模型接入 Workers AI
Cloudflare 在生日周宣布,將歐洲兩個公共機構訓練的開源模型 EuroLLM 和 Apertus 引入 Workers AI,現已開放訪問申請。EuroLLM 覆蓋 35 種語言,含全部 24 種歐盟官方語言;Apertus 由瑞士 ETH Zurich、EPFL 等開發,訓練資料超 15 萬億 token、覆蓋 1500 多種語言,權重與資料全部公開。Cloudflare 同時啟動面向政府網路安全機構與關鍵基礎設施運營方的實操工作坊,首場 10 月在新加坡舉行。
LiquidAI 發布 LFM2.5-Encoder 250M/350M 編碼器
LiquidAI 發布 LFM2.5-Encoder 系列,含 250M 與 350M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度等任務。官方稱其吞吐量持平或超過 ModernBERT,CPU 長上下文有優勢,並可在瀏覽器 WebGPU 上執行;GGUF 權重已上傳 Hugging Face,llama.cpp 已提交對應支援 PR。
語言判別訓練縮小多語言語音模型與單語模型差距
研究顯示,在相同預訓練資料預算下,多語言自監督語音模型仍落後於單語模型。作者在英語/法語 HuBERT 受控設定中測試兩種強化語言判別的干預,發現可縮小甚至在某些指標上消除這一差距,同時保留大量跨語言共享。
Qwen3.8-Flash-Next 177B 在單張 RTX 5070 上跑出 11-15 tok/s
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
Aleph Alpha 發布開源主權模型 Kolibri,78B 引數 Apache 2.0
德國 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,Apache 2.0 許可,權重已上 Hugging Face。它採用 MoE 架構,總引數 78.1B,每 token 僅啟用 3.46B,支援德語和英語,原生上下文 262,144 token,知識截止 2026 年 6 月 18 日。模型在德國和芬蘭基礎設施上從零訓練,使用 768 塊 NVIDIA B200,訓練約 24 萬億 token,其中德語佔比超五分之一。