模型發布
Falcon-Emirati-7B 模型發布:基於 Mamba 混合架構,專精阿聯酋阿拉伯語方言
HuggingFace Blog一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Falcon-Emirati-7B 是一款專為阿聯酋阿拉伯語(Emirati Arabic)方言與文化打造的語言模型,旨在彌補現代標準阿拉伯語(MSA)無法準確處理當地日常對話、詩歌與諺語非字面涵義的缺陷。
該模型基於 Falcon-H1-Arabic 的 7B 版本開發,採用 State Space Models(Mamba)與 Transformer 注意力機制並行的混合架構,兼具長序列處理的線性時間效率與長距離依賴的精準度。開發團隊指出,7B 規模能在保留方言細微差異與訓練推理成本之間取得最佳平衡,而 34B 成本過高、3B 則缺乏足夠的理解空間。
針對方言書面語料稀缺的問題,訓練數據結合了三種來源:未經翻譯的阿聯酋本土網站真實語料、關於阿聯酋文化與歷史的 MSA 文本,以及透過專屬詞彙表與語法規則嚴格限制生成的合成數據。團隊透過實驗測試不同的數據混合比例與訓練階段(持續預訓練、SFT 或偏好最佳化),以找出最佳的方言適應配方。
讀原始報導