
Two new multilingual models at 8B and 32B, with the full post-training recipe covering synthetic data routing, preference training, and merging laid out rather than hinted at.
articleBam Just Like That Simple And Efficient Parameter Upcycling For Mixture Of Experts 2024 08 15
articleMultilingual Arbitrage Optimizing Data Pools To Accelerate Multilingual Progress 2024 08 28
articleOne Tokenizer To Rule Them All Emergent Language Plasticity Via Multilingual Tokenizers 2025 05 30
articleInclude Evaluating Multilingual Language Understanding With Regional Knowledge 2024 11 29Checking sign-in…
Loading comments…