
results are almost always reported in English. This measures where extra samples and better selection actually buy accuracy in other languages, which changes how you budget compute for non-English traffic.
articleCommit0 Library Generation From Scratch 2024 12 02
articleLlmcrit Teaching Large Language Models To Use Criteria 2024 03 02
articleSeacrowd A Multilingual Multimodal Data Hub And Benchmark Suite For Southeast Asian Languages 2024 06 14
articleFishing For Magikarp Automatically Detecting Under Trained Tokens In Large Language Models 2024 05 08Checking sign-in…
Loading comments…