
present in the tokenizer but barely seen during training make models behave erratically when they appear in input. This detects them automatically in any model, which matters for robustness and for anything processing untrusted text.
articleCommit0 Library Generation From Scratch 2024 12 02
articleLlmcrit Teaching Large Language Models To Use Criteria 2024 03 02
articleSeacrowd A Multilingual Multimodal Data Hub And Benchmark Suite For Southeast Asian Languages 2024 06 14
articleBpe Stays On Script Structured Encoding For Robust Multilingual Pretokenization 2025 05 30Checking sign-in…
Loading comments…