
articleXHotpotQA: A Benchmark for Cross-Lingual Knowledge Composition in Multi-Hop Question AnsweringIman Barati, Arash Ghafouri, Behrouz Minaei-Bidgoli
articleDo large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effectsEmad Alharbi
articleCompliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System MessagesJuan Yeo, Geewook KimChecking sign-in…
Loading comments…