
Multi-turn relational reasoning still sits under 75% for the strongest models, and the diagnostic separates whether a failure came from perception, missing knowledge, or dropped across turns.
articleDiagnostic Foundation for Evaluating LLMs' Research Integrity as Co-ScientistsYash Tripathi, Silu Sharma, Sai Sidhanth Manoharan Jayanthi, Shivank Garg, Lin Li
articleThe Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual ReasoningGarima Arya Yadav, Nilay Yilmaz, Yezhou Yang
articleInter-dimension Dependence for Multi-Dimensional Evaluation of Open-Ended TextHaoyuan Li, Snigdha ChaturvediChecking sign-in…
Loading comments…