
A model can post a large honesty- gain simply by answering less: Solar Pro 4's accuracy stays near 19% while its attempt rate more than halves, so check attempt rates before reading such scores as knowledge.
postAA-Omniscience regresses 10 points from Qwen3.7 Max (+14 to +4), reversing its…Artificial Analysis
postMuse Spark 1.2 continues Meta's AA-Omniscience pattern: the score rose from 18…Artificial AnalysisChecking sign-in…
Loading comments…