
Reward design over tool choice, argument quality, and JSON validity moved a compact open model from 70.8% to 81.2% on held-out . This provides a worked template for post-training an on evidence-seeking rather than plausible-looking answers.
articleSERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement LearningJianze Wang, Kunwang Zheng, Ying Liu, Yu Cao, Qilong Zhang, Jinlong Chen, Hua Yang, Qianglong Chen
videoRL Without Verifiable Rewards (Will Brown, Prime Intellect)AI Engineer
articlePutting Task Expertise Into RlThinking Machines editorial sitemapChecking sign-in…
Loading comments…