
Test-time RL without answer voting or an external judge: the model evolves its own discriminating rubrics and scores rollouts from verdict- likelihoods, reporting ~20-point gains on HealthBench and ResearchQA with OOD transfer.
articleInducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent EvaluationDarragh Quinn, David Dylan, Roisin Healy, Fionn Carroll, Maeve Donnelly, Cormac Sheehan
articleDirect Preference Optimization: Your Language Model is Secretly a Reward ModelRafael Rafailov et al.Checking sign-in…
Loading comments…