
An graded deterministically instead of by an judge, with a human gold plan that provably scores 1.0 and 267 tasks that are infeasible by construction — so refusal, not just output quality, is measurable.
articleTangent: An Empirical Study of Testing Practices for LLM-Based Agent ApplicationsRangeet Pan, Tyler Stennett, Divya Sankar, Bridget McGinn, Alessandro Orso, Raju Pavuluri, Saurabh Sinha, Maja Vukovic
articleKNOWPLAN: Knowledge-Driven AI Agents for Smart Degree Pathway PlanningShuheng Cao, Weijia Zhang, Jiaqi Wu, Xiyun Hu, Yat Yang, Juqy Chen, Zhaoxiang Feng
articleCoupling Planning with Episodic Memory in LLM Agents for Software Issue ResolutionJiahao Zhang, Yifan Zhang, Yu HuangChecking sign-in…
Loading comments…