
How you phrase repair feedback to a coding matters enormously: concrete counterexamples that show exactly where an artifact fails beat generic 'try again' or error-only feedback by a wide margin in multi-turn self-correction.
articleGrounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test GenerationMichele Tufano, James McClure, Jos\'e Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivan\v{c}i\'c, Livio Dalloro, Pat Rondon
articleTIPCODER: Reinforcement Learning Boosted Test-time Instruction Proposer for Code GenerationMinyu Chen, Sihao Wu, Ling-I Wu, Song Qin, Jingyang Li, Lei Ning, Jianxin Xue, Guoqiang Li
articleAuditing and Decomposing Feedback-Driven Evolution in LLM Test Generation under the Oracle ProblemYunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen NiChecking sign-in…
Loading comments…