
If you run self-improving model loops, capability gains can quietly erode safety behavior; constraining a small mechanistically identified circuit preserved it more cheaply than reward-based penalties.
articleOne Recipe, Many Harnesses: What Self-Evolution Encodes Across Languages and ModelsSiqi Yang, Qianlan Yang, Yu-Xiong Wang, Saurabh Pujar, Martin Hirzel
articleSelf-Evolving Embodied Agents via Skill-Harness EvolutionPeidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li
articleRecursive Self-Improvement for Agents: 7-Check Persistence GateAlphaSignalAIChecking sign-in…
Loading comments…