
Safety-realignment defenses largely assume you know the attacker's prompt template; without it they degrade badly and realigned models can be re-jailbroken by a system-prompt swap. Distribution-level realignment holds up better.
articleAdversarial Attacks on LLMsLilian Weng
articleWhen Policies Change Probabilities: Modular Decision-Making for LLM Code ReviewRasvik Kudum, Max Corbett, Hitansh Paliwal, Romaisa Fatima, Thomas Jiralerspong, Sneheel Sarangi
articleEven More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent SystemsMarylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh FarnadiChecking sign-in…
Loading comments…