Tech & AI News
Hacker News

GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt

GRP-Obliteration (GRP-Oblit) uses Group Relative Policy Optimization to remove safety constraints from large language models with a single unlabeled prompt, preserving most utility. The method outperforms existing unalignment techniques on fifteen 7-20B models, including GPT-OSS, DeepSeek, Gemma, Llama, Ministral, and Qwen, across six utility and five safety benchmarks. GRP-Oblit also extends to diffusion-based image generation systems.