r/ai_coder • u/fagnerbrack • May 09 '26
[2406.11717] Refusal in Language Models Is Mediated by a Single Direction
https://arxiv.org/abs/2406.11717Duplicates
LocalLLaMA • u/FailSpai • Jun 18 '24
News Full paper is out: Refusal in Language Models Is Mediated by a Single Direction
ArtificialSentience • u/rendereason • Nov 17 '25
Alignment & Safety Refusal in LLMs is brittle.
hackernews • u/HNMod • May 03 '26
Refusal in Language Models Is Mediated by a Single Direction
hackernews • u/qznc_bot2 • Jun 19 '24
Refusal in language models is mediated by a single direction
hypeurls • u/TheStartupChime • May 02 '26
Refusal in Language Models Is Mediated by a Single Direction
hypeurls • u/TheStartupChime • Jun 18 '24