BabelSteering: Multilingual Safety Alignment via English Steering Vectors
Large language models (LLMs) are deployed globally in high-stakes settings, yet most safety research and alignment efforts remain concentrated on English. Thus, users interacting with LLMs in other languages may encounter weaker safeguards despite relying on the same systems for similarly sensitive tasks. In this work, we investigate whether safety signals learned from a high-resource language, like English, can improve multilingual safety. We propose BabelSteering, an activation steering method that acts as a lightweight inference- time intervention, using refusal directions derived from Engl
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- PossiblePossibly related (embedding) · 56%A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models - Apple Machine Learning Research →
- PossiblePossibly related (embedding) · 53%Large Language Models Are Still Getting Stronger, but Researchers Face New Bottlenecks in Data, Evaluation, and Safety | Newswise - Newswise →
- LinkedLinked via arxiv author · 85%Emma V. Stein →
“BabelSteering: Multilingual Safety Alignment via English Steering Vectors”
- LinkedLinked via arxiv author · 85%Dominik Meier →
“BabelSteering: Multilingual Safety Alignment via English Steering Vectors”
- LinkedLinked via arxiv author · 85%Terry Ruas →
“BabelSteering: Multilingual Safety Alignment via English Steering Vectors”
- LinkedLinked via arxiv author · 85%Jan Philip Wahle →
“BabelSteering: Multilingual Safety Alignment via English Steering Vectors”
- LinkedLinked via arxiv author · 85%Bela Gipp →
“BabelSteering: Multilingual Safety Alignment via English Steering Vectors”
- PossiblePossibly related (embedding) · 50%Safety and security of large language models in healthcare - Nature →
