Auditing Cross-Lingual Fairness in Language Model Watermarking
Watermarking schemes for large language model output are evaluated almost exclusively on English text using each scheme's detection threshold and a narrow set of quality measurements. Multilingual deployment exposes evaluation-design choices that are inconsequential on English but determine conclusions cross-lingually. We propose an evaluation framework with four components: detection thresholds calibrated empirically per deployment context, a threshold-independent companion measurement that distinguishes calibration failures from detection failures, three disjoint quality measurement paradigm
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- PossiblePossibly related (embedding) · 49%Large Language Models Are Still Getting Stronger, but Researchers Face New Bottlenecks in Data, Evaluation, and Safety | Newswise - Newswise →
- PossiblePossibly related (embedding) · 48%Can Large Language Models Capture Human Risk Preferences? - Mirage News →
- LinkedLinked via arxiv author · 85%Alexander Nemecek →
“Auditing Cross-Lingual Fairness in Language Model Watermarking”
- LinkedLinked via arxiv author · 85%Osama Zafar →
“Auditing Cross-Lingual Fairness in Language Model Watermarking”
- LinkedLinked via arxiv author · 85%Debargha Ganguly →
“Auditing Cross-Lingual Fairness in Language Model Watermarking”
- LinkedLinked via arxiv author · 85%Vikash Singh →
“Auditing Cross-Lingual Fairness in Language Model Watermarking”
- LinkedLinked via arxiv author · 85%Vipin Chaudhary →
“Auditing Cross-Lingual Fairness in Language Model Watermarking”
- LinkedLinked via arxiv author · 85%Erman Ayday →
“Auditing Cross-Lingual Fairness in Language Model Watermarking”
