Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Language-Aware Token Boosting: LLM Language Confusion Reduction Without Tuning

About

Large language models (LLMs) sometimes exhibit language confusion when generating non-English text. Existing approaches typically rely on fine-tuning to mitigate this issue. In contrast, we propose a tuning-free paradigm for reducing language confusion. Within this paradigm, we introduce two methods: Language-Aware Token Boosting (LATB), which applies targeted perturbations to tokens associated with the desired language, and Adaptive Language-Aware Token Boosting (Adaptive-LATB), which dynamically adjusts these perturbations based on the model's confidence in the intended language. Experiments demonstrate that our methods effectively improve multilingual alignment by reducing language confusion, while maintain the summarization quality without requiring any additional fine-tuning. Our code is publicly available. https://github.com/scbdatax/genai-datax-language-aware-token-boosting.

Trapoom Ukarapol, Pakhapoom Sarapat, Nut Chukamphaeng• 2026

Related benchmarks

TaskDatasetResultRank
SummarizationXLSum Korean (test)
ROUGE-27.03
14
SummarizationXL-Sum Arabic (test)
ROUGE-L12.45
12
SummarizationXLSum Japanese (test)
ROUGE-212.95
10
Multilingual SummarizationXL-SUM ru
Token-level Language Confusion0.28
5
Multilingual SummarizationXL-SUM zh
Token-level Language Confusion (%)4.78
5
Multilingual SummarizationXL-SUM ja
Token-level Language Confusion3.51
5
Multilingual SummarizationXL-SUM fr
Token-level Language Confusion (%)11
5
Multilingual SummarizationXL-SUM ko
Token-level Language Confusion3.45
5
Multilingual SummarizationXL-SUM th
Token-level Language Confusion0.38
5
Multilingual SummarizationXL-SUM hi
Token-level Language Confusion0.23
5
Showing 10 of 24 rows

Other info

Follow for update