Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

The Culture Funnel: You Can't Align What isn't in the Data

About

Current cultural alignment approaches focus on inference-time interventions, assuming models already contain sufficient cultural knowledge. We argue modern LLM pipelines suffer from a cultural data funnel. Using a multidimensional tagging framework across pretraining, fine-tuning, alignment, and reasoning datasets, we show explicit cultural signals decline sharply during post-training, while geographically concentrated, task-specialized data dominates. Multilinguality enhances geographic diversity of cultural knowledge but does not ensure balanced representation. Our tags improve downstream cultural benchmark performance, demonstrating that advances require shifting focus in training data pipelines. To facilitate future research, we release our culturally tagged dataset with 5.6M samples at https://huggingface.co/datasets/CohereLabs/CultureMarkers.

Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza, Thomas Euyang, Julia Kreutzer, Marzieh Fadaee• 2026

Related benchmarks

TaskDatasetResultRank
Bias EvaluationBBQ
Accuracy6
175
Multilingual General KnowledgeGlobal MMLU Lite (subset of 18 languages)
Accuracy2.3
15
Multilingual Cultural KnowledgeBLEnD average
Accuracy-0.8
4
Multilingual Cultural Preference and DynamicsNormAd average
Accuracy8
4
Multilingual Grade School MathMGSM (average)
Accuracy (MGSM)0.00e+0
4
Showing 5 of 5 rows

Other info

Follow for update