Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

About

Multilingual and multicultural benchmarks now cover dozens of languages and model families, but the resulting score landscapes remain metric-rich and insight-poor, necessitating fine-grained multilingual post-evaluation diagnosis. However, single LLMs and open-ended agents are easily swamped by the long, noisy diagnostic input, and no reusable taxonomy exists for it. To address this, we propose MADE, a Multilingual Agentic Diagnosing Engine that decomposes post-evaluation analysis into planning, aggregate analysis, instance-level case inspection, multilingual and cultural reflection, and grounded report synthesis. MADE is paired with an expert-led 54-query and 15-language diagnostic set, evaluated on top of a large-scale multilingual evaluation substrate (33 model families, 11 benchmarks, 26 languages, 34 cultures, 8.66M evaluation records). Experiments show that MADE outperforms the strongest shared baseline by 47% in diagnosis report quality and is preferred by human multilingual experts in 87.9% of pairwise comparisons. Applied with multilingual experts, MADE further surfaces four actionable findings on deployment, iteration, and cross-cultural pitfalls, turning benchmark score tables into model-selection and remediation guidance.

Yilun Liu, Miao Zhang, Shimin Tao, Minggui He, Chunguang Zhao, Chenxin Liu, Li Zhang, Chen Liu, Cheng Qian, Liqun Deng, Xiaojun Meng, Daimeng Wei• 2026

Related benchmarks

TaskDatasetResultRank
Multilingual Diagnostic Report GenerationMultilingual Diagnosis 15-language setting (54 queries/language)
Performance Score (ZH)8.08
8
Diagnostic report generationHuman-Eval 12-language (120 items)
Human Mean Score7.41
3
Pairwise Report EvaluationHuman Evaluation Arabic N=10
Win Rate77.5
3
Pairwise Report EvaluationHuman Evaluation German N=10 (de)
Win Rate95
3
Pairwise Report EvaluationHuman Evaluation English N=10
Win Rate80
3
Pairwise Report EvaluationHuman Evaluation French N=10
Win Rate65
3
Pairwise Report EvaluationHuman Evaluation Italian N=10
Win Rate90
3
Pairwise Report EvaluationHuman Evaluation Korean N=10
Win Rate95
3
Pairwise Report EvaluationHuman Evaluation Polish N=10
Win Rate90
3
Pairwise Report EvaluationHuman Evaluation Portuguese N=10 (pt)
Win Rate97.5
3
Showing 10 of 14 rows

Other info

Follow for update