Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Language Modeling on General Benchmarks (C-Eval, IFEval, MATH-500, LCB, H-Swag, SST-5, CrossNER) (test)

80.2C-Eval Score

Qwen2.5-14B-Ins.

69.90472.57775.2577.923Jun 4, 2026
Updated 1mo ago

Evaluation Results

MethodLinks
2026.06
80.279.680.620.485.954.359.765.8
2026.06
78.979.572.425.592.865.261.568
2026.06
74.548.876.89.324.442.934.244.4
2026.06
73.477.876.634.667.851.555.262.4
2026.06
72.977.17630.190.562.658.166.8
2026.06
70.343.946.53.670.254.349.848.4