| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Multi-modal Reasoning | M3CoT | Accuracy82.68 | 90 | |
| Visual Question Answering | M3CoT | Accuracy61.2 | 71 | |
| Multimodal Reasoning | M3CoT (test) | Total Acc91.61 | 55 | |
| Multimodal Chain-of-Thought Reasoning | M3CoT | Accuracy79.7 | 53 | |
| General Visual Reasoning | M3CoT | Accuracy74.2 | 17 | |
| Visual Question Answering | M3CoT (test) | Language Science Score78.67 | 15 | |
| Multimodal Reasoning | M3CoT | NS Score82.45 | 12 | |
| Multimodal Commonsense Reasoning | M3CoT social-science and social-commonsense sub-topics | Accuracy Change11.99 | 12 | |
| General multimodal reasoning | M3CoT | Pass@1 Accuracy78.21 | 11 | |
| Visual Evidence Quality Evaluation | M3CoT Reasoning (subset of 500 samples) | AIM-CoT Win Rate76.4 | 2 |