iReasoner: Trajectory-Aware Intrinsic Reasoning Supervision for Self-Evolving Large Multimodal Models
About
Recent work shows that large multimodal models (LMMs) can self-improve from unlabeled data via self-play and intrinsic feedback. Yet existing self-evolving frameworks mainly reward final outcomes, leaving intermediate reasoning weakly constrained despite its importance for visually grounded decision making. We propose iReasoner, a self-evolving framework that improves an LMM's implicit reasoning by explicitly eliciting chain-of-thought (CoT) and rewarding its internal agreement. In a Proposer--Solver loop over unlabeled images, iReasoner augments outcome-level intrinsic rewards with a trajectory-aware signal defined over intermediate reasoning steps, providing learning signals that distinguish reasoning paths leading to the same answer without ground-truth labels or external judges. Starting from Qwen2.5-VL-7B, iReasoner yields up to $+2.1$ points across diverse multimodal reasoning benchmarks under fully unsupervised post-training. We hope this work serves as a starting point for reasoning-aware self-improvement in LMMs in purely unsupervised settings. Our code is available at https://meghanaasunil.github.io/iReasoner.
Related benchmarks
| Task | Dataset | Result | Rank | |
|---|---|---|---|---|
| Visual Question Answering | ChartQA | Accuracy86.9 | 620 | |
| Visual Mathematical Reasoning | MathVista | Accuracy69.74 | 448 | |
| Visual Question Answering | AI2D | Accuracy87.08 | 402 | |
| Visual Question Answering | OK-VQA | Accuracy51.53 | 331 | |
| Visual Mathematical Reasoning | MathVision | Accuracy25.29 | 298 | |
| Visual Question Answering | InfoVQA | Accuracy88.12 | 264 | |
| Visual Question Answering | VQA v2 | Accuracy83.84 | 257 | |
| Multimodal Understanding | MMMU (val) | -- | 211 | |
| Visual Mathematical Reasoning | MathVerse | Accuracy45.91 | 194 | |
| Multimodal Benchmarking | MMBench | Accuracy87.08 | 168 |