Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

iReasoner: Trajectory-Aware Intrinsic Reasoning Supervision for Self-Evolving Large Multimodal Models

About

Recent work shows that large multimodal models (LMMs) can self-improve from unlabeled data via self-play and intrinsic feedback. Yet existing self-evolving frameworks mainly reward final outcomes, leaving intermediate reasoning weakly constrained despite its importance for visually grounded decision making. We propose iReasoner, a self-evolving framework that improves an LMM's implicit reasoning by explicitly eliciting chain-of-thought (CoT) and rewarding its internal agreement. In a Proposer--Solver loop over unlabeled images, iReasoner augments outcome-level intrinsic rewards with a trajectory-aware signal defined over intermediate reasoning steps, providing learning signals that distinguish reasoning paths leading to the same answer without ground-truth labels or external judges. Starting from Qwen2.5-VL-7B, iReasoner yields up to $+2.1$ points across diverse multimodal reasoning benchmarks under fully unsupervised post-training. We hope this work serves as a starting point for reasoning-aware self-improvement in LMMs in purely unsupervised settings. Our code is available at https://meghanaasunil.github.io/iReasoner.

Meghana Sunil, Manikandarajan Venmathimaran, Muthu Subash Kavitha• 2026

Related benchmarks

TaskDatasetResultRank
Visual Question AnsweringChartQA
Accuracy86.9
620
Visual Mathematical ReasoningMathVista
Accuracy69.74
448
Visual Question AnsweringAI2D
Accuracy87.08
402
Visual Question AnsweringOK-VQA
Accuracy51.53
331
Visual Mathematical ReasoningMathVision
Accuracy25.29
298
Visual Question AnsweringInfoVQA
Accuracy88.12
264
Visual Question AnsweringVQA v2
Accuracy83.84
257
Multimodal UnderstandingMMMU (val)--
211
Visual Mathematical ReasoningMathVerse
Accuracy45.91
194
Multimodal BenchmarkingMMBench
Accuracy87.08
168
Showing 10 of 29 rows

Other info

Follow for update