ORLoopBench: Solver-in-the-Loop Benchmarks for Self-Correction and Behavioral Rationality in Operations Research
About
Operations Research practitioners debug infeasible models through an iterative process: inspecting Irreducible Infeasible Subsystems ( IIS), identifying constraint conflicts, and repairing formulations until feasibility is restored. Existing LLM benchmarks mostly treat OR as one-shot translation from problem descriptions to solver code, omitting this diagnostic loop. We formalize infeasible-model repair as a solver-in-the-loop Markov Decision Process in which each action triggers solver re-execution and IIS recomputation, yielding deterministic, verifiable feedback. We introduce ORLoopBench, a benchmark suite with two components: OR-Debug-Bench releases 5,362 LP/MILP repair instances, while OR-Bias-Bench evaluates closed-form operational decision rationality across inventory settings. Solver-verified RLVR training enables an 8B model to surpass frontier APIs on LP repair (95.3% vs 92.4% RR @5), improves diagnostic behavior, and transfers to MILP repair. The same evaluation exposes semantic drift in whole-model code regeneration: feasible regenerated MILPs can solve the wrong problem. Process-level evaluation with solver oracles enables targeted training for reliable OR self-correction.
Related benchmarks
| Task | Dataset | Result | Rank | |
|---|---|---|---|---|
| Debugging | OR-Debug-Bench (450 stratified samples) | RR100 | 42 | |
| Operations Research Reasoning | OR-BIAS-BENCH ID | Rationality99.9 | 24 | |
| Operations Research Reasoning | OR-BIAS-BENCH OOD | Rationality99.6 | 24 | |
| Rational Ordering Evaluation | OR-BIAS-BENCH 400 samples (In-Distribution) | Bias4.9 | 7 | |
| Rational Ordering Evaluation | OR-BIAS-BENCH OOD 200 samples | Bias0.104 | 7 | |
| Behavioral Rationality Evaluation | OR-Bias-Bench | Bias Difference10.4 | 2 | |
| Iterative Debugging | OR-Debug-Bench | RR@595.3 | 2 |