Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

ORLoopBench: Solver-in-the-Loop Benchmarks for Self-Correction and Behavioral Rationality in Operations Research

About

Operations Research practitioners debug infeasible models through an iterative process: inspecting Irreducible Infeasible Subsystems ( IIS), identifying constraint conflicts, and repairing formulations until feasibility is restored. Existing LLM benchmarks mostly treat OR as one-shot translation from problem descriptions to solver code, omitting this diagnostic loop. We formalize infeasible-model repair as a solver-in-the-loop Markov Decision Process in which each action triggers solver re-execution and IIS recomputation, yielding deterministic, verifiable feedback. We introduce ORLoopBench, a benchmark suite with two components: OR-Debug-Bench releases 5,362 LP/MILP repair instances, while OR-Bias-Bench evaluates closed-form operational decision rationality across inventory settings. Solver-verified RLVR training enables an 8B model to surpass frontier APIs on LP repair (95.3% vs 92.4% RR @5), improves diagnostic behavior, and transfers to MILP repair. The same evaluation exposes semantic drift in whole-model code regeneration: feasible regenerated MILPs can solve the wrong problem. Process-level evaluation with solver oracles enables targeted training for reliable OR self-correction.

Ruicheng Ao, David Simchi-Levi, Xinshang Wang• 2026

Related benchmarks

TaskDatasetResultRank
DebuggingOR-Debug-Bench (450 stratified samples)
RR100
42
Operations Research ReasoningOR-BIAS-BENCH ID
Rationality99.9
24
Operations Research ReasoningOR-BIAS-BENCH OOD
Rationality99.6
24
Rational Ordering EvaluationOR-BIAS-BENCH 400 samples (In-Distribution)
Bias4.9
7
Rational Ordering EvaluationOR-BIAS-BENCH OOD 200 samples
Bias0.104
7
Behavioral Rationality EvaluationOR-Bias-Bench
Bias Difference10.4
2
Iterative DebuggingOR-Debug-Bench
RR@595.3
2
Showing 7 of 7 rows

Other info

Follow for update