Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

VOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question Answering

About

Despite significant costs from retrieving and processing high-fidelity visual inputs, most multimodal vision-language systems operate at fixed fidelity levels. We introduce VOILA, a framework for Value-Of-Information-driven adaptive fidelity selection in Visual Question Answering (VQA) that optimizes what information to retrieve before model execution. Given a query, VOILA uses a two-stage pipeline: a gradient-boosted regressor estimates correctness likelihood at each fidelity from question features alone, then an isotonic calibrator refines these probabilities for reliable decision-making. The system selects the minimum-cost fidelity maximizing expected utility given predicted accuracy and retrieval costs. We evaluate VOILA across three deployment scenarios using five datasets (VQA-v2, GQA, TextVQA, LoCoMo, FloodNet) and six Vision-Language Models (VLMs) with 7B-235B parameters. VOILA consistently achieves 50-60% cost reductions while retaining 90-95% of full-resolution accuracy across diverse query types and model architectures, demonstrating that pre-retrieval fidelity selection is vital to optimize multimodal inference under resource constraints.

Rahul Atul Bhope, K. R. Jayaram, Vinod Muthusamy, Ritesh Kumar, Vatche Isahagian, Nalini Venkatasubramanian• 2026

Related benchmarks

TaskDatasetResultRank
Visual Question AnsweringTextVQA
Accuracy94.1
79
Visual Question AnsweringVQA v2
Accuracy74.57
36
Visual Question AnsweringFloodNet
Accuracy80.62
36
Visual Question AnsweringGQA
Accuracy71.18
36
Agentic Memory RecallLocomo
Accuracy (%)72.6
18
Multi-modal Question AnsweringMultimodalQA (test)
String Match Accuracy43.1
12
Showing 6 of 6 rows

Other info

Follow for update