| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| A-EQA | Human Agent | Overall (LLM-Match)85.1 | 33 | 1mo ago | |
| OpenEQA v1.0 (test) | CoV | LLM-Match67.7 | 32 | 4mo ago | |
| OpenEQA | Accuracy69.3 | 26 | 1mo ago | ||
| OpenEQA EM-EQA | Accuracy86.8 | 24 | 22d ago | ||
| Episodic Memory EQA (EM-EQA) | LLM Match86.8 | 19 | 3mo ago | ||
| BridgeEQA 1,100 QA pairs (test) | EMVR VLM w/ Images + SG | Answer Correctness64.8 | 15 | 3mo ago | |
| BridgeEQA (test) | EMVR VLM w/ Images + SG | Image Citation Relevance88.9 | 15 | 3mo ago | |
| FG-EQA | ScoutVLA-Pi05 | QAS (Score)3.91 | 14 | 1mo ago | |
| HM-EQA | QwenNav-8B | Steps0.15 | 14 | 1mo ago | |
| RoboVQA | Tarsier2 | BLEU-177.1 | 13 | 4mo ago | |
| AVS-ProcTHOR | Existence Accuracy93.02 | 12 | 22d ago | ||
| A-EQA 1.0 (test) | MetaNav | LLM-Match58.3 | 10 | 3mo ago | |
| OpenEQA EM-EQA Episodes up to 32 frames | LLM-Match Score86.8 | 10 | 4mo ago | ||
| MT-HM3D | QwenNav-8B | Steps0.19 | 10 | 1mo ago | |
| OpenEQA (test) | GPT-4 Score86.8 | 10 | 3mo ago | ||
| EgoTaskQA (test) | Exact Match80 | 10 | 4mo ago | ||
| OpenEQA EM-EQA | Human | LLM-Match86.8 | 8 | 4mo ago | |
| PersonEQA | HUMEMBR | Total Accuracy75.41 | 7 | 25d ago | |
| A-EQA 184 (subset) | 3D-Mem | LLM-Match52.6 | 7 | 4mo ago | |
| NaVQA | Graph Memory | Response Latency (s)9.97 | 6 | 3mo ago | |
| 10-drone scenario simulation | MCPA | EQA Accuracy95.35 | 6 | 3mo ago | |
| A-EQA 184-question subset | HGR | LLM-Match55.9 | 6 | 3mo ago | |
| EXPRESS-Bench | QwenNav-8B | LLM Score79.27 | 6 | 1mo ago | |
| NiEH EQA (test) | LGT | Accuracy56.34 | 6 | 4mo ago | |
| DynHiL-EQA (Static) | DIVRR | Accuracy58.2 | 5 | 4mo ago |