| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Multi-shot Audio-Visual Generation | MAVINSet high-fidelity benchmark 1K-sample (test) | FVD231.6 | 11 | |
| Multi-shot Audio-Visual Generation | MAVINSet subjective 20 samples | AVQ36.8 | 11 | |
| Text-to-Audio-Video Generation | MAVINSet 1.0 (test) | FVD231.6 | 3 |