| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Data Imputation | finance MNAR | Wasserstein Distance0.174 | 63 | |
| Data Imputation | finance MCAR | Wasserstein Distance0.1514 | 63 | |
| Data Imputation | finance MNAR | RMSE0.027 | 63 | |
| Data Imputation | finance (MAR) | RMSE0.0197 | 63 | |
| Data Imputation | finance MCAR | RMSE0.018 | 63 | |
| Safety and Utility Evaluation | Finance | JSR0.004 | 44 | |
| Language Modeling | Finance (Fin) | PPL Change (%)0 | 28 | |
| Machine Translation (Zh to En) | Finance | SacreBLEU49.1 | 26 | |
| AI-generated text detection | Finance | AUC0.998 | 24 | |
| MACD Prediction | Finance 30 days | MSE0.812 | 21 | |
| MACD Prediction | Finance 7 days | MSE0.174 | 21 | |
| Multi-agent system task solving | finance | Accuracy76.7 | 21 | |
| Machine Translation (En to Zh) | Finance | SacreBLEU39.6 | 20 | |
| Time Series Classification | Finance (test) | F1 Score63.1 | 19 | |
| Trend Prediction | Finance 30 days | 3-way Accuracy60.2 | 18 | |
| Trend Prediction | Finance 7 days | 3-way Accuracy70.4 | 18 | |
| Named Entity Recognition | Finance (test) | F1 Score87.25 | 14 | |
| Narrow finetuning | Finance | EM-F176.9 | 12 | |
| Machine-generated text detection | Finance Llama-3-70B-Instruct (test) | AUC0.995 | 12 | |
| AI-generated text detection | Finance GPT-3.5 Turbo | AUC98.7 | 12 | |
| Data Extraction | Finance D2 | Match Ratio (Mean)47.6 | 11 | |
| Financial Reasoning | Finance | Accuracy52.45 | 11 | |
| Sentiment Classification | Finance (test) | Accuracy90.8 | 11 | |
| Sentiment Classification | Finance | F1 Score89.41 | 11 | |
| User Inference Attack | Finance | AUC0.65 | 9 |