Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
GUI Agent Task Completion on WeChat Mini-App Real-World (test)
Loading...
42.28
Success Rate (Human)
code-native-reward (Ours)
36.6952
38.1451
39.595
41.0449
Feb 15, 2026
Success Rate (Human)
Updated 5mo ago
Evaluation Results
Method
Method
Links
Success Rate (Human)
code-native-reward (Ours)
Training Environment=S...
2026.02
42.28
VLM-reward (Ours)
Training Environment=S...
2026.02
41.61
VLM-reward
Training Environment=R...
2026.02
40.94
Base Model
Training Environment=N/A
2026.02
36.91
Feedback
Search any
task
Search any
task