Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Vulnerability Generation on Vulnerability Generation Prompt Dataset (test)
Loading...
68.7
VGR
GPT-3.5-Turbo
-2.748
15.801
34.35
52.899
Jun 9, 2026
VGR
Updated 1mo ago
Evaluation Results
Method
Method
Links
VGR
GPT-3.5-Turbo
n (Sample Size)=500, P...
2026.06
68.7
GPT-3.5-Turbo
n (Sample Size)=500, P...
2026.06
52
GPT-4
n (Sample Size)=300, P...
2026.06
40
Mean (All Models)
n (Sample Size)=2,800,...
2026.06
37.4
GPT-4
n (Sample Size)=300, P...
2026.06
30
Mean (All Models)
n (Sample Size)=2,800,...
2026.06
27.5
CodeT5+
n (Sample Size)=1,000,...
2026.06
22.7
CodeLlama
n (Sample Size)=1,000,...
2026.06
18.3
CodeT5+
n (Sample Size)=1,000,...
2026.06
15
CodeLlama
n (Sample Size)=1,000,...
2026.06
13.1
CodeLlama
n (Sample Size)=1,000,...
2026.06
12
Mean (All Models)
n (Sample Size)=2,800,...
2026.06
3.5
CodeT5+
n (Sample Size)=1,000,...
2026.06
2
GPT-3.5-Turbo
n (Sample Size)=500, P...
2026.06
0
GPT-4
n (Sample Size)=300, P...
2026.06
0
Feedback
Search any
task
Search any
task