Contamination detection on BenchMarker
71.2AccuracyGoogle + GPT-5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Google + GPT-5Search API=Google, LLM Backbone=GPT-52026.02 | 71.2 | 67.7 | 43.6 | |
| Google + Gemini ProSearch API=Google, LLM Backbone=Gemini Pro2026.02 | 69.9 | 65 | 41.3 | |
| Google + Claude SonnetSearch API=Google, LLM Backbone=Claude Sonnet2026.02 | 69 | 63.6 | 39.7 | |
| Serper + GPT-5Search API=Serper, LLM Backbone=GPT-52026.02 | 67.6 | 64.5 | 35.6 | |
| Perplexity + GPT-5Search API=Perplexity, LLM Backbone=GPT-52026.02 | 64.2 | 52.9 | 31.2 | |
| Exa + GPT-5Search API=Exa, LLM Backbone=GPT-52026.02 | 59 | 42.7 | 21.6 | |
| Tavily + GPT-5Search API=Tavily, LLM Backbone=GPT-52026.02 | 58.1 | 40.7 | 20.1 | |
| Brave + GPT-5Search API=Brave, LLM Backbone=GPT-52026.02 | 54.2 | 27.6 | 13.5 | |
| Always FlawedType=Baseline2026.02 | 53.7 | 69.9 | 0 | |
| Random (50/50)Type=Baseline2026.02 | 50 | 51.8 | 0 | |
| Always Not FlawedType=Baseline2026.02 | 46.3 | 0 | 0 |