Reasoning Token Induction on Mixed Prompts (SimpleQA, SimpleBench, AIME2024, etc.) (test)
24,701Mean Completion TokensReasoningBomb
Evaluation Results
| Method | Links | |
|---|---|---|
| ReasoningBombReasoning Budget=256, Target Model=Claude 4.52026.01 | 24,701 | |
| ReasoningBombReasoning Budget=256, Target Model=Gemini 32026.01 | 21,646 | |
| ReasoningBombReasoning Budget=256, Target Model=DeepSeek-R12026.01 | 21,538 | |
| ReasoningBombReasoning Budget=256, Target Model=Average2026.01 | 18,759 | |
| ReasoningBombReasoning Budget=512, Target Model=Average2026.01 | 17,570 | |
| ReasoningBombReasoning Budget=128, Target Model=Average2026.01 | 17,096 | |
| LLM-GenTarget Model=Average2026.01 | 13,904 | |
| LRM-GenTarget Model=Average2026.01 | 12,201 | |
| AIME2024Target Model=Average2026.01 | 11,926 | |
| AutoDoSTarget Model=Average2026.01 | 11,585 | |
| In-Context Learning (ICL)Target Model=Average2026.01 | 7,928 | |
| ReasoningBombReasoning Budget=256, Target Model=GPT-52026.01 | 6,783 | |
| CatAttackTarget Model=Average2026.01 | 4,628 | |
| SimpleQATarget Model=Nemotron-3, Model Category=LRMs2026.01 | 4,464 | |
| SimpleBenchTarget Model=Average2026.01 | 4,267 | |
| ReasoningBombReasoning Budget=256, Target Model=DeepSeek-V32026.01 | 4,148 | |
| ReasoningBombReasoning Budget=128, Target Model=DeepSeek-V32026.01 | 3,863 | |
| ReasoningBombReasoning Budget=512, Target Model=DeepSeek-V32026.01 | 3,760 | |
| SimpleQATarget Model=Qwen3-32B, Model Category=LRMs2026.01 | 1,394 | |
| SimpleQATarget Model=Qwen3-30B, Model Category=LRMs2026.01 | 1,328 | |
| SimpleQATarget Model=GPT-5, Model Category=Commercial LRMs2026.01 | 1,232 | |
| SimpleQATarget Model=Average2026.01 | 1,158 | |
| SimpleQATarget Model=MiniMax-M2, Model Category=LRMs2026.01 | 947 | |
| SimpleQATarget Model=DeepSeek-R1, Model Category=LLMs2026.01 | 791 | |
| SimpleQATarget Model=Gemini 3, Model Category=Commercial LRMs2026.01 | 781 | |
| EngorgioReasoning Budget=128, Target Model=Average2026.01 | 731 | |
| SimpleQATarget Model=Claude 4.5, Model Category=Commercial LRMs2026.01 | 401 | |
| EngorgioReasoning Budget=512, Target Model=Average2026.01 | 294 | |
| EngorgioReasoning Budget=256, Target Model=Average2026.01 | 282 | |
| SimpleQATarget Model=DeepSeek-V3, Model Category=LLMs2026.01 | 195 | |
| SimpleQATarget Model=Kimi-K2, Model Category=LLMs2026.01 | 48 |