Code Generation on BigCodeBench (Accuracy, Average Added Skill Tokens)
52.19AccuracyFull Text
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Full TextBackbone Model=Phi-42026.06 | 52.19 | 4,628 | |
| SKIM (Adaptive)Backbone Model=Phi-42026.06 | 50.35 | 1,889 | |
| Full TextBackbone Model=Qwen3-8B2026.06 | 49.3 | 4,676 | |
| LLMLingua-2 (L)Backbone Model=Phi-42026.06 | 49.3 | 3,316 | |
| SKIM (Fix-512)Backbone Model=Phi-42026.06 | 49.12 | 1,414 | |
| LLMLingua-2 (M)Backbone Model=Phi-42026.06 | 47.46 | 2,615 | |
| SKIM (Adaptive)Backbone Model=Qwen3-8B2026.06 | 46.93 | 3,172 | |
| SKIM (Fix-256)Backbone Model=Phi-42026.06 | 46.58 | 708 | |
| LLMLingua-2 (L)Backbone Model=Qwen3-8B2026.06 | 46.05 | 3,362 | |
| SKIM (Fix-512)Backbone Model=Qwen3-8B2026.06 | 45.53 | 1,414 | |
| LLMLingua-2 (S)Backbone Model=Phi-42026.06 | 45.26 | 1,284 | |
| SKIM (Fix-256)Backbone Model=Qwen3-8B2026.06 | 44.21 | 708 | |
| NaiveBackbone Model=Phi-42026.06 | 43.77 | 0 | |
| LLMLingua-2 (M)Backbone Model=Qwen3-8B2026.06 | 43.6 | 2,655 | |
| NaiveBackbone Model=Qwen3-8B2026.06 | 40.96 | 0 | |
| LLMLingua-2 (S)Backbone Model=Qwen3-8B2026.06 | 40.7 | 1,300 | |
| ICAEBackbone Model=Qwen3-8B2026.06 | 29.47 | 256 | |
| ICAEBackbone Model=Phi-42026.06 | 0.88 | 256 | |
| 500xCompressorBackbone Model=Qwen3-8B2026.06 | 0.18 | 256 | |
| 500xCompressorBackbone Model=Phi-42026.06 | 0.09 | 256 |