Generalization across multiple tasks on Full Benchmark Suite Aggregate
82.2Average AccuracyFew-shot*
Evaluation Results
| Method | Links | |
|---|---|---|
| Few-shot*Model=Llama3.1-70B2025.09 | 82.2 | |
| ICRModel=Llama3.1-70B2025.09 | 81.5 | |
| ICRModel=Qwen3-32B2025.09 | 80.9 | |
| Few-shot*Model=Qwen3-32B2025.09 | 80.7 | |
| Zero-shotModel=Llama3.1-70B2025.09 | 77.6 | |
| I2CLModel=Llama3.1-70B2025.09 | 75.8 | |
| I2CLModel=Qwen3-32B2025.09 | 75.6 | |
| Zero-shotModel=Qwen3-32B2025.09 | 74.9 | |
| FVModel=Llama3.1-70B2025.09 | 72.7 | |
| FVModel=Qwen3-32B2025.09 | 71.9 |