Inductive Reasoning on DEER (test)
27.55AccuracyComplementary Steering
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Complementary SteeringBackbone=Llama-3.1-8B-it, Decoding Strategy=Greedy2026.04 | 27.55 | — | |
| Mono SteeringBackbone=Llama-3.1-8B-it, Decoding Strategy=Greedy2026.04 | 27.13 | — | |
| Complementary SteeringBackbone=Gemma-2-9B-it, Decoding Strategy=Greedy2026.04 | 27.03 | — | |
| Mono SteeringBackbone=Gemma-2-9B-it, Decoding Strategy=Greedy2026.04 | 26.49 | — | |
| UnsteeredBackbone=Llama-3.1-8B-it, Decoding Strategy=Greedy2026.04 | 26.36 | — | |
| Complementary SteeringBackbone=Gemma-2-9B-it, Decoding Strategy=Sampling@52026.04 | 25.56 | — | |
| Complementary SteeringBackbone=Llama-3.1-8B-it, Decoding Strategy=Sampling@52026.04 | 24.78 | — | |
| UnsteeredBackbone=Gemma-2-9B-it, Decoding Strategy=Greedy2026.04 | 24.52 | — | |
| Mono SteeringBackbone=Gemma-2-9B-it, Decoding Strategy=Sampling@52026.04 | 24.51 | — | |
| Mono SteeringBackbone=Llama-3.1-8B-it, Decoding Strategy=Sampling@52026.04 | 24.48 | — | |
| UnsteeredBackbone=Llama-3.1-8B-it, Decoding Strategy=Sampling@52026.04 | 24.25 | — | |
| Complementary SteeringBackbone=GPT-OSS-20B, Decoding Strategy=Sampling@52026.04 | 23.92 | — | |
| UnsteeredBackbone=Gemma-2-9B-it, Decoding Strategy=Sampling@52026.04 | 23.85 | — | |
| Mono SteeringBackbone=GPT-OSS-20B, Decoding Strategy=Sampling@52026.04 | 23.16 | — | |
| UnsteeredBackbone=GPT-OSS-20B, Decoding Strategy=Sampling@52026.04 | 22.91 | — | |
| Complementary SteeringBackbone=GPT-OSS-20B, Decoding Strategy=Greedy2026.04 | 18.52 | — | |
| Mono SteeringBackbone=GPT-OSS-20B, Decoding Strategy=Greedy2026.04 | 17.24 | — | |
| UnsteeredBackbone=GPT-OSS-20B, Decoding Strategy=Greedy2026.04 | 16.68 | — |