Deductive Reasoning on JustLogic (test)
59.05AccuracyComplementary Steering
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Complementary SteeringBackbone=Gemma-2-9B-it, Decoding Strategy=Greedy2026.04 | 59.05 | — | |
| Complementary SteeringBackbone=GPT-OSS-20B, Decoding Strategy=Greedy2026.04 | 58.43 | — | |
| Mono SteeringBackbone=GPT-OSS-20B, Decoding Strategy=Greedy2026.04 | 57.63 | — | |
| Mono SteeringBackbone=Gemma-2-9B-it, Decoding Strategy=Greedy2026.04 | 57.33 | — | |
| UnsteeredBackbone=Gemma-2-9B-it, Decoding Strategy=Greedy2026.04 | 56.86 | — | |
| Complementary SteeringBackbone=Llama-3.1-8B-it, Decoding Strategy=Greedy2026.04 | 56.46 | — | |
| UnsteeredBackbone=GPT-OSS-20B, Decoding Strategy=Greedy2026.04 | 56.12 | — | |
| Mono SteeringBackbone=Llama-3.1-8B-it, Decoding Strategy=Greedy2026.04 | 55.22 | — | |
| Complementary SteeringBackbone=Gemma-2-9B-it, Decoding Strategy=Sampling@52026.04 | 54.64 | — | |
| Complementary SteeringBackbone=GPT-OSS-20B, Decoding Strategy=Sampling@52026.04 | 53.67 | — | |
| Mono SteeringBackbone=GPT-OSS-20B, Decoding Strategy=Sampling@52026.04 | 52.08 | — | |
| Complementary SteeringBackbone=Llama-3.1-8B-it, Decoding Strategy=Sampling@52026.04 | 51.36 | — | |
| UnsteeredBackbone=GPT-OSS-20B, Decoding Strategy=Sampling@52026.04 | 51.12 | — | |
| Mono SteeringBackbone=Gemma-2-9B-it, Decoding Strategy=Sampling@52026.04 | 50.69 | — | |
| Mono SteeringBackbone=Llama-3.1-8B-it, Decoding Strategy=Sampling@52026.04 | 49.9 | — | |
| UnsteeredBackbone=Gemma-2-9B-it, Decoding Strategy=Sampling@52026.04 | 49.74 | — | |
| UnsteeredBackbone=Llama-3.1-8B-it, Decoding Strategy=Greedy2026.04 | 48.95 | — | |
| UnsteeredBackbone=Llama-3.1-8B-it, Decoding Strategy=Sampling@52026.04 | 47.45 | — |