Mathematical Reasoning on MATH-500 (Accuracy, Delta, Token Length, Ratio)
81.6AccuracyStability filtering + Content projection
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Stability filtering + Content projectionModel=Nemotron-1.5B, max_tokens=4096, layer=20, Transfer setting=Cross-model transfer, Steering vector source=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 81.6 | 15.4 | 1,147 | 39.8 | |
| Stability filtering + Content projectionModel=DeepScaleR-1.5B, max_tokens=4096, layer=20, Transfer setting=Cross-model transfer, Steering vector source=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 81.2 | 8.6 | 1,016 | 14.5 | |
| IRISSeed=456, B_think=4096, B_answer=512, n=200, Hardware=A1002026.05 | 80.5 | 33.5 | 3,754 | — | |
| IRISSeed=42, B_think=4096, B_answer=512, n=200, Hardware=A1002026.05 | 79.5 | 35.5 | 3,861 | — | |
| IRISSeed=Mean, B_think=4096, B_answer=512, n=200, Hardware=A1002026.05 | 79.5 | 34.5 | 3,841 | — | |
| IRISSeed=123, B_think=4096, B_answer=512, n=200, Hardware=A1002026.05 | 78.5 | 34.5 | 3,909 | — | |
| Stability filtering + Content projectionModel=Qwen-1.5B, max_tokens=4096, layer=20, Transfer setting=Source model, Steering vector source=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 78.4 | 17.6 | 1,008 | 10.7 | |
| SEALModel=Nemotron-1.5B, max_tokens=4096, layer=20, Transfer setting=Cross-model transfer, Steering vector source=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 76.6 | 10.4 | 1,230 | 43.7 | |
| SEALModel=DeepScaleR-1.5B, max_tokens=4096, layer=20, Transfer setting=Cross-model transfer, Steering vector source=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 75.2 | 2.6 | 1,076 | 17.9 | |
| SEALModel=Qwen-1.5B, max_tokens=4096, layer=20, Transfer setting=Source model, Steering vector source=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 73.4 | 12.6 | 1,103 | 10.3 | |
| BaselineModel=DeepScaleR-1.5B, max_tokens=4096, layer=20, Transfer setting=Cross-model transfer2026.04 | 72.6 | — | 1,323 | 35.1 | |
| Prompt textModel=Qwen-1.5B, max_tokens=4096, layer=20, Transfer setting=Source model2026.04 | 67.2 | 6.4 | 1,116 | 24.3 | |
| BaselineModel=Nemotron-1.5B, max_tokens=4096, layer=20, Transfer setting=Cross-model transfer2026.04 | 66.2 | — | 1,660 | 76.9 | |
| Prompt vectorModel=Qwen-1.5B, max_tokens=4096, layer=20, Transfer setting=Source model2026.04 | 61 | 0.2 | 1,604 | 39.4 | |
| BaselineModel=Qwen-1.5B, max_tokens=4096, layer=20, Transfer setting=Source model2026.04 | 60.8 | — | 1,547 | 39.1 | |
| TOWNSeed=456, B_think=4096, B_answer=512, n=200, Hardware=A1002026.05 | 47 | — | 3,550 | — | |
| TOWNSeed=Mean, B_think=4096, B_answer=512, n=200, Hardware=A1002026.05 | 45 | — | 3,622 | — | |
| TOWNSeed=42, B_think=4096, B_answer=512, n=200, Hardware=A1002026.05 | 44 | — | 3,627 | — | |
| TOWNSeed=123, B_think=4096, B_answer=512, n=200, Hardware=A1002026.05 | 44 | — | 3,688 | — |