Logical Reasoning on ReClor
85.43AccuracyQwen3-8B-Arguinas-Target-SFT
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-8B-Arguinas-Target-SFTModel Backbone=Qwen3-8B, Finetuning Strategy=Pre-adaptive Finetuning, SFT Data Source=Arguinas2026.03 | 85.43 | |
| Qwen3-8B-AAAC-Target-SFTModel Backbone=Qwen3-8B, Finetuning Strategy=Pre-adaptive Finetuning, SFT Data Source=AAAC2026.03 | 84.7 | |
| Qwen3-8B-Target-SFTModel Backbone=Qwen3-8B, Finetuning Strategy=Pre-adaptive Finetuning, SFT Data Source=Target2026.03 | 84.48 | |
| Qwen3-8B-EntailmentBank-Target-SFTModel Backbone=Qwen3-8B, Finetuning Strategy=Pre-adaptive Finetuning, SFT Data Source=EntailmentBank2026.03 | 84.05 | |
| Qwen3-8B-ArgumentOnly-Target-SFTModel Backbone=Qwen3-8B, Finetuning Strategy=Pre-adaptive Finetuning, SFT Data Source=ArgumentOnly2026.03 | 83.7 | |
| Qwen3-4B-InstructModel Backbone=Qwen3-4B-Instruct, Finetuning Strategy=Continued Finetuning, SFT Data Source=Baseline2026.03 | 81.3 | |
| Qwen3-4B-Instruct-Arguinas-SFTModel Backbone=Qwen3-4B-Instruct, Finetuning Strategy=Continued Finetuning, SFT Data Source=Arguinas2026.03 | 81.05 | |
| Qwen3-4B-Arguinas-Target-SFTModel Backbone=Qwen3-4B, Finetuning Strategy=Pre-adaptive Finetuning, SFT Data Source=Arguinas2026.03 | 78.98 | |
| Qwen3-4B-ArgumentOnly-Target-SFTModel Backbone=Qwen3-4B, Finetuning Strategy=Pre-adaptive Finetuning, SFT Data Source=ArgumentOnly2026.03 | 78.28 | |
| Qwen3-4B-EntailmentBank-Target-SFTModel Backbone=Qwen3-4B, Finetuning Strategy=Pre-adaptive Finetuning, SFT Data Source=EntailmentBank2026.03 | 77.55 | |
| Qwen3-4B-AAAC-Target-SFTModel Backbone=Qwen3-4B, Finetuning Strategy=Pre-adaptive Finetuning, SFT Data Source=AAAC2026.03 | 77.15 | |
| Qwen3-4B-Target-SFTModel Backbone=Qwen3-4B, Finetuning Strategy=Pre-adaptive Finetuning, SFT Data Source=Target2026.03 | 74.13 | |
| Qwen2.5-7B-Instruct-Arguinas-SFTModel Backbone=Qwen2.5-7B-Instruct, Finetuning Strategy=Continued Finetuning, SFT Data Source=Arguinas2026.03 | 73.05 | |
| Qwen2.5-7B-InstructModel Backbone=Qwen2.5-7B-Instruct, Finetuning Strategy=Continued Finetuning, SFT Data Source=Baseline2026.03 | 69.4 | |
| Full2025.12 | 60 | |
| H2OKV cache budget=3842025.12 | 60 | |
| KnormKV cache budget=5122025.12 | 59 | |
| StreamingLLMKV cache budget=3842025.12 | 59 | |
| H2OKV cache budget=5122025.12 | 58 | |
| SnapKVKV cache budget=3842025.12 | 58 | |
| StreamingLLMKV cache budget=5122025.12 | 58 | |
| SnapKVKV cache budget=2562025.12 | 57 | |
| SnapKVBackbone=DeepSeek-R1-Distill-Llama-8B, Cache Budget=3842025.12 | 56 | |
| H2OKV cache budget=2562025.12 | 56 | |
| SnapKVKV cache budget=5122025.12 | 55 | |
| RKVKV cache budget=5122025.12 | 54 | |
| SnapKVKV cache budget=1282025.12 | 53 | |
| FullBackbone=DeepSeek-R1-Distill-Llama-8B2025.12 | 51 | |
| KnormKV cache budget=3842025.12 | 46 | |
| RKVKV cache budget=3842025.12 | 40 | |
| H2OKV cache budget=1282025.12 | 32 | |
| ShadowKVBackbone=DeepSeek-R1-Distill-Llama-8B2025.12 | 27 | |
| ShadowKV2025.12 | 27 | |
| RKVKV cache budget=2562025.12 | 21 | |
| StreamingLLMKV cache budget=2562025.12 | 21 | |
| KnormKV cache budget=2562025.12 | 19 | |
| StreamingLLMKV cache budget=1282025.12 | 5 | |
| RKVKV cache budget=1282025.12 | 4 | |
| KnormKV cache budget=1282025.12 | 1 |