Question Answering on ARC-e (Accuracy and Exit Position)
85.1AccuracyFull Precision
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Full PrecisionModel=Qwen-30B-A3B2026.05 | 85.1 | — | |
| HCInferModel=Qwen-30B-A3B2026.05 | 82.42 | — | |
| Full PrecisionModel=Llama-3.1-8B2026.05 | 82.4 | — | |
| River-LLMBackbone Model=Llama3.1 8B (32 layers), Threshold (τ)=0.52026.04 | 82 | 3.01 | |
| BackboneBackbone Model=Llama3.1 8B (32 layers)2026.04 | 81.7 | — | |
| River-LLMBackbone Model=Llama3.1 8B (32 layers), Threshold (τ)=0.72026.04 | 81.4 | 8.44 | |
| HCInferModel=Llama-3.1-8B2026.05 | 81.18 | — | |
| Llama.cpp INT4Model=Qwen-30B-A3B2026.05 | 80.13 | — | |
| Llama.cpp INT3Model=Llama-3.1-8B2026.05 | 78.91 | — | |
| GPTQ INT4Model=Qwen-30B-A3B2026.05 | 78.03 | — | |
| GPTQ INT3Model=Llama-3.1-8B2026.05 | 77.81 | — | |
| BackboneBackbone Model=Llama3.2 1B (16 layers)2026.04 | 68.4 | — | |
| River-LLMBackbone Model=Llama3.2 1B (16 layers), Threshold (τ)=0.52026.04 | 67.8 | 3.24 | |
| River-LLMBackbone Model=Llama3.2 1B (16 layers), Threshold (τ)=0.72026.04 | 67.1 | 10.68 | |
| GPT2# params.=110M, Evaluation Protocol=Zero-shot2025.10 | 43.81 | — | |
| Llama (retrain)# params.=117M, Evaluation Protocol=Zero-shot2025.10 | 40.53 | — | |
| CCDD-MoEDiT# params.=104.0M, Evaluation Protocol=Zero-shot2025.10 | 30.01 | — | |
| CCDD-MMDiT# params.=144.1M, Evaluation Protocol=Zero-shot2025.10 | 28.75 | — | |
| MDLM# params.=92.1M, Evaluation Protocol=Zero-shot2025.10 | 28.37 | — | |
| GIDD-base# params.=320M, Evaluation Protocol=Zero-shot2025.10 | 28.32 | — | |
| GIDD# params.=92.1M, Evaluation Protocol=Zero-shot2025.10 | 26.73 | — |