Open-domain Reasoning on ARC-c
84.6Pass@1TRAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| TRAPOTraining Paradigm=Semi-supervised, Labeled Samples Count=4K, Unlabeled Samples Count=12K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 84.6 | |
| TRAPOTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 83.7 | |
| Fully SupervisedTraining Paradigm=Supervised, Labeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 82.3 | |
| Fully SupervisedTraining Paradigm=Supervised, Labeled Samples Count=4K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 82.1 | |
| TTRLTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 80.5 | |
| Sentence-level EntropyTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 79.4 | |
| Sentence-level EntropyTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 79.4 | |
| Fully SupervisedTraining Paradigm=Supervised, Labeled Samples Count=1K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 76.2 | |
| Token-level EntropyTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 75.6 | |
| Self-certaintyTraining Paradigm=Unsupervised, Unlabeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 72.9 | |
| Token-level EntropyTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 72.9 | |
| TTRLTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 72.6 | |
| Qwen-InstructTraining Paradigm=Original, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 70.3 | |
| Self-certaintyTraining Paradigm=Semi-supervised, Labeled Samples Count=1K, Unlabeled Samples Count=3K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 64.8 | |
| Qwen-BaseTraining Paradigm=Original, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 18.2 |