Star
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
STAR zero-shot (test)
51.5Interaction Score
7
STAR math scores Regular+Aide vs. Regular class sizes (Strong instrument ρ ≈ 0.89)
1Validity
6
STAR math scores Regular+Aide vs. Regular class sizes (Weak instrument ρ ≈ 0.28)
1Validity
6
STAR small vs. regular class size reading scores Strong instrument
1Validity
6
STAR small vs. regular class size reading scores Weak instrument ρ(Z, T) ≈ 0.29
1Validity
6
STAR Strong instrument math scores Small vs. Regular class sizes
1Validity Score
6
STAR math scores Small vs. Regular class sizes Weak instrument, ρ(Z, T) ≈ 0.29
100Validity
6
STAR
94.88Accuracy
6
STAR Real-world
92Object Recognition Success Rate
5
Star 1000 (test)
100AUC
5
Star ImageNet-derived texture (test)
48.78FID
3
Star
0.886AUC
2
STAR
82.13Accuracy (ACC)
1
STAR
71.5Accuracy
1
STAR
58.25Accuracy
1
STAR
41.13Accuracy
1
STAR
79.5Accuracy
1