Multi-task Generalization on StoryCloze, OpenQA, ARC-E, ARC-C combined
87.76Average AccuracyTrajectory
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TrajectoryTrain Dataset=ARC-E, Model=Qwen2.5-14b2026.03 | 87.76 | 94.28 | 85.58 | |
| TrajectoryTrain Dataset=ARC-C, Model=Qwen2.5-14b2026.03 | 84.05 | 85.24 | 83.66 | |
| TrajectoryTrain Dataset=OpenQA, Model=Qwen2.5-14b2026.03 | 84.04 | 88.2 | 82.65 | |
| Few-shot AccuracyModel=Qwen2.5-14b2026.03 | 77.2 | — | — | |
| Linear ProbeTrain Dataset=ARC-E, Model=Qwen2.5-14b2026.03 | 75.14 | 84.32 | 72.08 | |
| Linear ProbeTrain Dataset=ARC-C, Model=Qwen2.5-14b2026.03 | 74.96 | 75.6 | 74.74 | |
| Zero-shot AccuracyModel=Qwen2.5-14b2026.03 | 71 | — | — | |
| Linear ProbeTrain Dataset=OpenQA, Model=Qwen2.5-14b2026.03 | 69.55 | 80.31 | 65.97 |