ResearchBenchmarksSupervised Fine-Tuning on Supervised Fine-Tuning (SFT) Evaluation TasksFollow92.4Textual EntailmentTANDEM91.8892.01592.1592.285Jun 3, 2026Evaluation ResultsMethodMethodLinksTextual EntailmentAnswer VerificationText MatchingInference ExtractionWord SemanticsText CategorizationAverage Metric ScoreTest LossTANDEMModel Scale=3B, Evalua...Model Scale=3B, Evaluation Protocol=Supervised fine-tuning, Backbone=Qwen-2.5-3B2026.0692.476.989.680.18887.985.80.174UniformModel Scale=3B, Evalua...Model Scale=3B, Evaluation Protocol=Supervised fine-tuning, Backbone=Qwen-2.5-3B2026.0691.974.888.879.288.885.584.90.189