Tracing on Composite Evaluation Set (TOFU, ChatDoctor, Beavertails, TruthfulQA, WMDP Macro Average)
98.57TSRLlama-3.2-1B
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama-3.2-1BBase Model=Qwen-3-8B2026.03 | 98.57 | |
| Llama-3.2-1BBase Model=Llama-3-8B2026.03 | 97.95 | |
| DEBUGLMBase Model=Llama-3-8B2026.03 | 95.89 | |
| DEBUGLMBase Model=Qwen-3-8B2026.03 | 95.68 | |
| ROUGE-LBase Model=Llama-3-8B2026.03 | 94.4 | |
| ROUGE-LBase Model=Qwen-3-8B2026.03 | 94.18 | |
| SBERTBase Model=Qwen-3-8B2026.03 | 91.71 | |
| SBERTBase Model=Llama-3-8B2026.03 | 90.89 | |
| BM25Base Model=Llama-3-8B2026.03 | 58.04 | |
| BM25Base Model=Qwen-3-8B2026.03 | 57.15 |