Question Answering on TruthfulQA (Primary Truthfulness Metric)
58.4TruthfulQAGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPOBackbone=Qwen3-8B, Scenario=Strategic Deception2026.03 | 58.4 | |
| CoT MonitorBackbone=Llama-3.1-8B, Scenario=Strategic Deception2026.03 | 57.98 | |
| GRPOBackbone=Llama-3.1-8B, Scenario=Strategic Deception2026.03 | 56.42 | |
| SARBackbone=Qwen3-8B, Scenario=Strategic Deception2026.03 | 56.11 | |
| CoT MonitorBackbone=Qwen3-8B, Scenario=Strategic Deception2026.03 | 55.77 | |
| SARBackbone=Qwen3-8B, Scenario=Sycophancy2026.03 | 54.87 | |
| GRPOBackbone=Llama-3.1-8B, Scenario=Sycophancy2026.03 | 54.74 | |
| CoT MonitorBackbone=Llama-3.1-8B, Scenario=Sycophancy2026.03 | 54.56 | |
| Qwen3-8BScenario=Strategic Deception2026.03 | 54.44 | |
| Qwen3-8BScenario=Sycophancy2026.03 | 54.44 | |
| CoT MonitorBackbone=Qwen3-8B, Scenario=Sycophancy2026.03 | 54.38 | |
| SARBackbone=Llama-3.1-8B, Scenario=Sycophancy2026.03 | 54.23 | |
| GRPOBackbone=Qwen3-8B, Scenario=Sycophancy2026.03 | 54.22 | |
| Llama-3.1-8BScenario=Strategic Deception2026.03 | 54.05 | |
| Llama-3.1-8BScenario=Sycophancy2026.03 | 54.05 | |
| SARBackbone=Llama-3.1-8B, Scenario=Strategic Deception2026.03 | 52.42 | |
| Base modelRuntime (min)=N/A2026.04 | 30.2 | |
| POMERuntime (min)=10.62026.04 | 29.2 | |
| MuonRuntime (min)=12.02026.04 | 29 | |
| SIFTRuntime (min)=26.42026.04 | 29 | |
| AdamWRuntime (min)=8.12026.04 | 28.9 | |
| BLURRuntime (min)=8.62026.04 | 27.1 | |
| GradDiff w/ HybridAlgorithm=GradDiff, Optimizer=Hybrid2025.10 | 24.1 | |
| NPO w/ HybridAlgorithm=NPO, Optimizer=Hybrid2025.10 | 23.8 | |
| NPO w/ signAdamAlgorithm=NPO, Optimizer=signAdam2025.10 | 23.6 | |
| NPO w/ SAMAlgorithm=NPO, Optimizer=SAM2025.10 | 23.6 | |
| NPO w/ RSAlgorithm=NPO, Optimizer=RS2025.10 | 23.4 | |
| NPOAlgorithm=NPO2025.10 | 23.3 | |
| GradDiffAlgorithm=GradDiff2025.10 | 22.4 | |
| NPO w/ signSGDAlgorithm=NPO, Optimizer=signSGD2025.10 | 22.2 | |
| GradDiff w/ RSAlgorithm=GradDiff, Optimizer=RS2025.10 | 22.2 | |
| GradDiff w/ signSGDAlgorithm=GradDiff, Optimizer=signSGD2025.10 | 21.9 | |
| Pre-unlearn2025.10 | 21.4 | |
| GradDiff w/ SAMAlgorithm=GradDiff, Optimizer=SAM2025.10 | 21.4 | |
| GradDiff w/ signAdamAlgorithm=GradDiff, Optimizer=signAdam2025.10 | 20.8 | |
| GradDiff w/ ZOAlgorithm=GradDiff, Optimizer=ZO2025.10 | 20.3 | |
| NPO w/ ZOAlgorithm=NPO, Optimizer=ZO2025.10 | 18.5 |