Code Generation on HumanEval (ROCG, ρ)
94.2ROCGFLORA-Neg
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FLORA-NegModel=G4-31b-it, Eval-time correction=per-task best2026.07 | 94.2 | 76.3 | |
| SFTModel=Q3.5-9b, Eval-time correction=per-task best2026.07 | 94.1 | 56.3 | |
| Consistency FTModel=Q3.5-9b, Eval-time correction=per-task best2026.07 | 92.6 | 53.5 | |
| FLORA-PMIModel=G4-31b-it, Eval-time correction=per-task best2026.07 | 92.2 | 66.8 | |
| RankAlignModel=Q3.5-9b, Eval-time correction=per-task best2026.07 | 90.2 | 69.5 | |
| FLORA-NegModel=Q3.5-9b, Eval-time correction=per-task best2026.07 | 88.9 | 68.5 | |
| RankAlignModel=G4-31b-it, Eval-time correction=per-task best2026.07 | 86.9 | 40.9 | |
| SFTModel=G4-31b-it, Eval-time correction=per-task best2026.07 | 84.5 | 28.5 | |
| FLORA-PMIModel=Q3.5-9b, Eval-time correction=per-task best2026.07 | 83.2 | 58.9 | |
| Consistency FTModel=G4-31b-it, Eval-time correction=per-task best2026.07 | 74.9 | 49 | |
| BaseModel=G4-31b-it, Eval-time correction=per-task best2026.07 | 72.9 | 22.4 | |
| BaseModel=Q3.5-9b, Eval-time correction=per-task best2026.07 | 65.7 | 30.4 |