Reinforcement Learning on FLUX.1 dev SRPO protocol v1.0 (test)
6.3447AesBF16 Finetune
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| BF16 FinetunePrecision=BF16, Method=Finetune2026.07 | 6.3447 | 0.2316 | 1.0209 | 0.0029 | |
| FourTunePrecision=W4A4G42026.07 | 6.3119 | 0.2308 | 1.0152 | 0.0027 | |
| NF4 QLoRAPrecision=NF4, Method=QLoRA2026.07 | 6.2189 | 0.2318 | 1.0931 | 0.002 | |
| BF16 LoRAPrecision=BF16, Method=LoRA2026.07 | 6.1832 | 0.2307 | 1.0735 | 0.002 | |
| Base model2026.07 | 6.0135 | 0.23 | 1.1189 | 0.0015 |