Tool Use on ToolAlpaca
77.9Tool Use Success RateEMA
Evaluation Results
| Method | Links | |
|---|---|---|
| EMABase Model=Qwen2.5-7B, Protocol=EMA teacher2026.05 | 77.9 | |
| UniSD*Base Model=Qwen2.5-7B2026.05 | 77.9 | |
| Agree (Seq.)Base Model=Qwen2.5-7B, Protocol=Sequence-level agreement, Context Retrieval=True2026.05 | 76.5 | |
| Match (Joint)Base Model=Qwen2.5-7B, Protocol=Joint logit-representation matching2026.05 | 76.5 | |
| GKDSFT warm-up=3K, Continual learning=true2026.05 | 76 | |
| AOPDSFT warm-up=3K, Continual learning=true2026.05 | 75 | |
| Agree (Tok.)Base Model=Qwen2.5-7B, Protocol=Token-level agreement, Context Retrieval=True2026.05 | 75 | |
| ContrastBase Model=Qwen2.5-7B, Protocol=Token-level contrastive learning2026.05 | 75 | |
| SDFTBase Model=Qwen2.5-7B2026.05 | 73.5 | |
| GKDBase Model=Qwen2.5-7B2026.05 | 72.1 | |
| Match (Repr.)Base Model=Qwen2.5-7B, Protocol=Representation-only matching2026.05 | 72.1 | |
| ClipBase Model=Qwen2.5-7B, Protocol=Divergence clipping2026.05 | 70.6 | |
| CREDITModel=Qwen3-8B, Evaluation Protocol=best avg@162026.05 | 70.4 | |
| GRPOModel=Qwen3-8B, Evaluation Protocol=best avg@162026.05 | 69.7 | |
| SDPOModel=Qwen3-8B, Evaluation Protocol=best avg@162026.05 | 68 | |
| CREDITModel=OLMo-3-7B-Instruct, Evaluation Protocol=best avg@162026.05 | 67.4 | |
| ExOPDSFT warm-up=3K, Continual learning=true2026.05 | 67 | |
| SFTBase Model=Qwen2.5-7B2026.05 | 66.2 | |
| OPDSFT warm-up=3K, Continual learning=true2026.05 | 65 | |
| GRPOModel=OLMo-3-7B-Instruct, Evaluation Protocol=best avg@162026.05 | 64.4 | |
| RawBase Model=Qwen2.5-7B2026.05 | 61.8 | |
| OPSDBase Model=Qwen2.5-7B2026.05 | 61.8 | |
| SDPOModel=OLMo-3-7B-Instruct, Evaluation Protocol=best avg@162026.05 | 61.5 | |
| BaseModel=Qwen3-8B, Evaluation Protocol=best avg@162026.05 | 57.5 | |
| SSDBase Model=Qwen2.5-7B2026.05 | 55.9 | |
| BaseModel=OLMo-3-7B-Instruct, Evaluation Protocol=best avg@162026.05 | 39.3 |