Dialogue Agent Interaction on DEMO Average
8.14Goal Achievement ScoreLlama3.1-8B-Instruct w/ AMPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama3.1-8B-Instruct w/ AMPOInteraction Partner=GPT-4o, Base Model=Llama3.1-8B-Instruct2025.05 | 8.14 | |
| Llama3.1-8B-Instruct w/ GRPOInteraction Partner=GPT-4o, Base Model=Llama3.1-8B-Instruct2025.05 | 8.06 | |
| Llama3.1-8B-Instruct w/ AMPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Llama3.1-8B-Instruct2025.05 | 8.05 | |
| Llama3.1-8B-InstructInteraction Partner=GPT-4o, Base Model=Llama3.1-8B-Instruct2025.05 | 7.92 | |
| Llama3.1-8B-Instruct w/ GRPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Llama3.1-8B-Instruct2025.05 | 7.89 | |
| Qwen2.5-7B-Instruct w/ AMPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.86 | |
| Qwen2.5-7B-Instruct w/ GRPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.83 | |
| Qwen2.5-7B-Instruct w/ AMPOInteraction Partner=GPT-4o, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.81 | |
| Qwen2.5-7B-Instruct w/ GRPOInteraction Partner=GPT-4o, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.72 | |
| Qwen2.5-7B-InstructInteraction Partner=GPT-4o, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.65 | |
| Llama3.1-8B-InstructInteraction Partner=Claude-3.5-Sonnet, Base Model=Llama3.1-8B-Instruct2025.05 | 7.63 | |
| Qwen2.5-7B-InstructInteraction Partner=Claude-3.5-Sonnet, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.61 |