Dialogue Agent Interaction on DEMO Non-Collaboration set
8.03Goal Achievement ScoreLlama3.1-8B-Instruct w/ AMPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama3.1-8B-Instruct w/ AMPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Llama3.1-8B-Instruct2025.05 | 8.03 | |
| Llama3.1-8B-Instruct w/ GRPOInteraction Partner=GPT-4o, Base Model=Llama3.1-8B-Instruct2025.05 | 7.96 | |
| Llama3.1-8B-Instruct w/ AMPOInteraction Partner=GPT-4o, Base Model=Llama3.1-8B-Instruct2025.05 | 7.95 | |
| Qwen2.5-7B-Instruct w/ AMPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.87 | |
| Qwen2.5-7B-Instruct w/ GRPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.84 | |
| Llama3.1-8B-Instruct w/ GRPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Llama3.1-8B-Instruct2025.05 | 7.81 | |
| Qwen2.5-7B-Instruct w/ AMPOInteraction Partner=GPT-4o, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.77 | |
| Qwen2.5-7B-Instruct w/ GRPOInteraction Partner=GPT-4o, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.7 | |
| Llama3.1-8B-InstructInteraction Partner=GPT-4o, Base Model=Llama3.1-8B-Instruct2025.05 | 7.68 | |
| Qwen2.5-7B-InstructInteraction Partner=GPT-4o, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.62 | |
| Qwen2.5-7B-InstructInteraction Partner=Claude-3.5-Sonnet, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.62 | |
| Llama3.1-8B-InstructInteraction Partner=Claude-3.5-Sonnet, Base Model=Llama3.1-8B-Instruct2025.05 | 7.54 |