Dialogue Agent Interaction on DEMO Collaboration set
8.65Goal Achievement ScoreLlama3.1-8B-Instruct w/ AMPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama3.1-8B-Instruct w/ AMPOInteraction Partner=GPT-4o, Base Model=Llama3.1-8B-Instruct2025.05 | 8.65 | |
| Llama3.1-8B-InstructInteraction Partner=GPT-4o, Base Model=Llama3.1-8B-Instruct2025.05 | 8.56 | |
| Llama3.1-8B-Instruct w/ GRPOInteraction Partner=GPT-4o, Base Model=Llama3.1-8B-Instruct2025.05 | 8.35 | |
| Llama3.1-8B-Instruct w/ AMPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Llama3.1-8B-Instruct2025.05 | 8.12 | |
| Llama3.1-8B-Instruct w/ GRPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Llama3.1-8B-Instruct2025.05 | 8.09 | |
| Qwen2.5-7B-Instruct w/ AMPOInteraction Partner=GPT-4o, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.95 | |
| Qwen2.5-7B-Instruct w/ GRPOInteraction Partner=GPT-4o, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.9 | |
| Llama3.1-8B-InstructInteraction Partner=Claude-3.5-Sonnet, Base Model=Llama3.1-8B-Instruct2025.05 | 7.89 | |
| Qwen2.5-7B-Instruct w/ AMPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.82 | |
| Qwen2.5-7B-Instruct w/ GRPOInteraction Partner=Claude-3.5-Sonnet, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.81 | |
| Qwen2.5-7B-InstructInteraction Partner=GPT-4o, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.73 | |
| Qwen2.5-7B-InstructInteraction Partner=Claude-3.5-Sonnet, Base Model=Qwen2.5-7B-Instruct2025.05 | 7.57 |