Online Drama Performance Evaluation on HAMLET English & Chinese combined
79.45Overall ScoreClaude-4-sonnet-Thinking
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude-4-sonnet-ThinkingModel Reasoning Category=Reasoning Models, Sampling Strategy=greedy2025.07 | 79.45 | |
| Claude-4-sonnetModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 78.3 | |
| Qwen3-32B-ThinkingModel Reasoning Category=Reasoning Models, Sampling Strategy=greedy2025.07 | 73.85 | |
| OpenAI-o3Model Reasoning Category=Reasoning Models, Sampling Strategy=greedy2025.07 | 73.67 | |
| Qwen3-235B-A22B-ThinkingModel Reasoning Category=Reasoning Models, Sampling Strategy=greedy2025.07 | 73.33 | |
| DeepSeek-R1-0528Model Reasoning Category=Reasoning Models, Sampling Strategy=greedy2025.07 | 72.98 | |
| Qwen3-235B-A22BModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 71.21 | |
| Claude-3.7-sonnetModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 70.9 | |
| Higgs-Llama-3-70BModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 68.2 | |
| Qwen3-32BModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 65.57 | |
| GPT-4.1Model Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 62.74 | |
| Gemini-2.5-proModel Reasoning Category=Reasoning Models, Sampling Strategy=greedy2025.07 | 62 | |
| GPT-4.5-previewModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 60.84 | |
| Claude-3.5-sonnetModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 60.79 | |
| DeepSeek-V3-0324Model Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 59.44 | |
| Magistral-Small-2506Model Reasoning Category=Reasoning Models, Sampling Strategy=greedy2025.07 | 59.24 | |
| Minimax-M1Model Reasoning Category=Reasoning Models, Sampling Strategy=greedy2025.07 | 58.59 | |
| Qwen3-8B-ThinkingModel Reasoning Category=Reasoning Models, Sampling Strategy=greedy2025.07 | 58.16 | |
| Qwen3-8BModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 52.48 | |
| Mistral-Small-3.2-24BModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 49.93 | |
| Gemini-2.5-flashModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 49.48 | |
| Llama-3.1-70BModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 45.75 | |
| Llama-3.1-8BModel Reasoning Category=Non-Reasoning Models, Sampling Strategy=greedy2025.07 | 34.67 |