ResearchBenchmarksQualitative Response Evaluation on MT-HumanFollow74.7GPT-4.1-mini ScoreGIR-R64.71667.30869.972.492Sep 17, 2025Evaluation ResultsMethodMethodLinksGPT-4.1-mini ScoreQwen-Max ScoreClaude 3.5 Haiku ScoreKimi-K2 ScoreGIR-RBase LLM=doubao-1.5-li...Base LLM=doubao-1.5-lite-32k2025.0974.761.767.461GIR-PBase LLM=doubao-1.5-li...Base LLM=doubao-1.5-lite-32k2025.0973.960.964.157.1GI-RBase LLM=doubao-1.5-li...Base LLM=doubao-1.5-lite-32k2025.0969.757.765.352.8Ad-ChatBase LLM=doubao-1.5-li...Base LLM=doubao-1.5-lite-32k2025.0965.156.952.546.9