ResearchBenchmarksQualitative Response Evaluation on LM-MarketFollow73.73GPT-4.1-mini ScoreGIR-R63.413266.091668.7771.4484Sep 17, 2025Evaluation ResultsMethodMethodLinksGPT-4.1-mini ScoreQwen-Max ScoreClaude 3.5 Haiku ScoreKimi-K2 ScoreGIR-RBase LLM=doubao-1.5-li...Base LLM=doubao-1.5-lite-32k2025.0973.7361.356655GIR-PBase LLM=doubao-1.5-li...Base LLM=doubao-1.5-lite-32k2025.0972.6659.4664.4853.28GI-RBase LLM=doubao-1.5-li...Base LLM=doubao-1.5-lite-32k2025.0970.4657.0763.2149.91Ad-ChatBase LLM=doubao-1.5-li...Base LLM=doubao-1.5-lite-32k2025.0963.8155.9947.6642.47