Question Answering on Dynamic Event Benchmark Overall
73.86Overall AccuracyChronosGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| ChronosGPT-4oBackbone=GPT-4o, Method Paradigm=Chronos (Ours)2026.04 | 73.86 | |
| ChronosClaudeBackbone=Claude, Method Paradigm=Chronos (Ours)2026.04 | 73.06 | |
| ChronosLLaMA-3.1Backbone=LLaMA-3.1, Method Paradigm=Chronos (Ours)2026.04 | 63.64 | |
| ReAct RAGClaudeBackbone=Claude, Method Paradigm=Retrieval-based Methods2026.04 | 56.94 | |
| ReAct RAGGPT-4oBackbone=GPT-4o, Method Paradigm=Retrieval-based Methods2026.04 | 54.53 | |
| Vanilla RAGClaudeBackbone=Claude, Method Paradigm=Retrieval-based Methods2026.04 | 48.56 | |
| Vanilla RAGGPT-4oBackbone=GPT-4o, Method Paradigm=Retrieval-based Methods2026.04 | 47.48 | |
| ReAct RAGLLaMA-3.1Backbone=LLaMA-3.1, Method Paradigm=Retrieval-based Methods2026.04 | 39.65 | |
| Vanilla RAGLLaMA-3.1Backbone=LLaMA-3.1, Method Paradigm=Retrieval-based Methods2026.04 | 38.68 | |
| LoRA FTLLaMA-3.1Backbone=LLaMA-3.1, Method Paradigm=Parametric Updating Methods2026.04 | 32.17 | |
| GPT-4oBackbone=GPT-4o, Method Paradigm=Direct Generation2026.04 | 30.34 | |
| ClaudeBackbone=Claude, Method Paradigm=Direct Generation2026.04 | 27.02 | |
| WISELLaMA-3.1Backbone=LLaMA-3.1, Method Paradigm=Parametric Updating Methods2026.04 | 21.6 | |
| LLaMA-3.1Backbone=LLaMA-3.1, Method Paradigm=Direct Generation2026.04 | 21.17 | |
| MEMITLLaMA-3.1Backbone=LLaMA-3.1, Method Paradigm=Parametric Updating Methods2026.04 | 15.44 | |
| ROMELLaMA-3.1Backbone=LLaMA-3.1, Method Paradigm=Parametric Updating Methods2026.04 | 11.91 |