Clinical text revision on MIMIC Discharge Report
62.5Mistral ScoreRAG
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RAGMethod Category=In-Context Learning, Comparison Baseline=DeepSeek-chat2026.01 | 62.5 | 26.2 | 44.4 | |
| Weaving in RevisionMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 58.8 | 40 | 49.4 | |
| Weaving in DetectionMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 57.5 | 68.8 | 63.1 | |
| Self-CriticMethod Category=In-Context Learning, Comparison Baseline=DeepSeek-chat2026.01 | 53.8 | 30 | 41.9 | |
| Weaving in TotalMethod Category=ExperienceWeaver Final, Comparison Baseline=DeepSeek-chat2026.01 | 52.5 | 30 | 41.2 | |
| Weaving in Self-CriticMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 50 | 33.7 | 41.9 | |
| Deepseek R1 SearchMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 47.5 | 30 | 38.8 | |
| Deepseek ThinkingMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 42.5 | 18.8 | 30.6 | |
| Claude-4.5 SonnetMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | -35 | 11 | 11 | |
| GPT-5.1Method Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | -40 | 32 | 32 | |
| Gemini-3 ProMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | -47 | 20 | 20 |