Clinical Text Revision on MIMIC Chest X-ray Radiology Report
0.775Mistral ScoreWeaving in Total
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Weaving in TotalMethod Category=ExperienceWeaver Final, Comparison Baseline=DeepSeek-chat2026.01 | 0.775 | 0.812 | 0.794 | |
| Claude-4.5 SonnetMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.76 | 0.51 | 0.635 | |
| Weaving in RevisionMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 0.462 | 0.4 | 0.431 | |
| Gemini-3 ProMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.42 | 0.45 | 0.435 | |
| RAGMethod Category=In-Context Learning, Comparison Baseline=DeepSeek-chat2026.01 | 0.225 | 0.225 | 0.225 | |
| Self-CriticMethod Category=In-Context Learning, Comparison Baseline=DeepSeek-chat2026.01 | 0.175 | 0.425 | 0.3 | |
| Weaving in Self-CriticMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 0.15 | 0.35 | 0.25 | |
| GPT-5.1Method Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.14 | 0.28 | 0.21 | |
| Weaving in DetectionMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 0.138 | 0.488 | 0.312 | |
| Deepseek R1 SearchMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.137 | 0.488 | 0.312 | |
| Deepseek ThinkingMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.075 | 0.538 | 0.306 |