Clinical text revision on In house Radiology Report
0.79Mistral ScoreClaude-4.5 Sonnet
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Claude-4.5 SonnetMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.79 | 1.06 | 0.925 | |
| Gemini-3 ProMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.68 | 0.75 | 0.715 | |
| Deepseek ThinkingMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.65 | 0.762 | 0.706 | |
| Self-CriticMethod Category=In-Context Learning, Comparison Baseline=DeepSeek-chat2026.01 | 0.525 | 0.788 | 0.656 | |
| GPT-5.1Method Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.44 | 0.68 | 0.56 | |
| Weaving in Self-CriticMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 0.425 | 0.688 | 0.556 | |
| Weaving in DetectionMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 0.375 | 0.75 | 0.562 | |
| Weaving in TotalMethod Category=ExperienceWeaver Final, Comparison Baseline=DeepSeek-chat2026.01 | 0.338 | 0.575 | 0.456 | |
| RAGMethod Category=In-Context Learning, Comparison Baseline=DeepSeek-chat2026.01 | 0.2 | 0.888 | 0.544 | |
| Weaving in RevisionMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 0.188 | 0.875 | 0.531 | |
| Deepseek R1 SearchMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.175 | 0.7 | 0.438 |