Clinical text revision on MIMIC Free Text
0.375Mistral ScoreWeaving in Detection
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Weaving in DetectionMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 0.375 | 0.188 | 0.281 | |
| Deepseek ThinkingMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | 0.35 | 0.35 | 0.35 | |
| RAGMethod Category=In-Context Learning, Comparison Baseline=DeepSeek-chat2026.01 | 0.3 | 0.3 | 0.3 | |
| Self-CriticMethod Category=In-Context Learning, Comparison Baseline=DeepSeek-chat2026.01 | 0.262 | 0.475 | 0.369 | |
| Weaving in Self-CriticMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 0.238 | 0.388 | 0.312 | |
| Weaving in RevisionMethod Category=ExperienceWeaver Variant, Comparison Baseline=DeepSeek-chat2026.01 | 0.125 | 0.288 | 0.206 | |
| Deepseek R1 SearchMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | -0.025 | 0.088 | 0.031 | |
| Weaving in TotalMethod Category=ExperienceWeaver Final, Comparison Baseline=DeepSeek-chat2026.01 | -0.025 | 0.3 | 0.137 | |
| Claude-4.5 SonnetMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | -0.35 | 0.24 | -0.055 | |
| GPT-5.1Method Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | -0.4 | 0.27 | -0.065 | |
| Gemini-3 ProMethod Category=Direct SOTA LLMs, Comparison Baseline=DeepSeek-chat2026.01 | -0.47 | -0.08 | -0.275 |