Interpretive Quality Evaluation on Interpretive Quality Evaluation Dataset
92Theme-Expert OverlapPECII
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PECIIModel=Qwen-4B, Execution Strategy=PECII2026.04 | 92 | 4.9 | 96 | |
| PECIIModel=LLaMA-8B, Execution Strategy=PECII2026.04 | 92 | 4.9 | 96 | |
| PECIIModel=LLaMA-3B, Execution Strategy=PECII2026.04 | 91 | 4.9 | 95 | |
| PECIIModel=ChatGPT, Execution Strategy=PECII2026.04 | 91 | 4.9 | 95 | |
| PECIIModel=Qwen-1.5B, Execution Strategy=PECII2026.04 | 90 | 4.8 | 95 | |
| PECIIModel=LLaMA-1B, Execution Strategy=PECII2026.04 | 89 | 4.8 | 94 | |
| Sequential ExecutionModel=ChatGPT, Execution Strategy=Sequential2026.04 | 78 | 4.7 | 92 | |
| Sequential ExecutionModel=LLaMA-8B, Execution Strategy=Sequential2026.04 | 76 | 4.6 | 92 | |
| Sequential ExecutionModel=Qwen-4B, Execution Strategy=Sequential2026.04 | 74 | 4.4 | 90 | |
| Sequential ExecutionModel=LLaMA-3B, Execution Strategy=Sequential2026.04 | 69 | 4.2 | 87 | |
| BaselineModel=ChatGPT, Execution Strategy=Baseline (No Chunking)2026.04 | 64 | 4.5 | 85 | |
| Sequential ExecutionModel=LLaMA-1B, Execution Strategy=Sequential2026.04 | 63 | 4.1 | 84 | |
| Sequential ExecutionModel=Qwen-1.5B, Execution Strategy=Sequential2026.04 | 60 | 4 | 85 | |
| BaselineModel=LLaMA-8B, Execution Strategy=Baseline (No Chunking)2026.04 | 60 | 4.2 | 82 | |
| BaselineModel=Qwen-4B, Execution Strategy=Baseline (No Chunking)2026.04 | 56 | 3.9 | 78 | |
| BaselineModel=LLaMA-3B, Execution Strategy=Baseline (No Chunking)2026.04 | 48 | 3.5 | 72 | |
| BaselineModel=LLaMA-1B, Execution Strategy=Baseline (No Chunking)2026.04 | 42 | 3.4 | 70 | |
| BaselineModel=Qwen-1.5B, Execution Strategy=Baseline (No Chunking)2026.04 | 38 | 3.1 | 66 |