Internal Humorous Image Captioning Dataset
85Win RateHUMORCHAIN (without discriminator) (J)
Evaluation Results
| Method | Links | |
|---|---|---|
| HUMORCHAIN (without discriminator) (J)Strategy=Theory-Guided Multi-Stage Reasoning (without discriminator), Total Samples=300, Evaluation Protocol=Pairwise comparison vs Zero-shot (A)2025.11 | 85 | |
| HUMORCHAIN (without discriminator) (J)Strategy=Theory-Guided Multi-Stage Reasoning (without discriminator), Total Samples=300, Evaluation Protocol=Pairwise comparison vs Few-shot + Rule-Guided + CoT (F)2025.11 | 83 | |
| HUMORCHAIN (I)Strategy=Theory-Guided Multi-Stage Reasoning, Total Samples=300, Evaluation Protocol=Pairwise comparison vs HUMORCHAIN (J)2025.11 | 74.5 | |
| HUMORCHAIN (I)Strategy=Theory-Guided Multi-Stage Reasoning, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Zero-shot (A)2025.11 | 69.5 | |
| HUMORCHAIN (I)Strategy=Theory-Guided Multi-Stage Reasoning, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Few-shot + Rule-Guided + CoT (F)2025.11 | 68 | |
| Rule-Guided + CoT (E)Strategy=Adds Chain-of-Thought reasoning to theory-guided captioning, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Rule-Based (C)2025.11 | 53.5 | |
| Few-shot + Rule-Based (D)Strategy=Combines examples with theoretical references, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Few-shot + Rule-Guided + CoT (F)2025.11 | 52.3 | |
| Few-shot + Rule-Guided + CoT (F)Strategy=Combines all strategies without explicit multi-stage orchestration, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Rule-Guided + CoT (E)2025.11 | 51.8 | |
| Few-shot + Rule-Based (D)Strategy=Combines examples with theoretical references, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Few-shot (B)2025.11 | 50.8 | |
| Few-shot (B)Strategy=Example-based prompting with humor-style mimicry, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Zero-shot (A)2025.11 | 50.5 | |
| Zero-shot (A)Strategy=Direct image captioning without examples or theoretical cues, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Rule-Based (C)2025.11 | 50.2 | |
| Rule-Based (C)Strategy=References the four theories of humor, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Zero-shot (A)2025.11 | 49.8 | |
| Zero-shot (A)Strategy=Direct image captioning without examples or theoretical cues, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Few-shot (B)2025.11 | 49.5 | |
| Few-shot (B)Strategy=Example-based prompting with humor-style mimicry, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Few-shot + Rule-Based (D)2025.11 | 49.2 | |
| Rule-Guided + CoT (E)Strategy=Adds Chain-of-Thought reasoning to theory-guided captioning, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Few-shot + Rule-Guided + CoT (F)2025.11 | 48.2 | |
| Few-shot + Rule-Guided + CoT (F)Strategy=Combines all strategies without explicit multi-stage orchestration, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Few-shot + Rule-Based (D)2025.11 | 47.7 | |
| Rule-Based (C)Strategy=References the four theories of humor, Total Samples=300, Evaluation Protocol=Pairwise comparison vs Rule-Guided + CoT (E)2025.11 | 46.5 | |
| Few-shot + Rule-Guided + CoT (F)Strategy=Combines all strategies, Total Samples=300, Evaluation Protocol=Pairwise comparison vs HUMORCHAIN (I)2025.11 | 32 | |
| Zero-shot (A)Strategy=Direct image captioning, Total Samples=300, Evaluation Protocol=Pairwise comparison vs HUMORCHAIN (I)2025.11 | 30.5 | |
| HUMORCHAIN (without discriminator) (J)Strategy=Theory-Guided Multi-Stage Reasoning (without discriminator), Total Samples=300, Evaluation Protocol=Pairwise comparison vs HUMORCHAIN (I)2025.11 | 25.5 | |
| Few-shot + Rule-Guided + CoT (F)Strategy=Combines all strategies, Total Samples=300, Evaluation Protocol=Pairwise comparison vs HUMORCHAIN (J)2025.11 | 17 | |
| Zero-shot (A)Strategy=Direct image captioning, Total Samples=300, Evaluation Protocol=Pairwise comparison vs HUMORCHAIN (J)2025.11 | 15 |