Semantic Correctness Evaluation on M2F
73FaithfulnessNL vs. Lean
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| NL vs. LeanEvaluation Protocol=direct, Model=DeepSeek2026.06 | 73 | 2 | 25 | 74.7 | |
| NL vs. NLbEvaluation Protocol=round-trip, Model=GPT-oss-120b2026.06 | 61 | 13 | 26 | 74.7 |