Inference Efficiency on 200 samples Indic and English (test)
18.98TTFT (ms)MUTANT-Indic
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MUTANT-IndicParameters=1B, Hardware=8 H100 GPUs, Backend=Triton Inference Server, Max generation limit=256 new tokens2025.11 | 18.98 | 169.42 | |
| LLaMA-4Parameters=1B, Hardware=8 H100 GPUs, Backend=Triton Inference Server, Max generation limit=256 new tokens2025.11 | 19.17 | 117.99 |