Coding Ability on HumanEval (test)
28.49AccuracyAlpaca-GPT4 + NAIT (CodeX)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Alpaca-GPT4 + NAIT (CodeX)System ID=09, Capability Features=Individual, Data sampling ratio=10%2026.03 | 28.49 | 37.06 | 2.88 | |
| Alpaca-GPT4 + SelectITSystem ID=05, Fine-tuning protocol=Full Fine-tuning, Data sampling ratio=10%2026.03 | 27.92 | 37.16 | 3.15 | |
| Alpaca-GPT4System ID=01, Fine-tuning protocol=Full Fine-tuning, Data sampling ratio=10%2026.03 | 27.87 | 36.03 | — | |
| Alpaca-GPT4 + NAIT (GSM)System ID=08, Capability Features=Individual, Data sampling ratio=10%2026.03 | 27.84 | 37.7 | 4.65 | |
| LIMASystem ID=02, Fine-tuning protocol=Full Fine-tuning, Data sampling ratio=10%2026.03 | 27.75 | 36.17 | 0.39 | |
| Alpaca-GPT4 + NAIT (7-11)System ID=12, Capability Features=All, Data sampling ratio=10%2026.03 | 26.44 | 37.2 | 3.24 | |
| Alpaca-GPT4 + Random BaselineSystem ID=06, Fine-tuning protocol=Full Fine-tuning, Data sampling ratio=10%2026.03 | 25.55 | 35.69 | -0.94 | |
| Alpaca-GPT4 + NAIT (MMLU)System ID=07, Capability Features=Individual, Data sampling ratio=10%2026.03 | 25.23 | 37.18 | 3.2 | |
| Alpaca-GPT4 + Q2QSystem ID=04, Fine-tuning protocol=Full Fine-tuning, Data sampling ratio=10%2026.03 | 25.19 | 35.68 | -0.98 | |
| Alpaca-GPT4 + NAIT (BBH)System ID=11, Capability Features=Individual, Data sampling ratio=10%2026.03 | 25.15 | 36.47 | 1.23 | |
| Alpaca-GPT4 + NAIT (TydiQA)System ID=10, Capability Features=Individual, Data sampling ratio=10%2026.03 | 25.02 | 36.71 | 1.89 | |
| Alpaca-GPT4 + AlpaGasusSystem ID=03, Fine-tuning protocol=Full Fine-tuning, Data sampling ratio=10%2026.03 | 23.94 | 35.18 | -2.34 |