Medical Reasoning on MedQA and MedMCQA mixture
59.4Pass@1FedAvg-PubSwap
Evaluation Results
| Method | Links | |
|---|---|---|
| FedAvg-PubSwapBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=40, Number of GRPO steps=540, Aggregation strategy=Balanced, Swap period=22026.04 | 59.4 | |
| FedAvg-GRPOBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=10, Number of GRPO steps=5402026.04 | 58.7 | |
| FedAvg-PubSwapBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=90, Number of GRPO steps=540, Aggregation strategy=Balanced, Swap period=22026.04 | 58.5 | |
| FedAvg-GRPOBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=40, Number of GRPO steps=5402026.04 | 58.2 | |
| FedAvg-PubSwapBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=120, Number of GRPO steps=600, Aggregation strategy=Balanced, Swap period=22026.04 | 58.1 | |
| FedAvg-GRPOBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=90, Number of GRPO steps=5402026.04 | 57.9 | |
| FedAvg-PubSwapBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=10, Number of GRPO steps=540, Aggregation strategy=Balanced, Swap period=22026.04 | 57.5 | |
| FedAvg-GRPOBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=120, Number of GRPO steps=6002026.04 | 56 | |
| Base modelBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=10, Number of GRPO steps=5402026.04 | 49.2 | |
| Base modelBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=40, Number of GRPO steps=5402026.04 | 49.2 | |
| Base modelBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=90, Number of GRPO steps=5402026.04 | 49.2 | |
| Base modelBackbone=Llama3.2-3B-Instruct, Number of local steps (τ)=120, Number of GRPO steps=6002026.04 | 49.2 |