mlfoundations-dev/a1_code_stackexchange_codereview_1744643682_eval_1331
mlfoundations-dev/a1_code_stackexchange_codereview_1744643682_eval_1331 Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AMC23 MATH500 GPQADiamond JEEBench MMLUPro LiveCodeBench CodeElo Accuracy 16.3 55.8 76.2 46.3 39.1 29.0 25.2 6.5 AIME24 Average Accuracy: 16.33% ± 1.52% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 26.67% 8 30 2 16.67% 5 30 3… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/a1_code_stackexchange_codereview_1744643682_eval_1331.
09
mlfoundations-dev/a1codestackexchangecodereview1744643682eval1331
Precomputed model outputs for evaluation.
Evaluation Results
Summary
AIME24
- Average Accuracy: 16.33% ± 1.52%
- Number of Runs: 10
AMC23
- Average Accuracy: 55.75% ± 2.24%
- Number of Runs: 10
MATH500
- Accuracy: 76.20% | Accuracy | Questions Solved | Total Questions | |----------|-----------------|----------------| | 76.20% | 381 | 500 |
GPQADiamond
- Average Accuracy: 46.30% ± 1.13%
- Number of Runs: 3
JEEBench
- Average Accuracy: 39.14% ± 0.79%
- Number of Runs: 3
MMLUPro
- Average Accuracy: 29.00% ± 0.00%
- Number of Runs: 1
LiveCodeBench
- Average Accuracy: 25.24% ± 0.60%
- Number of Runs: 3
CodeElo
- Average Accuracy: 6.48% ± 0.37%
- Number of Runs: 3
