mlfoundations-dev/a1_code_stackexchange_codereview_1744693103_eval_1331
mlfoundations-dev/a1_code_stackexchange_codereview_1744693103_eval_1331 Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AMC23 MATH500 GPQADiamond JEEBench MMLUPro LiveCodeBench CodeElo Accuracy 18.0 52.5 74.8 42.8 40.3 28.6 25.6 6.8 AIME24 Average Accuracy: 18.00% ± 1.35% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 26.67% 8 30 2 20.00% 6 30 3… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/a1_code_stackexchange_codereview_1744693103_eval_1331.
07
mlfoundations-dev/a1codestackexchangecodereview1744693103eval1331
Precomputed model outputs for evaluation.
Evaluation Results
Summary
AIME24
- Average Accuracy: 18.00% ± 1.35%
- Number of Runs: 10
AMC23
- Average Accuracy: 52.50% ± 1.77%
- Number of Runs: 10
MATH500
- Accuracy: 74.80% | Accuracy | Questions Solved | Total Questions | |----------|-----------------|----------------| | 74.80% | 374 | 500 |
GPQADiamond
- Average Accuracy: 42.76% ± 0.36%
- Number of Runs: 3
JEEBench
- Average Accuracy: 40.29% ± 0.92%
- Number of Runs: 3
MMLUPro
- Average Accuracy: 28.60% ± 0.00%
- Number of Runs: 1
LiveCodeBench
- Average Accuracy: 25.57% ± 0.57%
- Number of Runs: 3
CodeElo
- Average Accuracy: 6.82% ± 0.90%
- Number of Runs: 3
