mlfoundations-dev/a1_code_sql_create_context_1744691318_eval_1331
mlfoundations-dev/a1_code_sql_create_context_1744691318_eval_1331 Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AMC23 MATH500 GPQADiamond JEEBench MMLUPro LiveCodeBench CodeElo Accuracy 9.7 40.0 52.0 26.9 20.4 28.4 11.7 4.3 AIME24 Average Accuracy: 9.67% ± 1.20% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 6.67% 2 30 2 16.67% 5 30 3 16.67% 5 30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/a1_code_sql_create_context_1744691318_eval_1331.
021
mlfoundations-dev/a1codesqlcreatecontext1744691318eval_1331
Precomputed model outputs for evaluation.
Evaluation Results
Summary
AIME24
- Average Accuracy: 9.67% ± 1.20%
- Number of Runs: 10
AMC23
- Average Accuracy: 40.00% ± 1.27%
- Number of Runs: 10
MATH500
- Accuracy: 52.00% | Accuracy | Questions Solved | Total Questions | |----------|-----------------|----------------| | 52.00% | 260 | 500 |
GPQADiamond
- Average Accuracy: 26.94% ± 2.25%
- Number of Runs: 3
JEEBench
- Average Accuracy: 20.42% ± 0.42%
- Number of Runs: 3
MMLUPro
- Average Accuracy: 28.40% ± 0.00%
- Number of Runs: 1
LiveCodeBench
- Average Accuracy: 11.74% ± 2.18%
- Number of Runs: 3
CodeElo
- Average Accuracy: 4.26% ± 0.23%
- Number of Runs: 3
