datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
global-mmlu-rephrased
global_mmlu (rephrased for base-model evaluation)
Global MMLU knowledge-MCQA items rewritten from question format into completion/cloze format for base (non-instruction-tuned) language model evaluation.
Base (non-instruction-tuned) language models often can't follow question-style
prompts like "What is the capital of Turkey?" -- that phrasing is suited to
instruction-tuned models. Each item here has been rewritten into a natural
completion prefix (e.g. "The capital of Turkey is… See the full description on the dataset page: https://huggingface.co/datasets/base-model-evals/global-mmlu-rephrased.belebele-rephrased
belebele (rephrased for base-model evaluation)
Belebele reading-comprehension items rewritten from question format into completion/cloze format for base (non-instruction-tuned) language model evaluation.
Base (non-instruction-tuned) language models often can't follow question-style
prompts like "What is the capital of Turkey?" -- that phrasing is suited to
instruction-tuned models. Each item here has been rewritten into a natural
completion prefix (e.g. "The capital of Turkey is… See the full description on the dataset page: https://huggingface.co/datasets/base-model-evals/belebele-rephrased.train_data_imdb_from_base_modelhub_models_with_base_model_infoSelf-J-score-wo-ref-base-lla31-8b-inst-model-lla-31-8b-inst-thre-1MATH_OOD_Test_D1_Base_Model_Eval_COTtetlock-binary-data-20260625_base_model_analyzedhub_models_with_base_model_info
Dataset Card for Hugging Face Hub Models with Base Model Metadata
Dataset Details
This dataset contains a subset of possible metadata for models hosted on the Hugging Face Hub.
All of these models contain base_model metadata i.e. information about the model used for fine-tuning.
This data can be used for creating network graphs showing links between models on the Hub.
Dataset Description
Curated by: [More Information Needed]
Funded by [optional]: [More… See the full description on the dataset page: https://huggingface.co/datasets/librarian-bots/hub_models_with_base_model_info.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_5o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-acronym_5o
Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T02:02:12.652182
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_5o__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_2dig__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_2dig
Experiment Description: Evaluation experiment for task longmult_2dig from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T00:50:28.324661
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_2dig__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_2dig__v1.Self-J-score-w-ref-ref-lla31-70b-inst-base-lla31-8b-inst-model-lla-31-8b-inst-thre-1D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_3dig__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_3dig
Experiment Description: Evaluation experiment for task longmult_3dig from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T01:07:20.942754
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_3dig__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_3dig__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_5dig__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_5dig
Experiment Description: Evaluation experiment for task longmult_5dig from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T01:43:02.308956
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_5dig__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_5dig__v1.quantem-base-model-sources
QuantEM — base model data sources
Every dataset in the corpus the QuantEM ViT-B encoder was pretrained on: public repository holdings, data contributed by external laboratories through the QuantEM outreach campaign, and in-house acquisitions.
Emitted verbatim from Supplementary Table 2 of the QuantEM manuscript — 657 rows. Please cite the
original sources listed here alongside QuantEM; rows carry a DOI or repository URL where one
exists.
Related:
ArrojoeDrigoLab/quantem — the… See the full description on the dataset page: https://huggingface.co/datasets/ArrojoeDrigoLab/quantem-base-model-sources.Self-J-score-w-ref-ref-llama31-70b-inst-base-llama31-8b-inst-model-lla31-8b-qwen2-7b-inst-0.5D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o
Experiment Description: Evaluation experiment for task letter_countdown_5o from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T02:12:20.603697
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_4o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-acronym_4o
Experiment Description: Evaluation experiment for task acronym_4o from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T02:06:08.393551
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_4o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_4o__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o
Experiment Description: Evaluation experiment for task letter_countdown_4o from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T02:22:26.243577
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o__v1.LLM_Beyond_Base_Model_qwen2.5_3b_correct_0531LLM_Beyond_Base_Model_qwen2.5_3bD-EVAL__standard_eval_v3__new_tasks_eval__base_model-eval_0D-EVAL__standard_eval_v3__FinEval_basemodel-eval_0D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_5arg__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-countdown_5arg
Experiment Description: Evaluation experiment for task countdown_5arg from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-26T23:24:41.569284
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_5arg__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_5arg__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-commonsenseQA__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-commonsenseQA
Experiment Description: Evaluation experiment for task commonsenseQA from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T00:08:01.014212
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-commonsenseQA__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-commonsenseQA__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_4dig__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_4dig
Experiment Description: Evaluation experiment for task longmult_4dig from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T01:24:13.992023
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_4dig__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_4dig__v1.base_llama_1b_model_judged_generationsD-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_6arg__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-countdown_6arg
Experiment Description: Evaluation experiment for task countdown_6arg from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-26T23:45:50.852122
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_6arg__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_6arg__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-gsm8k__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-gsm8k
Experiment Description: Evaluation experiment for task gsm8k from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T00:28:26.546911
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-gsm8k__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with immediate… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-gsm8k__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_3arg__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-countdown_3arg
Experiment Description: Evaluation experiment for task countdown_3arg from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-26T22:45:00.332516
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_3arg__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_3arg__v1.D-EVAL__standard_eval_v3__FinEval_16k_fulleval__3args_basemodel-eval_0
