Team Ai
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01base-model-evals /global-mmlu-rephrased global_mmlu (rephrased for base-model evaluation) Global MMLU knowledge-MCQA items rewritten from question format into completion/cloze format for base (non-instruction-tuned) language model evaluation. Base (non-instruction-tuned) language models often can't follow question-style prompts like "What is the capital of Turkey?" -- that phrasing is suited to instruction-tuned models. Each item here has been rewritten into a natural completion prefix (e.g. "The capital of Turkey is… See the full description on the dataset page: https://huggingface.co/datasets/base-model-evals/global-mmlu-rephrased.tabularmultiple-choicen<1K0 likes70 downloads23d agoHugging Face02base-model-evals /belebele-rephrased belebele (rephrased for base-model evaluation) Belebele reading-comprehension items rewritten from question format into completion/cloze format for base (non-instruction-tuned) language model evaluation. Base (non-instruction-tuned) language models often can't follow question-style prompts like "What is the capital of Turkey?" -- that phrasing is suited to instruction-tuned models. Each item here has been rewritten into a natural completion prefix (e.g. "The capital of Turkey is… See the full description on the dataset page: https://huggingface.co/datasets/base-model-evals/belebele-rephrased.tabularmultiple-choicen<1K0 likes62 downloads23d agoHugging Face03Kyleyee /train_data_imdb_from_base_modeltabular10K<n<100K0 likes38 downloads2y agoHugging Face04davanstrien /hub_models_with_base_model_infotabular10K<n<100K1 likes27 downloads3y agoHugging Face05oceanpty /Self-J-score-wo-ref-base-lla31-8b-inst-model-lla-31-8b-inst-thre-1tabular10K<n<100K0 likes18 downloads2y agoHugging Face06ksamiein /MATH_OOD_Test_D1_Base_Model_Eval_COTtabularn<1K0 likes17 downloads1y agoHugging Face07LightningRodLabs /tetlock-binary-data-20260625_base_model_analyzedtabularn<1K0 likes17 downloads4mo agoHugging Face08librarian-bots /hub_models_with_base_model_info Dataset Card for Hugging Face Hub Models with Base Model Metadata Dataset Details This dataset contains a subset of possible metadata for models hosted on the Hugging Face Hub. All of these models contain base_model metadata i.e. information about the model used for fine-tuning. This data can be used for creating network graphs showing links between models on the Hub. Dataset Description Curated by: [More Information Needed] Funded by [optional]: [More… See the full description on the dataset page: https://huggingface.co/datasets/librarian-bots/hub_models_with_base_model_info.tabular10K<n<100K5 likes16 downloads3y agoHugging Face09TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_5o__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-acronym_5o Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-27T02:02:12.652182 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_5o__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_5o__v1.tabularn<1K0 likes15 downloads1y agoHugging Face10TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_2dig__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_2dig Experiment Description: Evaluation experiment for task longmult_2dig from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-27T00:50:28.324661 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_2dig__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_2dig__v1.tabular1K<n<10K0 likes14 downloads1y agoHugging Face11oceanpty /Self-J-score-w-ref-ref-lla31-70b-inst-base-lla31-8b-inst-model-lla-31-8b-inst-thre-1tabular10K<n<100K0 likes13 downloads2y agoHugging Face12TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_3dig__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_3dig Experiment Description: Evaluation experiment for task longmult_3dig from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-27T01:07:20.942754 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_3dig__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_3dig__v1.tabular1K<n<10K0 likes13 downloads1y agoHugging Face13TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_5dig__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_5dig Experiment Description: Evaluation experiment for task longmult_5dig from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-27T01:43:02.308956 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_5dig__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_5dig__v1.tabular1K<n<10K0 likes13 downloads1y agoHugging Face14ArrojoeDrigoLab /quantem-base-model-sources QuantEM — base model data sources Every dataset in the corpus the QuantEM ViT-B encoder was pretrained on: public repository holdings, data contributed by external laboratories through the QuantEM outreach campaign, and in-house acquisitions. Emitted verbatim from Supplementary Table 2 of the QuantEM manuscript — 657 rows. Please cite the original sources listed here alongside QuantEM; rows carry a DOI or repository URL where one exists. Related: ArrojoeDrigoLab/quantem — the… See the full description on the dataset page: https://huggingface.co/datasets/ArrojoeDrigoLab/quantem-base-model-sources.tabularn<1K0 likes13 downloads2mo agoHugging Face15oceanpty /Self-J-score-w-ref-ref-llama31-70b-inst-base-llama31-8b-inst-model-lla31-8b-qwen2-7b-inst-0.5tabular10K<n<100K0 likes12 downloads2y agoHugging Face16TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o Experiment Description: Evaluation experiment for task letter_countdown_5o from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-27T02:12:20.603697 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o__v1.tabularn<1K0 likes12 downloads1y agoHugging Face17TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_4o__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-acronym_4o Experiment Description: Evaluation experiment for task acronym_4o from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-27T02:06:08.393551 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_4o__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_4o__v1.tabularn<1K0 likes11 downloads1y agoHugging Face18TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o Experiment Description: Evaluation experiment for task letter_countdown_4o from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-27T02:22:26.243577 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o__v1.tabularn<1K0 likes11 downloads1y agoHugging Face19JIAN-PENG /LLM_Beyond_Base_Model_qwen2.5_3b_correct_0531tabular10K<n<100K0 likes10 downloads1y agoHugging Face20JIAN-PENG /LLM_Beyond_Base_Model_qwen2.5_3btabular100K<n<1M0 likes9 downloads1y agoHugging Face21TAUR-dev /D-EVAL__standard_eval_v3__new_tasks_eval__base_model-eval_0tabularn<1K0 likes9 downloads1y agoHugging Face22TAUR-dev /D-EVAL__standard_eval_v3__FinEval_basemodel-eval_0tabular10K<n<100K0 likes8 downloads1y agoHugging Face23TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_5arg__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-countdown_5arg Experiment Description: Evaluation experiment for task countdown_5arg from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-26T23:24:41.569284 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_5arg__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_5arg__v1.tabular1K<n<10K0 likes7 downloads1y agoHugging Face24TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-commonsenseQA__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-commonsenseQA Experiment Description: Evaluation experiment for task commonsenseQA from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-27T00:08:01.014212 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-commonsenseQA__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-commonsenseQA__v1.tabular1K<n<10K0 likes7 downloads1y agoHugging Face25TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_4dig__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_4dig Experiment Description: Evaluation experiment for task longmult_4dig from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-27T01:24:13.992023 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_4dig__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_4dig__v1.tabular1K<n<10K0 likes7 downloads1y agoHugging Face26arianaazarbal /base_llama_1b_model_judged_generationstabularn<1K0 likes6 downloads1y agoHugging Face27TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_6arg__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-countdown_6arg Experiment Description: Evaluation experiment for task countdown_6arg from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-26T23:45:50.852122 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_6arg__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_6arg__v1.tabular1K<n<10K0 likes6 downloads1y agoHugging Face28TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-gsm8k__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-gsm8k Experiment Description: Evaluation experiment for task gsm8k from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-27T00:28:26.546911 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-gsm8k__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following configurations with immediate… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-gsm8k__v1.tabular1K<n<10K0 likes6 downloads1y agoHugging Face29TAUR-dev /D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_3arg__v1 Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-countdown_3arg Experiment Description: Evaluation experiment for task countdown_3arg from FinEval_16k_fulleval_3args_basemodel Start Time: 2025-10-26T22:45:00.332516 Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_3arg__v1 Stages Completed Total stages: 1 Models Created Dataset Configurations This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_3arg__v1.tabular1K<n<10K0 likes5 downloads1y agoHugging Face30TAUR-dev /D-EVAL__standard_eval_v3__FinEval_16k_fulleval__3args_basemodel-eval_0tabular10K<n<100K0 likes5 downloads1y agoHugging Face

Listings come live from the Hugging Face Hub API. Team Ai does not host these files.