leannmlindsey/GUE
This is a copy of the Genome Understanding Evaluation (GUE) that was presented in DNABERT-2: Efficient Foundation Model and Benchmark For Multi-Species Genome Zhihan Zhou and Yanrong Ji and Weijian Li and Pratik Dutta and Ramana Davuluri and Han Liu and is available to download directly from https://github.com/MAGICS-LAB/DNABERT_2 If you use this dataset, please cite @misc{zhou2023dnabert2, title={DNABERT-2: Efficient Foundation Model and Benchmark For Multi-Species Genome}… See the full description on the dataset page: https://huggingface.co/datasets/leannmlindsey/GUE.
configs:
- configname: empH3 data_files:
- split: train path: "GUE/emp_H3/train.csv"
- split: test path: "GUE/emp_H3/test.csv"
- split: dev path: "GUE/emp_H3/dev.csv"
- configname: empH3K14ac data_files:
- split: train path: "GUE/emp_H3K14ac/train.csv"
- split: test path: "GUE/emp_H3K14ac/test.csv"
- split: dev path: "GUE/emp_H3K14ac/dev.csv"
- configname: empH3K36me3 data_files:
- split: train path: "GUE/emp_H3K36me3/train.csv"
- split: test path: "GUE/emp_H3K36me3/test.csv"
- split: dev path: "GUE/emp_H3K36me3/dev.csv"
- configname: empH3K4me1 data_files:
- split: train path: "GUE/emp_H3K4me1/train.csv"
- split: test path: "GUE/emp_H3K4me1/test.csv"
- split: dev path: "GUE/emp_H3K4me1/dev.csv"
- configname: empH3K4me2 data_files:
- split: train path: "GUE/emp_H3K4me2/train.csv"
- split: test path: "GUE/emp_H3K4me2/test.csv"
- split: dev path: "GUE/emp_H3K4me2/dev.csv"
- configname: empH3K4me3 data_files:
- split: train path: "GUE/emp_H3K4me3/train.csv"
- split: test path: "GUE/emp_H3K4me3/test.csv"
- split: dev path: "GUE/emp_H3K4me3/dev.csv"
- configname: empH3K79me3 data_files:
- split: train path: "GUE/emp_H3K79me3/train.csv"
- split: test path: "GUE/emp_H3K79me3/test.csv"
- split: dev path: "GUE/emp_H3K79me3/dev.csv"
- configname: empH3K9ac data_files:
- split: train path: "GUE/emp_H3K9ac/train.csv"
- split: test path: "GUE/emp_H3K9ac/test.csv"
- split: dev path: "GUE/emp_H3K9ac/dev.csv"
- configname: empH4 data_files:
- split: train path: "GUE/emp_H4/train.csv"
- split: test path: "GUE/emp_H4/test.csv"
- split: dev path: "GUE/emp_H4/dev.csv"
- configname: empH4ac data_files:
- split: train path: "GUE/emp_H4ac/train.csv"
- split: test path: "GUE/emp_H4ac/test.csv"
- split: dev path: "GUE/emp_H4ac/dev.csv"
- configname: humantf0 datafiles:
- split: train path: "GUE/humantf0/train.csv"
- split: test path: "GUE/humantf0/test.csv"
- split: dev path: "GUE/humantf0/dev.csv"
- configname: humantf1 datafiles:
- split: train path: "GUE/humantf1/train.csv"
- split: test path: "GUE/humantf1/test.csv"
- split: dev path: "GUE/humantf1/dev.csv"
- configname: humantf2 datafiles:
- split: train path: "GUE/humantf2/train.csv"
- split: test path: "GUE/humantf2/test.csv"
- split: dev path: "GUE/humantf2/dev.csv"
- configname: humantf3 datafiles:
- split: train path: "GUE/humantf3/train.csv"
- split: test path: "GUE/humantf3/test.csv"
- split: dev path: "GUE/humantf3/dev.csv"
- configname: humantf4 datafiles:
- split: train path: "GUE/humantf4/train.csv"
- split: test path: "GUE/humantf4/test.csv"
- split: dev path: "GUE/humantf4/dev.csv"
- configname: mouse0 data_files:
- split: train path: "GUE/mouse_0/train.csv"
- split: test path: "GUE/mouse_0/test.csv"
- split: dev path: "GUE/mouse_0/dev.csv"
- configname: mouse1 data_files:
- split: train path: "GUE/mouse_1/train.csv"
- split: test path: "GUE/mouse_1/test.csv"
- split: dev path: "GUE/mouse_1/dev.csv"
- configname: mouse2 data_files:
- split: train path: "GUE/mouse_2/train.csv"
- split: test path: "GUE/mouse_2/test.csv"
- split: dev path: "GUE/mouse_2/dev.csv"
- configname: mouse3 data_files:
- split: train path: "GUE/mouse_3/train.csv"
- split: test path: "GUE/mouse_3/test.csv"
- split: dev path: "GUE/mouse_3/dev.csv"
- configname: mouse4 data_files:
- split: train path: "GUE/mouse_4/train.csv"
- split: test path: "GUE/mouse_4/test.csv"
- split: dev path: "GUE/mouse_4/dev.csv"
- configname: prom300all datafiles:
- split: train path: "GUE/prom300all/train.csv"
- split: test path: "GUE/prom300all/test.csv"
- split: dev path: "GUE/prom300all/dev.csv"
- configname: prom300notata datafiles:
- split: train path: "GUE/prom300notata/train.csv"
- split: test path: "GUE/prom300notata/test.csv"
- split: dev path: "GUE/prom300notata/dev.csv"
- configname: prom300tata datafiles:
- split: train path: "GUE/prom300tata/train.csv"
- split: test path: "GUE/prom300tata/test.csv"
- split: dev path: "GUE/prom300tata/dev.csv"
- configname: promcoreall datafiles:
- split: train path: "GUE/promcoreall/train.csv"
- split: test path: "GUE/promcoreall/test.csv"
- split: dev path: "GUE/promcoreall/dev.csv"
- configname: promcorenotata datafiles:
- split: train path: "GUE/promcorenotata/train.csv"
- split: test path: "GUE/promcorenotata/test.csv"
- split: dev path: "GUE/promcorenotata/dev.csv"
- configname: promcoretata datafiles:
- split: train path: "GUE/promcoretata/train.csv"
- split: test path: "GUE/promcoretata/test.csv"
- split: dev path: "GUE/promcoretata/dev.csv"
- configname: splicereconstructed data_files:
- split: train path: "GUE/splice_reconstructed/train.csv"
- split: test path: "GUE/splice_reconstructed/test.csv"
- split: dev path: "GUE/splice_reconstructed/dev.csv"
- configname: viruscovid data_files:
- split: train path: "GUE/virus_covid/train.csv"
- split: test path: "GUE/virus_covid/test.csv"
- split: dev path: "GUE/virus_covid/dev.csv"
- configname: virusspecies40 datafiles:
- split: train path: "GUE/virusspecies40/train.csv"
- split: test path: "GUE/virusspecies40/test.csv"
- split: dev path: "GUE/virusspecies40/dev.csv"
- configname: fungispecies20 datafiles:
- split: train path: "GUE/fungispecies20/train.csv"
- split: test path: "GUE/fungispecies20/test.csv"
- split: dev path: "GUE/fungispecies20/dev.csv"
- configname: EPIK562 data_files:
- split: train path: "GUE/EPI_K562/train.csv"
- split: test path: "GUE/EPI_K562/test.csv"
- split: dev path: "GUE/EPI_K562/dev.csv"
- configname: EPIHeLa-S3 data_files:
- split: train path: "GUE/EPI_HeLa-S3/train.csv"
- split: test path: "GUE/EPI_HeLa-S3/test.csv"
- split: dev path: "GUE/EPI_HeLa-S3/dev.csv"
- configname: EPINHEK data_files:
- split: train path: "GUE/EPI_NHEK/train.csv"
- split: test path: "GUE/EPI_NHEK/test.csv"
- split: dev path: "GUE/EPI_NHEK/dev.csv"
- configname: EPIIMR90 data_files:
- split: train path: "GUE/EPI_IMR90/train.csv"
- split: test path: "GUE/EPI_IMR90/test.csv"
- split: dev path: "GUE/EPI_IMR90/dev.csv"
- configname: EPIHUVEC data_files:
- split: train path: "GUE/EPI_HUVEC/train.csv"
- split: test path: "GUE/EPI_HUVEC/test.csv"
- split: dev path: "GUE/EPI_HUVEC/dev.csv"
- configname: EPIGM12878 data_files:
- split: train path: "GUE/EPI_GM12878/train.csv"
- split: test path: "GUE/EPI_GM12878/test.csv"
- split: dev path: "GUE/EPI_GM12878/dev.csv"
- configname: phagefragments data_files:
- split: train path: "GUE/phage_fragments/train.csv"
- split: test path: "GUE/phage_fragments/test.csv"
- split: dev path: "GUE/phage_fragments/dev.csv" ---
This is a copy of the Genome Understanding Evaluation (GUE) that was presented in
DNABERT-2: Efficient Foundation Model and Benchmark For Multi-Species Genome
Zhihan Zhou and Yanrong Ji and Weijian Li and Pratik Dutta and Ramana Davuluri and Han Liu
and is available to download directly from
https://github.com/MAGICS-LAB/DNABERT_2
If you use this dataset, please cite
@misc{zhou2023dnabert2, title={DNABERT-2: Efficient Foundation Model and Benchmark For Multi-Species Genome}, author={Zhihan Zhou and Yanrong Ji and Weijian Li and Pratik Dutta and Ramana Davuluri and Han Liu}, year={2023}, eprint={2306.15006}, archivePrefix={arXiv}, primaryClass={q-bio.GN} }
Instructions to Load Dataset in Google Colab
# choose the dataset that you wish to load, ex: prom_core_all
from datasets import load_dataset, get_dataset_config_names
config_names = get_dataset_config_names("leannmlindsey/GUE")
print(config_names)
prom_core_all = load_dataset("leannmlindsey/GUE", name="prom_core_all")
prom_core_all
prom_core_all["train"][0]