Team Ai
Datasetpublic

LucaGroup/LucaOne-Downstream-Task-Datasets

split: devpath: dataset/ncRNAFam/gene/multi_class/dev/dev.csv split: testpath: dataset/ncRNAFam/gene/multi_class/test/test.csv split: labelpath: dataset/ncRNAFam/gene/multi_class/label.txt config_name: ncRPIdata_files: split: trainpath: dataset/ncRPI/gene_protein/binary_class/train/train.csv split: devpath: dataset/ncRPI/gene_protein/binary_class/dev/dev.csv split: testpath:… See the full description on the dataset page: https://huggingface.co/datasets/LucaGroup/LucaOne-Downstream-Task-Datasets.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
2likes83downloads
Dataset Card
  • —split: dev path: dataset/ncRNAFam/gene/multi_class/dev/dev.csv
  • —split: test path: dataset/ncRNAFam/gene/multi_class/test/test.csv
  • —split: label path: dataset/ncRNAFam/gene/multi_class/label.txt
  • —configname: ncRPI datafiles:
  • —split: train path: dataset/ncRPI/geneprotein/binaryclass/train/train.csv
  • —split: dev path: dataset/ncRPI/geneprotein/binaryclass/dev/dev.csv
  • —split: test path: dataset/ncRPI/geneprotein/binaryclass/test/test.csv
  • —configname: PPI datafiles:
  • —split: train path: dataset/PPI/protein/binary_class/train/train.csv
  • —split: dev path: dataset/PPI/protein/binary_class/dev/dev.csv
  • —split: test path: dataset/PPI/protein/binary_class/test/test.csv
  • —configname: ProtLoc datafiles:
  • —split: train path: dataset/ProtLoc/protein/multi_class/train/train.csv
  • —split: dev path: dataset/ProtLoc/protein/multi_class/dev/dev.csv
  • —split: test path: dataset/ProtLoc/protein/multi_class/test/test.csv
  • —configname: ProtLocCDSGene datafiles:
  • —split: train path: dataset/ProtLocCDSGene/gene/multi_class/train/train.csv
  • —split: dev path: dataset/ProtLocCDSGene/gene/multi_class/dev/dev.csv
  • —split: test path: dataset/ProtLocCDSGene/gene/multi_class/test/test.csv
  • —configname: ProtLocCDSProt datafiles:
  • —split: train path: dataset/ProtLocCDSProt/protein/multi_class/train/train.csv
  • —split: dev path: dataset/ProtLocCDSProt/protein/multi_class/dev/dev.csv
  • —split: test path: dataset/ProtLocCDSProt/protein/multi_class/test/test.csv
  • —split: label path: dataset/ProtLocCDSProt/protein/multi_class/label.txt
  • —configname: ProtStab datafiles:
  • —split: train path: dataset/ProtStab/protein/regression/train/train.csv
  • —split: dev path: dataset/ProtStab/protein/regression/dev/dev.csv
  • —split: test path: dataset/ProtStab/protein/regression/test/test.csv
  • —configname: SpeciesTax datafiles:
  • —split: train path: dataset/SpeciesTax/gene/multi_class/train/train.csv
  • —split: dev path: dataset/SpeciesTax/gene/multi_class/dev/dev.csv
  • —split: test path: dataset/SpeciesTax/gene/multi_class/test/test.csv
  • —configname: SupKTax datafiles:
  • —split: train path: dataset/SupKTax/gene/multi_class/train/train.csv
  • —split: dev path: dataset/SupKTax/gene/multi_class/dev/dev.csv
  • —split: test path: dataset/SupKTax/gene/multi_class/test/test.csv

LucaOne-Downstream-Task-Datasets

This directory includes all the downstream task datasets of the LucaOne paper (https://www.nature.com/articles/s42256-025-01044-4).

Dataset Structure

This dataset includes three splits and a label info file:

  • —train(training dataset)
  • —dev (validation dataset)
  • —test (testing dataset)
  • —label.txt (label name to label index in *.csv, labelidx=${the line number of labelname - 1})

Usage:

python
from datasets import load_dataset


# load ncRPI dataset
ds = load_dataset("LucaGroup/LucaOne-Downstream-Task-Datasets", name="ncRPI")

Github

https://github.com/LucaOne/ - split: dev path: dataset/ncRNAFam/gene/multi_class/dev/dev.csv

  • —split: test path: dataset/ncRNAFam/gene/multi_class/test/test.csv
  • —split: label path: dataset/ncRNAFam/gene/multi_class/label.txt
  • —configname: ncRPI datafiles:
  • —split: train path: dataset/ncRPI/geneprotein/binaryclass/train/train.csv
  • —split: dev path: dataset/ncRPI/geneprotein/binaryclass/dev/dev.csv
  • —split: test path: dataset/ncRPI/geneprotein/binaryclass/test/test.csv
  • —configname: PPI datafiles:
  • —split: train path: dataset/PPI/protein/binary_class/train/train.csv
  • —split: dev path: dataset/PPI/protein/binary_class/dev/dev.csv
  • —split: test path: dataset/PPI/protein/binary_class/test/test.csv
  • —configname: ProtLoc datafiles:
  • —split: train path: dataset/ProtLoc/protein/multi_class/train/train.csv
  • —split: dev path: dataset/ProtLoc/protein/multi_class/dev/dev.csv
  • —split: test path: dataset/ProtLoc/protein/multi_class/test/test.csv
  • —configname: ProtLocCDSGene datafiles:
  • —split: train path: dataset/ProtLocCDSGene/gene/multi_class/train/train.csv
  • —split: dev path: dataset/ProtLocCDSGene/gene/multi_class/dev/dev.csv
  • —split: test path: dataset/ProtLocCDSGene/gene/multi_class/test/test.csv
  • —configname: ProtLocCDSProt datafiles:
  • —split: train path: dataset/ProtLocCDSProt/protein/multi_class/train/train.csv
  • —split: dev path: dataset/ProtLocCDSProt/protein/multi_class/dev/dev.csv
  • —split: test path: dataset/ProtLocCDSProt/protein/multi_class/test/test.csv
  • —split: label path: dataset/ProtLocCDSProt/protein/multi_class/label.txt
  • —configname: ProtStab datafiles:
  • —split: train path: dataset/ProtStab/protein/regression/train/train.csv
  • —split: dev path: dataset/ProtStab/protein/regression/dev/dev.csv
  • —split: test path: dataset/ProtStab/protein/regression/test/test.csv
  • —configname: SpeciesTax datafiles:
  • —split: train path: dataset/SpeciesTax/gene/multi_class/train/train.csv
  • —split: dev path: dataset/SpeciesTax/gene/multi_class/dev/dev.csv
  • —split: test path: dataset/SpeciesTax/gene/multi_class/test/test.csv
  • —configname: SupKTax datafiles:
  • —split: train path: dataset/SupKTax/gene/multi_class/train/train.csv
  • —split: dev path: dataset/SupKTax/gene/multi_class/dev/dev.csv
  • —split: test path: dataset/SupKTax/gene/multi_class/test/test.csv

LucaOne-Downstream-Task-Datasets

This directory includes all the downstream task datasets of the LucaOne paper (https://www.nature.com/articles/s42256-025-01044-4).

Dataset Structure

This dataset includes three splits and a label info file:

  • —train(training dataset)
  • —dev (validation dataset)
  • —test (testing dataset)
  • —label.txt (label name to label index in *.csv, labelidx=${the line number of labelname - 1})

Usage:

python
from datasets import load_dataset


# load ncRPI dataset
ds = load_dataset("LucaGroup/LucaOne-Downstream-Task-Datasets", name="ncRPI")

Github

https://github.com/LucaOne/