Team Ai
Datasetpublic

OmniEvalKit/omnievalkit-dataset

OmniEvalKit Evaluation Datasets Evaluation datasets for OmniEvalKit, a comprehensive evaluation framework for omni-modal (audio + video + image + text) models. Overview Total subsets: 65 Total samples: 315,264 Total size: 620.3 GB (Parquet with embedded audio/image/video) Subsets with embedded video: 15 Subsets requiring external video download: 2 Usage from datasets import load_dataset ds = load_dataset("OmniEvalKit/omnievalkit-dataset"… See the full description on the dataset page: https://huggingface.co/datasets/OmniEvalKit/omnievalkit-dataset.

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes246downloads
Dataset Card

OmniEvalKit Evaluation Datasets

Evaluation datasets for OmniEvalKit, a comprehensive evaluation framework for omni-modal (audio + video + image + text) models.

Overview

  • —Total subsets: 65
  • —Total samples: 315,264
  • —Total size: 620.3 GB (Parquet with embedded audio/image/video)
  • —Subsets with embedded video: 15
  • —Subsets requiring external video download: 2

Usage

python
from datasets import load_dataset

ds = load_dataset("OmniEvalKit/omnievalkit-dataset", "aishell1_test")
for sample in ds["test"]:
    print(sample)

Available Subsets

Audio (44 subsets, 267,616 samples, 186.5GB)

SubsetDisplay NameSamplesSizeSubcategoryVideo
aishell1_testAISHELL-1 Test7,1761.1GBasrNo
aishell2_testAISHELL-2 Test5,000432MBasrNo
audio_trivia_qaAudio Trivia QA1,024322MBqaNo
audio_web_questionsAudio Web Questions2,032222MBqaNo
audiocaps_testAudioCaps Test3,985139.2GBcaptionNo
clothocaption_testClothoCaption Test1,0451.8GBcaptionNo
commonvoice_enCommonVoice English v1516,386664MBasrNo
commonvoice_frCommonVoice French v1516,132653MBasrNo
commonvoice_yueCommonVoice Cantonese v155,593217MBasrNo
commonvoice_zhCommonVoice Chinese v1510,625470MBasrNo
covost2_en_zhCoVoST2 EN-ZH15,530672MBastNo
covost2_zh_enCoVoST2 ZH-EN4,897225MBastNo
fleurs_enFLEURS 英文647383MBasrNo
fleurs_zhFLEURS 中文945664MBasrNo
gigaspeech_testGigaSpeech Test19,8704MBasrNo
kespeech_testKeSpeech Test19,7233.2GBasrNo
librispeech_dev_cleanLibriSpeech Dev Clean2,703326MBasrNo
librispeech_dev_otherLibriSpeech Dev Other2,864304MBasrNo
librispeech_test_cleanLibriSpeech Test Clean2,620334MBasrNo
librispeech_test_otherLibriSpeech Test Other2,939318MBasrNo
meldMELD2,6101.4GBclsYes
mmar_benchMMAR Bench1,0003.3GBqaNo
mmau_test_miniMMAU Test Mini1,0001.4GBqaNo
mmsu_benchMMSU Bench4,9961.3GBqaNo
peoples_speech_testPeople's Speech Test34,8983.8GBasrNo
tedlium3_testTED-LIUM v3 Test3,737790MBasrNo
vocalsoundVocalSound3,5911.0GBclsNo
voice_cmmluVoice CMMLU11,58213.3GBqaNo
voicebench_advbenchVoiceBench AdvBench5200MBqaNo
voicebench_alpacaevalVoiceBench AlpacaEval1990MBqaNo
voicebench_alpacaeval_fullVoiceBench AlpacaEval Full6360MBqaNo
voicebench_bbhVoiceBench BBH1,0000MBqaNo
voicebench_commonevalVoiceBench CommonEval2000MBqaNo
voicebench_ifevalVoiceBench IFEval3450MBqaNo
voicebench_mmsuVoiceBench MMSU3,0740MBqaNo
voicebench_openbookqaVoiceBench OpenBookQA4550MBqaNo
voicebench_sdqaVoiceBench SD-QA6,0830MBqaNo
voicebench_wildvoiceVoiceBench WildVoice1,0000MBqaNo
voxpopuli_enVoxPopuli English1,842899MBasrNo
wavcaps_audioset_slWavCaps AudioSet_SL11,6763.7GBcaptionNo
wavcaps_freesoundWavCaps FreeSound1,0602.7GBcaptionNo
wavcaps_soundbibleWavCaps SoundBible1,232530MBcaptionNo
wenetspeech_test_meetingWenetSpeech Test Meeting8,370377MBasrNo
wenetspeech_test_netWenetSpeech Test Net24,774682MBasrNo

Omni (20 subsets, 46,648 samples, 432.1GB)

SubsetDisplay NameSamplesSizeSubcategoryVideo
av_odysseyAV-Odyssey4,55531.2GBqaNo
avmeme_fullAVMeme-Exam Full1,032777MBmeme_understandingYes
avmeme_mainAVMeme-Exam Main846643MBmeme_understandingYes
avut_benchmark_geminiAVUT-Benchmark Gemini9,87449.4GBqaYes
avut_benchmark_humanAVUT-Benchmark Human1,73412.3GBqaYes
daily_omniDaily-Omni1,197966MBqaYes
futureomniFutureOmni1,03450.7GBqaYes
jointavbenchJointAVBench2,85337.4GBqaYes
livesports3k_ccLiveSports-3K CC1,70263.0GBcaptionYes
omnibenchOmniBench1,1421.2GBqaNo
ovavelOV-AVEL Test5,81811.2GBevent_localizationYes
ovobenchOVO-Bench1,46864.1GBqaYes
streamingbench_realStreamingBench-Real (Offline)2,49955.6GBqaYes
streamingbench_sqaStreamingBench-SQA (Offline)2506.5GBqaYes
unobenchUNO-Bench3,7307.8GBqaNo
unobench_mcUNO-Bench-MC1,0003.6GBqaNo
video_holmesVideo-Holmes1,8375.8GBqaYes
videommeVideo-MME526MBqaYes
videomme_shortVideo-MME (Short)9003.8GBqaYes
worldsenseWorldSense3,17226.0GBqaYes

Unknown (1 subsets, 1,000 samples, 1.7GB)

SubsetDisplay NameSamplesSizeSubcategoryVideo
streamingbench_omnistreamingbench_omni1,0001.7GBunknownNo

Data Format

Each subset is stored as Parquet file(s):

  • —Metadata fields: All original JSONL fields (question, answer, paths, etc.)
  • —`audio`: HuggingFace Audio type — struct<bytes: binary, path: string>, playable in Dataset Viewer
  • —`image`: HuggingFace Image type — struct<bytes: binary, path: string>, viewable in Dataset Viewer
  • —`video`: Video binary — struct<bytes: binary, path: string>, embedded for applicable subsets
  • —`audio_bytes_dict`: Multiple audio files as base64-encoded JSON string
  • —`image_bytes_dict`: Multiple image files as base64-encoded JSON string

License

Apache 2.0. Individual datasets may have their own licenses.