Team Ai
20 results

data-processing

applied-ai-018 /peacock-data-public-datasets-idc-enfm-dataprocessing BharatGPT Data Curation for English Foundational Model RedPajamaV2 RedPajamaV2 directory contains scripts for processing and filtering of RedPajamaV2 dataset. Overall pipeline is as follows: URL Filtering scripts/utils/url_filtering.py: The first step of filtering is URL based. We use a blocklist of URLs known to contain inappropriate content. This list is taken from blocklistproject. It contains categories for advertisements, gambling, adult content, etc. All… See the full description on the dataset page: https://huggingface.co/datasets/applied-ai-018/peacock-data-public-datasets-idc-enfm-dataprocessing.0 likes274 downloads2y agoHugging Facerenjiepi /easy_5000_data_processingtext10K<n<100K0 likes99 downloads9mo agoHugging Facerenjiepi /medium_5000_data_processingtext1K<n<10K0 likes83 downloads9mo agoHugging Facelaion /nemotron-terminal-data_processing nemotron-terminal-data_processing Per-source partition of nvidia/Nemotron-Terminal-Corpus, filtered to source == "data_processing". The difficulty column preserves the original easy / medium / mixed split (na for the dataset_adapters/* files, which did not carry a difficulty label). Partitioning scheme: adapters_{code,math,swe} — rows from dataset_adapters/{code,math,swe}.parquet {skill} (e.g. debugging, security, …) — rows from synthetic_tasks/skill_based/{easy,medium… See the full description on the dataset page: https://huggingface.co/datasets/laion/nemotron-terminal-data_processing.textquestion-answering1K<n<10K0 likes68 downloads6mo agoHugging Facerenjiepi /medium_5000-data_processing_n100k1text1K<n<10K0 likes61 downloads9mo agoHugging Facerenjiepi /medium_5000_data_processing_fixedtext1K<n<10K0 likes60 downloads9mo agoHugging Face