Team Ai
Datasetpublic

heitorrosa/cvm-corpus

CVM Filings Corpus (PT-BR) Brazilian CVM regulatory filings in Portuguese, cleaned and chunked for language-model pretraining. Built for DAPT on financial Portuguese. Contents Path What output/corpus.jsonl Full corpus (7.2 GB). Chunk schema: text, company, cnpj, category, subject, date, year, document_id, chunk_id, extraction_quality. output/corpus-250M.jsonl DSIR-selected 250M-token subset (token count by chars÷4 proxy ≈ 150M whitespace tokens): 187… See the full description on the dataset page: https://huggingface.co/datasets/heitorrosa/cvm-corpus.

sourceHugging Facegpl-3.0updated 8d agoView on Hugging Face
0likes9.6kdownloads

heitorrosa/cvm-corpus · main · files are served by the source, never re-hosted here

heitorrosa/cvm-corpus · Team Ai