Proyag/paracrawl_context
Dataset Card for ParaCrawl_Context This is a dataset for document-level machine translation introduced in the ACL 2024 paper Document-Level Machine Translation with Large-Scale Public Parallel Data. It is a dataset consisting of parallel sentence pairs from the ParaCrawl dataset along with corresponding preceding context extracted from the webpages the sentences were crawled from. Dataset Details Dataset Description This dataset adds… See the full description on the dataset page: https://huggingface.co/datasets/Proyag/paracrawl_context.
Update bibtex
Update README.md
Update README.md
Add funding acknowledgement
Missed a link update
Update links and bibtex
Dataset card
Update license
Add basic metadata
Change default config to eng-deu
Upload dataset (part 00002-of-00003)
Upload dataset (part 00001-of-00003)
Upload dataset (part 00000-of-00003)
Upload dataset (part 00001-of-00002)
Upload dataset (part 00000-of-00002)
Upload dataset (part 00001-of-00002)
Upload dataset (part 00000-of-00002)
Upload dataset (part 00001-of-00002)
Upload dataset (part 00000-of-00002)
Upload dataset (part 00001-of-00002)
Upload dataset (part 00000-of-00002)
Upload dataset (part 00001-of-00002)
Upload dataset (part 00000-of-00002)
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Remove incomplete config
Upload dataset
Delete test files
Delete test folder
Upload dataset
Upload eng-rus files
initial commit
