Team Ai
Datasetpublic

ranWang/UN_Sitemap_Multilingual_HTML_Corpus

Dataset Card for "UN Sitemap Multilingual HTML Corpus" Update Time +8:00 2023-3-23 17:25:20 Dataset Summary 此数据集是从联合国网站提供的的sitemap中爬取的,包含了各种语言的HTML文件,并按照语言进行分类。数据集包含了不同语言的文章、新闻等联合国文本。数据集旨在为研究人员、学者和语言技术开发人员提供一个多语言文本集,可用于各种自然语言处理任务和应用。 数据集包括以下语言:汉语(zh)、英语(en)、西班牙语(ar)、俄语(ru)、西班牙语(es)、法语(fr)。 Dataset Structure Data Instances 数据集文件大小: 约 14 GB 一个 'zh' 的例子如下: { 'uuid': 'a154688c-b385-4d2a-bec7-f239f1397d21', 'url':… See the full description on the dataset page: https://huggingface.co/datasets/ranWang/UN_Sitemap_Multilingual_HTML_Corpus.

sourceHugging Faceupdated 3y agoView on Hugging Face
3likes479downloads
discussions and pull requests

Conversations for this repository live on Hugging Face.

Team Ai shows imported repositories read-only. Posting into someone else’s repository from here would need an authorised integration and the account holder’s consent, so the link goes to the source instead.

Open discussions on Hugging Face
ranWang/UN_Sitemap_Multilingual_HTML_Corpus · Team Ai