Team Ai
Datasetpublic

ud-nlp/LLM-Text-Generation-Dataset

Generated Text Dataset - 4 Millions+ Logs Dataset comprises 4 million+ logs of synthetic texts generated by large language models (LLMs) across 32 languages, leveraging 3 different GPT models for diverse, high-quality training data. Designed for text generation tasks, language model training, and NLP applications, supporting generative AI and text classification.- Get the data Dataset characteristics: Characteristic Data Description Generated texts to… See the full description on the dataset page: https://huggingface.co/datasets/ud-nlp/LLM-Text-Generation-Dataset.

sourceHugging Facecc-by-nc-nd-4.0updated 1y agoView on Hugging Face
0likes13downloads
Dataset Card

Generated Text Dataset - 4 Millions+ Logs

Dataset comprises 4 million+ logs of synthetic texts generated by large language models (LLMs) across 32 languages, leveraging 3 different GPT models for diverse, high-quality training data. Designed for text generation tasks, language model training, and NLP applications, supporting generative AI and text classification.- [Get the data](https://unidata.pro/datasets/llm-text-generation/?utm_source=huggingface-nlp&utm_medium=referral&utm_campaign=LLM-Text-Generation-Dataset)

Dataset characteristics:

**Characteristic****Data**
DescriptionGenerated texts to achieve higher performance in various NLP tasks
Data typesText
TasksGenerating text, answering questions, text classification
Total number of files4,000,000+
LanguagesUkrainian, Turkish, Thai, Swedish, Slovak, Portuguese (Brazil), Portuguese, Polish, Persian, Dutch, Marathi, Malayalam, Korean, Japanese, Italian, Indonesian, Hungarian, Hindi, Irish, Greek, German, French, Finnish, Esperanto, English, Danish, Czech, Chinese, Catalan, Azerbaijani, Arabic
LabelingMetadata (language, model, time of generation, prompt, response)

📊 Sample dataset available! For full access, contact us to discuss purchase terms.

Dataset structure

  • —LLM__data — file contains metadata of dataset.

🧩 Like the dataset but need different data? We can collect a custom dataset just for you - learn more about our data collection services here

Similar Datasets:

  1. 1.Speech Emotion Recognition Dataset
  2. 2.British English Speech Recognition Dataset
  3. 3.Spanish Speech Recognition Dataset

🌐 UniData - your trusted data partner. Unique, accurate, thoroughly collected and annotated data designed to fuel your AI/ML success.