GilbertAkham/gilbert-multitask-mix
DATASET_README.md --- language: - en task_categories: - text-generation - summarization - question-answering - conversational tags: - multitask - email - stories - qa - summarization - chat license: - cc-by-4.0 - apache-2.0 - mit --- # Gilbert-Multitask-Mix A diverse multitask dataset for text generation training, combining samples from 5 different domains with structured prompt formatting. ## Dataset Description This dataset contains 6,500+ examples across multiple text… See the full description on the dataset page: https://huggingface.co/datasets/GilbertAkham/gilbert-multitask-mix.
016
DATASET_README.md
---
language:
- en
task_categories:
- text-generation
- summarization
- question-answering
- conversational
tags:
- multitask
- email
- stories
- qa
- summarization
- chat
license:
- cc-by-4.0
- apache-2.0
- mit
---
# Gilbert-Multitask-Mix
A diverse multitask dataset for text generation training, combining samples from 5 different domains with structured prompt formatting.
## Dataset Description
This dataset contains 6,500+ examples across multiple text generation tasks, formatted for instruction fine-tuning of language models.
### Domains Included:
1. **Email Drafting** (1,200 examples)
- Source: Enron AESLC emails
- Task: Generate email replies from subject and body
2. **Story Continuation** (1,500 examples)
- Source: STORIES dataset
- Task: Continue fictional narratives
3. **Technical Q&A** (1,300 examples)
- Source: Stack Overflow and technical forums
- Task: Answer programming and technical questions
4. **News Summarization** (1,300 examples)
- Source: CNN/DailyMail
- Task: Summarize news articles
5. **Chat Responses** (1,200 examples)
- Source: Everyday conversations
- Task: Generate conversational replies
## Dataset Structure
### Data Format
Each example follows this structured format:{ "text": "### Task: <task_description>\n\n### Input:\n<context>\n\n### Output:\n<target>" }
