Maid121232/majid-multitask-dataset
Majid Multi-task Dataset | مجموعه داده چندوظیفهای مجید English Description 🇬🇧 This dataset provides Persian–English text for multi-task NLP: text classification and question answering, including subtasks such as sentiment analysis and toxicity detection. Dataset Details Curated by: Maid121232 (Majid) Languages: Persian (fa), English (en) License: Apache-2.0 Size: Small (< 10k samples) Tasks: Text Classification, Question Answering Dataset Structure Files: train.csv… See the full description on the dataset page: https://huggingface.co/datasets/Maid121232/majid-multitask-dataset.
<p align="center"> <img src="https://huggingface.co/datasets/Maid121232/majid-multitask-dataset/resolve/main/banner.png" alt="Majid Multitask Dataset Banner" width="100%"/> </p>
<p align="center"> <img src="https://huggingface.co/datasets/Maid121232/majid-multitask-dataset/resolve/main/logo.png" alt="Majid Multitask Dataset Logo" width="300"/> </p>
Majid Multi-task Dataset | مجموعه داده چندوظیفهای مجید
English Description 🇬🇧
This dataset provides Persian–English text for multi-task NLP: text classification and question answering, including subtasks such as sentiment analysis and toxicity detection.
Dataset Details
- Curated by: Maid121232 (Majid)
- Languages: Persian (fa), English (en)
- License: Apache-2.0
- Size: Small (< 10k samples)
- Tasks: Text Classification, Question Answering
Dataset Structure
- Files: train.csv, valid.csv, test.csv
- Columns:
- id → Sample ID
- text → Input text
- label → Task-specific label (e.g., positive/negative, toxic/non-toxic)
- task → Task type (sentiment, toxicity, qa, classification)
Example: json { "id": 1, "text": "This movie was amazing!", "label": "positive", "task": "sentiment" }
Usage `python from datasets import load_dataset
base = "https://huggingface.co/datasets/Maid121232/majid-multitask-dataset/resolve/main" ds = loaddataset( "csv", datafiles={ "train": f"{base}/train.csv", "validation": f"{base}/valid.csv", "test": f"{base}/test.csv", } ) print(ds["train"][0]) `
Limitations
- Small dataset size, limited generalization.
- Possible label noise.
- Not balanced across all tasks.
Citation bibtex @dataset{majid2025multitask, author = {Maid121232}, title = {Majid Multi-task Dataset}, year = {2025}, url = {https://huggingface.co/datasets/Maid121232/majid-multitask-dataset} }
توضیحات فارسی 🇮🇷
این مجموعه داده برای چند وظیفهی پردازش زبان طبیعی (NLP) طراحی شده است: طبقهبندی متن و پرسش و پاسخ؛ شامل زیروظایفی مثل تحلیل احساسات و تشخیص سمیت.
جزئیات
- تهیهکننده: Maid121232 (مجید)
- زبانها: فارسی (fa)، انگلیسی (en)
- مجوز: Apache-2.0
- اندازه: کوچک (کمتر از 10k نمونه)
- وظایف: طبقهبندی متن، پرسش و پاسخ
ساختار
- فایلها: train.csv، valid.csv، test.csv
- ستونها: id، text، label، task
مثال: json { "id": 1, "text": "این فیلم فوقالعاده بود!", "label": "positive", "task": "sentiment" }
نحوهی بارگذاری `python from datasets import load_dataset
base = "https://huggingface.co/datasets/Maid121232/majid-multitask-dataset/resolve/main" ds = loaddataset( "csv", datafiles={ "train": f"{base}/train.csv", "validation": f"{base}/valid.csv", "test": f"{base}/test.csv", } ) print(ds["train"][0]) `
محدودیتها
- اندازه کوچک و پوشش محدود
- احتمال نویز در برچسبها
- عدم توازن کامل بین وظایف
استناد bibtex @dataset{majid2025multitask, author = {Maid121232}, title = {Majid Multi-task Dataset}, year = {2025}, url = {https://huggingface.co/datasets/Maid121232/majid-multitask-dataset} }
تماس ایجاد و بهاشتراکگذاری توسط Maid121232 (مجید) `
