Team Ai
Datasetpublic

Maid121232/majid-multitask-dataset

Majid Multi-task Dataset | مجموعه داده چندوظیفه‌ای مجید English Description 🇬🇧 This dataset provides Persian–English text for multi-task NLP: text classification and question answering, including subtasks such as sentiment analysis and toxicity detection. Dataset Details Curated by: Maid121232 (Majid) Languages: Persian (fa), English (en) License: Apache-2.0 Size: Small (< 10k samples) Tasks: Text Classification, Question Answering Dataset Structure Files: train.csv… See the full description on the dataset page: https://huggingface.co/datasets/Maid121232/majid-multitask-dataset.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes42downloads
Dataset Card

<p align="center"> <img src="https://huggingface.co/datasets/Maid121232/majid-multitask-dataset/resolve/main/banner.png" alt="Majid Multitask Dataset Banner" width="100%"/> </p>

<p align="center"> <img src="https://huggingface.co/datasets/Maid121232/majid-multitask-dataset/resolve/main/logo.png" alt="Majid Multitask Dataset Logo" width="300"/> </p>

Majid Multi-task Dataset | مجموعه داده چندوظیفه‌ای مجید


English Description 🇬🇧

This dataset provides Persian–English text for multi-task NLP: text classification and question answering, including subtasks such as sentiment analysis and toxicity detection.

Dataset Details

  • —Curated by: Maid121232 (Majid)
  • —Languages: Persian (fa), English (en)
  • —License: Apache-2.0
  • —Size: Small (< 10k samples)
  • —Tasks: Text Classification, Question Answering

Dataset Structure

  • —Files: train.csv, valid.csv, test.csv
  • —Columns:
  • —id → Sample ID
  • —text → Input text
  • —label → Task-specific label (e.g., positive/negative, toxic/non-toxic)
  • —task → Task type (sentiment, toxicity, qa, classification)

Example: json { "id": 1, "text": "This movie was amazing!", "label": "positive", "task": "sentiment" }

Usage `python from datasets import load_dataset

base = "https://huggingface.co/datasets/Maid121232/majid-multitask-dataset/resolve/main" ds = loaddataset( "csv", datafiles={ "train": f"{base}/train.csv", "validation": f"{base}/valid.csv", "test": f"{base}/test.csv", } ) print(ds["train"][0]) `

Limitations

  • —Small dataset size, limited generalization.
  • —Possible label noise.
  • —Not balanced across all tasks.

Citation bibtex @dataset{majid2025multitask, author = {Maid121232}, title = {Majid Multi-task Dataset}, year = {2025}, url = {https://huggingface.co/datasets/Maid121232/majid-multitask-dataset} }


توضیحات فارسی 🇮🇷

این مجموعه داده برای چند وظیفه‌ی پردازش زبان طبیعی (NLP) طراحی شده است: طبقه‌بندی متن و پرسش و پاسخ؛ شامل زیروظایفی مثل تحلیل احساسات و تشخیص سمیت.

جزئیات

  • —تهیه‌کننده: Maid121232 (مجید)
  • —زبان‌ها: فارسی (fa)، انگلیسی (en)
  • —مجوز: Apache-2.0
  • —اندازه: کوچک (کمتر از 10k نمونه)
  • —وظایف: طبقه‌بندی متن، پرسش و پاسخ

ساختار

  • —فایل‌ها: train.csv، valid.csv، test.csv
  • —ستون‌ها: id، text، label، task

مثال: json { "id": 1, "text": "این فیلم فوق‌العاده بود!", "label": "positive", "task": "sentiment" }

نحوه‌ی بارگذاری `python from datasets import load_dataset

base = "https://huggingface.co/datasets/Maid121232/majid-multitask-dataset/resolve/main" ds = loaddataset( "csv", datafiles={ "train": f"{base}/train.csv", "validation": f"{base}/valid.csv", "test": f"{base}/test.csv", } ) print(ds["train"][0]) `

محدودیت‌ها

  • —اندازه کوچک و پوشش محدود
  • —احتمال نویز در برچسب‌ها
  • —عدم توازن کامل بین وظایف

استناد bibtex @dataset{majid2025multitask, author = {Maid121232}, title = {Majid Multi-task Dataset}, year = {2025}, url = {https://huggingface.co/datasets/Maid121232/majid-multitask-dataset} }


تماس ایجاد و به‌اشتراک‌گذاری توسط Maid121232 (مجید) `