dbrovkin/toxic-russian-comments-multilabel
Russian Toxic Comments Multi-Label Balanced Dataset Описание Этот датасет создан для задачи Multi-Task классификации токсичности русскоязычных комментариев. Датасет содержит сбалансированные примеры с тремя бинарными метками: profanity: наличие нецензурной лексики (мат) threat: наличие угроз illegal: запросы на незаконные действия (прокси-метка на основе THREAT + INSULT) Структура данных Датасет содержит следующие поля: Поле Тип Описание… See the full description on the dataset page: https://huggingface.co/datasets/dbrovkin/toxic-russian-comments-multilabel.
Russian Toxic Comments Multi-Label Balanced Dataset
Описание
Этот датасет создан для задачи Multi-Task классификации токсичности русскоязычных комментариев. Датасет содержит сбалансированные примеры с тремя бинарными метками:
- profanity: наличие нецензурной лексики (мат)
- threat: наличие угроз
- illegal: запросы на незаконные действия (прокси-метка на основе THREAT + INSULT)
Структура данных
Датасет содержит следующие поля:
Статистика
Распределение классов
- profanity: 14,193 (5.5%)
- threat: 21,235 (8.2%)
- illegal: 11,048 (4.3%)
Размеры
- Общее количество: 257,896 примеров
- Количество классов: 3 бинарных
Источник данных
Датасет собран на основе Toxic Russian Comments с Kaggle.
Процесс создания
- Загрузка: Датасет загружен с Kaggle
- Очистка: Удалены HTML-теги, URL, email, упоминания, хештеги, эмодзи
- Фильтрация: Удалены слишком короткие/длинные тексты, спам
- Балансировка: Применен RandomOverSampler для балансировки классов
- Преобразование: Метки преобразованы в 3 бинарные колонки
Применение
Датасет подходит для:
- Multi-Task классификации токсичности
- Обучения энкодеров (BERT, RoBERTa и др.)
- Исследований в области модерации контента
Лицензия
MIT License
Авторы
Создано в рамках учебного интенсива по искусственному интеллекту.
Дата создания
2026-07-17
Пример использования
from datasets import load_dataset
# Загрузка датасета
dataset = load_dataset("YOUR_USERNAME/toxic-russian-comments-multilabel")
# Доступ к данным
train_data = dataset['train']
# Пример
example = train_data[0]
print(example['clean_text'])
print(f"Profanity: {example['profanity']}")
print(f"Threat: {example['threat']}")
print(f"Illegal: {example['illegal']}")Контакты
Для вопросов и предложений обращайтесь через Issues на Hugging Face.
