Team Ai
Datasetpublic

dbrovkin/toxic-russian-comments-multilabel

Russian Toxic Comments Multi-Label Balanced Dataset Описание Этот датасет создан для задачи Multi-Task классификации токсичности русскоязычных комментариев. Датасет содержит сбалансированные примеры с тремя бинарными метками: profanity: наличие нецензурной лексики (мат) threat: наличие угроз illegal: запросы на незаконные действия (прокси-метка на основе THREAT + INSULT) Структура данных Датасет содержит следующие поля: Поле Тип Описание… See the full description on the dataset page: https://huggingface.co/datasets/dbrovkin/toxic-russian-comments-multilabel.

sourceHugging Facemitupdated 3mo agoView on Hugging Face
1likes45downloads
Dataset Card

Russian Toxic Comments Multi-Label Balanced Dataset

Описание

Этот датасет создан для задачи Multi-Task классификации токсичности русскоязычных комментариев. Датасет содержит сбалансированные примеры с тремя бинарными метками:

  • —profanity: наличие нецензурной лексики (мат)
  • —threat: наличие угроз
  • —illegal: запросы на незаконные действия (прокси-метка на основе THREAT + INSULT)

Структура данных

Датасет содержит следующие поля:

ПолеТипОписание
clean_textstringОчищенный текст комментария
profanityint1 - есть мат, 0 - нет мата
threatint1 - есть угрозы, 0 - нет угроз
illegalint1 - есть запросы на незаконное, 0 - нет

Статистика

Распределение классов

  • —profanity: 14,193 (5.5%)
  • —threat: 21,235 (8.2%)
  • —illegal: 11,048 (4.3%)

Размеры

  • —Общее количество: 257,896 примеров
  • —Количество классов: 3 бинарных

Источник данных

Датасет собран на основе Toxic Russian Comments с Kaggle.

Процесс создания

  1. 1.Загрузка: Датасет загружен с Kaggle
  2. 2.Очистка: Удалены HTML-теги, URL, email, упоминания, хештеги, эмодзи
  3. 3.Фильтрация: Удалены слишком короткие/длинные тексты, спам
  4. 4.Балансировка: Применен RandomOverSampler для балансировки классов
  5. 5.Преобразование: Метки преобразованы в 3 бинарные колонки

Применение

Датасет подходит для:

  • —Multi-Task классификации токсичности
  • —Обучения энкодеров (BERT, RoBERTa и др.)
  • —Исследований в области модерации контента

Лицензия

MIT License

Авторы

Создано в рамках учебного интенсива по искусственному интеллекту.

Дата создания

2026-07-17

Пример использования

python
from datasets import load_dataset

# Загрузка датасета
dataset = load_dataset("YOUR_USERNAME/toxic-russian-comments-multilabel")

# Доступ к данным
train_data = dataset['train']

# Пример
example = train_data[0]
print(example['clean_text'])
print(f"Profanity: {example['profanity']}")
print(f"Threat: {example['threat']}")
print(f"Illegal: {example['illegal']}")

Контакты

Для вопросов и предложений обращайтесь через Issues на Hugging Face.