Team Ai
Datasetpublic

NurzatS/Product_Image_Classification

Product Image Classification Dataset Датасет изображений товаров, собранный с крупных узбекских маркетплейсов (asaxiy.uz, texnomart.uz, olcha.uz) для задачи автоматической классификации e-commerce продукции. Описание датасета Данный набор данных содержит фотографии товаров, разбитых по 5 основным категориям электроники. Данные прошли автоматическую очистку от поврежденных файлов и дедупликацию по MD5-хешу. Категории (Classes): headphones — Наушники… See the full description on the dataset page: https://huggingface.co/datasets/NurzatS/Product_Image_Classification.

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes197downloads
Dataset Card

Product Image Classification Dataset

Датасет изображений товаров, собранный с крупных узбекских маркетплейсов (asaxiy.uz, texnomart.uz, olcha.uz) для задачи автоматической классификации e-commerce продукции.

Описание датасета

Данный набор данных содержит фотографии товаров, разбитых по 5 основным категориям электроники. Данные прошли автоматическую очистку от поврежденных файлов и дедупликацию по MD5-хешу.

Категории (Classes):

  1. 1.headphones — Наушники
  2. 2.laptop — Ноутбуки
  3. 3.smartphone — Смартфоны
  4. 4.tv — Телевизоры
  5. 5.watch — Смарт-часы и браслеты

Структура данных

Датасет автоматически очищен от битых файлов и дедуплицирован по MD5-хешам. Данные распределены по выборкам в пропорции 70% / 15% / 15%:

text
dataset_prepared/
├── train/              # Обучающая выборка (70%)
│   ├── headphones/     # Изображения наушников
│   ├── laptop/         # Изображения ноутбуков
│   ├── smartphone/     # Изображения смартфонов
│   ├── tv/             # Изображения телевизоров
│   └── watch/          # Изображения часов
├── val/                # Валидационная выборка (15%)
│   └── [тех же 5 категорий]
└── test/               # Тестовая выборка (15%)
    └── [тех же 5 категорий]

## Источники и сбор данных

Данные были собраны с помощью автоматизированного парсинга на базе **Selenium**:
* [Asaxiy.uz](https://asaxiy.uz)
* [Texnomart.uz](https://texnomart.uz)
* [Olcha.uz](https://olcha.uz)

При сборе таргетировалось целевое количество порядка **220 изображений на категорию** с запасом на отсев дубликатов и брака.

## Использование в Python

### Загрузка через библиотеку `datasets` (если данные структурированы стандартом ImageFolder):

from datasets import load_dataset

Загрузка датасета с Hugging Face

dataset = loaddataset("NurzatS/ProductImage_Classification") # Замените название на ваше

Просмотр структуры

print(dataset)

Доступ к первому элементу

example = dataset["train"][0] image = example["image"] label = example["label"]