NurzatS/Product_Image_Classification
Product Image Classification Dataset Датасет изображений товаров, собранный с крупных узбекских маркетплейсов (asaxiy.uz, texnomart.uz, olcha.uz) для задачи автоматической классификации e-commerce продукции. Описание датасета Данный набор данных содержит фотографии товаров, разбитых по 5 основным категориям электроники. Данные прошли автоматическую очистку от поврежденных файлов и дедупликацию по MD5-хешу. Категории (Classes): headphones — Наушники… See the full description on the dataset page: https://huggingface.co/datasets/NurzatS/Product_Image_Classification.
Product Image Classification Dataset
Датасет изображений товаров, собранный с крупных узбекских маркетплейсов (asaxiy.uz, texnomart.uz, olcha.uz) для задачи автоматической классификации e-commerce продукции.
Описание датасета
Данный набор данных содержит фотографии товаров, разбитых по 5 основным категориям электроники. Данные прошли автоматическую очистку от поврежденных файлов и дедупликацию по MD5-хешу.
Категории (Classes):
- headphones — Наушники
- laptop — Ноутбуки
- smartphone — Смартфоны
- tv — Телевизоры
- watch — Смарт-часы и браслеты
Структура данных
Датасет автоматически очищен от битых файлов и дедуплицирован по MD5-хешам. Данные распределены по выборкам в пропорции 70% / 15% / 15%:
dataset_prepared/
├── train/ # Обучающая выборка (70%)
│ ├── headphones/ # Изображения наушников
│ ├── laptop/ # Изображения ноутбуков
│ ├── smartphone/ # Изображения смартфонов
│ ├── tv/ # Изображения телевизоров
│ └── watch/ # Изображения часов
├── val/ # Валидационная выборка (15%)
│ └── [тех же 5 категорий]
└── test/ # Тестовая выборка (15%)
└── [тех же 5 категорий]
## Источники и сбор данных
Данные были собраны с помощью автоматизированного парсинга на базе **Selenium**:
* [Asaxiy.uz](https://asaxiy.uz)
* [Texnomart.uz](https://texnomart.uz)
* [Olcha.uz](https://olcha.uz)
При сборе таргетировалось целевое количество порядка **220 изображений на категорию** с запасом на отсев дубликатов и брака.
## Использование в Python
### Загрузка через библиотеку `datasets` (если данные структурированы стандартом ImageFolder):
from datasets import load_dataset
Загрузка датасета с Hugging Face
dataset = loaddataset("NurzatS/ProductImage_Classification") # Замените название на ваше
Просмотр структуры
print(dataset)
Доступ к первому элементу
example = dataset["train"][0] image = example["image"] label = example["label"]
