jwidmer/test-powerserver-preprocessing
Dataset Card for test-powerserver-preprocessing This dataset was created using pagexml-hf converter from Transkribus PageXML data. Dataset Summary This dataset contains 61 samples across 1 split(s). Dataset Structure Data Splits train: 61 samples Dataset Size Approximate total size: 509.28 MB Total samples: 61 Features image: Image(mode=None, decode=False) xml_content: Value('string') filename:… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/test-powerserver-preprocessing.
017
1---2dataset_info:3 config_name: default4 features:5 - name: image6 dtype:7 image:8 decode: false9 - name: xml_content10 dtype: string11 - name: filename12 dtype: string13 - name: project_name14 dtype: string15 splits:16 - name: train17 num_examples: 6118 num_bytes: 53401744419 download_size: 53401744420 dataset_size: 53401744421configs:22- config_name: default23 data_files:24 - split: train25 path: data/train/**/*.parquet26tags:27 - image-to-text28 - htr29 - trocr30 - transcription31 - pagexml32license: mit33---34 35# Dataset Card for test-powerserver-preprocessing36 37This dataset was created using pagexml-hf converter from Transkribus PageXML data.38 39## Dataset Summary40 41This dataset contains 61 samples across 1 split(s).42 43## Dataset Structure44 45### Data Splits46 47- **train**: 61 samples48 49### Dataset Size50 51- Approximate total size: 509.28 MB52- Total samples: 6153 54### Features55 56- **image**: `Image(mode=None, decode=False)`57- **xml_content**: `Value('string')`58- **filename**: `Value('string')`59- **project_name**: `Value('string')`60 61## Data Organization62 63Data is organized as parquet shards by split and project:64```65data/66├── <split>/67│ └── <project_name>/68│ └── <timestamp>-<shard>.parquet69```70 71The HuggingFace Hub automatically merges all parquet files when loading the dataset.72 73## Usage74 75```python76from datasets import load_dataset77 78# Load entire dataset79dataset = load_dataset("jwidmer/test-powerserver-preprocessing")80 81# Load specific split82train_dataset = load_dataset("jwidmer/test-powerserver-preprocessing", split="train")83```84 85### Projects Included86 871507-05-13_Hanserezess,_Lübeck_Ascensio_Domini_1507_(SAHST_Rep__2,_I_040-6)88 89 