Team Ai
Datasetpublic

jwidmer/test-powerserver-preprocessing

Dataset Card for test-powerserver-preprocessing This dataset was created using pagexml-hf converter from Transkribus PageXML data. Dataset Summary This dataset contains 61 samples across 1 split(s). Dataset Structure Data Splits train: 61 samples Dataset Size Approximate total size: 509.28 MB Total samples: 61 Features image: Image(mode=None, decode=False) xml_content: Value('string') filename:… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/test-powerserver-preprocessing.

sourceHugging Facemitupdated 4mo agoView on Hugging Face
0likes17downloads
README.md89 linesDownload Raw Back to root
1---2dataset_info:3  config_name: default4  features:5  - name: image6    dtype:7      image:8        decode: false9  - name: xml_content10    dtype: string11  - name: filename12    dtype: string13  - name: project_name14    dtype: string15  splits:16  - name: train17    num_examples: 6118    num_bytes: 53401744419  download_size: 53401744420  dataset_size: 53401744421configs:22- config_name: default23  data_files:24  - split: train25    path: data/train/**/*.parquet26tags:27  - image-to-text28  - htr29  - trocr30  - transcription31  - pagexml32license: mit33---34 35# Dataset Card for test-powerserver-preprocessing36 37This dataset was created using pagexml-hf converter from Transkribus PageXML data.38 39## Dataset Summary40 41This dataset contains 61 samples across 1 split(s).42 43## Dataset Structure44 45### Data Splits46 47- **train**: 61 samples48 49### Dataset Size50 51- Approximate total size: 509.28 MB52- Total samples: 6153 54### Features55 56- **image**: `Image(mode=None, decode=False)`57- **xml_content**: `Value('string')`58- **filename**: `Value('string')`59- **project_name**: `Value('string')`60 61## Data Organization62 63Data is organized as parquet shards by split and project:64```65data/66├── <split>/67│   └── <project_name>/68│       └── <timestamp>-<shard>.parquet69```70 71The HuggingFace Hub automatically merges all parquet files when loading the dataset.72 73## Usage74 75```python76from datasets import load_dataset77 78# Load entire dataset79dataset = load_dataset("jwidmer/test-powerserver-preprocessing")80 81# Load specific split82train_dataset = load_dataset("jwidmer/test-powerserver-preprocessing", split="train")83```84 85### Projects Included86 871507-05-13_Hanserezess,_Lübeck_Ascensio_Domini_1507_(SAHST_Rep__2,_I_040-6)88 89