jwidmer/test-bie-preprocessing-lines
Dataset Card for test-bie-preprocessing-lines This dataset is derived from jwidmer/test-bie-preprocessing-lines and has been enriched with inference results. Dataset Summary This dataset contains 825 samples across 1 split(s). Projects Included 1507-05-13_Hanserezess,Lübeck_Ascensio_Domini_1507(SAHST_Rep__2,_I_040-6) Duplicate Line Information Duplicate line statistics are calculated from the dataset key columns filename, region_id… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/test-bie-preprocessing-lines.
Dataset Card for test-bie-preprocessing-lines
This dataset is derived from jwidmer/test-bie-preprocessing-lines and has been enriched with inference results.
Dataset Summary
This dataset contains 825 samples across 1 split(s).
Projects Included
1507-05-13Hanserezess,LübeckAscensioDomini1507(SAHSTRep2,I_040-6)
Duplicate Line Information
Duplicate line statistics are calculated from the dataset key columns filename, region_id, and line_id, plus project_name when project metadata is available.
Only original rows are counted here.
- Duplicate rows: 0
- Duplicate groups: 0
- Duplicate excess rows: 0
Duplicate Lines by Split
- train: 0 duplicate rows, 0 duplicate groups, 0 duplicate excess rows
Dataset Structure
Data Splits
- train: 825 samples
Dataset Size
- Approximate total size: 117.53 MB
- Total samples: 825
Features
- image:
Image(mode=None, decode=False) - text:
Value('string') - line_id:
Value('string') - line_reading_order:
Value('int64') - line_coords:
List(List(Value('int64'))) - line_baseline:
List(List(Value('int64'))) - line_augmentation:
Value('string') - region_id:
Value('string') - region_reading_order:
Value('int64') - region_type:
Value('string') - region_coords:
List(List(Value('int64'))) - filename:
Value('string') - project_name:
Value('string') - inference_20260702_103450_555442_model_fgho_trocr-hanseXVI-kurrent:
Value('string')
Data Organization
Data is organized as parquet shards by split and project:
data/
├── <split>/
│ └── <project_name>/
│ └── <timestamp>-<shard>.parquetThe HuggingFace Hub automatically merges all parquet files when loading the dataset.
Usage
from datasets import load_dataset
# Load entire dataset
dataset = load_dataset("jwidmer/test-bie-preprocessing-lines")
# Load specific split
dataset_split = load_dataset("jwidmer/test-bie-preprocessing-lines", split="train")