Team Ai
Datasetpublic

jwidmer/test-bie-preprocessing-lines

Dataset Card for test-bie-preprocessing-lines This dataset is derived from jwidmer/test-bie-preprocessing-lines and has been enriched with inference results. Dataset Summary This dataset contains 825 samples across 1 split(s). Projects Included 1507-05-13_Hanserezess,Lübeck_Ascensio_Domini_1507(SAHST_Rep__2,_I_040-6) Duplicate Line Information Duplicate line statistics are calculated from the dataset key columns filename, region_id… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/test-bie-preprocessing-lines.

sourceHugging Facemitupdated 3mo agoView on Hugging Face
0likes12downloads
Dataset Card

Dataset Card for test-bie-preprocessing-lines

This dataset is derived from jwidmer/test-bie-preprocessing-lines and has been enriched with inference results.

Dataset Summary

This dataset contains 825 samples across 1 split(s).

Projects Included

1507-05-13Hanserezess,LübeckAscensioDomini1507(SAHSTRep2,I_040-6)

Duplicate Line Information

Duplicate line statistics are calculated from the dataset key columns filename, region_id, and line_id, plus project_name when project metadata is available.

Only original rows are counted here.

  • —Duplicate rows: 0
  • —Duplicate groups: 0
  • —Duplicate excess rows: 0

Duplicate Lines by Split

  • —train: 0 duplicate rows, 0 duplicate groups, 0 duplicate excess rows

Dataset Structure

Data Splits

  • —train: 825 samples

Dataset Size

  • —Approximate total size: 117.53 MB
  • —Total samples: 825

Features

  • —image: Image(mode=None, decode=False)
  • —text: Value('string')
  • —line_id: Value('string')
  • —line_reading_order: Value('int64')
  • —line_coords: List(List(Value('int64')))
  • —line_baseline: List(List(Value('int64')))
  • —line_augmentation: Value('string')
  • —region_id: Value('string')
  • —region_reading_order: Value('int64')
  • —region_type: Value('string')
  • —region_coords: List(List(Value('int64')))
  • —filename: Value('string')
  • —project_name: Value('string')
  • —inference_20260702_103450_555442_model_fgho_trocr-hanseXVI-kurrent: Value('string')

Data Organization

Data is organized as parquet shards by split and project:

data/
├── <split>/
│   └── <project_name>/
│       └── <timestamp>-<shard>.parquet

The HuggingFace Hub automatically merges all parquet files when loading the dataset.

Usage

python
from datasets import load_dataset

# Load entire dataset
dataset = load_dataset("jwidmer/test-bie-preprocessing-lines")

# Load specific split
dataset_split = load_dataset("jwidmer/test-bie-preprocessing-lines", split="train")