Team Ai
Datasetpublic

hamzas/digitize-pid-ner

Digitize-PID: Pipeline numbers (NER) Note: I am not the author of this dataset Named Entity Recognition dataset for extracting pipeline numbers from full text of P&ID (Piping and Instrumentation Diagram) documents. Dataset Details Dataset Description Pipeline numbers are structured identifiers in engineering documents: Example Format: A-123-BC (3-5 segments with a separator such as -, , or _) Use case: Automated extraction from P&ID document text… See the full description on the dataset page: https://huggingface.co/datasets/hamzas/digitize-pid-ner.

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes22downloads
Dataset Card

Digitize-PID: Pipeline numbers (NER)

Note: I am not the author of this dataset

Named Entity Recognition dataset for extracting pipeline numbers from full text of P&ID (Piping and Instrumentation Diagram) documents.

Dataset Details

Dataset Description

Pipeline numbers are structured identifiers in engineering documents:

  • —Example Format: A-123-BC (3-5 segments with a separator such as -, , or _)
  • —Use case: Automated extraction from P&ID document text
  • —Domain: Process and piping industry

Data Fields

  • —id: Unique example identifier
  • —tokens: List of tokenized words/punctuation
  • —labels: BIO tags for each token
  • —pipeline_numbers: Ground truth pipeline numbers
  • —full_text: Original text

Label Schema

LabelMeaning
B-PIPEBeginning of pipeline number
I-PIPEInside pipeline number
OOutside (not pipeline number)

Splits

Data was randomly split.

SplitExamples
train400
validation50
test50

Data Creation

  • —Source: Digitize-PID
  • —Annotation: Automatic BIO tagging with character-level alignment

Usage

With Hugging Face Datasets

python
from datasets import load_dataset

dataset = load_dataset("hamzas/digitize-pid-ner")

print(dataset)

# Access example
example = dataset['train'][0]
print(example['tokens'])
print(example['labels'])