Team Ai
Datasetpublic

mrapacz/sighum-interlinear-vector-baselines

SIGHUM Interlinear Vector Baselines Companion dataset for the paper Degree Zero of Translation: Using Interlinear Baselines to Quantify Translator Intervention (SIGHUM 2026). Contents Config Description index (default) Translation metadata: 79 translations across 5 languages with strategy labels embeddings_{lang} Chapter-level Qwen3-Embedding-8B vectors (4096-dim) per translation × chapter intervention_by_chapter L2 distance to interlinear baseline… See the full description on the dataset page: https://huggingface.co/datasets/mrapacz/sighum-interlinear-vector-baselines.

sourceHugging Facecc-by-4.0updated 7mo agoView on Hugging Face
0likes27downloads
Dataset Card

SIGHUM Interlinear Vector Baselines

Companion dataset for the paper Degree Zero of Translation: Using Interlinear Baselines to Quantify Translator Intervention (SIGHUM 2026).

Contents

ConfigDescription
index (default)Translation metadata: 79 translations across 5 languages with strategy labels
embeddings_{lang}Chapter-level Qwen3-Embedding-8B vectors (4096-dim) per translation × chapter
interventionbychapterL2 distance to interlinear baseline per translation × chapter
intervention_summaryPer-translation summary statistics (mean, std, median distance)

Quick Start

python
from datasets import load_dataset

# Browse translations
index = load_dataset("mrapacz/sighum-interlinear-vector-baselines", "index", split="train")
print(index.to_pandas())

# Load English chapter-level embeddings
eng = load_dataset("mrapacz/sighum-interlinear-vector-baselines", "embeddings_eng", split="train")

# Load intervention distances
intervention = load_dataset("mrapacz/sighum-interlinear-vector-baselines", "intervention_by_chapter", split="train")

Languages

English (17), French (15), Italian (13), Polish (17), Spanish (17) — 74 prose translations + 5 interlinear baselines.

Model

All embeddings computed with Qwen/Qwen3-Embedding-8B.

Links