mrapacz/sighum-interlinear-vector-baselines
SIGHUM Interlinear Vector Baselines Companion dataset for the paper Degree Zero of Translation: Using Interlinear Baselines to Quantify Translator Intervention (SIGHUM 2026). Contents Config Description index (default) Translation metadata: 79 translations across 5 languages with strategy labels embeddings_{lang} Chapter-level Qwen3-Embedding-8B vectors (4096-dim) per translation × chapter intervention_by_chapter L2 distance to interlinear baseline… See the full description on the dataset page: https://huggingface.co/datasets/mrapacz/sighum-interlinear-vector-baselines.
SIGHUM Interlinear Vector Baselines
Companion dataset for the paper Degree Zero of Translation: Using Interlinear Baselines to Quantify Translator Intervention (SIGHUM 2026).
Contents
Quick Start
from datasets import load_dataset
# Browse translations
index = load_dataset("mrapacz/sighum-interlinear-vector-baselines", "index", split="train")
print(index.to_pandas())
# Load English chapter-level embeddings
eng = load_dataset("mrapacz/sighum-interlinear-vector-baselines", "embeddings_eng", split="train")
# Load intervention distances
intervention = load_dataset("mrapacz/sighum-interlinear-vector-baselines", "intervention_by_chapter", split="train")Languages
English (17), French (15), Italian (13), Polish (17), Spanish (17) — 74 prose translations + 5 interlinear baselines.
Model
All embeddings computed with Qwen/Qwen3-Embedding-8B.
Links
- Code & Poster: github.com/mrapacz/sighum-interlinear-vector-baselines
- Targum Corpus: huggingface.co/datasets/mrapacz/targum-corpus
