Team Ai
Datasetpublic

rodriguescarson/adaption-language-flores-seed

FLORES Machine Translation Pairs Professional translations of Wikinews and Wikibooks sentences between English and many languages. Rows 21,320 Domain translation Format data.parquet, one row per example Licence cc-by-sa-4.0 Built for supervised fine-tuning (SFT) experiments on Adaption AutoScientist Columns Column Description original_prompt The prompt (user turn) as uploaded. original_completion The target response as… See the full description on the dataset page: https://huggingface.co/datasets/rodriguescarson/adaption-language-flores-seed.

sourceHugging Facecc-by-sa-4.0updated 15d agoView on Hugging Face
0likes68downloads
Dataset Card

FLORES Machine Translation Pairs

Professional translations of Wikinews and Wikibooks sentences between English and many languages.

Rows21,320
Domaintranslation
Formatdata.parquet, one row per example
Licencecc-by-sa-4.0
Built forsupervised fine-tuning (SFT) experiments on Adaption AutoScientist

Columns

ColumnDescription
original_promptThe prompt (user turn) as uploaded.
original_completionThe target response as uploaded.
enhanced_promptEmpty in this dataset.
enhanced_completionEmpty in this dataset.

How it was built

Built from FLORES-200; variants differ in direction (en to X only) and language subset (e.g. Indic only).

Sources and licence

Notes

  • —Columns enhanced_prompt, enhanced_completion are empty in this dataset (the Adaption export reserves them for rewritten text).
  • —Share-alike: derivatives must carry the same licence.

Loading

python
from datasets import load_dataset
ds = load_dataset("rodriguescarson/adaption-language-flores-seed", split="train")
python
import pandas as pd
df = pd.read_parquet("hf://datasets/rodriguescarson/adaption-language-flores-seed/data.parquet")

Published by Carson Rodrigues (Hugging Face, Kaggle).