Team Ai
Datasetpublic

rodriguescarson/adaption-konkani-script-12k

Konkani Script Conversion Konkani script tasks: Devanagari to Kannada script, Kannada script back to Devanagari, ISO 15919 romanisation, and script identification. Rows 12,000 Domain Konkani language Format data.parquet, one row per example Licence cc-by-4.0 Built for supervised fine-tuning (SFT) experiments on Adaption AutoScientist Columns Column Description original_prompt The prompt (user turn) as uploaded.… See the full description on the dataset page: https://huggingface.co/datasets/rodriguescarson/adaption-konkani-script-12k.

sourceHugging Facecc-by-4.0updated 14d agoView on Hugging Face
0likes68downloads
Dataset Card

Konkani Script Conversion

Konkani script tasks: Devanagari to Kannada script, Kannada script back to Devanagari, ISO 15919 romanisation, and script identification.

Rows12,000
DomainKonkani language
Formatdata.parquet, one row per example
Licencecc-by-4.0
Built forsupervised fine-tuning (SFT) experiments on Adaption AutoScientist

Columns

ColumnDescription
original_promptThe prompt (user turn) as uploaded.
original_completionThe target response as uploaded.
enhanced_promptEmpty in this dataset.
enhanced_completionEmpty in this dataset.

How it was built

6,025 verified Konkani sentences from ai4bharat/sangraha, each kept only if its script conversions round-trip exactly; 9,000 conversion labels re-derived after writing with 0 errors.

Sources and licence

Notes

  • —Columns enhanced_prompt, enhanced_completion are empty in this dataset (the Adaption export reserves them for rewritten text).

Loading

python
from datasets import load_dataset
ds = load_dataset("rodriguescarson/adaption-konkani-script-12k", split="train")
python
import pandas as pd
df = pd.read_parquet("hf://datasets/rodriguescarson/adaption-konkani-script-12k/data.parquet")

Published by Carson Rodrigues (Hugging Face, Kaggle).