selim-b-kh/buddhi-pragati-patch
Buddhi-Pragati Crossword Dataset This dataset contains crossword clue-answer pairs extracted from multiple Indian language sources. Available Languages Assamese Total Entries: 6511 Sources: IndicWikiBio, IndoWordNet Quality Scores: Quality Score Range: 0.60 - 1.00 Average Quality Score: 0.986 Median Quality Score: 1.000 Indian Cultural Context Scores: Context Score Range: 0.10 - 0.61 Average Context Score: 0.406 Median Context Score: 0.403… See the full description on the dataset page: https://huggingface.co/datasets/selim-b-kh/buddhi-pragati-patch.
Buddhi-Pragati Crossword Dataset
This dataset contains crossword clue-answer pairs extracted from multiple Indian language sources.
Available Languages
Assamese
- Total Entries: 6511
- Sources: IndicWikiBio, IndoWordNet
Quality Scores:
- Quality Score Range: 0.60 - 1.00
- Average Quality Score: 0.986
- Median Quality Score: 1.000
Indian Cultural Context Scores:
- Context Score Range: 0.10 - 0.61
- Average Context Score: 0.406
- Median Context Score: 0.403
English
- Total Entries: 5506
- Sources: Bhasha-Wiki, MILU
Quality Scores:
- Quality Score Range: 0.60 - 1.00
- Average Quality Score: 0.944
- Median Quality Score: 1.000
Indian Cultural Context Scores:
- Context Score Range: 0.00 - 0.47
- Average Context Score: 0.166
- Median Context Score: 0.150
Gujarati
- Total Entries: 6571
- Sources: Bhasha-Wiki, MILU, IndoWordNet
Quality Scores:
- Quality Score Range: 0.60 - 1.00
- Average Quality Score: 0.968
- Median Quality Score: 1.000
Indian Cultural Context Scores:
- Context Score Range: 0.01 - 0.68
- Average Context Score: 0.227
- Median Context Score: 0.218
Dataset Structure
Each entry contains:
id: Unique identifierclue: Crossword clue textanswer: Single-word answer (uppercase)source: Original data source (MILU, IndicWikiBio, IndoWordNet, Bhasha-Wiki)source_id: Original ID in source datasetcontext_score: Indian cultural context score (0.0-1.0)quality_score: Crossword suitability score (0.0-1.0)
Usage
from datasets import load_dataset
# Load specific language
dataset = load_dataset("selim-b-kh/buddhi-pragati-patch", "assamese")
dataset = load_dataset("selim-b-kh/buddhi-pragati-patch", "english")
dataset = load_dataset("selim-b-kh/buddhi-pragati-patch", "gujarati")Summary Statistics
- Total Languages: 3
- Total Entries: 18,588
- All Sources: Bhasha-Wiki, IndoWordNet, IndicWikiBio MILU
