Team Ai
Datasetpublic

selim-b-kh/buddhi-pragati-patch

Buddhi-Pragati Crossword Dataset This dataset contains crossword clue-answer pairs extracted from multiple Indian language sources. Available Languages Assamese Total Entries: 6511 Sources: IndicWikiBio, IndoWordNet Quality Scores: Quality Score Range: 0.60 - 1.00 Average Quality Score: 0.986 Median Quality Score: 1.000 Indian Cultural Context Scores: Context Score Range: 0.10 - 0.61 Average Context Score: 0.406 Median Context Score: 0.403… See the full description on the dataset page: https://huggingface.co/datasets/selim-b-kh/buddhi-pragati-patch.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes60downloads
Dataset Card

Buddhi-Pragati Crossword Dataset

This dataset contains crossword clue-answer pairs extracted from multiple Indian language sources.

Available Languages

Assamese

  • —Total Entries: 6511
  • —Sources: IndicWikiBio, IndoWordNet

Quality Scores:

  • —Quality Score Range: 0.60 - 1.00
  • —Average Quality Score: 0.986
  • —Median Quality Score: 1.000

Indian Cultural Context Scores:

  • —Context Score Range: 0.10 - 0.61
  • —Average Context Score: 0.406
  • —Median Context Score: 0.403

English

  • —Total Entries: 5506
  • —Sources: Bhasha-Wiki, MILU

Quality Scores:

  • —Quality Score Range: 0.60 - 1.00
  • —Average Quality Score: 0.944
  • —Median Quality Score: 1.000

Indian Cultural Context Scores:

  • —Context Score Range: 0.00 - 0.47
  • —Average Context Score: 0.166
  • —Median Context Score: 0.150

Gujarati

  • —Total Entries: 6571
  • —Sources: Bhasha-Wiki, MILU, IndoWordNet

Quality Scores:

  • —Quality Score Range: 0.60 - 1.00
  • —Average Quality Score: 0.968
  • —Median Quality Score: 1.000

Indian Cultural Context Scores:

  • —Context Score Range: 0.01 - 0.68
  • —Average Context Score: 0.227
  • —Median Context Score: 0.218

Dataset Structure

Each entry contains:

  • —id: Unique identifier
  • —clue: Crossword clue text
  • —answer: Single-word answer (uppercase)
  • —source: Original data source (MILU, IndicWikiBio, IndoWordNet, Bhasha-Wiki)
  • —source_id: Original ID in source dataset
  • —context_score: Indian cultural context score (0.0-1.0)
  • —quality_score: Crossword suitability score (0.0-1.0)

Usage

python
from datasets import load_dataset

# Load specific language
dataset = load_dataset("selim-b-kh/buddhi-pragati-patch", "assamese")
dataset = load_dataset("selim-b-kh/buddhi-pragati-patch", "english")
dataset = load_dataset("selim-b-kh/buddhi-pragati-patch", "gujarati")

Summary Statistics

  • —Total Languages: 3
  • —Total Entries: 18,588
  • —All Sources: Bhasha-Wiki, IndoWordNet, IndicWikiBio MILU