Team Ai
Modelpublic

onecxi/vakgyata-tiny

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
2likes27downloads
Model Card

Vakgyata

Language Identification for Indian Languages from Speech


Model Overview

vakgyata is an open-source language identification model specifically designed to classify Indian languages from raw speech audio. It is built upon the pretrained `Harveenchadha/wav2vec2-pretrained-clsril-23-10k` with additional Layer Normalization integrated to improve stability and performance for audio classification tasks.


Variants and Model Sizes

VariantParametersAccuracy
vakgyata-base95M95.88%
vakgyata-small52M95.06%
vakgyata-mini38M95.06%
vakgyata-tiny24M93.63%

Supported Languages

LanguageCode
English (India)en-IN
Hindihi-IN
Odiaor-IN
Bengalibn-IN
Tamilta-IN
Telugute-IN
Kannadakn-IN
Malayalamml-IN
Marathimr-IN
Gujaratigu-IN
Punjabipa-IN
Assameseas-IN

Specifications

  • —Supported Sampling Rate: 16000 Hz
  • —Recommended Audio Format: 16kHz, 16bit PCM (Mono)

Installation

bash
pip install transformers torchaudio

Usage

python
from transformers import Wav2Vec2ForSequenceClassification, AutoFeatureExtractor
import torch

device = "cuda" if torch.cuda.is_available() else "cpu"

model_id = "onecxi/vakgyata-tiny"

processor = AutoFeatureExtractor.from_pretrained(model_id)
model = Wav2Vec2ForSequenceClassification.from_pretrained(model_id).to(device)

Inference Example

python
import torchaudio

# Load the audio (ensure it's 16kHz mono)
audio, sr = torchaudio.load("path/to/audio.wav")

# Preprocess
inputs = processor(audio.squeeze(), sampling_rate=sr, return_tensors="pt").to(device)

# Inference
with torch.no_grad():
    logits = model(**inputs).logits

# Softmax to get probabilities
probs = logits.softmax(dim=-1).cpu().numpy()

# Predicted language
language = model.config.id2label.get(probs.argmax())
print("Predicted Language:", language)

Citation

If you use this model in your research or application, please consider citing the model and its base source:

@misc{vakgyata2024,
  title={vakgyata: Language Identification for Indian Speech},
  author={OneCXI},
  year={2024},
  url={https://huggingface.co/onecxi/vakgyata-tiny}
}