Team Ai
Datasetpublic

vxltxrllc/audio-function-calling-v1

Audio Function Calling Dataset (vxltxrllc/audio-function-calling-v1) Multimodal dataset containing conversational function-calling turns with pre-extracted Voxtral Mini (vxltxrllc/voxtral-mini-audio-extractor) latent audio features in bfloat16. Overview Audio Turns: 703 user turns processed across 137 multi-turn conversations (~85.7 minutes of effective speech audio). Feature Format: Unpadded sequence-trimmed bfloat16 tensors with shape [T_frames, 3072] stored in… See the full description on the dataset page: https://huggingface.co/datasets/vxltxrllc/audio-function-calling-v1.

sourceHugging Faceapache-2.0updated 3d agoView on Hugging Face
0likes44downloads
Dataset Card

Audio Function Calling Dataset (vxltxrllc/audio-function-calling-v1)

Multimodal dataset containing conversational function-calling turns with pre-extracted Voxtral Mini (vxltxrllc/voxtral-mini-audio-extractor) latent audio features in bfloat16.

Overview

  • —Audio Turns: 703 user turns processed across 137 multi-turn conversations (~85.7 minutes of effective speech audio).
  • —Feature Format: Unpadded sequence-trimmed bfloat16 tensors with shape [T_frames, 3072] stored in .safetensors shards (12.5 Hz frame rate).
  • —Manifest: Compact Parquet manifest (data/train.parquet, ~523 KB) linking text conversations and function calls directly to latent feature shards (features/shard_*.safetensors).

Dataset Structure

text
vxltxrllc/audio-function-calling-v1/
├── README.md
├── data/
│   └── train.parquet              # Main conversational manifest
└── features/
    ├── shard_00000.safetensors    # BF16 audio feature embeddings [T, 3072]
    └── shard_00001.safetensors