vxltxrllc/audio-function-calling-v1
Audio Function Calling Dataset (vxltxrllc/audio-function-calling-v1) Multimodal dataset containing conversational function-calling turns with pre-extracted Voxtral Mini (vxltxrllc/voxtral-mini-audio-extractor) latent audio features in bfloat16. Overview Audio Turns: 703 user turns processed across 137 multi-turn conversations (~85.7 minutes of effective speech audio). Feature Format: Unpadded sequence-trimmed bfloat16 tensors with shape [T_frames, 3072] stored in… See the full description on the dataset page: https://huggingface.co/datasets/vxltxrllc/audio-function-calling-v1.
Audio Function Calling Dataset (vxltxrllc/audio-function-calling-v1)
Multimodal dataset containing conversational function-calling turns with pre-extracted Voxtral Mini (vxltxrllc/voxtral-mini-audio-extractor) latent audio features in bfloat16.
Overview
- Audio Turns: 703 user turns processed across 137 multi-turn conversations (~85.7 minutes of effective speech audio).
- Feature Format: Unpadded sequence-trimmed
bfloat16tensors with shape[T_frames, 3072]stored in.safetensorsshards (12.5 Hzframe rate). - Manifest: Compact Parquet manifest (
data/train.parquet, ~523 KB) linking text conversations and function calls directly to latent feature shards (features/shard_*.safetensors).
Dataset Structure
vxltxrllc/audio-function-calling-v1/
├── README.md
├── data/
│ └── train.parquet # Main conversational manifest
└── features/
├── shard_00000.safetensors # BF16 audio feature embeddings [T, 3072]
└── shard_00001.safetensors