tugrulbayrak/Real-TurnTurk
Real-TurnTurk English: Real-TurnTurk is a multimodal, two-channel Turkish dyadic conversation dataset built to improve turn-taking prediction in voice-based dialogue systems. Unlike Syn-TurnTurk, the other dataset we built, every conversation here is a real, unscripted exchange between two people, recorded over video calls. Each participant was captured on a separate audio channel, so speaker attribution is exact and requires no diarization model. Alongside the audio, the… See the full description on the dataset page: https://huggingface.co/datasets/tugrulbayrak/Real-TurnTurk.
Real-TurnTurk

English: Real-TurnTurk is a multimodal, two-channel Turkish dyadic conversation dataset built to improve turn-taking prediction in voice-based dialogue systems. Unlike Syn-TurnTurk, the other dataset we built, every conversation here is a real, unscripted exchange between two people, recorded over video calls. Each participant was captured on a separate audio channel, so speaker attribution is exact and requires no diarization model. Alongside the audio, the dataset ships frame-level facial feature vectors (head pose, gaze, 52 ARKit blendshapes), time-aligned transcripts, and frame-level speech activity annotations on a shared 62.5 ms grid.
Türkçe: Real-TurnTurk, sesli diyalog sistemlerinde "sıra alma / sıra değişimi" (turn-taking) tahminini geliştirmek amacıyla oluşturulmuş çok kipli (multimodal) Türkçe iki kanallı konuşma veri kümesidir. Oluşturduğumuz diğer veri kümesi Syn-TurnTurk'ten farklı olarak buradaki tüm diyaloglar, iki kişi arasında görüntülü görüşme üzerinden kaydedilmiş gerçek ve senaryosuz konuşmalardır. Her katılımcı ayrı bir ses kanalında kaydedilmiştir; bu sayede konuşmacı ataması kesindir ve herhangi bir ayrıştırma (diarization) modeli gerektirmez. Ses kayıtlarının yanı sıra veri kümesi kare düzeyinde yüz öznitelik vektörleri (kafa pozu, bakış, 52 ARKit blendshape), zaman hizalı transkriptler ve ortak 62.5 ms ızgarada kare düzeyinde konuşma aktivitesi etiketleri içerir.
Use Cases / Kullanım Alanları
English: This dataset can be used for the following AI tasks:
- Turn-taking prediction in Turkish spoken dialogue systems
- Multimodal speech analysis
- Time-aligned transcription and voice activity detection (VAD)
- Speech modeling supported by facial feature vectors (ARKit blendshapes, head pose)
Türkçe: Bu veri kümesi aşağıdaki yapay zeka görevleri için kullanılabilir:
- Türkçe diyalog sistemlerinde sıra değişimi ve sıra alma (turn-taking prediction) tahmini
- Çok kipli (multimodal) konuşma analizi
- Zaman hizalı transkript ve ses aktivite tespiti (VAD)
- Yüz öznitelik vektörleri (ARKit blendshape, kafa pozu) ile desteklenen konuşma modellemesi
Dataset Summary / Veri Kümesi Özeti
Speakers recur across recordings, so person-level comparison is possible: p01 and p06 each appear in three conversations, p03 and p04 in two. / Konuşmacılar kayıtlar arasında tekrar ettiği için kişi bazlı karşılaştırma mümkündür: p01 ve p06 üçer, p03 ve p04 ikişer diyalogda yer alır.
Files / Dosyalar
Each recording lives in its own directory named by recording ID. / Her kayıt, kayıt kimliğiyle adlandırılmış kendi dizinindedir.
<recording_id>/
├── <recording_id>__L_<person>.webm # left panel speaker, isolated audio
├── <recording_id>__R_<person>.webm # right panel speaker, isolated audio
├── <recording_id>__text.csv # transcript with speaker + timing
├── <recording_id>__speech_activity.csv # frame-level voice activity
├── <recording_id>__video_features.csv # frame-level facial features
└── <recording_id>__animation.mp4 # rendered face-vector animationColumn Schemas / Kolon Şemaları
text.csv
speech_activity.csv
VAD settings: min_silence_duration_ms=300, speech_pad_ms=100, min_speech_duration_ms=120.
video_features.csv
face_detected=0 rows are kept, with measurement columns left empty, so the time axis stays continuous and gaps remain visible. / face_detected=0 satırları silinmemiştir; ölçüm kolonları boş bırakılmıştır, böylece zaman ekseni kesintisiz kalır ve boşluklar görünür olur.
Technical Specifications / Teknik Özellikler
Audio / Ses — *__L_*.webm, *__R_*.webm
Speech activity annotations were computed after downmixing to 16 kHz mono. / Konuşma aktivitesi etiketleri 16 kHz mono'ya indirildikten sonra hesaplanmıştır.
Animation / Animasyon — *__animation.mp4
Per-speaker isolated audio is in the .webm files. / Konuşmacı bazlı yalıtılmış ses .webm dosyalarındadır.
Feature Extraction / Öznitelik Çıkarımı
Landmark coordinates are normalised to 0..1 relative to the participant tile, not pixels; video_features.csv holds measurements derived from them. The source video.mp4 and the raw 478-point landmarks are not part of this release. / Landmark koordinatları piksel değil, katılımcı karosuna göre 0..1 normalize edilmiştir; video_features.csv bunlardan türetilmiş ölçümleri taşır. Kaynak video.mp4 ve ham 478 nokta landmark bu yayına dahil değildir.
Size / Boyut
Total 3.0 GB, 400-693 MB per recording; animation.mp4 accounts for roughly 80% of the volume. / Toplam 3.0 GB, kayıt başına 400-693 MB; hacmin yaklaşık %80'i animation.mp4 dosyalarından geliyor.
Statistical Analysis / İstatistiksel Analizler
1. Floor Transfer Offset (FTO)
FTO is the gap between the end of one speaker's turn and the start of the next speaker's turn. Negative values mean the next speaker started before the previous one finished. Backchannels are excluded. / FTO, bir konuşmacının sırasının bitişi ile diğerinin başlangıcı arasındaki farktır. Negatif değer, sonraki konuşmacının öncekinin sözü bitmeden başladığını gösterir. Geri bildirimler hesaba katılmamıştır.
2. Turn Durations / Sıra Süreleri
3. Per-Recording Breakdown / Kayıt Bazlı Dağılım
Conversational style varies widely across pairs: rec02 is orderly (median FTO +438 ms, 3% simultaneous speech) while rec04 and rec03 are lively and overlap-heavy (12-13% simultaneous speech). / Çiftler arasında konuşma tarzı belirgin şekilde değişiyor: rec02 sıralı ilerliyor (medyan FTO +438 ms, %3 eşzamanlı konuşma), rec04 ve rec03 ise canlı ve örtüşme yoğun (%12-13 eşzamanlı konuşma).
4. Overlap and Silence / Örtüşme ve Sessizlik
5. Speech Time per Speaker / Konuşmacı Başına Konuşma Süresi
Measured Audio-Visual Lead / Ölçülen Ses-Görüntü Öncelemesi
Mouth movement precedes voicing: speakers open and position the articulators before phonation begins. This lead was measured per channel by cross-correlating mouth-movement energy (|Δ mouth_open|, 7-frame smoothing) against the isolated-channel VAD. / Ağız hareketi seslendirmeden önce başlar: konuşmacı, ses çıkmadan önce artikülatörleri konumlandırır. Bu önceleme, ağız hareket enerjisi (|Δ mouth_open|, 7 kare yumuşatma) ile yalıtılmış kanal VAD'i çapraz korelasyona sokularak kanal başına ölçülmüştür.
The lead is partly person-specific and reproducible across recordings: p04 measures +125 and +188 ms in two different conversations, p03 +438 ms in both of its recordings, p01 +375/+375/+312 ms across three. rec05 sits highest on both channels. / Önceleme kısmen kişiye özgü ve kayıtlar arasında tekrarlanabilir: p04 iki ayrı diyalogda +125 ve +188 ms, p03 iki kaydında da +438 ms, p01 üç kaydında +375/+375/+312 ms ölçülüyor. rec05 her iki kanalında da en yüksek değerlere sahip.
Anyone fusing face and audio at sub-second resolution should account for these per-channel values, since the lead is comparable in magnitude to the FTO distribution being modelled. / Yüz ve sesi saniye altı çözünürlükte birleştirecek olanlar bu kanal bazlı değerleri hesaba katmalıdır; önceleme, modellenen FTO dağılımıyla aynı büyüklük mertebesindedir.
Contributors / Katkıda Bulunanlar
- Fatma Nur Korkmaz
- Bekir Berker Türker
- Mustafa Sertaç Türkel
- Okan Pomen
- Alper Kaplan
- Selin Coşkun
- Selin Güler
- Nur Yağmur Tuncer
- Ahmet Tuğrul Bayrak
License / Lisans
This dataset is licensed under the Apache 2.0 License. / Bu veri seti Apache 2.0 Lisansı ile sunulmaktadır.
Citation / Atıf
If you use this dataset, please cite the accompanying paper. / Bu veri kümesini kullanıyorsanız lütfen ilgili bildiriye atıf veriniz.
@misc{bayrak2026realturnturkmultimodalturkishcorpus,
title={Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction},
author={Ahmet Tuğrul Bayrak and Fatma Nur Korkmaz and Bekir Berker Türker and Mustafa Sertaç Türkel and Alper Kaplan},
year={2026},
eprint={2608.22071},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2608.22071},
}
