Team Ai
Datasetpublic

figmtu/aac_subtitle_deberta_classified

This dataset contains sentences from the OpenSubtitles2016 movie subtitle corpus. Each sentence is scored according to how similar it was to a spoken (dialogue_prob) or written (forum_prob) communication. See our EMNLP 2025 paper for details.

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes15downloads
Dataset Card

This dataset contains sentences from the OpenSubtitles2016 movie subtitle corpus. Each sentence is scored according to how similar it was to a spoken (dialogueprob) or written (forumprob) communication.

See our EMNLP 2025 paper for details.