Team Ai
Datasetpublic

anna4uonline/TextCorrectorDataset

TextCorrectorDataset Набор данных предназначен для обучения моделей автоматической коррекции текста. Содержит пары «искажённый текст — исправленный текст», включающие орфографические, пунктуационные и OCR-ошибки. Используется для задач постобработки распознавания текста и повышения качества письменной речи. Особенности: разнообразные типы ошибок (опечатки, OCR-шум, грамматические искажения) подходит для обучения seq2seq и LLM-моделей коррекции текста Ограничения:… See the full description on the dataset page: https://huggingface.co/datasets/anna4uonline/TextCorrectorDataset.

sourceHugging Facemitupdated 6mo agoView on Hugging Face
0likes10downloads
Dataset Card

TextCorrectorDataset

Набор данных предназначен для обучения моделей автоматической коррекции текста.

Содержит пары «искажённый текст — исправленный текст», включающие орфографические, пунктуационные и OCR-ошибки.

Используется для задач постобработки распознавания текста и повышения качества письменной речи.

Особенности:

  • —разнообразные типы ошибок (опечатки, OCR-шум, грамматические искажения)
  • —подходит для обучения seq2seq и LLM-моделей коррекции текста

Ограничения:

  • —ограниченная обобщаемость на домены, отсутствующие в датасете

Благодарности

Датасет подготовлен в рамках проекта по оцифровке и распознаванию отчётов губернаторов Енисейской губернии в Центре искусственного интеллекта Сибирского федерального университета.

Работа выполнена при поддержке гранта Фонда содействия инновациям «Код ИИ» — VII очередь.

Авторы также выражают благодарность сайту fromthepage.sfu-kras.ru за предоставленные архивные сканы.