anna4uonline/TextCorrectorDataset
TextCorrectorDataset Набор данных предназначен для обучения моделей автоматической коррекции текста. Содержит пары «искажённый текст — исправленный текст», включающие орфографические, пунктуационные и OCR-ошибки. Используется для задач постобработки распознавания текста и повышения качества письменной речи. Особенности: разнообразные типы ошибок (опечатки, OCR-шум, грамматические искажения) подходит для обучения seq2seq и LLM-моделей коррекции текста Ограничения:… See the full description on the dataset page: https://huggingface.co/datasets/anna4uonline/TextCorrectorDataset.
TextCorrectorDataset
Набор данных предназначен для обучения моделей автоматической коррекции текста.
Содержит пары «искажённый текст — исправленный текст», включающие орфографические, пунктуационные и OCR-ошибки.
Используется для задач постобработки распознавания текста и повышения качества письменной речи.
Особенности:
- разнообразные типы ошибок (опечатки, OCR-шум, грамматические искажения)
- подходит для обучения seq2seq и LLM-моделей коррекции текста
Ограничения:
- ограниченная обобщаемость на домены, отсутствующие в датасете
Благодарности
Датасет подготовлен в рамках проекта по оцифровке и распознаванию отчётов губернаторов Енисейской губернии в Центре искусственного интеллекта Сибирского федерального университета.
Работа выполнена при поддержке гранта Фонда содействия инновациям «Код ИИ» — VII очередь.
Авторы также выражают благодарность сайту fromthepage.sfu-kras.ru за предоставленные архивные сканы.
