Старая орфография ломает распознавание не потому, что буквы непонятные, а потому, что таких слов нет в современных словарях. Инструмент, который «исправляет» текст по смыслу, здесь вредит: он молча приводит документ к нынешним нормам.
Соберите формулировку задачи: что на снимке, что нужно получить, на каком языке. Готовый текст можно скопировать или открыть уже подставленным в приложении.
Формулировка собирается прямо в браузере и годится для любой модели с распознаванием картинок. Сам файл здесь не обрабатывается: снимок вы прикладываете уже в приложении.
Для исследования и цитирования — обязательно. Ять и еръ несут информацию о тексте.
Для чтения и поиска удобнее. Но это уже интерпретация, а не копия.
Самый честный путь: оригинальное написание плюс современная версия для поиска.
Просите два результата сразу: точную передачу написания и отдельно современную версию. Первый нужен для работы с источником, второй — чтобы по документу вообще можно было искать: современный поиск не найдёт слово с ятем.
И обязательно оговаривайте, что нечитаемое надо помечать. В старых текстах соблазн додумать особенно велик, а цена такой догадки в исследовании высока.
Печатный — да, если предупредить о старой орфографии. Без предупреждения текст часто молча приводится к современным нормам.
Заметно сложнее: другой алфавит, титла и надстрочные знаки. Результат почти всегда требует вычитки специалистом.
Просить приводить их как есть и отдельно давать расшифровку. Автоматическая расшифровка без пометки — источник ошибок.
Только если есть современная версия написания. Поэтому оба варианта и держат рядом.
Выцветшие чернила, штамп поверх текста, старая орфография — если инструмент проходит это, с остальным справится точно.
Разобрать страницу →