Отсканированный документ в формате PDF не всегда содержит настоящий текст. Иногда внутри файла находится обычная фотография страницы: ее можно открыть и прочитать, но нельзя нормально выделить, скопировать или найти в ней нужную фразу. Технология OCR решает эту задачу. Она делает содержимое документа доступным для поиска и копирования.
Что такое OCR
Аббревиатура расшифровывается как Optical Character Recognition — оптическое распознавание символов. Программа анализирует изображение, определяет области с текстом, распознает символы и преобразует их в цифровые данные. Это особенно удобно, если исходник существует только в виде скана или фотографии. Вместо ручного набора нескольких страниц можно обработать файл с помощью онлайн-инструмента и получить документ с распознаваемым текстом.
OCR используют для:
- договоров, заявлений и архивных документов;
- счетов, накладных и других рабочих материалов;
- старых книг и журналов;
- фотографий документов, сделанных на смартфон.
Как распознать PDF со скана
Процесс обычно занимает несколько шагов. Пользователь загружает PDF или фотографию в сервис распознавания, после чего система анализирует страницы и создает текстовый слой или преобразует содержимое в редактируемый формат. Например, современные OCR-инструменты умеют работать не только с многостраничными PDF, но и с отдельными изображениями. Google Диск поддерживает преобразование PDF и изображений в текст, а Adobe Acrobat позволяет распознавать текст непосредственно в PDF. После обработки результат стоит проверить. Даже качественное распознавание может ошибаться в отдельных символах, особенно если исходная фотография размыта, текст повернут или часть страницы плохо освещена.
Что с качеством
OCR работает с изображением, поэтому качество исходного файла напрямую влияет на результат. Если фотография сделана под углом, буквы мелкие, страница имеет сильные тени или изображение размыто, программе сложнее правильно определить символы. Перед загрузкой желательно проверить несколько параметров:
- страницу лучше расположить ровно и без перспективных искажений;
- текст должен быть достаточно четким;
- желательно убрать блики, тени и лишний фон;
- при наличии настройки языка нужно выбрать язык документа.
Некоторые системы автоматически выравнивают изображение, очищают его от цифрового шума и корректируют положение страницы перед распознаванием.
Что происходит после OCR
Результатом может стать PDF с поиском по тексту либо редактируемый документ — конкретный вариант зависит от используемого сервиса и настроек. При этом исходное изображение страницы в некоторых режимах сохраняется, а распознанный текст размещается отдельным слоем. Это удобно для архивов: внешний вид оригинала остается прежним, но по документу уже можно искать слова и копировать отдельные фрагменты. Для документов, которые предполагается редактировать, важно проверить не только сами слова, но и структуру страницы. Таблицы, колонки, печати, нестандартные шрифты и сложная верстка требуют более тщательной проверки.
Почему результат нужно проверять
OCR не является способом механического «фотографирования» текста в цифровой формат. Программа интерпретирует изображение и может принять один символ за другой. Особенно внимательно стоит проверить даты, номера документов, суммы, адреса, названия организаций и другие данные, где одна ошибка меняет смысл. Для обычного текста достаточно выборочной проверки, а для юридических, финансовых и технических документов лучше просмотреть весь распознанный материал.
OCR онлайн экономит время там, где раньше приходилось вручную перепечатывать страницы. Главное — подготовить качественный исходник, правильно выбрать язык распознавания и обязательно проверить готовый текст перед дальнейшим использованием.
