Как распознать PDF
- Загрузите скан PDF.
- Оставьте режим «Скан» или включите умное распознавание для сложной верстки.
- Скачайте DOCX, а при необходимости и PDF с поиском.
Распознайте текст в скане PDF и получите редактируемый DOCX. Можно дополнительно собрать PDF с поиском, чтобы искать и копировать найденный текст.
OCR нужен, если PDF выглядит как картинка: текст нельзя выделить мышью, скопировать или найти через поиск внутри документа - даже если глазами страница читается прекрасно.
Для архивов и договоров удобно получить не только DOCX, но и PDF с текстовым слоем: внешний вид остаётся PDF, а поиск и копирование текста начинают работать, как в обычном текстовом документе.
OCR (распознавание текста) - это не обязательно конвертация в Word. У распознавания есть два разных практических результата, и стоит понимать разницу, прежде чем выбирать. DOCX - редактируемый документ: текст можно менять, копировать целыми абзацами, дополнять. PDF с поиском - это тот же исходный скан, который внешне выглядит как обычный PDF (страницы-картинки), но внутри него появляется невидимый текстовый слой: можно нажать Ctrl+F и найти нужное слово, выделить текст и скопировать фрагмент, при этом визуальный вид документа (печати, подписи, бланк) не меняется ни на пиксель.
Если нужно отредактировать текст - выбирайте DOCX. Если нужно просто иметь возможность искать по архиву сканов, находить нужный договор по слову в тексте или копировать номер счёта без перепечатки - подходит PDF с поиском, а исходный вид документа сохраняется как есть. На этой странице можно получить сразу оба варианта за одну обработку - галочка «PDF с поиском» уже включена по умолчанию, а режим «Скан» тоже выбран заранее, чтобы не настраивать всё вручную.
По умолчанию текст распознаётся локальным движком Tesseract с языковыми моделями «русский + английский». Рядом с результатом показывается уровень уверенности распознавания - ориентир, насколько можно доверять тексту без перепроверки. Галочка «Умное распознавание» подключает более точный внешний алгоритм (на основе Google Document AI) для сложных случаев: таблиц, счетов с рамками, документов с колонками - в пределах отдельного лимита по размеру и числу страниц файла.
До оплаты сервис показывает предпросмотр - фрагмент текста с одной-двух страниц, распознанный локальным алгоритмом. Это позволяет оценить качество, прежде чем платить за обработку всего файла. Полное распознавание всех страниц (и «Умное распознавание», если оно выбрано) запускается уже после подтверждения оплаты.
Точность напрямую зависит от качества исходного изображения. Попробуйте включить «Умное распознавание»; если ошибок всё ещё много, вероятная причина - в самом скане (наклон, размытость, низкое разрешение), а не в настройках сервиса.
Если поиск (Ctrl+F) не срабатывает после распознавания, вероятно, слово было прочитано с ошибкой - сверьте с фрагментом предпросмотра. Для критично важных документов проверяйте распознанный текст, а не полагайтесь на поиск вслепую, особенно если ищете точную сумму или номер документа.
PDF с поиском не должен менять визуальный вид страницы - текстовый слой добавляется поверх исходного изображения незаметно, а не заменяет картинку текстом. Если что-то выглядит иначе, попробуйте пересобрать файл заново.
Включите «Умное распознавание» и режим сохранения расположения - оно лучше держит структуру сложных документов. Подробный разбор режима для таблиц - на странице PDF в Word с таблицами.
Распознавание доступно для PDF до 20 страниц за раз. Более длинный документ разделите на части на странице разделить PDF и распознайте каждую часть отдельно.
Сервис не может прочитать зашифрованный файл даже для определения типа. Снимите пароль на странице разблокировать PDF, затем загрузите файл заново.
Максимальный размер загрузки - 100 МБ. Сожмите файл на странице сжать PDF и попробуйте снова.
| Способ | Что на выходе | Что нужно |
|---|---|---|
| ЯсноДок онлайн | DOCX и/или PDF с текстовым слоем (поиск) | Браузер, ничего не устанавливать |
| Adobe Acrobat (распознавание текста) | PDF с текстовым слоем поверх скана | Лицензия Acrobat Pro |
| Google Диск (открыть PDF как Google Документ) | Текст в Google Документе, форматирование часто теряется | Аккаунт Google |
| Специализированные OCR-программы | PDF с поиском, DOCX, часто и другие форматы | Платная лицензия, установка |
Если нужно именно сохранить документ как PDF, но с возможностью искать по нему текст (архив договоров, накладных, переписки), онлайн-распознавание с опцией «PDF с поиском» экономит шаг: не нужно потом ещё раз пересохранять результат обратно в PDF из Word. Для регулярной обработки больших архивов сканов (сотни и тысячи файлов) специализированные программы с пакетной обработкой могут оказаться удобнее - у нас файлы распознаются по одному.
Распознавание - платная обработка: от 99 ₽ за файл в режиме обычного текста, от 149 ₽ с сохранением таблиц, цена зависит от числа страниц и показывается до оплаты. Распознавание доступно для PDF до 20 страниц, PDF с поиском собирается для файлов до 20 страниц, максимальный размер загрузки - 100 МБ. Файл используется только для распознавания и конвертации, не публикуется в открытом доступе и не применяется для обучения каких-либо моделей; после скачивания результата файлы задачи удаляются с сервера автоматически.
Оплата - разовая, через ЮKassa, без подписки. Если из одного скана нужно и DOCX, и PDF с поиском, платить дважды не придётся - оба результата собираются в рамках одной обработки.
Самый частый сценарий - архив бумажных документов, которые уже отсканированы, но по ним нельзя найти нужный файл иначе как открывая один за другим. Если пропустить сканы через распознавание и получить PDF с поиском, всю папку можно будет искать по слову: по номеру договора, по фамилии, по названию организации - обычным поиском средствами операционной системы или почтового клиента, если файлы хранятся в облаке или на диске.
Второй частый случай - нужно один раз скопировать номер счёта, ИНН или адрес из скана, не перепечатывая вручную и не заводя отдельный DOCX-файл ради пары строк. PDF с поиском для этого подходит лучше, чем DOCX: документ остаётся в привычном виде, но текст из него можно выделить и скопировать.
Третий случай - подготовка документов к отправке в системы, которые требуют «читаемый» PDF, а не просто картинку: некоторые порталы электронного документооборота и системы автоматической проверки принимают только PDF с текстовым слоем, даже если человек и без него прекрасно прочитает скан. В этом случае распознавание - не опция для удобства, а обязательный шаг перед загрузкой файла.
Чаще всего через OCR проходят: договоры и акты, которые получили сканом от контрагента и нужно где-то процитировать; счета и накладные, где важно быстро найти сумму или номер; старые бумажные архивы, переведённые в PDF сканером; справки, выписки и официальные документы, полученные из госорганов или банков в виде скана; фото документов, присланные в мессенджере, когда оригинала на руках нет и переснять его негде.
Общий признак таких документов - в них нет текстового слоя, хотя визуально буквы читаются нормально. Проверить это можно быстро: попробуйте выделить текст мышью в любой программе для просмотра PDF - если не получается, документу точно нужно распознавание, независимо от того, как хорошо он выглядит на экране.
Распознавание рассчитано на русский и английский текст - этого достаточно для большинства деловых документов на территории России: договоров, счетов, справок, писем с элементами на английском (например, названий компаний или адресов). Распознавание печатного текста работает надёжно на чётких сканах; рукописный текст, подписи и заполненные от руки поля распознаются хуже и могут потребовать перепроверки вручную.
Ни один сервис распознавания, включая наш, не гарантирует стопроцентную точность на плохом исходнике - смазанном фото, документе с сильным наклоном или низким разрешением. Поэтому перед использованием результата (особенно для поиска точных цифр или юридически значимого текста) стоит свериться с фрагментом предпросмотра и, если что-то смущает, с оригиналом документа - это касается и DOCX, и PDF с поиском.
Это распознавание текста на страницах PDF, которые являются сканом или изображением.
Да, сервис работает с русским и английским текстом.
Для таблиц, счетов и актов лучше включить умное распознавание.
Да, отметьте опцию PDF с поиском перед обработкой.
Распознавание сканов требует больше вычислений, чем обычное извлечение текстового слоя из PDF.
Да. Чем четче страница, тем выше шанс получить аккуратный текст и таблицы.
Да, в пределах текущего лимита обработки. Если документ большой, цена и доступность покажутся после проверки файла.
Нет, распознавание работает онлайн в браузере.
PDF с поиском сохраняет исходный вид документа как картинку, но добавляет невидимый текстовый слой для поиска и копирования. DOCX - полностью редактируемый текстовый документ.
Да, DOCX и PDF с поиском можно собрать за одну обработку одного и того же файла.
Материал обновлён 21 августа 2026 года.
Если задача шире одной конвертации, используйте соседние инструменты ЯсноДок для PDF и документов.
Основной конвертер PDF в редактируемый DOCX.
Распознавание сканов с прицелом именно на DOCX.
Сохраните картинки со страниц PDF отдельными файлами.
Посмотрите и отредактируйте свойства файла.
DOCX для счетов, актов, строк и колонок.
Получите файл формата DOCX для Word.
Сохраните DOC или DOCX обратно в PDF.
Напишите, если файл не обработался или нужен нестандартный сценарий.
Если текст со скана нужен как основа для договора, претензии или другого документа, в ЯсноДок можно сразу собрать его по шаблону, не перепечатывая вручную - с подсказками по формулировкам и ссылками на нормы там, где они уместны.