Распознать текст в PDF

Отсканированный договор, снятая на телефон страница, старый факс, сохранённый в PDF, — всё это выглядит документами, а ведёт себя как картинки: не ищется, не копируется, и экранному диктору нечего прочитать. Эта страница распознаёт слова и кладёт их обратно ровно туда, где они на странице, — невидимо. Скан выглядит так же, а всё остальное начинает работать.

Распознавание — это догадка, а не чтение: чистая печатная страница выходит почти идеально, снятый на телефон мятый чек — нет. Ничего не исправляется автоматически: правдоподобная поправка в числе — та ошибка, которую вы уже не поймаете.

Скан никуда не загружается: движок и модель языка скачиваются в ваш браузер и работают там. На выходе — ваш же скан с невидимым текстовым слоем поверх: картинка та же, но поиск, копирование и экранный диктор работают.

Рядом: Распознать текст с картинки · PDF в текст · PDF в Word · Сжать PDF

Как пользоваться

  1. Выберите отсканированный PDF.
  2. Укажите язык документа — от него распознавание зависит сильнее, чем от чего-либо ещё.
  3. Нажмите кнопку, подождите и скачайте PDF с текстом или обычный текст.

Полезно знать

Что такое PDF, по которому ищут

Это ваш скан со вторым слоем: распознанные слова, поставленные ровно поверх напечатанных и нарисованные невидимыми чернилами. Страница выглядит той же самой — та же бумага, те же печати, та же приписка на полях, — но Ctrl+F находит в ней фамилию, фразу можно скопировать, а экранный диктор прочитать вслух. Поэтому картинка сохраняется, а не заменяется чистым текстом: скан часто и есть документ, и переверстать его значило бы сделать другой.

Распознавание — это догадка, а не чтение

Чистая печатная страница выходит почти идеально. Снятый на телефон мятый чек — нет, и ни один движок этого не изменит. Поэтому средняя уверенность показывается после работы, а ничего автоматически не исправляется: правдоподобная поправка в цифре — та самая ошибка, которую уже никто не поймает. Прочитайте текст, прежде чем на него полагаться, — особенно числа.

Частые вопросы

Скан куда-нибудь загружается?

Нет. Движок и модель языка скачиваются в ваш браузер и работают там; файл остаётся на устройстве.

Сколько всего скачается?

Около двух-трёх мегабайт: движок и одна языковая модель. Число написано на странице до нажатия, а после первого запуска всё работает без сети.

В моём PDF уже есть текст — стоит ли распознавать?

Нет, и страница скажет об этом, когда заметит: распознавание заменит хороший текст догадкой. Возьмите «PDF в текст».

Сколько страниц потянет?

До пятидесяти. Дальше браузер потратил бы десятки минут, и страница честно сообщает, сколько было сделано.

Похожие инструменты