PDF в текст

Копирование из PDF даёт слова, разрезанные пополам, строки, оборванные по краю колонки, и название компании через каждые сорок строк. Здесь текст вынимается и чистится — каждая правка это переключатель, который вы включаете сами, а файл не покидает вкладку.

или перетащите их сюда

PDF с текстовым слоем — не скан. До 60 МБ

Файл остаётся на этом устройстве: открывается внутри вкладки, никуда не отправляется. И ничего не скачивается — читалка PDF уже часть этой страницы.

Что не переносится: картинки, таблицы как таблицы, полужирный и курсив. Таблица станет строками текста, а вёрстка в две колонки прочитается сначала левой — так текст и лежит в файле.

Рядом: PDF в Word · Распознать текст с картинки · Сравнить два PDF · Подсчёт слов

Как пользоваться

  1. Выберите PDF с текстовым слоем — не скан.
  2. Включите нужное: склеивать переносы, собирать строки в абзацы, убирать колонтитулы и номера страниц.
  3. Скопируйте текст или скачайте его файлом .txt.

Полезно знать

Вынуть текст — половина работы

PDF хранит не строки, а куски текста с координатами. Одна строка нередко приезжает десятком кусков, потому что в середине предложения сменился шрифт, и простой извлекатель выдаёт их по одному на строку. Поэтому куски сначала собираются обратно в строки по высоте и только потом чистятся. Та же сборка работает в инструменте сравнения двух PDF: если бы там она была другой, один и тот же файл показывал бы разные различия.

Три правки, и ни одна не делается молча

Переносы склеиваются — но только если следующая строка начинается со строчной буквы, иначе составное название слиплось бы в одно слово. Строки собираются в абзацы — но заголовки, нумерованные пункты и элементы списка остаются на своих строках: слить пункты договора в один абзац хуже, чем оставить лишние переводы строк. Колонтитулы и номера страниц убираются по повторению на листах, а голое число считается номером, только если оно не больше числа страниц, — так «2026» в таблице остаётся на месте.

Скан получает другой ответ

Если PDF — скан, текста в нём нет вовсе: страницы это картинки. Пустое поле выглядело бы как сломанный инструмент, а не как неподходящий, поэтому страница говорит, что случилось, и отправляет к распознаванию текста — оно читает и страницы PDF. Проверка нарочно грубая: меньше сорока букв на весь документ означает подписи внутри картинок, а не текстовый слой.

Частые вопросы

Мой документ куда-нибудь загружается?

Нет. Он открывается внутри вкладки браузера и читается там же. И ничего не скачивается — читалка PDF уже часть этой страницы.

Почему текст получился пустым?

Скорее всего, это скан: картинка каждой страницы без текстового слоя. Пропустите файл через «Текст с картинки» — там буквы распознаются, и страницы PDF тоже принимаются.

Почему перепутались колонки?

Потому что вёрстка в две колонки хранится так, как её рисовали, и левая колонка обычно идёт целиком первой. Порядок здесь следует файлу, а не догадкам о вёрстке: неверная догадка путает текст сильнее, чем сами колонки.

Что будет с таблицами?

Таблица станет строками текста: ячейки сохранят порядок, но потеряют сетку. Если нужна сетка, возьмите «PDF в Excel» — там колонки восстанавливаются по координатам.

Какого размера документ он берёт?

До 60 МБ и первые 500 страниц. Дальше ожидание перестаёт себя оправдывать, и страница говорит об этом, а не зависает.

Похожие инструменты