PDF в Word

Перетащите PDF, и текст внутри него будет восстановлен как абзацы и таблицы в файле Word. Ничего не вклеивается картинкой страницы, поэтому то, что вы скачиваете, это документ, в котором можно сразу работать.

Без загрузки

PDF для преобразования

В PDF должен быть настоящий текст. Сканированный PDF представляет собой картинку страницы, извлекать из него нечего. Файлы открываются только в этом браузере и никуда не загружаются.

Переносятся порядок чтения, абзацы и таблицы. Точное расположение на странице не переносится. PDF нигде не записывает, что было абзацем, а что таблицей, поэтому и то и другое восстанавливается по положению символов.

Изображения, печати и подписи со страницы тоже извлекаются и попадают в документ. Они встают по порядку чтения, а не по исходным координатам.

В сканированном PDF хранятся фотографии, а не текст, так что преобразовывать нечего. Добавьте файл, и инструмент сразу об этом скажет.

Страницы не вставляются целиком как картинки. Скачанный файл открывается как редактируемый документ в Word или Excel.

Как превратить PDF в файл Word

  1. 1

    Перетащите PDF

    В файле должен быть настоящий текст. Несколько сразу тоже подойдут.

  2. 2

    Нажмите преобразовать

    Каждая страница читается на предмет того, где стоят её символы, и они собираются в абзацы и таблицы. Ход работы показан номером страницы.

  3. 3

    Скачайте DOCX

    Он открывается в Word готовым к правке. Исходный PDF остаётся нетронутым.

Что делает этот инструмент

Что значит вернуть PDF обратно

PDF, это формат не для хранения текста, а для рисования страницы. Внутри файла лежит длинный список команд вида напечатай этот знак вот здесь, и нигде не записано, где заканчивался абзац и какой блок чисел был таблицей. Эти сведения выбрасываются в тот самый момент, когда документ экспортируют в PDF.

Поэтому речь идёт о восстановлении, а не о преобразовании. Где стоят символы, насколько далеко друг от друга строки и какого размера шрифт, всё это читается обратно, чтобы вывести исходную форму. Промежуток шире обычного или строка, оборвавшаяся далеко до правого поля, означают, что там кончался абзац. Ячейки, левый край которых совпадает на нескольких строках подряд, означают таблицу.

Раз это догадка, она может не сработать. Чего инструмент не сделает, так это не придумает значение, которого не нашёл. Страницы без текста отмечаются как пустые, а готовый документ перечитывается и проверяется до того, как попадёт к вам.

Что переходит, а что нет

Порядок чтения, абзацы, заголовки и таблицы переходят, разрывы страниц тоже. Изображения, печати и подписи со страницы тоже извлекаются и вставляются, только встают они по порядку чтения, а не по исходным координатам. Не переходят точное расположение на странице, шрифты и цвет текста.

Вёрстку намеренно не копируют. Воспроизвести положения означало бы рассыпать надписи по фиксированным координатам, и собранный так документ открывается нормально, но рассыпается, стоит поправить одну строку. Цель этого инструмента, документ, в котором можно работать.

ЭлементПереходит?
Порядок чтения и формулировкиДа
Разделение на абзацыВосстанавливается по положению
ЗаголовкиШрифт крупнее основного текста считается заголовком
ТаблицыВосстанавливаются из выстроенных значений
Разрывы страницДа
Шрифты, цвет, точная вёрсткаНет
Изображения, печати, подписиДа, в порядке чтения

Отсканированный PDF вернуть нельзя

PDF, полученный съёмкой бумаги или прогоном через офисный сканер, это одна картинка на страницу. Глаз видит буквы, но в файле нет ни одной. Извлекать нечего, значит и восстанавливать нечего.

Инструмент говорит об этом прямо, а не выдаёт вам пустой файл. Если сканами оказались лишь некоторые страницы, он называет номера тех, что вернулись пустыми. Читать текст с картинок он не умеет.

Файл никогда не покидает ваше устройство

Всё преобразование происходит внутри этого браузера. И чтение PDF, и запись нового документа выполняет код, работающий на вашем устройстве. Шага отправки здесь попросту нет.

Это можно проверить. Откройте вкладку сети в инструментах разработчика (F12) и запустите преобразование: запрос на отправку размером с ваш файл либо появится, либо нет.

Частые вопросы

Мой файл куда-то загружается?+

Нет. И чтение PDF, и запись файла Word происходят внутри этого браузера. Ни учётной записи, ни установки не требуется.

Файл Word будет выглядеть точно как PDF?+

Нет. Формулировки, порядок чтения, абзацы и таблицы переходят, но расположение на странице не воспроизводится. Копировать его означало бы прибить надписи к координатам, а такой документ править невозможно.

Таблица получилась неправильной.+

В таблицах внутри PDF часто нет линий, а там, где они есть, эти линии нарисованы на другом слое, которого извлечение текста никогда не видит. Поэтому таблицы находят по тому, остаются ли ячейки выровненными вниз по странице. Очень узкие промежутки между столбцами и объединённые ячейки могут это сбить.

Работает ли это с отсканированным PDF?+

Нет. Скан, это картинка страницы, и в нём нет ни одной буквы. Перетащите такой файл, и инструмент скажет об этом сразу.

А PDF с паролем?+

Сработает, если пароль вам известен. Встретив зашифрованный файл, инструмент покажет поле для пароля. Введите его и запустите преобразование снова.

Есть ли ограничение по числу страниц?+

Ограничений не вводилось. Но всё работает на вашем устройстве, поэтому очень длинный документ займёт пропорционально больше времени. Компьютер справляется быстрее телефона.

Читайте также

Форматы

Как открыть .docx без Word и достать текст, если Word пишет, что файл повреждён

Две ситуации: у вас есть .docx, но нет Word, или Word отказывается открывать файл с сообщением "Word found unreadable content" (Word обнаружил нечитаемое содержимое). Ниже бесплатные программы, которые его открывают, что каждая из них от вас требует и как достать текст из файла, который не открывает ни одна из них.

Читать дальше →