Что уцелеет, когда PDF станет файлом Word
Вы преобразуете PDF в Word, и таблица выходит кривой. Вы решаете, что конвертер плохой, пробуете другой и получаете примерно то же. Некоторые задачи не решаются сменой инструмента.
Перетащите PDF, и текст внутри него будет восстановлен как абзацы и таблицы в файле Word. Ничего не вклеивается картинкой страницы, поэтому то, что вы скачиваете, это документ, в котором можно сразу работать.
Без загрузки
PDF для преобразования
В PDF должен быть настоящий текст. Сканированный PDF представляет собой картинку страницы, извлекать из него нечего. Файлы открываются только в этом браузере и никуда не загружаются.
Переносятся порядок чтения, абзацы и таблицы. Точное расположение на странице не переносится. PDF нигде не записывает, что было абзацем, а что таблицей, поэтому и то и другое восстанавливается по положению символов.
Изображения, печати и подписи со страницы тоже извлекаются и попадают в документ. Они встают по порядку чтения, а не по исходным координатам.
В сканированном PDF хранятся фотографии, а не текст, так что преобразовывать нечего. Добавьте файл, и инструмент сразу об этом скажет.
Страницы не вставляются целиком как картинки. Скачанный файл открывается как редактируемый документ в Word или Excel.
В файле должен быть настоящий текст. Несколько сразу тоже подойдут.
Каждая страница читается на предмет того, где стоят её символы, и они собираются в абзацы и таблицы. Ход работы показан номером страницы.
Он открывается в Word готовым к правке. Исходный PDF остаётся нетронутым.
PDF, это формат не для хранения текста, а для рисования страницы. Внутри файла лежит длинный список команд вида напечатай этот знак вот здесь, и нигде не записано, где заканчивался абзац и какой блок чисел был таблицей. Эти сведения выбрасываются в тот самый момент, когда документ экспортируют в PDF.
Поэтому речь идёт о восстановлении, а не о преобразовании. Где стоят символы, насколько далеко друг от друга строки и какого размера шрифт, всё это читается обратно, чтобы вывести исходную форму. Промежуток шире обычного или строка, оборвавшаяся далеко до правого поля, означают, что там кончался абзац. Ячейки, левый край которых совпадает на нескольких строках подряд, означают таблицу.
Раз это догадка, она может не сработать. Чего инструмент не сделает, так это не придумает значение, которого не нашёл. Страницы без текста отмечаются как пустые, а готовый документ перечитывается и проверяется до того, как попадёт к вам.
Порядок чтения, абзацы, заголовки и таблицы переходят, разрывы страниц тоже. Изображения, печати и подписи со страницы тоже извлекаются и вставляются, только встают они по порядку чтения, а не по исходным координатам. Не переходят точное расположение на странице, шрифты и цвет текста.
Вёрстку намеренно не копируют. Воспроизвести положения означало бы рассыпать надписи по фиксированным координатам, и собранный так документ открывается нормально, но рассыпается, стоит поправить одну строку. Цель этого инструмента, документ, в котором можно работать.
| Элемент | Переходит? |
|---|---|
| Порядок чтения и формулировки | Да |
| Разделение на абзацы | Восстанавливается по положению |
| Заголовки | Шрифт крупнее основного текста считается заголовком |
| Таблицы | Восстанавливаются из выстроенных значений |
| Разрывы страниц | Да |
| Шрифты, цвет, точная вёрстка | Нет |
| Изображения, печати, подписи | Да, в порядке чтения |
PDF, полученный съёмкой бумаги или прогоном через офисный сканер, это одна картинка на страницу. Глаз видит буквы, но в файле нет ни одной. Извлекать нечего, значит и восстанавливать нечего.
Инструмент говорит об этом прямо, а не выдаёт вам пустой файл. Если сканами оказались лишь некоторые страницы, он называет номера тех, что вернулись пустыми. Читать текст с картинок он не умеет.
Всё преобразование происходит внутри этого браузера. И чтение PDF, и запись нового документа выполняет код, работающий на вашем устройстве. Шага отправки здесь попросту нет.
Это можно проверить. Откройте вкладку сети в инструментах разработчика (F12) и запустите преобразование: запрос на отправку размером с ваш файл либо появится, либо нет.
Нет. И чтение PDF, и запись файла Word происходят внутри этого браузера. Ни учётной записи, ни установки не требуется.
Нет. Формулировки, порядок чтения, абзацы и таблицы переходят, но расположение на странице не воспроизводится. Копировать его означало бы прибить надписи к координатам, а такой документ править невозможно.
В таблицах внутри PDF часто нет линий, а там, где они есть, эти линии нарисованы на другом слое, которого извлечение текста никогда не видит. Поэтому таблицы находят по тому, остаются ли ячейки выровненными вниз по странице. Очень узкие промежутки между столбцами и объединённые ячейки могут это сбить.
Нет. Скан, это картинка страницы, и в нём нет ни одной буквы. Перетащите такой файл, и инструмент скажет об этом сразу.
Сработает, если пароль вам известен. Встретив зашифрованный файл, инструмент покажет поле для пароля. Введите его и запустите преобразование снова.
Ограничений не вводилось. Но всё работает на вашем устройстве, поэтому очень длинный документ займёт пропорционально больше времени. Компьютер справляется быстрее телефона.
Вы преобразуете PDF в Word, и таблица выходит кривой. Вы решаете, что конвертер плохой, пробуете другой и получаете примерно то же. Некоторые задачи не решаются сменой инструмента.
Две ситуации: у вас есть .docx, но нет Word, или Word отказывается открывать файл с сообщением "Word found unreadable content" (Word обнаружил нечитаемое содержимое). Ниже бесплатные программы, которые его открывают, что каждая из них от вас требует и как достать текст из файла, который не открывает ни одна из них.
Нужно поменять одну дату в договоре. Переводишь в Word, съезжают таблицы и поля; выгружаешь обратно в PDF, меняются ещё и шрифты. Из-за одной строки весь документ становится другим.