PDF в Excel

Перетащите PDF, и значения, стоящие столбцами как таблица, разложатся по ячейкам. Каждая страница становится отдельным листом, так что вы не потеряете, откуда взялось число.

Без загрузки

PDF для преобразования

В PDF должен быть настоящий текст. Сканированный PDF представляет собой картинку страницы, извлекать из него нечего. Файлы открываются только в этом браузере и никуда не загружаются.

Переносятся порядок чтения, абзацы и таблицы. Точное расположение на странице не переносится. PDF нигде не записывает, что было абзацем, а что таблицей, поэтому и то и другое восстанавливается по положению символов.

Изображения, печати и подписи со страницы тоже переносятся. Поверх ячеек они мешали бы расчётам, поэтому собраны под данными на каждом листе.

В сканированном PDF хранятся фотографии, а не текст, так что преобразовывать нечего. Добавьте файл, и инструмент сразу об этом скажет.

Страницы не вставляются целиком как картинки. Скачанный файл открывается как редактируемый документ в Word или Excel.

Как превратить PDF в таблицу

  1. 1

    Перетащите PDF

    Чем более табличный документ, тем лучше результат. Несколько сразу тоже подойдут.

  2. 2

    Нажмите преобразовать

    Положение символов определяет, где каждая таблица начинается и заканчивается.

  3. 3

    Скачайте XLSX

    Он открывается в Excel или Google Таблицах готовым к расчётам.

Что делает этот инструмент

Читается положение, а не линии

У таблиц в PDF очень часто вообще нет линий по краям. Там, где они есть, эти линии нарисованы на другом слое, нежели текст, и невидимы для всего, что извлекает слова. Именно поэтому подходы, построенные на поиске линий, так часто дают сбой.

Читается, стало быть, положение. Внутри строки промежуток заметно шире межсловного означает границу ячейки, а когда такие промежутки стоят на одной и той же горизонтальной позиции в нескольких строках подряд, этот блок и есть таблица. Минимум три строки. Блоки из двух строк, это обычно заголовок с датой, отодвинутой к правому краю, и превращение такого в таблицу только затрудняет чтение.

Пустая ячейка не оставляет в файле следа, потому что символов там никогда не было. Сцепление ячеек по порядку сдвинуло бы всё на одну позицию, поэтому каждая ячейка падает в ближайший столбец, а остальные остаются пустыми.

По листу на страницу

Когда таблицы разбросаны по нескольким страницам, сваливание их на один лист лишает вас понимания, с какой страницы пришло число. Поэтому каждая страница становится отдельным листом, названным по номеру страницы.

Строки, не входящие в таблицу, тоже сохраняются, по одной на строку. Выбросив заголовок над таблицей или примечание о том, в каких единицах даны цифры, вы останетесь с числами, которые нечем прочесть. Изображения и печати со страницы тоже переносятся и складываются под данными на каждом листе, чтобы не висеть над ячейками и не мешать расчётам.

Отсканированный PDF вернуть нельзя

PDF, полученный съёмкой бумаги или прогоном через офисный сканер, это одна картинка на страницу. Глаз видит буквы, но в файле нет ни одной. Извлекать нечего, значит и восстанавливать нечего.

Инструмент говорит об этом прямо, а не выдаёт вам пустой файл. Если сканами оказались лишь некоторые страницы, он называет номера тех, что вернулись пустыми. Читать текст с картинок он не умеет.

Файл никогда не покидает ваше устройство

Всё преобразование происходит внутри этого браузера. И чтение PDF, и запись нового документа выполняет код, работающий на вашем устройстве. Шага отправки здесь попросту нет.

Это можно проверить. Откройте вкладку сети в инструментах разработчика (F12) и запустите преобразование: запрос на отправку размером с ваш файл либо появится, либо нет.

Частые вопросы

Мой файл куда-то загружается?+

Нет. И чтение PDF, и запись таблицы происходят внутри этого браузера.

Попадает ли текст, не входящий в таблицу?+

Да, по строке на строку в первом столбце. Выбросить заголовок над таблицей или единицы измерения означало бы оставить числа, которые никто не истолкует.

Ячейки сдвинулись на один столбец.+

Так выходит потому, что пустая ячейка не оставляет в PDF следа. Падение каждой ячейки в ближайший столбец сильно уменьшает это, но таблицы с очень узкими промежутками между столбцами всё ещё могут съезжать.

А объединённые ячейки?+

Объединённые ячейки не переносятся. Значение из объединённого блока попадает в ближайший одиночный столбец.

Числа пришли текстом.+

PDF не записывает, число это или подпись, поэтому значение сохраняется ровно так, как выглядит. Разделители тысяч и знаки валют заставляют Excel читать его как текст. Смена формата ячейки в Excel это исправляет.

Работает ли это с отсканированным PDF?+

Нет. Скан, это картинка страницы, и извлекать из него нечего.