PDF в Word
Извлекает реальный текст из PDF и переносит его в новый документ Word в виде абзацев — быстро, бесплатно и полностью в браузере. Это конвертация только текста: изображения, таблицы и исходная разметка не переносятся.
- Файлы никогда не покидают ваше устройство
- Бесплатно, без регистрации
- Без водяных знаков
- Работает офлайн после загрузки Бета
Как пользоваться: pdf в word
- 1
Добавьте PDF
Перетащите документ на страницу или выберите его через диалог выбора файла.
- 2
Текст извлекается автоматически
Текст каждой страницы считывается и переносится в абзацы — это начинается сразу после добавления файла, никаких настроек не требуется.
- 3
Скачайте .docx
Сохраните полученный документ Word и откройте его в Word, Google Docs или LibreOffice.
Как на самом деле работает извлечение текста из PDF
Страница PDF не имеет понятия «абзацев» или «заголовков» в том смысле, в каком его имеет документ Word, — внутри это набор позиционированных фрагментов текста, каждый из которых, по сути, говорит: «нарисуй эти символы в такой-то точке с координатами x, y, таким-то шрифтом». Здесь нет ни структуры документа, ни даже надёжного понятия о том, где заканчивается одна строка и начинается следующая; программа просмотра PDF восстанавливает визуальный вид страницы, отрисовывая каждый фрагмент текста в указанной позиции, а человек, читающий результат, воспринимает строки и абзацы только потому, что позиции случайно выстраиваются именно так. Конвертация PDF в редактируемый документ означает движение в обратную сторону от этого: группировку фрагментов текста со схожим вертикальным положением в строки, а затем поиск мест, где вертикальный промежуток между одной строкой и следующей необычно велик, — это признак того, что абзац только что закончился, — и трактовку этого как разрыва абзаца. Это, по сути, реконструкция на основе данных о позиции, а не чтение какой-то скрытой структуры документа, и именно поэтому исходное форматирование невозможно восстановить: в файле изначально не было структурированной информации о форматировании для восстановления — только сведения о том, где были расположены чернила.
Почему OCR — это другая задача и намеренно вне рамок этого инструмента
Легко предположить, что «прочитать PDF» и «прочитать отсканированную страницу» — одна и та же задача, решаемая одним и тем же инструментом, но на самом деле это принципиально разные проблемы. Извлечение текста, которым занимается этот инструмент, читает текст, который PDF уже хранит как текст, — коды символов и их позиции, те же данные, которые программа просмотра PDF использует, чтобы позволить вам выделить и скопировать предложение. OCR (оптическое распознавание символов) решает гораздо более сложную задачу: смотрит на страницу, которая является всего лишь картинкой, без каких-либо текстовых данных где-либо в файле, и с помощью распознавания изображений пытается угадать, какие буквы и слова эта картинка изображает. Это принципиально более тяжёлая задача — она включает обработку изображений, модели распознавания символов и неотъемлемую неопределённость в том, что вообще считать «правильным» ответом, и ничего из этого не применимо, когда текст уже присутствует как текст. Встраивание полноценного движка OCR в инструмент, вся привлекательность которого заключается в мгновенной работе прямо в браузере, означало бы пожертвовать скоростью и простотой, которые делают этот инструмент полезным, ради меньшинства PDF, оказавшихся сканами. Отсканированный, состоящий только из изображения PDF — реальный и распространённый случай, и этот инструмент честно сообщает об этом в результатах, а не молча выдаёт пустой документ, — но по-настоящему решить эту задачу означает обратиться к специализированному инструменту OCR, а не растягивать возможности этого инструмента за пределы того, что он честно умеет.
Почему перенос текста лучше, чем попытка имитировать исходную разметку
Более амбициозный конвертер мог бы попытаться воссоздать разметку исходной страницы — размещая текст в блоках примерно в нужных координатах, угадывая колонки, пытаясь воспроизвести шрифты. На практике это создаёт документ, который внешне похож на оригинал, но его практически невозможно по-настоящему редактировать: текст оказывается в разрозненных плавающих блоках вместо связного потока абзацев, скверно перестраивается при любом добавлении или удалении содержимого и сопротивляется пользователю на каждой правке. Перенос извлечённого текста в обычные абзацы вместо этого — подход, который использует этот инструмент, — намеренно жертвует визуальным сходством ради документа, который ведёт себя так, как и должен вести себя документ Word: наберите текст в конце абзаца, и он нормально перенесётся на новую строку, удалите предложение — и остальная часть страницы перестроится так, как текстовые редакторы работают всегда. Для распространённой цели — получить слова из PDF в редактируемом документе, чтобы процитировать, отредактировать, использовать повторно или перевести, — этот компромисс правильный, и именно поэтому этот инструмент не пытается быть инструментом сохранения разметки, притворяющимся текстовым редактором.
Часто задаваемые вопросы
Будет ли документ Word выглядеть точно так же, как мой PDF?
Нет, и цель не в этом. Этот инструмент извлекает реальный текст с каждой страницы и переносит его в обычные абзацы нового документа Word. Изображения, таблицы, колонки, а также исходные шрифты и разметка не переносятся. Если вам нужен именно текст — чтобы процитировать, отредактировать или использовать повторно, — это как раз то, что получится на выходе; если вам нужна точная посимвольная редактируемая копия оригинального дизайна страницы, ни один автоматический конвертер на самом деле этого не даёт, и этот инструмент честно говорит о таком компромиссе, а не делает вид, что его не существует.
Загружается ли мой PDF куда-либо?
Нет. И извлечение текста, и создание документа Word происходят прямо в вашем браузере — PDF никогда не покидает ваше устройство. Здесь нет никакого сервера и нечего загружать, а это важно для договоров, резюме и всего прочего, что вы предпочли бы никуда не отправлять.
Почему я получил пустой или почти пустой документ?
Этот инструмент читает текст, уже встроенный в PDF как текст, — ту же информацию, которую программа просмотра PDF позволяет вам выделить и скопировать. В PDF, который на самом деле является всего лишь фотографией или сканом страницы, без какого-либо текстового слоя под изображением, этому инструменту просто нечего читать, поэтому результат оказывается пустым или почти пустым. Этот инструмент не выполняет OCR (оптическое распознавание символов, которое считывает текст с изображения) — он лишь извлекает текст, уже существующий как текст. Если ваш документ — скан, вам нужен инструмент OCR, а не этот.
Какого качества результата стоит ожидать?
Для обычного текстового PDF — отчётов, писем, статей, экспортированных документов — извлечённый текст точен, а разрывы абзацев в целом оказываются в нужных местах. Многоколоночная вёрстка, таблицы и текст внутри изображений — это как раз те случаи, где подход на основе переноса текста показывает свои пределы, поскольку извлечение не имеет реального представления о колонках или ячейках — только о тексте, расположенном на странице. Для всего, что выходит за рамки простого текста, стоит ожидать некоторой ручной доработки после открытия .docx.
Можно ли конвертировать несколько PDF сразу?
Да — перетащите до 10 файлов одновременно, и каждый будет преобразован в собственный .docx, доступный для скачивания по отдельности или все вместе в виде ZIP-архива.
Вам также может понадобиться
Word в PDF
Превратите файл .docx в аккуратный, читаемый PDF
PDF в JPG
Превращайте каждую страницу PDF в изображение
Сжать PDF
Сжимайте отсканированные PDF — с честно объяснённым компромиссом
Добавить водяной знак на PDF
Проставьте "ЧЕРНОВИК" или "КОНФИДЕНЦИАЛЬНО" на каждой странице
JPG в PDF
Превращайте фото и сканы в единый PDF
Объединить PDF
Объединяйте несколько PDF в один документ
Повернуть PDF
Выпрямите страницы, перевёрнутые набок
Разделить PDF
Извлекайте страницы или разбивайте PDF на отдельные файлы