Перейти к основному содержимому
Tooletto

PDF в Word

Извлекает реальный текст из PDF и переносит его в новый документ Word в виде абзацев — быстро, бесплатно и полностью в браузере. Это конвертация только текста: изображения, таблицы и исходная разметка не переносятся.

  • Файлы никогда не покидают ваше устройство
  • Бесплатно, без регистрации
  • Без водяных знаков
  • Работает офлайн после загрузки
  • Бета
Loading tool…

Как пользоваться: pdf в word

  1. 1

    Добавьте PDF

    Перетащите документ на страницу или выберите его через диалог выбора файла.

  2. 2

    Текст извлекается автоматически

    Текст каждой страницы считывается и переносится в абзацы — это начинается сразу после добавления файла, никаких настроек не требуется.

  3. 3

    Скачайте .docx

    Сохраните полученный документ Word и откройте его в Word, Google Docs или LibreOffice.

Как на самом деле работает извлечение текста из PDF

Страница PDF не имеет понятия «абзацев» или «заголовков» в том смысле, в каком его имеет документ Word, — внутри это набор позиционированных фрагментов текста, каждый из которых, по сути, говорит: «нарисуй эти символы в такой-то точке с координатами x, y, таким-то шрифтом». Здесь нет ни структуры документа, ни даже надёжного понятия о том, где заканчивается одна строка и начинается следующая; программа просмотра PDF восстанавливает визуальный вид страницы, отрисовывая каждый фрагмент текста в указанной позиции, а человек, читающий результат, воспринимает строки и абзацы только потому, что позиции случайно выстраиваются именно так. Конвертация PDF в редактируемый документ означает движение в обратную сторону от этого: группировку фрагментов текста со схожим вертикальным положением в строки, а затем поиск мест, где вертикальный промежуток между одной строкой и следующей необычно велик, — это признак того, что абзац только что закончился, — и трактовку этого как разрыва абзаца. Это, по сути, реконструкция на основе данных о позиции, а не чтение какой-то скрытой структуры документа, и именно поэтому исходное форматирование невозможно восстановить: в файле изначально не было структурированной информации о форматировании для восстановления — только сведения о том, где были расположены чернила.

Почему OCR — это другая задача и намеренно вне рамок этого инструмента

Легко предположить, что «прочитать PDF» и «прочитать отсканированную страницу» — одна и та же задача, решаемая одним и тем же инструментом, но на самом деле это принципиально разные проблемы. Извлечение текста, которым занимается этот инструмент, читает текст, который PDF уже хранит как текст, — коды символов и их позиции, те же данные, которые программа просмотра PDF использует, чтобы позволить вам выделить и скопировать предложение. OCR (оптическое распознавание символов) решает гораздо более сложную задачу: смотрит на страницу, которая является всего лишь картинкой, без каких-либо текстовых данных где-либо в файле, и с помощью распознавания изображений пытается угадать, какие буквы и слова эта картинка изображает. Это принципиально более тяжёлая задача — она включает обработку изображений, модели распознавания символов и неотъемлемую неопределённость в том, что вообще считать «правильным» ответом, и ничего из этого не применимо, когда текст уже присутствует как текст. Встраивание полноценного движка OCR в инструмент, вся привлекательность которого заключается в мгновенной работе прямо в браузере, означало бы пожертвовать скоростью и простотой, которые делают этот инструмент полезным, ради меньшинства PDF, оказавшихся сканами. Отсканированный, состоящий только из изображения PDF — реальный и распространённый случай, и этот инструмент честно сообщает об этом в результатах, а не молча выдаёт пустой документ, — но по-настоящему решить эту задачу означает обратиться к специализированному инструменту OCR, а не растягивать возможности этого инструмента за пределы того, что он честно умеет.

Почему перенос текста лучше, чем попытка имитировать исходную разметку

Более амбициозный конвертер мог бы попытаться воссоздать разметку исходной страницы — размещая текст в блоках примерно в нужных координатах, угадывая колонки, пытаясь воспроизвести шрифты. На практике это создаёт документ, который внешне похож на оригинал, но его практически невозможно по-настоящему редактировать: текст оказывается в разрозненных плавающих блоках вместо связного потока абзацев, скверно перестраивается при любом добавлении или удалении содержимого и сопротивляется пользователю на каждой правке. Перенос извлечённого текста в обычные абзацы вместо этого — подход, который использует этот инструмент, — намеренно жертвует визуальным сходством ради документа, который ведёт себя так, как и должен вести себя документ Word: наберите текст в конце абзаца, и он нормально перенесётся на новую строку, удалите предложение — и остальная часть страницы перестроится так, как текстовые редакторы работают всегда. Для распространённой цели — получить слова из PDF в редактируемом документе, чтобы процитировать, отредактировать, использовать повторно или перевести, — этот компромисс правильный, и именно поэтому этот инструмент не пытается быть инструментом сохранения разметки, притворяющимся текстовым редактором.

Часто задаваемые вопросы

Будет ли документ Word выглядеть точно так же, как мой PDF?

Нет, и цель не в этом. Этот инструмент извлекает реальный текст с каждой страницы и переносит его в обычные абзацы нового документа Word. Изображения, таблицы, колонки, а также исходные шрифты и разметка не переносятся. Если вам нужен именно текст — чтобы процитировать, отредактировать или использовать повторно, — это как раз то, что получится на выходе; если вам нужна точная посимвольная редактируемая копия оригинального дизайна страницы, ни один автоматический конвертер на самом деле этого не даёт, и этот инструмент честно говорит о таком компромиссе, а не делает вид, что его не существует.

Загружается ли мой PDF куда-либо?

Нет. И извлечение текста, и создание документа Word происходят прямо в вашем браузере — PDF никогда не покидает ваше устройство. Здесь нет никакого сервера и нечего загружать, а это важно для договоров, резюме и всего прочего, что вы предпочли бы никуда не отправлять.

Почему я получил пустой или почти пустой документ?

Этот инструмент читает текст, уже встроенный в PDF как текст, — ту же информацию, которую программа просмотра PDF позволяет вам выделить и скопировать. В PDF, который на самом деле является всего лишь фотографией или сканом страницы, без какого-либо текстового слоя под изображением, этому инструменту просто нечего читать, поэтому результат оказывается пустым или почти пустым. Этот инструмент не выполняет OCR (оптическое распознавание символов, которое считывает текст с изображения) — он лишь извлекает текст, уже существующий как текст. Если ваш документ — скан, вам нужен инструмент OCR, а не этот.

Какого качества результата стоит ожидать?

Для обычного текстового PDF — отчётов, писем, статей, экспортированных документов — извлечённый текст точен, а разрывы абзацев в целом оказываются в нужных местах. Многоколоночная вёрстка, таблицы и текст внутри изображений — это как раз те случаи, где подход на основе переноса текста показывает свои пределы, поскольку извлечение не имеет реального представления о колонках или ячейках — только о тексте, расположенном на странице. Для всего, что выходит за рамки простого текста, стоит ожидать некоторой ручной доработки после открытия .docx.

Можно ли конвертировать несколько PDF сразу?

Да — перетащите до 10 файлов одновременно, и каждый будет преобразован в собственный .docx, доступный для скачивания по отдельности или все вместе в виде ZIP-архива.