PDF в Word
Извлеките текст из PDF в редактируемый файл .docx . PDF читает эта страница, и он никогда не отправляется на сервер.
Что это делает, а что нет
Он возвращает текст: порядок чтения, абзацы, разрывы страниц и заголовки там, где PDF набирает их более крупным кеглем. Он не восстанавливает вёрстку страницы: колонки, таблицы как настоящие таблицы, изображения и шрифты не переносятся. Если ваш PDF — скан или фотография листа, текста в нём нет вовсе, и эта страница скажет об этом, а не выдаст вам пустой документ.
Выберите PDF с этого устройства для преобразования.
Нет ограничения на число файлов, нет дневного лимита и нет очереди: работа идёт на этой машине. Выберите один файл для обычного режима или сразу несколько — тогда результаты придут одним архивом ZIP.
Об этом преобразовании PDF в Word
Выберите PDF размером до 150 МБ и преобразуйте его. Текстовый слой читается прямо на странице, группируется в строки и абзацы по координатам символов и записывается в .docx с именем вашего PDF. Так возвращаются слова, а не страница: это извлечение текста, и страница говорит об этом над кнопкой.
PDF хранит глифы по координатам, а не абзацы, поэтому порядок чтения, группировку строк и границы абзацев приходится восстанавливать из геометрии — и именно это восстановление вы получаете. Переходят: порядок чтения, абзацы, разрывы страниц и заголовки, набранные более крупным кеглем. Не переходят: вёрстка, колонки, таблицы как таблицы, изображения и шрифты, и называть результат преобразованием, а не извлечением, было бы преувеличением. PDF совсем без текста — скан или фотография листа — отклоняется с прямым указанием причины, а не возвращает вам пустой документ.
Пошагово
- 1Выберите PDFДо 150 МБ. Файл открывается в памяти вкладки.
- 2ПреобразуйтеТекстовый слой читается и группируется в строки и абзацы по координатам символов.
- 3Скачайте .docxДокумент получает имя вашего PDF и открывается в Word, LibreOffice или Google Документах.
Что переживает преобразование, а что нет
Переживают: порядок чтения, деление на абзацы, разрывы страниц и заголовки более крупным кеглем, размеченные стилем заголовка.
Не переживают: вёрстка страницы, колонки, таблицы как таблицы, изображения и исходные шрифты. Если нужен документ один в один, ни один бесплатный инструмент этого не даст; здесь возвращаются слова, чтобы их можно было править.
Если ваш PDF — это скан
Отсканированный PDF содержит не текст, а изображение текста. Инструмент отклоняет его с указанием причины, вместо того чтобы выдать пустой .docx.
Для такого случая сначала пропустите файл через распознавание текста в PDF, которое работает внутри браузера, а затем преобразуйте здесь.
Частые вопросы
- Сохраняется ли исходное форматирование?
- Нет. Сохраняются слова, порядок чтения, абзацы и заголовки. Вёрстка, колонки и таблицы — нет: это извлечение текста, а не воспроизведение страницы.
- Нужна ли регистрация или адрес электронной почты?
- Нет. Ни аккаунта, ни почты, ни отправки результата письмом — файл никогда не покидает ваш браузер.
- Работает ли это с отсканированным PDF?
- Напрямую нет: у скана нет текстового слоя, и он отклоняется с указанием причины. Пропустите его через распознавание текста и попробуйте снова.