PDFをWordに
PDFから文字を取り出して編集できる .docx ファイルにします。PDFはこのページが読み取り、サーバーへ送られることはありません。
できることと、できないこと
取り出せるのは文字です。読み順、段落、改ページ、そしてPDFが大きな文字で組んでいる見出しが対象になります。ページのレイアウトは組み直しません。段組み、表としての表、画像、書体は引き継がれません。PDFがスキャンや紙の写真であれば文字は一切含まれておらず、このページは空の文書を渡すのではなく、その旨をお伝えします。
この端末から変換するPDFを選んでください。
ファイル数の制限、1日あたりの制限、待ち行列はありません。処理はこの端末で行われます。通常の1ファイル処理なら1つ選び、まとめて処理してZIPで受け取るなら複数選んでください。
このPDFからWordへの変換について
150 MBまでのPDFを選んで変換します。テキストレイヤーをページ内で読み取り、文字の座標から行と段落に組み直し、元のPDFの名前を付けた .docx として書き出します。これは文字を取り戻すものであって、ページを再現するものではありません。テキスト抽出であることは、ボタンの上に明記しています。
PDFは段落ではなく、座標に置かれたグリフを保存しています。したがって読み順、行のまとまり、段落の境界はすべて幾何情報から再構成する必要があり、あなたが受け取るのはその再構成結果です。引き継がれるのは、読み順、段落、改ページ、そして大きな文字で組まれた見出しです。引き継がれないのは、レイアウト、段組み、表としての表、画像、書体で、この結果を抽出ではなく変換と呼ぶのは言い過ぎになります。文字をまったく含まないPDF —— スキャンや紙の写真 —— は、空の文書を返すのではなく、その旨を明示して受け付けません。
手順
- 1PDFを選ぶ150 MBまで。ファイルはタブのメモリ上で開かれます。
- 2変換するテキストレイヤーを読み取り、文字の座標にもとづいて行と段落にまとめ直します。
- 3.docx をダウンロードする元のPDFの名前が付いた文書が保存され、Word、LibreOffice、Google ドキュメントで開けます。
残るものと、残らないもの
残るのは、読み順、段落の区切り、改ページ、そして大きな文字で組まれた見出しです。見出しは見出しスタイルとして設定されます。
残らないのは、ページのレイアウト、段組み、表としての表、画像、元の書体です。まったく同じ文書が必要であれば、無償のツールでそれを実現できるものはありません。ここで取り戻せるのは、編集するための文字です。
PDFがスキャンの場合
スキャンしたPDFには文字が入っておらず、文字の画像が入っています。このツールは空の .docx を渡すのではなく、その理由を示して受け付けません。
その場合は、まずブラウザ内で文字を認識するPDFのOCRを通してから、ここで変換してください。
よくある質問
- 元のレイアウトは保たれますか。
- いいえ。保たれるのは文字、読み順、段落、見出しです。レイアウト、段組み、表は保たれません。ページの再現ではなく、テキスト抽出だからです。
- 会員登録やメールアドレスの入力は必要ですか。
- 不要です。アカウントもメールアドレスも、結果をメールで送る仕組みもありません。ファイルがブラウザから出ないためです。
- スキャンしたPDFでも使えますか。
- そのままでは使えません。スキャンにはテキストレイヤーが無く、その旨を示して拒否されます。先にOCRを通してからお試しください。