ファイルが端末から出ることはありません。 ファイルをブラウザで開いて画像を取り出します。JPEGとして入っているものは再圧縮せずそのままお返しするので、画質は落ちません。
ページを写し取るのではなく、PDF・HWP・HWPXの中に保存されている画像を元の画質のまま取り出します。再圧縮しないので何も失われません。送信もしません。
ファイルが端末から出ることはありません。 ファイルをブラウザで開いて画像を取り出します。JPEGとして入っているものは再圧縮せずそのままお返しするので、画質は落ちません。
PDF・HWP・HWPXの中に入っている画像を、元の大きさのまま取り出します。ページを写し取るのではなく、ファイルの中に保存されている絵そのものを取り戻します。
画面の写しは、その画面に映っていたものしか残りません。文書のほうは挿入したときの絵をそのまま抱えていることが多く、ずっと大きいこともあります — 元の画像を失った後に取り戻せるのはそのためです。
HWPとHWPXの中の画像も取り出せます。ハングルワープロを入れている必要はありません。韓国の文書を受け取ったMacやChromebookで役に立ちます。
文書を開くのも取り出すのもブラウザの中なので、社内の書類や契約書もそのまま扱えます。
スキャナが作ったPDFには、ページごとに大きなJPEGが一枚ずつ入っています。だから取り出すと、ページ全体が画像として出てきます — スキャンをJPGに変えるのにそのまま使えます。反対にワードやハングルから書き出したPDFは文字が文字のまま入っているので、写真だけが別に出てきます。
JPEG2000やファクス圧縮、CMYKのようにそのままでは取り出せない形式は二つ目の道へ進みます — PDFを描くライブラリを読み込み、画素に展開してPNGで取り出します。それでも駄目なもの、ウィンドウズのメタファイルのように描画の命令でできたもの、表や数式のような埋め込みオブジェクトは取り出さず、理由を一覧に書きます。アイコンやマスクに使われたごく小さな画像は、何百も溢れ出ないよう一覧から外しました。
ハングルの文書の中には、拡張子が.jpgなのに実際はPNGというファイルが珍しくありません。ファイルの先頭数バイトで形式を見分けて正しい拡張子で保存するので、取り出したファイルが開かないということがありません。JPEGは圧縮し直さず元のバイトをそのまま返すので、画質は落ちません。
ファイル名は.pdf・.hwp・.hwpxで終わる必要がありますが、どの解析器で開くかは名前ではなくファイル先頭の数バイトで決めます。ハングルが.hwpという名前でHWPXを保存することがあり、拡張子だけ.pdfに変えたファイルも出回っています。そうしたファイルも中身が三つのどれかなら開き、どれでもなければそう知らせます。
PDFでは縦横を掛けて400画素に満たない画像をそもそも数えません。箇条書きの記号・下線の断片・透明マスクがその大きさで、一つの文書に何百も入っていて写真を探しにくくするからです。飛ばした画像の一覧にも載せません。本当に小さなアイコンが要るなら、画面を拡大してキャプチャするほうが早いです。
その文書の図が、画像ではなく図形や文字で描かれているためです。表・矢印・テキストボックスは描画の命令なので、取り出せる画像がありません。
挿入されたときにすでに縮んでいたものです。ファイルに無い細部は、どうやっても取り戻せません。
それは別の作業です — 印刷画面の「PDFに保存」を使うか、画面を写し取ってください。
見出しのロゴや背景の模様も画像として入っています。プレビューを見て要るものをお選びください。
複数のファイルを続けて保存すると、ブラウザが許可するか尋ねます。許可すると順に保存され、保存名は元の名前の後ろに01・02の番号が付きます。
プレビューの下に縦横のピクセルと形式、容量が書いてあります。大きいものだけ選んで保存すればよいです。
HWPXは圧縮されたフォルダの中に画像がファイルとして入っていて、HWPは一つの塊の中に入っています。どちらでも同じ画面で取り出せます。
HWPは開く前に文書先頭の印を見て、パスワードが掛かっているか配布用(DRM)で保存された文書なら、そう知らせて止まります。パスワードはハングルで解いて保存し直せばよく、配布用の文書は作った側で通常の文書として出し直してもらう必要があります。PDFはこの検査をしないので、パスワードの掛かったPDFは先に解除した写しを作ってきてください。