容量を減らすために圧縮をかけた結果、文字がかすれて読めなくなったり、会社ロゴやグラフの線がモザイク状に崩れてしまっては本末転倒です。「画質劣化を避けつつファイルサイズだけを絞り込む」ためには、デジタル文書の圧縮構造を理解する必要があります。
PDFの圧縮には、元のデータを完全に復元できる「可逆圧縮(ロスレス)」と、人間の視覚では判別できない余剰情報を間引く「非可逆圧縮(ロッシー)」が存在します。文書の視認性を保つ鍵は、文字情報のベクターデータ(輪郭の数値情報)を一切損なわずに保持したまま、背景の写真やラスター画像のみを狙い撃ちしてリサンプリング(画素の間引き)することです。
業界の標準規格を策定した本家であるAdobe Acrobat PDF圧縮機能では、高度な最適化アルゴリズムが採用されています。テキストデータはベクター形式のまま保持されるため、どれだけ拡大しても文字のエッジがぼやけることはありません。さらに、文書内で実際に使用されている文字のフォント情報だけを抽出して埋め込む「サブセット化」処理を実行し、未使用の文字データを削ぎ落とすことで、PDF容量を減らす画質落とさない理想的なサイズダウンを実現しています。
また、紙書類を取り込んだスキャンPDFにおいては、事前にOCR(光学文字認識)処理を施すことが劇的な軽量化につながります。画像として記録されていた文字領域をデジタルテキストに置き換え、下地の画像を強めに圧縮あるいはモノクロ2値化(白と黒のみに変換)することで、可読性を劇的に引き上げながらファイルサイズを10分の1以下にスリム化できるのです。