スキャンした PDF が大きい理由と安全な圧縮方法
スキャン中心の PDF が圧縮しにくい理由と、失われる可能性のある情報を解説。軽量化後にページ、署名、読みやすさを確認する方法も紹介します。
誰かが6ページ契約をスキャン 300 DPI, 取得 a 14 MB PDFポータルにアップロードしてアップロードする 2 MB 限界。最初の本能は、再びコンプレッサーを介してファイルを実行することです。 ファイルがほとんど動きます。 つまり、コンプレッサーが弱いためではありません。スキャンされるからです。 PDF ほとんどの人が想定した感覚で文書ではありません。身に着けている写真の積み重ねです。 PDF ラッパー、コンプレッサーは、写真を再圧縮できるだけ。
スキャンしたPDFは容器です
PDFの2種類のページ
PDFのページは、2つの非常に異なる種類のコンテンツを保持することができます。
| ページコンテンツ | 典型的なソース | サイズがどこにあるか |
|---|---|---|
| ベクトルテキストとフォント | ワード、LaTeX、ブラウザ「PDFへの印刷」 | フォントプログラム、埋め込まれた1回および再利用 |
| 1つのフルページビットマップイメージ | スキャナ、電話カメラ、MFP | 画像のピクセル、品質、色 |
2行目はスキャンが生成するものです。スキャナーは文字を理解していません。300 DPIでページをラスターイメージでキャプチャします。A4では、ほぼ2480 × 3508ピクセルを1ページごとにキャプチャし、PDFに貼り付けます。6ページはそれらの画像の6つです。
そのため、サイズの問題は、画像の質問に変わります。何ピクセル、どのように多くの色、どのくらいの頻度の高い詳細、およびどのような品質設定。 PDFフォーマット自体は、非常に少ない貢献します。 つまり、ワードプロセッサからエクスポートされたテキストネイティブPDFは、多くの場合、既に小さく、ほとんど何も再評価しません。
なぜコンプレッサーを2回実行しても何もしないのですか?
ページイメージは既にJPEGです
最も一般的な無駄な努力は、繰り返し同じスキャンを圧縮しています, 各パスが少し離れて振る舞います. それはではありません, 具体的な理由のために: スキャンされたPDF内のページイメージは、既にJPEG圧縮されています. JPEGは、損失しています, その出力は、その入力よりも有意に圧縮されません. 同じ品質のJPEGを再エンコーディングすることは、既に同じ品質で同じサイズのファイルを生成します, 同じサイズの再エンコードは、同じ品質が、同じサイズの低画質で失われています.
DPIが変更された下段のスキャンは何か
2番目のパスは、実際に助ける2つのことを回復することはできません。低解像度でキャプチャされていないピクセル、元のエンコーディングが既に破棄されていないことの詳細。 異なる設定で本物の再エンコードのみ、または少数のピクセルは、算数を変更します。
空間を取っているものを識別する
何かを変更する前に、ファイルにあるものを見つけます。 PDF リーダーの文を選択してみてください。 選択可能なテキストはテキストレイヤーが存在することを意味しますが、それは決定的ではありません。スキャンは、大きな背景画像の上に目に見えない OCR 層を運ぶことができ、画像はファイルを満たしています。 PDFの点検 レポートページカウント、ページ寸法と埋め込まれた画像とフォントの事実 — 回答がどこに住んでいるかです。
スキャンの回避可能なサイズの典型的なソース:
- コンテンツが不要な場合、600 DPIでキャプチャされたページ
- 白い余白を渡る写実的な騒音 — 走査の利益は余りに高く置きます
- 誤りや空白のページを含む
- 黒と白のドキュメントのカラーキャプチャ
- フレームに含まれている机の端、指または影
処理の前に元の状態を保ちましょう。バージョンが低下すると、元が唯一の方法に戻ります。
なぜ手書きが圧縮に抵抗するのか
すべての鉛筆ストロークはエッジです
いくつかの予測可能な黒いストロークでほとんどフラットな白であるため、タイプされたテキストのページがよく圧縮されます。手書きのページは反対です。テクスチャードペーパーに鉛筆やペンが数千もの小さな不規則なエッジを生成し、それらのエッジのすべてが高周波コンテンツです。低品質のスキャナからノイズは同じものを追加し、それは本物のペンストロークからエンコーダに無関心です。
ご覧のとおり、トレードオフは明示的になります。 そのようなページ上のコンプレッサーの唯一のレバーは、細かい詳細を滑らかにしています。そして、手書きの署名では、その細かい詳細 is コンテンツ。 灰色のぼるにシグネチャは、拒否されたアップロードよりも悪いです、それが受け入れられ、後で質問される可能性があるため。
目に見えるステップのサイズを減らす
やりがいのある5つのパス
- 必要とされていないページを削除, 投稿のルールが許せば. これは、ゼロ品質の損失でサイズを減らす唯一のステップです.
- Open PDFの圧縮機 ポータルのルールから実際のバイトのターゲットを設定し、推測からではなく。
- 限界が硬くなると厳密なモードを使用します。 ツールが満たない場合は、統一された候補を提出するのではなく、失敗を読んでください。
- Compareページカウントとページ次元を元のものにします。ページをサイレントに落としたのは最悪の成功です。
- **Zoomは、小さなテキスト、スタンプ、手書き、薄いルールで。**は、あなたが1を持っている場合は、2番目のPDFリーダーで結果を開きます、そのため、単一のレンダラーのquirkはあなたを誤解しません。
AttachReadyはPDFオブジェクトを最適化し、サポートされた埋め込まれた画像を再圧縮することができます。いくつかのマスクと複雑な色のスペースは、積極的な書き換えではなく保存されます。そのため、結果は警告を伴うことができます。それらを読む。普遍的な「200 KBに無光沢」はありません。既にエンコードされているPDFは、非常に縮小し、それは本当の答えであり、ツールの失敗ではありません。
ページのレベルの操作と文書レベルの操作
どの操作が実際にファイルを縮小できるか
どの操作がページ上で動作するかを知ると、ファイルが全体的に保存されます。
| 運営会社 | スコープ | サイズへの影響 |
|---|---|---|
| ページを選択の特長 | ページレベル | 削除されたページへの比例 |
| 回転率の特長 | ページレベル | エッセンシャル どれも |
| マージの特長 | ドキュメントレベル | 入力を追加; 決して収縮しません |
| コンプレッションの特長 | ドキュメントレベル | 埋め込まれたイメージを再エンコード |
| 再スキャン | ソース | ダウンストリームをすべて変更 |
実用的な結果: スキャンの大きな削減が必要な場合は、通常、決定的な動きは、ファイルがこれまで、スキャナで、DPIとカラーモードの選択で、コンプレッサーに到達する前に発生します。
品質を危険にさらすことができない場合、認証のみのパス
スプリット、点検、比較して下さい、元を保って下さい
時には、正しい答えは、まったく圧縮されません。 文書が署名された契約、認定された翻訳、または合法的に関連性のあるものであれば、代わりにこれを試してください。
- ポータルが複数のアップロードを受け入れるかどうかを確認します。 6ページスキャンを3ページファイルに分割すると、再エンコーディングなしで制限が合わされます。
- 実際にスキャン重いかテキストネイティブであるかどうかを確認するファイルをチェックする—テキストPDFは画像の動作を必要としません。
- 削除が無効な場合、コピーを圧縮し、送信前に元の200%ズームでページと比較します。
- 元のままにして、自分が開いていない結果を提出しないでください。
保護された、署名された、珍しいファイル
暗号化されたPDFは、処理の前に、承認した人によって復号化する必要があります。 アクティブなコンテンツ、埋め込まれた添付ファイルまたは実行可能または外部のアクションを持つPDFは拒否される可能性があります。 処理境界であり、受け入れられたファイルはマルウェアフリーであると主張するものではありません。
PDF を書き換えると、デジタル署名を無効化できます。署名された元をキープし、署名が有効に保たなければならないときに、承認されたプロセスを使用します。 圧縮は再署名または新鮮な公式文書を入手するための代替ではありません。
ターゲットが非現実的であるとき
長い、詳細、手書きのスキャンは、小さなバイトの制限で合法性を維持することはできません。 その場合、クリーナースキャンを賢明な解像度で試し、色が要求されていない場合はグレースケールに変換し、複数のアップロードが許可されている場合、または別の送信チャネルに関する受信組織にのみ文書を分割します。 投稿が進行状況インジケータが緑色に変わるように要求するページを削除しないでください。
関連するワークフローについては、PDFのページをマージし、選択します と アップロードエラー診断 を参照してください。 フォーマットと制限 ページでは、アクセス層ごとに適用される天井が一覧表示されます。