PDF 指南
扫描 PDF 为什么很大,怎样压缩才不影响阅读?
区分扫描型与文字型 PDF,按页数、嵌入图片和实际体积处理,并检查压缩后的文字、签名与文件完整性。
扫描 PDF 通常是在文档容器中放入多张图片,其体积与扫描像素、噪点、色彩和编码方式有关。从文字处理软件直接导出的 PDF 可能本来就很小,可压缩空间反而有限。
先判断体积来自哪里
在阅读器中试着选择一句文字。能选择文字说明存在文字层,但不一定表示它不是扫描件:扫描图上也可能叠加 OCR 文字。PDF 检查会提供页数、页面尺寸和图片、字体等信息,帮助理解文件结构。
过高扫描分辨率、白边上的噪点、重复页面和不必要的彩色信息,都可能增大文件。处理前保留原件,以便发现模糊时重新调整。
按步骤降低体积
- 在接收方允许时,先移除真正不需要的页面。
- 打开PDF 压缩,填写实际大小限制。
- 硬性上传上限使用严格模式,无法达标时先查看失败原因。
- 对比压缩前后的页数和页面尺寸。
- 放大检查小字、印章、手写内容与细线,有条件时用另一个阅读器再打开一次。
AttachReady 会优化 PDF 对象并重新压缩支持的嵌入图片。某些遮罩或复杂色彩空间会被保留,结果可能附带警告。不存在适用于所有文件的“无损压到 200KB”设置;已经高效编码的 PDF 可能只能减少很少体积。
加密、签名和主动内容
加密 PDF 需要由有权限的人先解密。包含主动内容、嵌入附件、可执行或外部动作的文件可能被拒绝;这属于处理边界,不能理解为通过处理的文件已经完成病毒扫描。
重新写入 PDF 可能使原有数字签名失效。需要保留签名有效性时,应保存签名原件并遵循接收方认可的流程;压缩不能代替重新签名或取得新的官方文档。
目标大小不现实怎么办
多页、细节丰富的扫描件可能无法在很小的体积下保持可读。可以使用更清楚、分辨率合适的扫描源;仅在允许多个文件时拆分提交;或向接收方询问替代渠道。不要为了达到大小上限删掉必需证据。
相关操作可参考PDF 合并与选页和上传错误排查。处理引擎使用 qpdf 与 pikepdf,文档重写能力不代表任何固定压缩比例。