浏览器内 PDF 压缩背后的工程学
传统的在线压缩器将多兆字节的 PDF 文档上传到远程云服务器场,引入排队延迟,并且通常依赖于诸如 Ghostscript 之类的有损服务器脚本,这些脚本将向量文本栅格化为模糊的像素化位图。这种传统工作流程为机密的财务报告、合同和医疗记录带来了严重的隐私风险。
我们的双通道压缩引擎完全在浏览器的独立 WebAssembly 运行时中运行。在通道 1 中,引擎检查 PDF 交叉引用 (xref) 表,剔除未引用的死修订,删除非必要的 TrueType 微调指令表(例如 hdmx、VDMX、LTSh 和 PCLT),并在不触及文本字形向量的情况下压缩原始对象流 (/ObjStm)。
当需要更深层次的缩减时,通道 2 会评估嵌入的栅格图片。使用 MozJPEG 级别的离散余弦变换 (DCT) 量化,嵌入的照片被降采样到校准的 DPI 目标(96 到 150 DPI)并重新嵌���到精确的物理页面边界中。由于所有计算都通过 Web Workers 在您的设备 RAM 中运行,您的文档将保持 100% 私密,且执行速度低于一秒。

