Räumliche Tabellenextraktion: Statische PDFs in bearbeitbare Tabellenkalkulationen umwandeln
PDF-Dateien wurden für ein konsistentes visuelles Drucken entwickelt, nicht für die Bearbeitung strukturierter Daten. Im Gegensatz zu Tabellenkalkulationen speichern PDFs keine nativen Tabellen; sie speichern einzelne schwebende Text-Glyphen mit geometrischen Koordinatenmarkierungen.
Unser In-Browser-Parser schließt diese Lücke durch hochpräzises räumliches Clustering. Durch die Auswertung von Zeichenbegrenzungsrahmen, Schrifthöhen und Leerzeichentrennern rekonstruiert er Tabellenmatrizen im lokalen RAM und erstellt saubere, strukturierte Microsoft Excel-Arbeitsmappen, die sofort für Berechnungen bereitstehen.

