Przestrzenna ekstrakcja tabel: zamiana statycznych plików PDF na edytowalne arkusze kalkulacyjne
Pliki PDF zostały zaprojektowane z myślą o spójnym drukowaniu wizualnym, a nie edycji ustrukturyzowanych danych. W przeciwieństwie do arkuszy kalkulacyjnych, pliki PDF nie przechowują natywnych tabel; przechowują poszczególne pływające glify tekstowe z znacznikami współrzędnych geometrycznych.
Nasz parser działający w przeglądarce niweluje tę lukę za pomocą precyzyjnego klastrowania przestrzennego. Oceniając ramki ograniczające znaki, wysokości czcionek i ograniczniki białych znaków, rekonstruuje matryce tabelaryczne w lokalnej pamięci RAM, tworząc czyste, ustrukturyzowane skoroszyty programu Microsoft Excel gotowe do natychmiastowych obliczeń.

