Ruimtelijke tabelextractie: statische PDF's omzetten in bewerkbare spreadsheets
PDF-bestanden zijn ontworpen voor consistent visueel afdrukken, niet voor gestructureerde gegevensbewerking. In tegenstelling tot spreadsheets slaan PDF's geen native tabellen op; ze slaan individuele zwevende teksttekens op met geometrische coördinatenmarkeringen.
Onze in-browser parser overbrugt deze kloof door middel van zeer nauwkeurige ruimtelijke clustering. Door begrenzingsvakken van tekens, lettertypehoogten en witruimtescheidingstekens te evalueren, reconstrueert het tabelmatrices in lokaal RAM, wat schone, gestructureerde Microsoft Excel-werkmappen oplevert die klaar zijn voor onmiddellijke berekening.

