THotPDF.AnalyzeLoadedPageSemanticText
Analyzuje pozicované glyfy a vrací sémantické řádky ve stabilním pořadí čtení
Syntaxe Delphi
function AnalyzeLoadedPageSemanticText(PageIndex: Integer; out ALayout: THPDFSemanticTextLayout): boolean;
Popis
Analyzátor seskupuje baselines, velké vodorovné mezery dělí na buňky, odhaluje opakující se sloupcová pásma, rozpoznává zarovnané řádky tabulek a klasifikuje položky seznamů, nadpisy a popisky obrázků či tabulek. Obsah přes celou šířku a řádky tabulek dělí stránku na svislé zóny, přičemž běžný obsah se řadí nejdřív po sloupcích a v každém sloupci shora dolů
THPDFSemanticTextLayout hlásí ColumnCount, TableCount, mediány stránky a uspořádané Lines. Každý řádek si nese bounds, buňky, roli, sloupec a zónu, indexy tabulky a řádku, úroveň seznamu i původní pořadí ve zdroji, takže aplikace mohou vestavěné heuristiky nahradit vlastními
Geometrický průchod používá řazení O(n log n) a ohraničené přiřazování sloupcových pásem
Viz také ExtractLoadedPageSemanticText