THotPDF.AnalyzeLoadedPageSemanticText

Analyzuje pozicované glyfy a vrací sémantické řádky ve stabilním pořadí čtení

Syntaxe Delphi

function AnalyzeLoadedPageSemanticText(PageIndex: Integer;
  out ALayout: THPDFSemanticTextLayout): boolean;

Popis

Analyzátor seskupuje baselines, velké vodorovné mezery dělí na buňky, odhaluje opakující se sloupcová pásma, rozpoznává zarovnané řádky tabulek a klasifikuje položky seznamů, nadpisy a popisky obrázků či tabulek. Obsah přes celou šířku a řádky tabulek dělí stránku na svislé zóny, přičemž běžný obsah se řadí nejdřív po sloupcích a v každém sloupci shora dolů

THPDFSemanticTextLayout hlásí ColumnCount, TableCount, mediány stránky a uspořádané Lines. Každý řádek si nese bounds, buňky, roli, sloupec a zónu, indexy tabulky a řádku, úroveň seznamu i původní pořadí ve zdroji, takže aplikace mohou vestavěné heuristiky nahradit vlastními

Geometrický průchod používá řazení O(n log n) a ohraničené přiřazování sloupcových pásem

Viz také ExtractLoadedPageSemanticText