ExtractStructuredDocument

Текст, извличане, структурирани данни

Описание

Извлича диапазон от страници в един JSON документ, един XHTML документ или последователност от открити CSV таблици

Синтаксис

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

Параметри

PageRangeДиапазон от страници с начало от едно, като 1-3,7, или празен низ за всяка страница
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) или PDF_STRUCTURED_TEXT_CSV (2)
OptionsНула или PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

Върнати стойности

JSON съдържа версия на масива pages, а XHTML съдържа по един семантичен section за всяка избрана страница

CSV съдържа само открити таблици и е празен, когато никоя избрана страница няма такава

Невалиден диапазон, формат или опция и всяка грешка при извличане връщат празен низ

Забележки

Докато се сглобява изходът, се запазва само текстовият модел на текущата страница, така че паметта за извличане на геометрията и йерархията следва най-сложната избрана страница, а не броя страници в документа

Избраната страница се възстановява преди връщането от извикването

Напредъкът и кооперативното отменяне използват нормалния жизнен цикъл на операцията с документ

LastErrorCode е 111 при невалиден вход и 515 при неуспешно извличане

Вижте също

ExtractStructuredPage, ExtractPageRangeText