ExtractStructuredDocument

Text, extraction, structured data

Опис

Вилучає діапазон сторінок в один документ JSON, один документ XHTML чи послідовність виявлених таблиць CSV

Синтаксис

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

Параметри

PageRangeДіапазон сторінок з нумерацією з одиниці, як-от 1-3,7, чи порожній рядок для всіх сторінок
FormatPDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1), or PDF_STRUCTURED_TEXT_CSV (2)
OptionsZero or PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

Return values

JSON містить версійований масив pages, а XHTML — один семантичний section на кожну вибрану сторінкуCSV містить лише виявлені таблиці й порожній, коли жодна вибрана сторінка їх не має

Недійсний діапазон, формат чи опція, як і будь-яка помилка вилучення, повертають порожній рядок

Примітки

Поки вивід збирається, утримується лише текстова модель поточної сторінки, тож пам'ять вилучення геометрії та ієрархії залежить від найскладнішої вибраної сторінки, а не від кількості сторінок документа

Вибрана сторінка відновлюється перед поверненням з виклику

Вибрана сторінка відновлюється до повернення з викликуПрогрес і кооперативне скасування використовують звичайний життєвий цикл операцій з документом

LastErrorCode дорівнює 111 для недійсного вводу і 515, коли вилучення не вдається

Див. також

ExtractStructuredPage, ExtractPageRangeText