ExtractStructuredDocument
Текст, извличане, структурирани данни
Описание
Извлича диапазон от страници в един JSON документ, един XHTML документ или последователност от открити CSV таблици
Синтаксис
Delphi
Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
Format, Options: Integer): WideString;ActiveX
Function PDFlib::ExtractStructuredDocument(PageRange As String,
Format As Long, Options As Long) As StringDLL
const wchar_t* DLExtractStructuredDocument(int InstanceID,
const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
const char* PageRange, int Format, int Options);Параметри
| PageRange | Диапазон от страници с начало от едно, като 1-3,7, или празен низ за всяка страница |
|---|---|
| Format | PDF_STRUCTURED_TEXT_JSON (0), PDF_STRUCTURED_TEXT_XHTML (1) или PDF_STRUCTURED_TEXT_CSV (2) |
| Options | Нула или PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1) |
Върнати стойности
JSON съдържа версия на масива pages, а XHTML съдържа по един семантичен section за всяка избрана страница
CSV съдържа само открити таблици и е празен, когато никоя избрана страница няма такава
Невалиден диапазон, формат или опция и всяка грешка при извличане връщат празен низ
Забележки
Докато се сглобява изходът, се запазва само текстовият модел на текущата страница, така че паметта за извличане на геометрията и йерархията следва най-сложната избрана страница, а не броя страници в документа
Избраната страница се възстановява преди връщането от извикването
Напредъкът и кооперативното отменяне използват нормалния жизнен цикъл на операцията с документ
LastErrorCode е 111 при невалиден вход и 515 при неуспешно извличане