ExtractStructuredDocument

متن، استخراج، دادهٔ ساخت‌یافته

توضیحات

بازهٔ صفحه را به یک سند JSON، یک سند XHTML یا دنباله‌ای از جدول‌های CSV تشخیص‌داده‌شده صادر می‌کند

نحو

Delphi

Function TPDFlib.ExtractStructuredDocument(Const PageRange: WideString;
  Format, Options: Integer): WideString;

ActiveX

Function PDFlib::ExtractStructuredDocument(PageRange As String,
  Format As Long, Options As Long) As String

DLL

const wchar_t* DLExtractStructuredDocument(int InstanceID,
  const wchar_t* PageRange, int Format, int Options);
const char* DLExtractStructuredDocumentA(int InstanceID,
  const char* PageRange, int Format, int Options);

پارامترها

PageRangeبازهٔ صفحهٔ یک‌مبنه مانند 1-3,7، یا رشتهٔ خالی برای همهٔ صفحات
FormatPDF_STRUCTURED_TEXT_JSON (0)، PDF_STRUCTURED_TEXT_XHTML (1) یا PDF_STRUCTURED_TEXT_CSV (2)
Optionsصفر یا PDF_STRUCTURED_TEXT_INCLUDE_STYLES (1)

مقادیر بازگشتی

JSON آرایهٔ نسخه‌دار pages دارد و XHTML به‌ازای هر صفحهٔ انتخاب‌شده یک section معنایی داردCSV فقط جدول‌های تشخیص‌داده‌شده را دارد و وقتی هیچ صفحهٔ انتخاب‌شده‌ای جدول ندارد خالی است

بازه، قالب یا گزینهٔ نامعتبر و هر شکست استخراج، رشتهٔ خالی برمی‌گرداند

ملاحظات

فقط مدل متن صفحهٔ جاری هنگام سرهم‌کردن خروجی نگه داشته می‌شود، پس حافظهٔ استخراج برای هندسه و سلسله‌مراتب از پیچیده‌ترین صفحهٔ انتخاب‌شده پیروی می‌کند نه از تعداد صفحات سند

صفحهٔ انتخاب‌شده پیش از بازگشت فراخوانی بازگردانی می‌شودپیشرفت و لغو تعاونی از چرخهٔ عمر عادی عملیات سند استفاده می‌کنند

LastErrorCode برای ورودی نامعتبر 111 و هنگام شکست استخراج 515 است

همچنین ببینید

ExtractStructuredPage، ExtractPageRangeText