GetPageText

استخراج، دست‌کاری صفحه

توضیحات

این تابع دو روش متفاوت برای استخراج متن از صفحهٔ انتخاب‌شده فراهم می‌کند و نتایج را در قالب‌های گوناگونی ارائه می‌دهد

توابع SetTextExtractionWordGap، SetTextExtractionOptions و SetTextExtractionArea

برای تنظیم فرایند استخراج متن می‌توان از توابع استفاده کرد

نحو

Delphi

Function TPDFlib.GetPageText(ExtractOptions: Integer): WideString;

ActiveX

Function PDFlib::GetPageText(ExtractOptions As Long) As String

DLL

const wchar_t * DLGetPageText(int InstanceID, int ExtractOptions);

پارامترها

ExtractOptionsبا الگوریتم استخراج متن استاندارد: 0 = استخراج متن در قالب قابل خواندن 1 = منسوخ 2 = برگرداندن رشتهٔ CSV شامل فونت، رنگ، اندازه و موقعیت هر قطعه متن روی صفحه با الگوریتم دقیق‌تر اما کندتر: 3 = برگرداندن یک رشتهٔ CSV برای هر قطعه متن روی صفحه با این قالب: Font Name, Text Color, Text Size, X1, Y1, X2, Y2, X3, Y3, X4, Y4, Text مختصات، چهار گوشهٔ محدودکنندهٔ متن‌اند، با واحدهای تنظیم‌شده توسط تابع SetMeasurementUnits و مبدأ تنظیم‌شده توسط تابع SetOrigin اندازه‌گیری می‌شوند؛ ترتیب مختصات پادساعتگرد است و گوشهٔ پایین-چپ اول می‌آید 4 = مانند گزینهٔ 3، اما کلمه‌های جداگانه برگردانده می‌شوند و جست‌وجوی کلمات راحت‌تر می‌شود 5 = مانند گزینهٔ 3 اما عرض نویسه‌ها بعد از هر بلوک متن خروجی می‌شود 6 = مانند گزینهٔ 4 اما عرض نویسه‌ها بعد از هر خط متن خروجی می‌شود 7 = استخراج متن در قالب قابل خواندن با دقتی بهتر از گزینهٔ 0 8 = قالب خروجی مشابه گزینهٔ 0 اما با الگوریتم دقیق‌تر؛ خطوط بدون قالب‌بندی برمی‌گرداند 9 = استخراج متن در ترتیب خواندن بصری: یک XY-cut بازگشتی چیدمان‌های چندستونه را ستون‌به‌ستون نگه می‌دارد به‌جای درهم‌آمیختن خطوط 10 = خروجی جداشده با tab آگاه از جدول: لبه‌های چپ بلوک‌ها به موقعیت‌های ستونی سراسری خوشه می‌شوند تا سلول‌های هم‌تراز عمودی در همهٔ ردیف‌ها هم‌تراز بمانند 11 = متن شبکهٔ ثابت حفظ‌کنندهٔ layout: صفحه روی یک شبکهٔ نویسهٔ هم‌عرض با فاصله‌های واقعی نگاشت می‌شود و هم‌ترازی بصری بدون tab stop حفظ می‌شود

مقادیر بازگشتی

متن صفحهٔ انتخاب‌شده، یا رشتهٔ خالی اگر مشکلی پیش آمده باشد؛ خطوط با نویسه‌های CR-LF جدا می‌شوند