GetPageText

חילוץ, פעולות בדפים

תיאור

פונקציה זו מספקת שתי שיטות שונות לחילוץ טקסט מהעמוד הנבחר, ומציגה את התוצאות במגוון פורמטים

ה-SetTextExtractionWordGap, SetTextExtractionOptions ו-SetTextExtractionArea

אפשר להשתמש בפונקציות כדי להתאים את תהליך חילוץ הטקסט

תחביר

Delphi

Function TPDFlib.GetPageText(ExtractOptions: Integer): WideString;

ActiveX

Function PDFlib::GetPageText(ExtractOptions As Long) As String

DLL

const wchar_t * DLGetPageText(int InstanceID, int ExtractOptions);

פרמטרים

ExtractOptionsהשתמשו באלגוריתם חילוץ הטקסט הסטנדרטי: 0 = חילוץ טקסט בפורמט קריא לבני אדם 1 = Deprecated 2 = החזרת מחרוזת CSV הכוללת גופן, צבע, גודל ומיקום של כל קטע טקסט בדף באמצעות אלגוריתם חילוץ הטקסט המדויק יותר אך האיטי יותר: 3 = החזרת מחרוזת CSV עבור כל קטע טקסט בדף בפורמט הבא: Font Name, Text Color, Text Size, X1, Y1, X2, Y2, X3, Y3, X4, Y4, Text הקואורדינטות הן ארבע הנקודות התוחמות את הטקסט, הנמדדות באמצעות היחידות שהוגדרו בפונקציה SetMeasurementUnits והמקור שהוגדר בפונקציה SetOrigin. סדר הקואורדינטות הוא נגד כיוון השעון, כשהפינה השמאלית התחתונה ראשונה. 4 = דומה לאפשרות 3, אך מוחזרות מילים בודדות, וכך החיפוש אחר מילים נעשה קל יותר 5 = דומה לאפשרות 3, אך רוחבי התווים מופקים אחרי כל בלוק טקסט 6 = דומה לאפשרות 4, אך רוחבי התווים מופקים אחרי כל שורת טקסט 7 = חילוץ טקסט בפורמט קריא לבני אדם בדיוק משופר בהשוואה לאפשרות 0 8 = פורמט פלט דומה לאפשרות 0, אך באמצעות האלגוריתם המדויק יותר. מוחזרות שורות ללא עיצוב 9 = חילוץ טקסט בסדר קריאה ויזואלי: חיתוך XY רקורסיבי שומר על פריסות מרובות עמודות עמודה אחר עמודה במקום לשזור שורות 10 = ייצוא מופרד בטאבים מודע לטבלאות: הקצוות השמאליים של בלוקים נקלטים למיקומי עמודה גלובליים, כך שתאים מיושרים אנכית נשארים מיושרים בין שורות 11 = טקסט ברשת קבועה ששומרת על הפריסה: הדף ממופה לרשת תווים ברוחב אחיד עם ריפוד ברווחים אמיתיים, תוך שמירה על היישור החזותי בלי עצירות טאב

ערכי החזרה

הטקסט של הדף הנבחר, או מחרוזת ריקה אם אירעה בעיה. שורות מופרדות בתווי CR-LF