ExportDocumentMarkdown
Tekst, wyodrębnianie, Markdown
Opis
Eksportuje wybrany zakres stron PDF do jednego semantycznego ciągu Markdown odpowiedniego do indeksowania wyszukiwania, baz wiedzy i przetwarzania przez modele językowe
Składnia
Delphi
Function TPDFlib.ExportDocumentMarkdown(Const PageRange: WideString;
Options: Integer): WideString;ActiveX
Function PDFlib::ExportDocumentMarkdown(PageRange As String,
Options As Long) As StringDLL
const wchar_t* DLExportDocumentMarkdown(int InstanceID,
const wchar_t* PageRange, int Options);
const char* DLExportDocumentMarkdownA(int InstanceID,
const char* PageRange, int Options);Parametry
| PageRange | Zakres liczony od 1, na przykład 1-3,7, albo pusty ciąg dla wszystkich stron; jawna kolejność stron jest zachowywana |
|---|---|
| Options | Maska opcji udokumentowana przez ExportPageMarkdown |
Wartości zwracane
Zwraca połączony tekst Markdown albo pusty ciąg, gdy sprawdzanie poprawności, anulowanie lub wyodrębnianie się nie powiedzie
Uwagi
Analiza używa SetStructuredTextOptions niezależnie od specyficznych dla formatu opcji Options; źródła kolejności czytania i ostrzeżenia fallbacku sprawdź w GetLastStructuredTextDiagnostics
Gdy powiązania treści są kompletne, pierwszeństwo ma rzeczywista kolejność drzewa tagów; treść nierozwiązana lub niejednoznaczna zachowuje wyodrębniony tekst w fallbacku mieszanym albo geometrycznym, a nieznanych ról niestandardowych nie zgaduje się po ich nazwach
Analiza całego dokumentu potrafi scalać fragmenty tabel z kolejnych stron źródła i rozpoznawać powtarzające się elementy stałe marginesów; domyślne wykrywanie tych elementów zachowuje tekst
Scalone i kontynuowane tabele używają jednego osadzonego kodu HTML tabeli, zachowują puste komórki i pomijają rozpoznane powtarzające się nagłówki kontynuacji
Przy włączonych znacznikach strony zwykle zaczynają się od <!-- page: N -->; kontynuowana tabela pomija znaczniki wewnątrz otwartego kodu HTML tabeli
Jawna kolejność stron jest zachowywana; odwróconych lub niekolejnych wyborów stron nie łączy się na siłę
Modele wybranych stron i kompletny wynik Markdown są buforowane dla analizy całego dokumentu; API strumienia i pliku również zachowuje ten model analizy i bufory wyjścia
Wyodrębnianie zachowuje wybraną stronę i otwarty stos tagów zapisu; bieżące niezapisane tagi zapisu trafiają do wyniku bez tagów zamykających i bez finalizowania dokumentu
Postęp i kooperacyjne anulowanie korzystają ze zwykłego cyklu życia operacji na dokumencie
LastErrorCode ma wartość 113 dla nieprawidłowego zakresu lub maski opcji oraz 517, gdy wyodrębnianie się nie powiedzie
Zobacz również
ExportPageMarkdown, SaveMarkdownToStream, ExtractStructuredDocument