ExportDocumentMarkdown

Tekst, wyodrębnianie, Markdown

Opis

Eksportuje wybrany zakres stron PDF do jednego semantycznego ciągu Markdown odpowiedniego do indeksowania wyszukiwania, baz wiedzy i przetwarzania przez modele językowe

Składnia

Delphi

Function TPDFlib.ExportDocumentMarkdown(Const PageRange: WideString;
  Options: Integer): WideString;

ActiveX

Function PDFlib::ExportDocumentMarkdown(PageRange As String,
  Options As Long) As String

DLL

const wchar_t* DLExportDocumentMarkdown(int InstanceID,
  const wchar_t* PageRange, int Options);
const char* DLExportDocumentMarkdownA(int InstanceID,
  const char* PageRange, int Options);

Parametry

PageRangeZakres liczony od 1, na przykład 1-3,7, albo pusty ciąg dla wszystkich stron; jawna kolejność stron jest zachowywana
OptionsMaska opcji udokumentowana przez ExportPageMarkdown

Wartości zwracane

Zwraca połączony tekst Markdown albo pusty ciąg, gdy sprawdzanie poprawności, anulowanie lub wyodrębnianie się nie powiedzie

Uwagi

Analiza używa SetStructuredTextOptions niezależnie od specyficznych dla formatu opcji Options; źródła kolejności czytania i ostrzeżenia fallbacku sprawdź w GetLastStructuredTextDiagnostics

Gdy powiązania treści są kompletne, pierwszeństwo ma rzeczywista kolejność drzewa tagów; treść nierozwiązana lub niejednoznaczna zachowuje wyodrębniony tekst w fallbacku mieszanym albo geometrycznym, a nieznanych ról niestandardowych nie zgaduje się po ich nazwach

Analiza całego dokumentu potrafi scalać fragmenty tabel z kolejnych stron źródła i rozpoznawać powtarzające się elementy stałe marginesów; domyślne wykrywanie tych elementów zachowuje tekst

Scalone i kontynuowane tabele używają jednego osadzonego kodu HTML tabeli, zachowują puste komórki i pomijają rozpoznane powtarzające się nagłówki kontynuacji

Przy włączonych znacznikach strony zwykle zaczynają się od <!-- page: N -->; kontynuowana tabela pomija znaczniki wewnątrz otwartego kodu HTML tabeli

Jawna kolejność stron jest zachowywana; odwróconych lub niekolejnych wyborów stron nie łączy się na siłę

Modele wybranych stron i kompletny wynik Markdown są buforowane dla analizy całego dokumentu; API strumienia i pliku również zachowuje ten model analizy i bufory wyjścia

Wyodrębnianie zachowuje wybraną stronę i otwarty stos tagów zapisu; bieżące niezapisane tagi zapisu trafiają do wyniku bez tagów zamykających i bez finalizowania dokumentu

Postęp i kooperacyjne anulowanie korzystają ze zwykłego cyklu życia operacji na dokumencie

LastErrorCode ma wartość 113 dla nieprawidłowego zakresu lub maski opcji oraz 517, gdy wyodrębnianie się nie powiedzie

Zobacz również

ExportPageMarkdown, SaveMarkdownToStream, ExtractStructuredDocument