Syntaksbevarende normalisering af én logisk PDF-page-content-sekvens og robust detektion af inline-image-grænser
NormalizePdfContentSequence sammensætter de leverede indholdsstreams i array-rækkefølge og tokeniserer resultatet som én logisk page-content-sekvens
Den bevarer literal strenge, hex-strenge, navne, arrays, dictionaries, inline-image-payloads og ukendte operatorer, mens tokensepareringen kanoniseres; kommentarer kan fjernes, og strukturel balance kan kræves
CollectPdfContentResourceUses registrerer ressourcenavne, som tekst-, XObject-, graphics-state-, colour-space-, pattern-, shading-, marked-content-property- og inline-image-operatorer forbruger, under det centrale tokenbudget
FindInlineImageBlock finder en komplet BI-, ID- og EI-blok uden at behandle en EI-bytesekvens inde i image-payload-data som terminatoren
| Function | Description |
TPdfContentNormalizeOptions.Default | Aktiverer kommentarfjernelse, balancevalidering, fordelagtig Flate-komprimering og spring over usikre sider; forbyder signede omskrivninger og anvender de tre standardgrænser |
NormalizePdfContentSequence | Returnerer normaliserede bytes og en detaljeret rapport eller False med fejlstatus og diagnostisk tekst |
CollectPdfContentResourceUses | Returnerer ressourcekind og dekodet PDF-navn for hver ressourceforbrugende indholdsoperator eller False med diagnostisk tekst for misdannet eller over-budget input |
FindInlineImageBlock | Returnerer offsets for den næste komplette inline-image-blok på eller efter StartPos |
| Type | Description |
TPdfContentNormalizeStatus | Udfald eller fejlkategori for sekvens- og dokumentnormalisering |
TPdfContentNormalizeOptions | Normaliseringspolitik og byte- og token-grænser pr. side |
TPdfContentNormalizeReport | Status, byte- og sidetotaler, stream- og token-metrikker, syntaksobservationer og diagnostisk tekst |
TPdfContentResourceKind | Ressourceværdier pcrkFont, pcrkXObject, pcrkExtGState, pcrkColorSpace, pcrkPattern, pcrkShading og pcrkProperties |
TPdfContentResourceUse | Ét dekodet ressourcenavn Name sammen med dets Kind |
TPdfContentResourceUses | Dynamisk array af indsamlede ressourceforbrug i indholds-rækkefølge |
| Value | Meaning |
pcnsNotStarted | Rapporten er initialiseret, men normaliseringen er ikke fuldført |
pcnsCompleted | Normaliseringen fuldført med succes |
pcnsInputLimitExceeded | Det logiske input oversteg MaxInputBytesPerPage, eller en konfigureret grænse var ikke positiv |
pcnsOutputLimitExceeded | De normaliserede bytes ville overstige MaxOutputBytesPerPage |
pcnsTokenLimitExceeded | Indholdssekvensen oversteg MaxTokensPerPage |
pcnsMalformedToken | Et PDF-indholdstoken kunne ikke læses fuldstændigt |
pcnsUnresolvedInlineImage | En komplet inline-image-payload-grænse kunne ikke findes |
pcnsUnbalancedState | Påkrævet balance i graphics-, tekst-, marked-content-, kompatibilitets-, array- eller dictionary-scope fejlede |
pcnsUnsupportedFilter | Dokumentniveau-normalisering stødte på en content-stream-filter, den ikke kan dekode |
pcnsEncryptedDocument | Dokumentniveau-normalisering nægtede krypteret input |
pcnsSignedDocument | Dokumentniveau-normalisering nægtede signed input uden autorisation |
pcnsDocumentRewriteFailed | Den omsluttende PDF-objektgraf-omskrivning eller verifikation fejlede |
pcnsResourceBudgetExceeded | Deadline for den procesbrede TPdfParserResourceBudget blev nået, før normaliseringen var fuldført |
| Field | Description |
RemoveComments | Udelader PDF-kommentarer, mens påkrævede token-grænser bevares |
RequireBalancedState | Kræver balancerede q/Q-, BT/ET-, marked-content-, kompatibilitets-, array- og dictionary-scopes |
CompressOutput | Tillader, at document-level-wrapperen Flate-komprimerer en normaliseret sidestream, når komprimering reducerer dens størrelse |
SkipUnsafePages | Tillader, at dokumentniveau-normalisering bevarer en side uændret efter et usikkert eller ikke-understøttet resultat i stedet for at afbryde dokumentomskrivningen |
AllowSignedDocument | Tillader eksplicit en fuld omskrivning af signed input, hvilket invalidere eksisterende signatur-byte-intervaller |
MaxInputBytesPerPage | Maksimal samlet mængde bytes på tværs af de leverede indholdsstreams for én side |
MaxOutputBytesPerPage | Maksimalt tilladte bytes i den normaliserede indholdssekvens |
MaxTokensPerPage | Maksimalt antal tokens, der inspiceres for én side |
| Field | Description |
Status | Aktuel TPdfContentNormalizeStatus |
SourceByteCount | Samlede mængde kildeindholdsbytes |
OutputByteCount | Samlede mængde normaliserede eller omskrevne outputbytes |
PageCount | Sider inspiceret af dokumentniveau-normalisering |
NormalizedPageCount | Sider, der med succes blev erstattet med normaliseret indhold |
SkippedPageCount | Usikre sider bevaret uændret under skip-politikken |
InputStreamCount | Kildeindholdsstreams, der er sat sammen til logiske pagesekvenser |
OutputStreamCount | Normaliserede indholdsstreams, der er produceret |
CoalescedArrayCount | Multi-stream /Contents-arrays erstattet af én enkelt normaliseret stream |
TokenCount | Behandlede tokens |
CommentCount | Kommentarer, der blev stødt på, uanset om de blev bevaret eller fjernet |
InlineImageCount | Komplette inline-image-blokke bevaret |
UnknownOperatorCount | Ukendte operatorer bevaret ordret |
ErrorMessage | Diagnostisk tekst for den første fejl |