Syntaxbevarande normalisering av en logisk sidinnehållssekvens i PDF och robust detektering av inline-bildgränser
NormalizePdfContentSequence fogar samman de angivna innehållsströmmarna i arrayordning och tokeniserar resultatet som en logisk sidinnehållssekvens
Den bevarar literala strängar, hexsträngar, namn, arrayer, ordböcker, inline-bildnyttolaster och okända operatorer medan tokensepareringen kanoniseras; kommentarer kan tas bort och strukturell balans kan krävas
CollectPdfContentResourceUses registrerar resursnamn som konsumeras av text-, XObject-, graphics-state-, färgrymd-, mönster-, skuggnings-, marked-content-egenskaps- och inline-bildoperatorer inom den centrala tokenbudgeten
FindInlineImageBlock lokaliserar ett komplett BI-, ID- och EI-block utan att behandla en EI-bytesekvens inuti bildnyttolasten som avslutare
| Function | Description |
TPdfContentNormalizeOptions.Default | Aktiverar borttagning av kommentarer, balansvalidering, gynnsam Flate-komprimering och hopp över osäkra sidor; tillåter inte omskrivning av signerade dokument och tillämpar de tre standardgränserna |
NormalizePdfContentSequence | Returnerar normaliserade bytes och en detaljerad rapport, eller False med felstatus och diagnostisk text |
CollectPdfContentResourceUses | Returnerar resursslaget och det avkodade PDF-namnet för varje resurskonsumerande innehållsoperator, eller False med diagnostisk text för felformaterad eller över budgetens indata |
FindInlineImageBlock | Returnerar offset för nästa kompletta inline-bildblock på eller efter StartPos |
| Type | Description |
TPdfContentNormalizeStatus | Utfall eller felkategori för sekvens- och dokumentnormalisering |
TPdfContentNormalizeOptions | Normaliseringspolicy och per-sida-gränser för bytes och tokens |
TPdfContentNormalizeReport | Status, totaler för bytes och sidor, ström- och tokenmått, syntaxobservationer och diagnostisk text |
TPdfContentResourceKind | Resursvärdena pcrkFont, pcrkXObject, pcrkExtGState, pcrkColorSpace, pcrkPattern, pcrkShading och pcrkProperties |
TPdfContentResourceUse | Ett avkodat resurs-Name tillsammans med dess Kind |
TPdfContentResourceUses | Dynamisk array av insamlade resursanvändningar i innehållsordning |
| Value | Meaning |
pcnsNotStarted | Rapporten har initierats men normaliseringen har inte slutförts |
pcnsCompleted | Normaliseringen slutfördes framgångsrikt |
pcnsInputLimitExceeded | Den logiska indatan överskred MaxInputBytesPerPage eller en konfigurerad gräns var inte positiv |
pcnsOutputLimitExceeded | De normaliserade bytes skulle överskrida MaxOutputBytesPerPage |
pcnsTokenLimitExceeded | Innehållssekvensen överskred MaxTokensPerPage |
pcnsMalformedToken | En PDF-innehållstoken kunde inte läsas helt |
pcnsUnresolvedInlineImage | En komplett gräns för en inline-bildnyttolast kunde inte hittas |
pcnsUnbalancedState | Krävd balans i graphics-, text-, marked-content-, kompatibilitets-, array- eller ordlistescope misslyckades |
pcnsUnsupportedFilter | Dokumentnormaliseringen stötte på ett innehållsströmfilter som den inte kan avkoda |
pcnsEncryptedDocument | Dokumentnormaliseringen vägrade krypterad indata |
pcnsSignedDocument | Dokumentnormaliseringen vägrade signerad indata utan behörighet |
pcnsDocumentRewriteFailed | Den omslutande PDF-objektgrafsomskrivningen eller verifieringen misslyckades |
pcnsResourceBudgetExceeded | Deadline för den processövergripande TPdfParserResourceBudget nåddes innan normaliseringen hann slutföras |
| Field | Description |
RemoveComments | Utelämnar PDF-kommentarer samtidigt som nödvändiga tokenavgränsare behålls |
RequireBalancedState | Kräver balanserade q/Q-, BT/ET-, marked-content-, kompatibilitets-, array- och ordlistescopes |
CompressOutput | Tillåter att dokumentomslag Flate-komprimerar en normaliserad sidström när komprimeringen minskar dess storlek |
SkipUnsafePages | Tillåter att dokumentnormaliseringen bevarar en sida oförändrad efter ett osäkert eller stödlöst resultat i stället för att avbryta dokumentomskrivningen |
AllowSignedDocument | Tillåter uttryckligen fullständig omskrivning av signerad indata, vilket ogiltigförklarar befintliga signaturbyteintervall |
MaxInputBytesPerPage | Maximalt totalt antal bytes över de angivna innehållsströmmarna för en sida |
MaxOutputBytesPerPage | Maximalt antal bytes som tillåts i den normaliserade innehållssekvensen |
MaxTokensPerPage | Maximalt antal tokens som inspekteras för en sida |
| Field | Description |
Status | Aktuell TPdfContentNormalizeStatus |
SourceByteCount | Totalt antal källinnehållsbytes |
OutputByteCount | Totalt antal normaliserade eller omskrivna utdatabytes |
PageCount | Sidor som inspekterats av dokumentnormaliseringen |
NormalizedPageCount | Sidor som framgångsrikt ersatts med normaliserat innehåll |
SkippedPageCount | Osäkra sidor som bevarats oförändrade enligt skip-policyen |
InputStreamCount | Källinnehållsströmmar som fogats samman till logiska sidsekvenser |
OutputStreamCount | Normaliserade innehållsströmmar som producerats |
CoalescedArrayCount | Flervalssidor med /Contents-arrayer som ersatts av en enda normaliserad ström |
TokenCount | Tokens som bearbetats |
CommentCount | Kommentarer som påträffats, oavsett om de behållits eller tagits bort |
InlineImageCount | Kompletta inline-bildblock som bevarats |
UnknownOperatorCount | Okända operatorer som bevarats ordagrant |
ErrorMessage | Diagnostisk text för det första felet |