reads an in, generates an out of pdf pages
466
Many PDFs tile artwork into multiple image objects (quarters/strips) for rendering/compression.
pdfimages extracts those objects exactly as stored, so you may see chopped segments.
This watcher supports:
/volume1/docker/pdf mounted to /work)/work/in — drop PDFs here/work/out — outputs go here (one subfolder per PDF)/work/archive — processed PDFs are moved here/work/failed — PDFs that error or produce no outputs/work/out/<pdf-stem>/
pages/ — full rendered pages (MODE=pages or MODE=both)images/ — organized extracted assets (MODE=images or MODE=both)
p###/ — “good” assets grouped by page, renamed with metadata_blank/ — mostly-white/empty images (backgrounds)_tiny/ — small strips/icons/noise (below thresholds)_masks/ — likely 1-bit masks/stencils_unknown/ — anything that couldn’t be mapped cleanly_list.txt — raw pdfimages -list output for debugging/tweaks.done.json — marker containing pdf hash + settingsMIN_W, MIN_H, MIN_PIXELS — bucket tiny stuff to _tinyBLANK_MAX_NONWHITE_PCT — bucket blank-ish to _blank (default 0.5%)images/p001, images/p002, etc.docker build -t polyhydra/poppler-watcher:1.2 .
docker stack deploy -c stack.yml pdf
Content type
Image
Digest
sha256:cdc08a845…
Size
66.8 MB
Last updated
7 months ago
docker pull lancer1977/pdfparser