diff options
| author | Matthias Andreas Benkard <code@mail.matthias.benkard.de> | 2020-12-06 15:16:22 +0100 |
|---|---|---|
| committer | Matthias Andreas Benkard <code@mail.matthias.benkard.de> | 2020-12-06 19:24:02 +0100 |
| commit | 545aeb6e25386121b414e6aa0cae0a96758cf3c8 (patch) | |
| tree | 6cb998430e9c461c283ff7d692d0b14aad2a541d /src/main/resources | |
| parent | 1d92ac8fbb6c5c3a3be7bf477fef9251dcd3dfe2 (diff) | |
Configure Tika correctly.
With the new configuration, Tika can now extract text from PDFs and
XML documents.
Also configures logging for the application.
Change-Id: I7a89c2b232ed4e220665dd335a5f5a0cc3ef2994
Diffstat (limited to 'src/main/resources')
| -rw-r--r-- | src/main/resources/eu/mulk/aendggner/logging.properties | 17 | ||||
| -rw-r--r-- | src/main/resources/eu/mulk/aendggner/tika-config.xml | 32 |
2 files changed, 49 insertions, 0 deletions
diff --git a/src/main/resources/eu/mulk/aendggner/logging.properties b/src/main/resources/eu/mulk/aendggner/logging.properties new file mode 100644 index 0000000..cdebd0e --- /dev/null +++ b/src/main/resources/eu/mulk/aendggner/logging.properties @@ -0,0 +1,17 @@ +# +# General settings +# +handlers=java.util.logging.ConsoleHandler +java.util.logging.SimpleFormatter.format=%1$tY-%1$tm-%1$td %1$tH:%1$tM:%1$tS %4$-11s %2$-40s %5$s %6$s%n +java.util.logging.ConsoleHandler.level=ALL +.level=INFO +# +# Application +# +eu.mulk.level=ALL +# +# 3rd-party libraries +# +org.apache.level=WARNING +org.apache.tika.config.level=SEVERE +org.apache.pdfbox.pdmodel.graphics.color.PDICCBased.level=SEVERE diff --git a/src/main/resources/eu/mulk/aendggner/tika-config.xml b/src/main/resources/eu/mulk/aendggner/tika-config.xml new file mode 100644 index 0000000..7c7983c --- /dev/null +++ b/src/main/resources/eu/mulk/aendggner/tika-config.xml @@ -0,0 +1,32 @@ +<?xml version="1.0" encoding="UTF-8" standalone="no"?> +<properties> + <service-loader dynamic="true" loadErrorHandler="IGNORE"/> + + <encodingDetectors> + <encodingDetector class="org.apache.tika.detect.DefaultEncodingDetector"/> + </encodingDetectors> + + <translator class="org.apache.tika.language.translate.DefaultTranslator"/> + + <detectors> + <detector class="org.apache.tika.detect.DefaultDetector"/> + </detectors> + + <parsers> + + <parser class="org.apache.tika.parser.DefaultParser"> + <parser-exclude class="org.apache.tika.parser.pdf.PDFParser"/> + <parser-exclude class="org.apache.tika.parser.ocr.TesseractOCRParser"/> + </parser> + + <parser class="org.apache.tika.parser.pdf.PDFParser"> + <params> + <param name="extractInlineImages" type="bool">true</param> + <param name="ocrStrategy" type="string">auto</param> + </params> + </parser> + + <parser class="org.apache.tika.parser.ocr.TesseractOCRParser"/> + + </parsers> +</properties> |
