aboutsummaryrefslogtreecommitdiff
path: root/src/main/resources
diff options
context:
space:
mode:
authorMatthias Andreas Benkard <code@mail.matthias.benkard.de>2020-12-06 15:16:22 +0100
committerMatthias Andreas Benkard <code@mail.matthias.benkard.de>2020-12-06 19:24:02 +0100
commit545aeb6e25386121b414e6aa0cae0a96758cf3c8 (patch)
tree6cb998430e9c461c283ff7d692d0b14aad2a541d /src/main/resources
parent1d92ac8fbb6c5c3a3be7bf477fef9251dcd3dfe2 (diff)
Configure Tika correctly.
With the new configuration, Tika can now extract text from PDFs and XML documents. Also configures logging for the application. Change-Id: I7a89c2b232ed4e220665dd335a5f5a0cc3ef2994
Diffstat (limited to 'src/main/resources')
-rw-r--r--src/main/resources/eu/mulk/aendggner/logging.properties17
-rw-r--r--src/main/resources/eu/mulk/aendggner/tika-config.xml32
2 files changed, 49 insertions, 0 deletions
diff --git a/src/main/resources/eu/mulk/aendggner/logging.properties b/src/main/resources/eu/mulk/aendggner/logging.properties
new file mode 100644
index 0000000..cdebd0e
--- /dev/null
+++ b/src/main/resources/eu/mulk/aendggner/logging.properties
@@ -0,0 +1,17 @@
+#
+# General settings
+#
+handlers=java.util.logging.ConsoleHandler
+java.util.logging.SimpleFormatter.format=%1$tY-%1$tm-%1$td %1$tH:%1$tM:%1$tS %4$-11s %2$-40s %5$s %6$s%n
+java.util.logging.ConsoleHandler.level=ALL
+.level=INFO
+#
+# Application
+#
+eu.mulk.level=ALL
+#
+# 3rd-party libraries
+#
+org.apache.level=WARNING
+org.apache.tika.config.level=SEVERE
+org.apache.pdfbox.pdmodel.graphics.color.PDICCBased.level=SEVERE
diff --git a/src/main/resources/eu/mulk/aendggner/tika-config.xml b/src/main/resources/eu/mulk/aendggner/tika-config.xml
new file mode 100644
index 0000000..7c7983c
--- /dev/null
+++ b/src/main/resources/eu/mulk/aendggner/tika-config.xml
@@ -0,0 +1,32 @@
+<?xml version="1.0" encoding="UTF-8" standalone="no"?>
+<properties>
+ <service-loader dynamic="true" loadErrorHandler="IGNORE"/>
+
+ <encodingDetectors>
+ <encodingDetector class="org.apache.tika.detect.DefaultEncodingDetector"/>
+ </encodingDetectors>
+
+ <translator class="org.apache.tika.language.translate.DefaultTranslator"/>
+
+ <detectors>
+ <detector class="org.apache.tika.detect.DefaultDetector"/>
+ </detectors>
+
+ <parsers>
+
+ <parser class="org.apache.tika.parser.DefaultParser">
+ <parser-exclude class="org.apache.tika.parser.pdf.PDFParser"/>
+ <parser-exclude class="org.apache.tika.parser.ocr.TesseractOCRParser"/>
+ </parser>
+
+ <parser class="org.apache.tika.parser.pdf.PDFParser">
+ <params>
+ <param name="extractInlineImages" type="bool">true</param>
+ <param name="ocrStrategy" type="string">auto</param>
+ </params>
+ </parser>
+
+ <parser class="org.apache.tika.parser.ocr.TesseractOCRParser"/>
+
+ </parsers>
+</properties>