aboutsummaryrefslogtreecommitdiff
path: root/src
diff options
context:
space:
mode:
authorMatthias Andreas Benkard <code@mail.matthias.benkard.de>2026-07-13 07:08:31 +0200
committerMatthias Andreas Benkard <code@mail.matthias.benkard.de>2026-07-13 07:08:31 +0200
commit1b9bfb1bfed11593e08cde8bb072dbfb5980b740 (patch)
tree984c268931d2d5567551a4cb1a50f9c735a2a3f1 /src
parent545aeb6e25386121b414e6aa0cae0a96758cf3c8 (diff)
Modernize build: Java 21, Tika 3, PDFBox 3, JUnit 5.
Bump all dependencies and plugins to current versions. Replace the tika-parsers bundle with a direct PDFBox dependency (we need PDFTextStripper control), add java-diff-utils for the synopsis diff, and add JUnit 5 with AssertJ for testing. Drop unused dependencies (tess4j, Lanterna, term4j, sqlite-jdbc, imageio codecs, annotation libraries) in favour of jspecify. Regenerate the Maven wrapper with the official plugin (Takari is dead) and remove the vestigial Ant wrapper and Tika configuration. Co-Authored-By: Claude Fable 5 <noreply@anthropic.com> Change-Id: I0e1813b3967027cbb0bb978591d345ce138fa0a0
Diffstat (limited to 'src')
-rw-r--r--src/main/resources/eu/mulk/aendggner/tika-config.xml32
1 files changed, 0 insertions, 32 deletions
diff --git a/src/main/resources/eu/mulk/aendggner/tika-config.xml b/src/main/resources/eu/mulk/aendggner/tika-config.xml
deleted file mode 100644
index 7c7983c..0000000
--- a/src/main/resources/eu/mulk/aendggner/tika-config.xml
+++ /dev/null
@@ -1,32 +0,0 @@
-<?xml version="1.0" encoding="UTF-8" standalone="no"?>
-<properties>
- <service-loader dynamic="true" loadErrorHandler="IGNORE"/>
-
- <encodingDetectors>
- <encodingDetector class="org.apache.tika.detect.DefaultEncodingDetector"/>
- </encodingDetectors>
-
- <translator class="org.apache.tika.language.translate.DefaultTranslator"/>
-
- <detectors>
- <detector class="org.apache.tika.detect.DefaultDetector"/>
- </detectors>
-
- <parsers>
-
- <parser class="org.apache.tika.parser.DefaultParser">
- <parser-exclude class="org.apache.tika.parser.pdf.PDFParser"/>
- <parser-exclude class="org.apache.tika.parser.ocr.TesseractOCRParser"/>
- </parser>
-
- <parser class="org.apache.tika.parser.pdf.PDFParser">
- <params>
- <param name="extractInlineImages" type="bool">true</param>
- <param name="ocrStrategy" type="string">auto</param>
- </params>
- </parser>
-
- <parser class="org.apache.tika.parser.ocr.TesseractOCRParser"/>
-
- </parsers>
-</properties>