diff options
| author | Matthias Andreas Benkard <code@mail.matthias.benkard.de> | 2026-07-13 07:08:31 +0200 |
|---|---|---|
| committer | Matthias Andreas Benkard <code@mail.matthias.benkard.de> | 2026-07-13 07:08:31 +0200 |
| commit | 1b9bfb1bfed11593e08cde8bb072dbfb5980b740 (patch) | |
| tree | 984c268931d2d5567551a4cb1a50f9c735a2a3f1 /src/main | |
| parent | 545aeb6e25386121b414e6aa0cae0a96758cf3c8 (diff) | |
Modernize build: Java 21, Tika 3, PDFBox 3, JUnit 5.
Bump all dependencies and plugins to current versions. Replace the
tika-parsers bundle with a direct PDFBox dependency (we need
PDFTextStripper control), add java-diff-utils for the synopsis diff,
and add JUnit 5 with AssertJ for testing. Drop unused dependencies
(tess4j, Lanterna, term4j, sqlite-jdbc, imageio codecs, annotation
libraries) in favour of jspecify. Regenerate the Maven wrapper with
the official plugin (Takari is dead) and remove the vestigial Ant
wrapper and Tika configuration.
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
Change-Id: I0e1813b3967027cbb0bb978591d345ce138fa0a0
Diffstat (limited to 'src/main')
| -rw-r--r-- | src/main/resources/eu/mulk/aendggner/tika-config.xml | 32 |
1 files changed, 0 insertions, 32 deletions
diff --git a/src/main/resources/eu/mulk/aendggner/tika-config.xml b/src/main/resources/eu/mulk/aendggner/tika-config.xml deleted file mode 100644 index 7c7983c..0000000 --- a/src/main/resources/eu/mulk/aendggner/tika-config.xml +++ /dev/null @@ -1,32 +0,0 @@ -<?xml version="1.0" encoding="UTF-8" standalone="no"?> -<properties> - <service-loader dynamic="true" loadErrorHandler="IGNORE"/> - - <encodingDetectors> - <encodingDetector class="org.apache.tika.detect.DefaultEncodingDetector"/> - </encodingDetectors> - - <translator class="org.apache.tika.language.translate.DefaultTranslator"/> - - <detectors> - <detector class="org.apache.tika.detect.DefaultDetector"/> - </detectors> - - <parsers> - - <parser class="org.apache.tika.parser.DefaultParser"> - <parser-exclude class="org.apache.tika.parser.pdf.PDFParser"/> - <parser-exclude class="org.apache.tika.parser.ocr.TesseractOCRParser"/> - </parser> - - <parser class="org.apache.tika.parser.pdf.PDFParser"> - <params> - <param name="extractInlineImages" type="bool">true</param> - <param name="ocrStrategy" type="string">auto</param> - </params> - </parser> - - <parser class="org.apache.tika.parser.ocr.TesseractOCRParser"/> - - </parsers> -</properties> |
