From c86a73a6e1da7dd28076054936458b850eda2947 Mon Sep 17 00:00:00 2001 From: Matthias Andreas Benkard Date: Sun, 26 Jul 2026 08:02:10 +0200 Subject: Berlin column spike: stream order already reads correctly MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit The plan assumed the two-column Berlin gazette would need x-coordinate column detection. It does not: the content stream already emits the left column fully before the right one, so commands come out in reading order. The test pins that finding. What does go wrong there is different, and two parts of it are fixed: * The article's amendment formula carries its own target ("§ 2 Satz 1 des Gesetzes zur Errichtung … wird wie folgt geändert"), but the following items never inherited it. The pattern's leading \b could never match before "§" — a non-word character needs a word character in front of it — so the paragraph branch was dead code and only the Bavarian "Art." branch ever fired. * The running page header is not a line of its own; it sits inside the body text of the following column, so it has to be cut out rather than dropped as a column title. Two blockers remain and are recorded rather than papered over: Article 1 amends an *Anlage* with its own numbering, which the model does not carry (the same gap that shelved Baden-Württemberg), and full-width frames (title block, imprint) sit elsewhere in the stream than on the page, which would need a real XY-cut. Stems are unobtainable either way — gesetze.berlin.de is an authenticated juris app like the Schleswig- Holstein portal. 229 tests green; all pinned figures unchanged. Co-Authored-By: Claude Opus 5 Change-Id: I4619dbe96a023d61104d7107a9a34533123d1bc5 --- .../aenderung/parse/AenderungsgesetzParser.java | 11 +++++++---- .../aendggner/aenderung/parse/TextBereiniger.java | 10 ++++++++++ .../sampledata/Landesrecht-Beispiele.adoc | 23 ++++++++++++++++++++-- 3 files changed, 38 insertions(+), 6 deletions(-) (limited to 'src/main') diff --git a/src/main/java/eu/mulk/aendggner/aenderung/parse/AenderungsgesetzParser.java b/src/main/java/eu/mulk/aendggner/aenderung/parse/AenderungsgesetzParser.java index 976cd5e..407a4cb 100644 --- a/src/main/java/eu/mulk/aendggner/aenderung/parse/AenderungsgesetzParser.java +++ b/src/main/java/eu/mulk/aendggner/aenderung/parse/AenderungsgesetzParser.java @@ -102,12 +102,15 @@ public final class AenderungsgesetzParser { } // Eingebettetes Rahmenziel in der Änderungsformel selbst: „Art. 7 Abs. 2 des Bayerischen - // Umweltinformationsgesetzes … wird wie folgt geändert:“. Der Lookbehind auf „durch “ schließt - // die Zitierkette der Änderungshistorie aus („das zuletzt durch § 5 des Gesetzes vom … geändert - // worden ist“) — dort ist die Norm nie das Subjekt der Formel. + // Umweltinformationsgesetzes … wird wie folgt geändert:“, „§ 2 Satz 1 des Gesetzes zur + // Errichtung … wird wie folgt geändert:“. Der Lookbehind auf „durch “ schließt die Zitierkette + // der Änderungshistorie aus („das zuletzt durch § 5 des Gesetzes vom … geändert worden ist“) — + // dort ist die Norm nie das Subjekt der Formel. Die vordere Grenze darf nicht \b sein: „§“ ist + // selbst kein Wortzeichen, ein \b davor verlangte also ein vorangehendes Wortzeichen und machte + // den §-Zweig unerreichbar. private static final Pattern EINGEBETTETES_ZIEL = Pattern.compile( - "(?