# S01 – Alle Hefte extrahieren Lies `prompts/suggestions/00-MASTER.md`. Nur Extraktion – noch keine Varianten erfinden. ## Auftrag 1. Parse **jede** `.docx` in `1. Ausbildungsjahr/` und `2. Ausbildungsjahr/`. 2. Ziehe Rohtext aus `word/document.xml`. 3. Speichere Rohdump + strukturierte Phrasen: - `web/scripts/extracted-all.txt` (Roh) - `web/scripts/raw-phrases.json` mit Feldern: - `sourceFile` - `activities[]` - `weekThemes[]` - `schoolTopics[]` - `frameworkRefs[]` (nur zum Filtern, nicht als Suggestion) ## Parsing-Hinweise Abschnitte typischerweise: - Tätigkeiten vor „Betriebliche Tätigkeiten“ / Rahmenplan - „Thema der Woche …“ - „Berufsschule …“ Alles was Header/Footer/Unterschrift ist → ignorieren. ## Abnahme - [ ] Anzahl Quelldateien = Anzahl geparster Hefte (ca. 78) - [ ] Pro Heft mindestens ein paar Activities (außer reine Urlaubswochen) - [ ] JSON ist valide und nachvollziehbar