963 B
963 B
S01 – Alle Hefte extrahieren
Lies prompts/suggestions/00-MASTER.md. Nur Extraktion – noch keine Varianten erfinden.
Auftrag
- Parse jede
.docxin1. Ausbildungsjahr/und2. Ausbildungsjahr/. - Ziehe Rohtext aus
word/document.xml. - Speichere Rohdump + strukturierte Phrasen:
web/scripts/extracted-all.txt(Roh)web/scripts/raw-phrases.jsonmit Feldern:sourceFileactivities[]weekThemes[]schoolTopics[]frameworkRefs[](nur zum Filtern, nicht als Suggestion)
Parsing-Hinweise
Abschnitte typischerweise:
- Tätigkeiten vor „Betriebliche Tätigkeiten“ / Rahmenplan
- „Thema der Woche …“
- „Berufsschule …“
Alles was Header/Footer/Unterschrift ist → ignorieren.
Abnahme
- Anzahl Quelldateien = Anzahl geparster Hefte (ca. 78)
- Pro Heft mindestens ein paar Activities (außer reine Urlaubswochen)
- JSON ist valide und nachvollziehbar