This commit is contained in:
2026-07-26 18:11:57 +02:00
parent d408e01ab5
commit 21a3b34471
139 changed files with 32872 additions and 0 deletions
@@ -0,0 +1,31 @@
# S01 Alle Hefte extrahieren
Lies `prompts/suggestions/00-MASTER.md`. Nur Extraktion noch keine Varianten erfinden.
## Auftrag
1. Parse **jede** `.docx` in `1. Ausbildungsjahr/` und `2. Ausbildungsjahr/`.
2. Ziehe Rohtext aus `word/document.xml`.
3. Speichere Rohdump + strukturierte Phrasen:
- `web/scripts/extracted-all.txt` (Roh)
- `web/scripts/raw-phrases.json` mit Feldern:
- `sourceFile`
- `activities[]`
- `weekThemes[]`
- `schoolTopics[]`
- `frameworkRefs[]` (nur zum Filtern, nicht als Suggestion)
## Parsing-Hinweise
Abschnitte typischerweise:
- Tätigkeiten vor „Betriebliche Tätigkeiten“ / Rahmenplan
- „Thema der Woche …“
- „Berufsschule …“
Alles was Header/Footer/Unterschrift ist → ignorieren.
## Abnahme
- [ ] Anzahl Quelldateien = Anzahl geparster Hefte (ca. 78)
- [ ] Pro Heft mindestens ein paar Activities (außer reine Urlaubswochen)
- [ ] JSON ist valide und nachvollziehbar