gute
This commit is contained in:
@@ -0,0 +1,31 @@
|
||||
# S01 – Alle Hefte extrahieren
|
||||
|
||||
Lies `prompts/suggestions/00-MASTER.md`. Nur Extraktion – noch keine Varianten erfinden.
|
||||
|
||||
## Auftrag
|
||||
|
||||
1. Parse **jede** `.docx` in `1. Ausbildungsjahr/` und `2. Ausbildungsjahr/`.
|
||||
2. Ziehe Rohtext aus `word/document.xml`.
|
||||
3. Speichere Rohdump + strukturierte Phrasen:
|
||||
- `web/scripts/extracted-all.txt` (Roh)
|
||||
- `web/scripts/raw-phrases.json` mit Feldern:
|
||||
- `sourceFile`
|
||||
- `activities[]`
|
||||
- `weekThemes[]`
|
||||
- `schoolTopics[]`
|
||||
- `frameworkRefs[]` (nur zum Filtern, nicht als Suggestion)
|
||||
|
||||
## Parsing-Hinweise
|
||||
|
||||
Abschnitte typischerweise:
|
||||
- Tätigkeiten vor „Betriebliche Tätigkeiten“ / Rahmenplan
|
||||
- „Thema der Woche …“
|
||||
- „Berufsschule …“
|
||||
|
||||
Alles was Header/Footer/Unterschrift ist → ignorieren.
|
||||
|
||||
## Abnahme
|
||||
|
||||
- [ ] Anzahl Quelldateien = Anzahl geparster Hefte (ca. 78)
|
||||
- [ ] Pro Heft mindestens ein paar Activities (außer reine Urlaubswochen)
|
||||
- [ ] JSON ist valide und nachvollziehbar
|
||||
Reference in New Issue
Block a user