Qualitätskriterien
draft
Erste Fassung, 2026-07-21. Gekürzt aus docs/regine-eval-protokoll.md
— erstellt für Regine Thiering, Grundlage: ihre fünf Kriterien vom 2026-06-30.
Fünf Kriterien bestimmen, ob Renate gut genug antwortet — vier davon werden automatisch bei jeder neuen Version gemessen, das fünfte per manuellem Test.
| # | Kriterium | Wie gemessen | Stand |
|---|---|---|---|
| 1 | Fehlerquote | Ein zweites Sprachmodell bewertet jede Antwort gegen die Quelle | 19,6 % (Ziel: ≤ 25 %) |
| 2 | Fallback-Rate | Anteil der Fragen, bei denen Renate ausweicht | 0 % (Ziel: ≤ 20 %) |
| 3 | Antwortlatenz | Zeit von Frage bis vollständiger Antwort | P50 ≈ 7 s, P95 ≈ 18 s |
| 4 | Konsistenz | Gleiche Frage, vier Formulierungen — bleibt die Antwort inhaltlich gleich? | Ziel: ≥ 0,85 (Kosinus-Ähnlichkeit) |
| 5 | Kontextverständnis & Fehlerkorrektur | Manuell — vier Gesprächsszenarien | siehe unten |
Die vier manuellen Szenarien (Kriterium 5)
Manche Dinge lassen sich nicht sinnvoll automatisch prüfen — ob Renate sich in einem Gespräch tatsächlich vernünftig verhält, muss ein Mensch beurteilen. Deshalb gibt es vier kurze Testszenarien, die vor jeder neuen Freigabe einmal durchgespielt werden (ca. 20–30 Minuten insgesamt):
- Rückbezug im Gespräch — merkt sich Renate, worüber gerade gesprochen wurde, wenn eine Folgefrage gestellt wird?
- Tippfehler-Robustheit — versteht Renate eine Frage trotz Tippfehlern (z. B. “Brichtheft” statt “Berichtsheft”)?
- Widerspruch durch Nutzerin — bleibt Renate bei einer korrekten Antwort, wenn ihr (fälschlich) widersprochen wird?
- Themenwechsel — vermischt Renate alte und neue Themen, wenn mitten im Gespräch das Thema wechselt?
Jedes Szenario wird mit ✅ (bestanden), ⚠ (teilweise) oder ❌ (nicht bestanden)
bewertet. Die volle Anleitung mit allen Gesprächsschritten steht in
docs/regine-eval-protokoll.md im Code-Repository — hier die Kurzfassung für
alle, die die Ergebnisse einordnen, nicht selbst testen wollen.
Namens-Rechenschaft
Jede Antwort zeigt, auf welchem Lernhappen bzw. Forumsbeitrag sie beruht — sichtbar als Quellenangabe unter der Antwort, nicht nur intern protokolliert.