Ein Rückblick vom 8. Juni bis zum 1. Juli — vom stabilen Produktivbetrieb über zwei verworfene Ideen bis zu Regines neuen Qualitätskriterien.
Beide wurden sauber gemessen, nicht nur ausprobiert — deshalb bleiben sie mit gutem Gewissen aus.
Grundlage dafür: Eval-Gate + Versionsschema, aufgesetzt 09.06. direkt nach dem letzten Bericht (eq4p/vs3m) — Fragenkatalog, Deploy-Gate, v0.1.x/v2026.06.x-Tags
Nebenbei: das Embedding-Modell wurde auf Qwen3-Embedding-4B umgestellt (das ursprünglich geplante Modell war bei ScaDS nicht verfügbar) — kompletter Neu-Einbettungslauf.
MRR@5 — Trefferqualität der Suche im aktuellen Gate-Lauf, gleichauf mit der Top-1-Trefferquote. Keine falschen Ausweicher im letzten Lauf.
Zweites, unabhängiges Sprachmodell bewertet jede Antwort gegen die Quelle. Alarmgrenze: 25 %.
Brücke: Fehlerquote ↔ error_rateAnteil ausweichender Antworten im letzten Gate-Lauf.
Brücke: Trübung ↔ fallback_rateP50 / P95 — Median und langsamer Ausreißer, ScaDS-Backend.
Wie lange braucht ein Lernhappen zum Auftauchen?Fragen × Umformulierungen in 6 Themengruppen — gleiche Frage, andere Worte, gleiche Antwort?
Immer derselbe Teichgrund, egal von wo man reinschaut~20–30 Min., vor jeder Freigabe für Erprobungspartnerinnen. Mit Regine abgestimmtes Protokoll.
Was kein Instrument von der Brücke aus sehen kanneval.py --judge, dokumentiert in docs/eval-guide.mdBasislinie vs. Alarmgrenze. Ein Anstieg über 25 % blockiert künftig den Deploy.
eval_runs.error_rate, drain.duckdbKein falscher Ausweicher im letzten Gate-Lauf (24 bewertete Fragen).
DrainStore.capture() → eval_runs.fallback_rateP50 / P95 im letzten Gate-Lauf (v2026.06.8, ScaDS-Backend).
EvalEngine per-question timing → drain.duckdbeval/consistency.py --tag <Version>, Fragenkatalog in eval/consistency_questions.yamlNeu gebaut in der Nacht-Session 30.06.→01.07., noch kein Baseline-Lauf gefahren.
consistency_runs (drain.duckdb)~20–30 Min., vor jeder Freigabe für Erprobungspartnerinnen. ✅/⚠/❌ pro Szenario.
docs/regine-eval-protokoll.mdNeues Design + Quellenangaben ist bereits mit main zusammengeführt — jetzt taggen und auf renate.chat live schalten
auco-eval-VM aufsetzen, sobald die IP zugeteilt ist — Demo Anfang August vorbereiten
Regines Fünf-Kriterien-Protokoll (inkl. der vier manuellen Szenarien) einmal komplett durchlaufen, bevor die nächste Version an Erprobungspartnerinnen geht
Trübung ↔ low_confidence — Renates und Regines Vokabular für dasselbe Konzept, an der Brücke gespiegelt.
Klarheit, Schwelle, Messung — die volle Begriffskarte der drei Ufer (Renate / Brücke / Regine).
docs/regine-eval-protokoll.md
Alle fünf Kriterien im Detail, inkl. der vier manuellen Gesprächsszenarien K1–K4.
docs/eval-guide.md
Spaltenreferenz für Eval-Ausgaben — was Klarheit, Trübung und Fehlerquote bedeuten.
docs/GLOSSARY.md · docs/METAPHORS.md
Alle Brücken-Begriffe und die drei Zonen (Garten, Brücke, Observatorium) im Überblick.
docs/comms/2026-07-07_JF-AuCo-Renate.txt
Dieser Vortrag als Fließtext, zum Nachlesen oder Weiterleiten.