AuCo · Renate — Jour Fixe

Juni-Sprint

Ein Rückblick vom 8. Juni bis zum 1. Juli — vom stabilen Produktivbetrieb über zwei verworfene Ideen bis zu Regines neuen Qualitätskriterien.

23 days. 202 commits.
07.07.2026 · 01 / 15
Am Teich

renate.chat läuft stabil — jetzt auf Docker

  • Docker-Umstieg abgeschlossen — weniger Betriebsrisiko bei Neustarts und Updates, aktuelle Version v2026.06.8
  • 274 Lernhappen aus 50 AP4-Dateien im Teich, Nacht-Cron liest automatisch weiter nach
  • Neue Landing-Page live: Teich-Morgen/Teich-Abend-Hero, Feature-Überblick „Am Teich, im Schuppen, beim Picknick"
Feature-Strip der neuen Landing-Page: Am Teich, im Schuppen, beim Picknick
docs/screenshots/v0.1.7/landing/features.png
02 / 15
Im Schuppen — Retrieval-Experimente

Zwei naheliegende Ideen, klar verworfen

Beide wurden sauber gemessen, nicht nur ausprobiert — deshalb bleiben sie mit gutem Gewissen aus.

Grundlage dafür: Eval-Gate + Versionsschema, aufgesetzt 09.06. direkt nach dem letzten Bericht (eq4p/vs3m) — Fragenkatalog, Deploy-Gate, v0.1.x/v2026.06.x-Tags

Reranker (zweite Sortierstufe) — Top-1-Trefferquote
ohne Reranker83,3 %
mit Reranker70,8 %
bleibt deaktiviert
LDA-Themen-Vorfilter — Top-1-Trefferquote
ohne LDA-Vorfilter83,3 %
mit LDA-Vorfilter50,0 %
bleibt deaktiviert

Nebenbei: das Embedding-Modell wurde auf Qwen3-Embedding-4B umgestellt (das ursprünglich geplante Modell war bei ScaDS nicht verfügbar) — kompletter Neu-Einbettungslauf.

03 / 15
Beim Picknick — Ingest-Pipeline

Mehr Quellen, mehr Automatik, eine Lücke geschlossen

  • Liest jetzt neben DOCX-Ordnern auch ZIP-Archive, Nextcloud-Freigaben und ganze Discourse-Kategorien
  • Nach jedem Einlesen: automatischer Picknick-Bericht im Forum; wöchentlich zusätzlich ein Expert-Digest („was wurde gefragt")
  • Sicherheitslücke geschlossen: /picnic konnte vorher von jeder angemeldeten Person auf beliebige URLs gerichtet werden — jetzt mit Freigabeliste und Rollenprüfung abgesichert
Qualitäts-Gate vor jedem Deploy
83,3 %

MRR@5 — Trefferqualität der Suche im aktuellen Gate-Lauf, gleichauf mit der Top-1-Trefferquote. Keine falschen Ausweicher im letzten Lauf.

04 / 15
Neues im Chat

Quellenangaben direkt unter der Antwort

  • Antworten werden jetzt in Markdown formatiert (Listen, Hervorhebungen)
  • Jede Antwort zeigt Quellen-Chips — welcher Lernhappen oder welches Forumsthema die Antwort stützt
  • Mehrfachtreffer aus DOCX und Forum werden automatisch zusammengeführt statt doppelt angezeigt
  • mit main zusammengeführt — als Nächstes: taggen und auf renate.chat deployen
Chat-Antwort mit Quellenangabe-Chips unter dem Text
docs/screenshots/v2026.06.2/answer-chips.png · Branch attribution-test-scads
05 / 15
Im Hintergrund — Betrieb

Aufgeräumt, bevor es kompliziert wird

06 / 15
Regines fünf Qualitätskriterien — übergeben 30.06.

Vier automatisiert, eines bewusst manuell

automatisiert

1 · Fehlerquote

19,6 %

Zweites, unabhängiges Sprachmodell bewertet jede Antwort gegen die Quelle. Alarmgrenze: 25 %.

Brücke: Fehlerquote ↔ error_rate
automatisiert

2 · Fallback-Rate

0 %

Anteil ausweichender Antworten im letzten Gate-Lauf.

Brücke: Trübung ↔ fallback_rate
automatisiert

3 · Antwortlatenz

7s / 18s

P50 / P95 — Median und langsamer Ausreißer, ScaDS-Backend.

Wie lange braucht ein Lernhappen zum Auftauchen?
automatisiert

4 · Konsistenz

24 × 4

Fragen × Umformulierungen in 6 Themengruppen — gleiche Frage, andere Worte, gleiche Antwort?

Immer derselbe Teichgrund, egal von wo man reinschaut
bewusst manuell

5 · Kontextverständnis & Fehlerkorrektur

4 Szenarien

~20–30 Min., vor jeder Freigabe für Erprobungspartnerinnen. Mit Regine abgestimmtes Protokoll.

Was kein Instrument von der Brücke aus sehen kann
07 / 15
Kriterium 1, im Detail
Fehlerquote ↔ error_rate

Wie die Fehlerquote gemessen wird

19,6 % → ≤ 25 %

Basislinie vs. Alarmgrenze. Ein Anstieg über 25 % blockiert künftig den Deploy.

eval_runs.error_rate, drain.duckdb
08 / 15
Kriterium 2, im Detail
Trübung ↔ fallback_rate

Wie oft war das Wasser trüb?

0 % · Ziel ≤ 20 %

Kein falscher Ausweicher im letzten Gate-Lauf (24 bewertete Fragen).

DrainStore.capture() → eval_runs.fallback_rate
09 / 15
Kriterium 3, im Detail
Antwortlatenz

Wie lange braucht ein Lernhappen zum Auftauchen?

7 s / 18 s

P50 / P95 im letzten Gate-Lauf (v2026.06.8, ScaDS-Backend).

EvalEngine per-question timing → drain.duckdb
10 / 15
Kriterium 4, im Detail
Konsistenz

Immer derselbe Teichgrund, egal von wo man reinschaut

Ziel ≥ 0,85

Neu gebaut in der Nacht-Session 30.06.→01.07., noch kein Baseline-Lauf gefahren.

consistency_runs (drain.duckdb)
11 / 15
Kriterium 5, im Detail
Kontextverständnis & Fehlerkorrektur

Was kein Instrument von der Brücke aus sehen kann

4 Szenarien

~20–30 Min., vor jeder Freigabe für Erprobungspartnerinnen. ✅/⚠/❌ pro Szenario.

docs/regine-eval-protokoll.md
12 / 15
Laufend

Worauf wir warten

wartet
auco-staging TLS — Freischaltung tcp/80+443 beim ZIH (Hauffe/Jungstand) läuft; löst sich automatisch nach Freigabe
wartet
auco-eval-VM — neu beantragt für interne Demo Anfang August; TLS diesmal über Cloudflare-DNS, keine Portfreischaltung nötig
vorbereitet
DNS-Delegation chat.ausbilderinnen-community.de → Cloudflare — Antrag an Herrn Mahlberg ist vorbereitet, aber noch nicht abgeschickt; erst prüfen, ob wir sie überhaupt brauchen
13 / 15
Nächste Schritte

Was als Nächstes ansteht

  1. Neues Design + Quellenangaben ist bereits mit main zusammengeführt — jetzt taggen und auf renate.chat live schalten

  2. auco-eval-VM aufsetzen, sobald die IP zugeteilt ist — Demo Anfang August vorbereiten

  3. Regines Fünf-Kriterien-Protokoll (inkl. der vier manuellen Szenarien) einmal komplett durchlaufen, bevor die nächste Version an Erprobungspartnerinnen geht

14 / 15
Referenzen & weiteres Material

Zum Nachlesen

Vokabular-Artefakt Concept Map: Fallback

Trübung ↔ low_confidence — Renates und Regines Vokabular für dasselbe Konzept, an der Brücke gespiegelt.

Vokabular-Artefakt Observatory

Klarheit, Schwelle, Messung — die volle Begriffskarte der drei Ufer (Renate / Brücke / Regine).

Protokoll docs/regine-eval-protokoll.md

Alle fünf Kriterien im Detail, inkl. der vier manuellen Gesprächsszenarien K1–K4.

Referenz docs/eval-guide.md

Spaltenreferenz für Eval-Ausgaben — was Klarheit, Trübung und Fehlerquote bedeuten.

Vokabular docs/GLOSSARY.md · docs/METAPHORS.md

Alle Brücken-Begriffe und die drei Zonen (Garten, Brücke, Observatorium) im Überblick.

Bericht docs/comms/2026-07-07_JF-AuCo-Renate.txt

Dieser Vortrag als Fließtext, zum Nachlesen oder Weiterleiten.

15 / 15