LLMOps · Workshop für Betrieb und Plattform

LLMOps-Workshop: LLM-Anwendungen im Betrieb

Die Anwendung läuft. Und jetzt? Niemand weiß, ob die letzte Prompt-Änderung etwas verbessert hat, warum die Antwortzeit gestiegen ist, was der Monat kostet, und ob eine Ausgabe von gestern heute noch so herauskäme. Dieser Workshop baut den Betriebsteil, der aus einem funktionierenden Prototyp ein betreibbares System macht: Tracing, Evals, Leitplanken, Versionierung, Budget, Freigaben.

Über den Workshop

Die Schleife aus Messen, Beobachten und Freigeben

Der Kern von LLMOps ist eine Schleife: Aufgaben messbar machen, Spuren sammeln, Fehler in Regressionsdaten überführen, Änderungen vor dem Rollout prüfen, im Betrieb überwachen. Der Workshop baut diese Schleife Schritt für Schritt an Ihrer Anwendung auf.

Er richtet sich an Plattform-, AI-Engineering- und Betriebsteams, die eine LLM-Anwendung verantworten. Typische Auslöser sind ein anstehender Modellwechsel, eine Kostenüberraschung, ein Vorfall ohne erkennbare Ursache oder die Anforderung, Änderungen künftig belegen zu müssen. Vorausgesetzt werden eine laufende Anwendung, Zugriff auf ihre Umgebung und die Bereitschaft, Messpunkte einzubauen.

Was der Workshop nicht leistet: Er baut keine LLM-Anwendung und kein Retrieval-System, sondern setzt auf dem auf, was bereits läuft. Wer noch baut, beginnt mit der LLM- und RAG-Schulung, dem On-Premise-Lab für den Aufbau des Stacks. Dieser Workshop schließt daran an. Ebenfalls kein Thema sind Feinabstimmung und das Training eigener Modelle, beides ist eine eigene Disziplin mit anderen Voraussetzungen.

Schulungsziel

Was Ihr Team danach kann

  • Änderungen bewerten statt vermuten. Aufgabenspezifische Eval-Datensätze und Bewerter, mit denen sich Prompt-, Modell- und Retrieval-Änderungen vergleichen lassen.
  • Sehen, was passiert. Spuren mit Prompt, Retrieval, Werkzeugaufrufen, Tokenzahl, Latenz und Kosten. Ein Fehlerbericht ohne Spur ist nicht untersuchbar.
  • Fehler einsammeln. Auffälligkeiten aus dem Betrieb landen automatisch in Regressionsdatensätzen, statt in Chatverläufen zu versickern.
  • Leitplanken setzen. Ein- und Ausgabefilter, Umgang mit indirekten Prompt-Injektionen, Sperrlisten und Rückfallverhalten. Kandidatentext ist immer Datum, nie Anweisung.
  • Versionieren. Prompt, Modellstand, Rubrik, Eval-Datensatz und Retrieval-Konfiguration gehören zusammen versioniert. Sonst ist ein Ergebnis von letzter Woche nicht mehr erklärbar.
  • Kosten und Latenz budgetieren. Verbrauch je Anwendungsfall messen, Budgetgrenzen setzen, teure Pfade erkennen, bevor die Rechnung sie zeigt.
Inhalt

Was wir gemeinsam durchgehen

  • Betriebsbild aufnehmen. Was läuft, wer ruft es auf, was passiert bei Ausfall des Anbieters oder des lokalen Servers.
  • Tracing einrichten. Spuren über die ganze Kette, von der Anfrage bis zur Antwort, mit den Feldern, die man später wirklich braucht.
  • Evals bauen. Kleine, harte Datensätze statt großer weicher. Bewerter mit Rubrik, stabilem Ausgabeformat und dokumentierter Version.
  • Freigabe-Gates definieren. Welche Kennzahl darf nicht fallen, welcher kritische Fehler blockiert, wer entscheidet im Zweifel.
  • Rollout und Rückfall. Stufenweise Ausrollung, Beobachtungsfenster, Rückfall auf den letzten funktionierenden Stand. Eine Modelländerung ist ein Deployment.
  • Datenschutz im Betrieb. Spuren und Protokolle dürfen kein neuer Sammelort für personenbezogene Daten werden. Minimierung, Schwärzung, Aufbewahrungsfristen.
Formate & Termine

Drei Zuschnitte

Betriebs-Check
Umfang & Format1 Tag, online oder Präsenz
ZielgruppeTeams mit laufender Anwendung, Standortbestimmung
Preisauf Anfrage
Nächste Terminenach Absprache
Das nehmen Sie mitLückenliste über Tracing, Evals, Leitplanken, Versionierung und Kosten, priorisiert nach Risiko
Begleitung im Betrieb
Umfang & Formatfortlaufend
ZielgruppeTeams nach dem Workshop
Preisauf Anfrage
Nächste Terminenach Absprache
Das nehmen Sie mitReview der Eval-Ergebnisse, Nachschärfen der Gates, Unterstützung bei Vorfällen und Modellwechseln

Alle Formate: Deutsch & Englisch.

Alle Preise verstehen sich netto zzgl. gesetzlicher Umsatzsteuer. Das Angebot richtet sich ausschließlich an Unternehmer im Sinne des § 14 BGB.

Ihr Dozent und Berater

Betrieb, nicht nur Demo

Dr.-Ing. Grigory Devadze. Ich betreue LLM-Systeme, die produktiv laufen, und schule denselben Stoff.

  • Produktive Systeme. Ein agentisches KI- und RAG-System für maritime E-Mail-Intelligence im Produktivbetrieb, eine souveräne LLM-Plattform auf dedizierter GPU-Infrastruktur für ein Software-Unternehmen.
  • Messen als eigener Arbeitsschwerpunkt. Rubriken, Bias-Kontrollen und menschliche Kalibrierung für Bewertermodelle sind eigener Schulungsinhalt, nicht ein zugekauftes Kapitel.
  • Herstellerneutral. Werkzeuge werden nach Ihrem Stack ausgewählt, lokal betriebene und angebotene Dienste gleichermaßen.

Schulungen & Projekte u. a. für Siemens AG und SRH Hochschule Berlin.

→ Profil und Referenzen ansehen
Dr.-Ing. Grigory Devadze
FAQ

Häufige Fragen

Wir nutzen einen Cloud-Anbieter, kein lokales Modell. Passt das?

Ja. Die Betriebsfragen sind dieselben, nur die Werkzeuge unterscheiden sich. Bei lokalen Modellen kommen Hardware- und Auslastungsfragen hinzu, bei Anbietern Kontingente und Modellwechsel ohne Vorwarnung.

Reicht ein Bewertermodell als Qualitätssicherung?

Nein, und der Workshop zeigt genau warum. Bewertermodelle haben belegte Verzerrungen: Position, Länge, Stil, Selbstbevorzugung. Sie taugen für Triage, Regressionstests und Vergleiche, nicht als alleinige Instanz bei folgenreichen Entscheidungen. Wie sich diese Verzerrungen kontrollieren lassen, zeigt der vertiefende Artikel LLM-as-a-Judge für RAG: Rubrik, Bias-Kontrollen und Kalibrierung.

Wie viele Beispiele braucht ein brauchbarer Eval-Satz?

Für einen belastbaren Einstieg genügen einige Dutzend menschlich bewertete Fälle, für eine produktive Messgrundlage sind es einige hundert. Wichtiger als die Zahl ist, dass die schwierigen Fälle enthalten sind.

Was, wenn wir noch gar nichts messen?

Das ist der Normalfall und der beste Zeitpunkt. Der erste Schritt ist Tracing, danach fällt der Eval-Satz aus echten Spuren fast von allein an.

Können wir am Übungsstack arbeiten statt am Produktivsystem?

Ja. Für Teams ohne Freigabe steht eine vollständig lokale Übungsumgebung bereit.

Anfrage

Die Anwendung läuft, aber niemand kann sie belegen?

Kurzes Vorgespräch zu Stack, Betriebsmodell und Zielbild, danach ein konkretes Angebot mit Workshop-Agenda.

oderE-Mail schreiben