Die Anwendung läuft. Und jetzt? Niemand weiß, ob die letzte Prompt-Änderung etwas verbessert hat, warum die Antwortzeit gestiegen ist, was der Monat kostet, und ob eine Ausgabe von gestern heute noch so herauskäme. Dieser Workshop baut den Betriebsteil, der aus einem funktionierenden Prototyp ein betreibbares System macht: Tracing, Evals, Leitplanken, Versionierung, Budget, Freigaben.
Der Kern von LLMOps ist eine Schleife: Aufgaben messbar machen, Spuren sammeln, Fehler in Regressionsdaten überführen, Änderungen vor dem Rollout prüfen, im Betrieb überwachen. Der Workshop baut diese Schleife Schritt für Schritt an Ihrer Anwendung auf.
Er richtet sich an Plattform-, AI-Engineering- und Betriebsteams, die eine LLM-Anwendung verantworten. Typische Auslöser sind ein anstehender Modellwechsel, eine Kostenüberraschung, ein Vorfall ohne erkennbare Ursache oder die Anforderung, Änderungen künftig belegen zu müssen. Vorausgesetzt werden eine laufende Anwendung, Zugriff auf ihre Umgebung und die Bereitschaft, Messpunkte einzubauen.
Was der Workshop nicht leistet: Er baut keine LLM-Anwendung und kein Retrieval-System, sondern setzt auf dem auf, was bereits läuft. Wer noch baut, beginnt mit der LLM- und RAG-Schulung, dem On-Premise-Lab für den Aufbau des Stacks. Dieser Workshop schließt daran an. Ebenfalls kein Thema sind Feinabstimmung und das Training eigener Modelle, beides ist eine eigene Disziplin mit anderen Voraussetzungen.
Alle Formate: Deutsch & Englisch.
Alle Preise verstehen sich netto zzgl. gesetzlicher Umsatzsteuer. Das Angebot richtet sich ausschließlich an Unternehmer im Sinne des § 14 BGB.
Dr.-Ing. Grigory Devadze. Ich betreue LLM-Systeme, die produktiv laufen, und schule denselben Stoff.
Schulungen & Projekte u. a. für Siemens AG und SRH Hochschule Berlin.
→ Profil und Referenzen ansehen
Ja. Die Betriebsfragen sind dieselben, nur die Werkzeuge unterscheiden sich. Bei lokalen Modellen kommen Hardware- und Auslastungsfragen hinzu, bei Anbietern Kontingente und Modellwechsel ohne Vorwarnung.
Nein, und der Workshop zeigt genau warum. Bewertermodelle haben belegte Verzerrungen: Position, Länge, Stil, Selbstbevorzugung. Sie taugen für Triage, Regressionstests und Vergleiche, nicht als alleinige Instanz bei folgenreichen Entscheidungen. Wie sich diese Verzerrungen kontrollieren lassen, zeigt der vertiefende Artikel LLM-as-a-Judge für RAG: Rubrik, Bias-Kontrollen und Kalibrierung.
Für einen belastbaren Einstieg genügen einige Dutzend menschlich bewertete Fälle, für eine produktive Messgrundlage sind es einige hundert. Wichtiger als die Zahl ist, dass die schwierigen Fälle enthalten sind.
Das ist der Normalfall und der beste Zeitpunkt. Der erste Schritt ist Tracing, danach fällt der Eval-Satz aus echten Spuren fast von allein an.
Ja. Für Teams ohne Freigabe steht eine vollständig lokale Übungsumgebung bereit.
Sie bauen den Stack erst noch auf? LLM- und RAG-Schulung: das On-Premise-Lab für Softwareteams · Klassische Modelle und LLM-Anwendungen teilen die Freigabe- und Überwachungslogik: MLOps-Schulung: vom Notebook zum kontrollierten Release
Kurzes Vorgespräch zu Stack, Betriebsmodell und Zielbild, danach ein konkretes Angebot mit Workshop-Agenda.