LLM & RAG · Lab für Entwicklerteams

LLM- und RAG-Schulung: das On-Premise-Lab für Softwareteams

Ihr RAG-Prototyp läuft, aber niemand kann sagen, ob er gut ist. Das ist der Normalfall. Retrieval-Qualität wurde nie gemessen, die Datenhoheitsfrage ist offen, und jede Änderung am Prompt fühlt sich wie ein Fortschritt an, ohne dass es einer sein muss. Dieses Lab baut mit Ihrem Team einen RAG-Stack auf Ihrer eigenen Infrastruktur auf und macht ihn messbar.

Über die Schulung

Vom Prototyp zum messbar bewerteten System

Die Schulung folgt dem Weg vom Prototyp zum bewerteten System: zuerst die Bausteine eines RAG-Stacks verstehen, dann jeden Baustein auf dem eigenen Stack umsetzen und messen. Am Ende stehen ein lauffähiges System, eine Baseline, ein Eval-Set und eine Checkliste für das Deployment.

Die Schulung richtet sich an Software-, Plattform- und Security-Teams, die ein RAG-System auf eigener Infrastruktur aufbauen oder einen vorhandenen Prototyp messbar machen wollen, sowie an einzelne Entwicklerinnen und Entwickler im offenen Training. Ein bestehender Prototyp ist der häufigste und der bessere Ausgangspunkt. Eigene GPUs sind für den Einstieg nicht zwingend, die Dimensionierung ist Teil des Inhalts.

Schulungsziel

Belastbare Antworten statt guter Demos

Nach der Schulung baut Ihr Team RAG-Systeme, deren Qualität es beziffern kann, und betreibt lokale Modelle auf eigener Hardware. Konkret beherrscht Ihr Team danach:

  • Lokale Modelle produktiv betreiben. Modellauswahl nach Aufgabe statt nach Ranking, Quantisierung und ihre Kosten, GPU-Dimensionierung, Serving mit Ollama, llama.cpp oder vLLM. Alle Daten bleiben im Haus.
  • Retrieval messen, bevor Sie es verbessern. Eine Baseline aus echten Fragen Ihres Teams, Recall und Precision an definierten Cutoffs, nDCG und MRR für gerankte Ergebnisse.
  • Die richtigen Stellschrauben kennen. Chunking, Embedding-Modell, hybride Suche aus BM25 und Vektoren, Cross-Encoder-Reranking. Reranking hebt die Endqualität deutlich und kostet Latenz.
  • Judges einsetzen, ohne ihnen blind zu glauben. LLM-as-a-Judge mit Rubrik, vertauschter Reihenfolge, geblindeten Modellnamen und menschlicher Kalibrierung. Positions-, Längen- und Selbstpräferenz-Bias sind dokumentiert und werden im Lab sichtbar gemacht.
  • Den Weg in den Betrieb planen. Löschpfade und stabile Chunk-IDs ab Tag eins, ACL-bewusstes Retrieval, Reindexierung ohne Ausfall über Alias-Wechsel, Monitoring von Drift und Kosten.
Inhalt

Was wir gemeinsam durchgehen

  • Grundlagen und Abgrenzung. Wann Retrieval die richtige Antwort ist und wann langer Kontext, Feintuning oder schlicht eine Datenbankabfrage besser passen.
  • Der Stack auf Ihrer Hardware. Modell laden, quantisieren, servieren. Speicherbedarf, Durchsatz und Latenz messen statt schätzen. Betriebsmodelle von der Workstation bis zum dedizierten GPU-Server.
  • Indexierung und Retrieval. Dokumente aufbereiten, Chunking-Strategien im Vergleich, Embedding-Modelle auswählen und wechseln, Vektorindex-Strukturen und ihre Betriebseigenschaften, hybride Suche, Reranking.
  • Evaluation als Artefakt. Eval-Set aus echten Fragen, Metriken für Retrieval und Generierung getrennt (Precision, Recall, MRR, MAP, nDCG, selbst gerechnet und gegen eine Bibliothek gegengeprüft), Groundedness und Zitatqualität, Judge mit versionierter Rubrik und stabilem JSON-Schema, Regressionslauf in der CI.
  • Sicherheit im Retrieval. Indirekte Prompt Injection über vergiftete Dokumente, Zugriffskontrolle vor der Antwort statt danach, Confidence-Gate und sauberes „Weiß ich nicht“ statt geratener Antwort.
  • Betrieb und Governance. Zugriffskontrolle im Retrieval, Löschung und Aktualisierung des Index, Provenienz der Antworten, Drift-Beobachtung, Kostenrahmen. Dazu die deutschen und europäischen Anker, die bei Firmendokumenten regelmäßig auftauchen.
Formate & Termine

Drei Wege zum eigenen RAG-Stack

Inhouse-Lab
Umfang & Format3 Tage, Präsenz oder online, auf Ihrer Infrastruktur
ZielgruppeSoftware-, Plattform- und Security-Teams ab 3 Personen
Preisauf Anfrage
Nächste Terminenach Absprache
Das nehmen Sie mitLauffähiger RAG-Stack auf Ihrer Hardware; Eval-Suite als Team-Artefakt; Deployment-Checkliste mit Zugriffskontrolle, Löschpfad und Monitoring
Coaching / Delivery-Begleitung
Umfang & Formatfortlaufend
ZielgruppeTeams nach dem Lab
Preisauf Anfrage
Nächste Terminenach Absprache
Das nehmen Sie mitBegleitung vom Lab zum Produktivsystem; Review der Eval-Ergebnisse; Entscheidungsvorlagen für Hardware, Modelle und Betrieb

Alle Formate: Deutsch & Englisch.

Alle Preise verstehen sich netto zzgl. gesetzlicher Umsatzsteuer. Das Angebot richtet sich ausschließlich an Unternehmer im Sinne des § 14 BGB.

Ihr Dozent und Berater

Wissenschaftlich fundiert, im Produktivbetrieb erprobt

Dr.-Ing. Grigory Devadze. Ich schule nicht aus dem Lehrbuch, sondern das, was ich täglich selbst umsetze: in Industrie, Unternehmen und an Hochschulen.

  • Produktive Systeme, nicht nur Demos. Ein agentisches KI- und RAG-System für maritime E-Mail-Intelligence läuft im Produktivbetrieb. Für ein Software-Unternehmen ist eine souveräne LLM-Plattform auf dedizierter GPU-Infrastruktur entstanden.
  • Messen ist eigener Arbeitsschwerpunkt. RAG- und Retrieval-Evaluation einschließlich der Kontrollen gegen Judge-Bias ist eigener Schulungs- und Beratungsinhalt. Sie lernen hier das Bewerten, nicht nur das Bauen.
  • Herstellerneutral. Ich vermittle Methoden und Werkzeuge, die ich selbst einsetze. Empfehlungen richten sich nach Ihrem Stack, Ihrer Hardware und Ihren Compliance-Vorgaben, nicht nach einem Anbieter.

Schulungen & Projekte u. a. für Siemens AG und SRH Hochschule Berlin.

→ Profil und Referenzen ansehen
Dr.-Ing. Grigory Devadze
FAQ

Häufige Fragen

Welche Modelle und Werkzeuge nutzen wir?

Was zu Ihrer Aufgabe passt. Im Lab kommen offene Modelle über Ollama, llama.cpp oder vLLM zum Einsatz. Die Auswahl entscheiden Use Case, verfügbare Hardware und Ihre Compliance-Vorgaben, nicht der aktuelle Ranking-Platz eines Modells.

Brauchen wir eigene GPUs?

Für den Einstieg nicht zwingend. Es gibt lauffähige Setups von der Workstation bis zum dedizierten GPU-Server. Die Dimensionierung ist Teil des Inhalts: Sie rechnen im Lab aus, was Ihr Anwendungsfall an Speicher, Durchsatz und Latenz tatsächlich braucht.

Können wir mit echten Firmendaten arbeiten?

Ja, wenn Ihre Compliance das erlaubt. Alles läuft auf Ihrer Infrastruktur, es verlässt kein Dokument das Haus. Wenn die Freigabe fehlt oder zu lange dauert, arbeiten wir mit einem fertigen Übungsstack auf synthetischen Daten: ein technischer Wissensassistent auf einem erfundenen Dokumentbestand, mit Goldstandard-Fragen für die Metriken. Der Stack läuft vollständig lokal und offline, Generator über Ollama, Embeddings über sentence-transformers.

Was unterscheidet das von einem RAG-Tutorial?

Tutorials enden beim ersten funktionierenden Prompt. Hier endet es bei einem System, dessen Qualität Sie beziffern können, plus Deployment-Checkliste.

Wir haben schon einen RAG-Prototyp. Passt das trotzdem?

Das ist der häufigste Ausgangspunkt und der bessere. Wir setzen die Baseline auf Ihren bestehenden Stack, messen ihn und arbeiten an den Stellen weiter, die die Messung als schwach ausweist.

Anfrage

Lokales LLM und RAG im Team produktiv machen?

Kurzes Vorgespräch, dann konkretes Angebot mit Lab-Agenda.

oderE-Mail schreiben