Ein Modell bewerten zu lassen, was ein anderes Modell geantwortet hat, ist verlockend: es skaliert, es versteht Sprache, und es liefert sofort eine Zahl. Genau darin liegt die Falle. Ein Bewertermodell ist kein Messgerät. Es hat belegte, systematische Verzerrungen, es driftet zwischen Versionen, und es lässt sich angreifen. Nützlich ist es trotzdem, wenn man es wie ein fehlbares Werkzeug behandelt und nicht wie eine Instanz.
Dieser Artikel beschreibt, wofür ein Bewertermodell in der RAG-Evaluation taugt, welche Kontrollen dazugehören und wo die Grenze verläuft.
Die typische erste Umsetzung lautet: „Welche Antwort ist besser, A oder B?“ Ohne Rubrik, ohne Quellenkontext, ohne Kalibrierung, ohne Kontrolle der Reihenfolge. Das Ergebnis ist eine Zahl mit zwei Nachkommastellen, die scheinbar präzise ist und in Wahrheit die Position der Antwort, ihre Länge und ihren Tonfall misst.
Aussagekräftig wird die Bewertung erst durch drei Dinge: eine aufgabenspezifische Rubrik, den Quellenkontext im Bewertungsprompt und eine menschliche Vergleichsbasis.
| Muster | Vorgehen | Gut für | Hauptrisiko |
|---|---|---|---|
| Paarweiser Vergleich | A gegen B, Sieger oder Unentschieden | Prompt-, Modell- und Konfigurationsvergleiche | Positions- und Längenverzerrung |
| Punktbewertung | Einzelantwort auf einer Skala oder bestanden/nicht bestanden | Regressionstests, Faithfulness-Prüfungen | Skalendrift, Scheinpräzision |
| Mehrkriterien-Rubrik | Dimensionen getrennt bewerten | Diagnose statt Gesamtnote | Aufwand, uneinheitliche Anwendung |
| Referenzbasiert | Bewerter erhält Musterantwort oder Quellen | Faktische Fragen, RAG | Fehlende Referenzen im Alltag |
Für RAG ist die referenzbasierte Bewertung der Regelfall. Der Bewerter bekommt die abgerufenen Belegstellen und die Anweisung, ausschließlich gegen diesen Kontext zu urteilen. Ohne diese Anweisung verzeiht er Behauptungen, die er aus seinem Training zu kennen glaubt, und die Messung geht am eigentlichen Fehler vorbei.
Keine der folgenden Verzerrungen ist eine Vermutung, alle sind in der Fachliteratur dokumentiert.
Eine brauchbare strukturierte Bewerterausgabe für eine RAG-Antwort enthält mindestens: Rubrikversion, Einzelwerte je Dimension (Korrektheit, Belegtheit, Anweisungstreue, Vollständigkeit, Prägnanz, Sicherheit), ein Gesamturteil bestanden oder nicht bestanden, kritische Fehler, nicht belegte Behauptungen, eine Vertrauensangabe und eine kurze Begründung.
Der wichtigste Teil ist die Liste der nicht belegten Behauptungen. Sie ist diagnostisch, während eine Gesamtnote nur ein Gefühl in Zahlform ist.
Menschen sind die Referenz, an der Bewertermodelle gemessen werden, nicht umgekehrt. Für einen Pilotlauf reichen etwa 50 bis 100 menschlich bewertete Beispiele, für eine produktive Messgrundlage sind je nach Risiko einige hundert nötig.
Zu beobachten sind: Übereinstimmung zwischen Bewerter und Mensch, Übereinstimmung zwischen Menschen untereinander, Rate der fälschlich bestandenen und fälschlich durchgefallenen Fälle, Kippquote bei vertauschter Reihenfolge, Empfindlichkeit gegenüber Promptvarianten.
Der Vergleich zwischen Menschen ist dabei der härteste Realitätstest. Wo Menschen sich uneinig sind, ist auch kein Modellurteil belastbar.
Bei Code gilt eine klare Rangfolge: Tests, statische Analyse, Typprüfung und Sicherheitsscans stehen vor dem Bewertermodell. Es übernimmt die qualitative Beurteilung, Menschen prüfen wichtige Änderungen.
Ein Freigabetor sollte deshalb nie an einem einzelnen Mittelwert hängen. Belastbar ist eine Kombination: keine sicherheitsrelevante Verschlechterung, Halluzinationsrate unter Schwelle, keine statistisch bedeutsame Verschlechterung der Aufgabenerfüllung, Siegquote im paarweisen Vergleich über Schwelle, und eine menschliche Prüfung, die das Restrisiko bestätigt.
Produktionsreife entsteht aus dem Bewertungssystem, nicht aus einem stärkeren Bewertermodell. Rubriken, Kalibrierung, Verzerrungskontrollen, menschliche Stichproben, Versionierung, Driftbeobachtung und klar benannte Grenzen bei folgenreichen Entscheidungen: das ist die Arbeit. Ein größeres Modell als Bewerter ersetzt nichts davon.
Wenn Sie diese Schleife an einer eigenen Anwendung aufbauen wollen: der LLMOps-Workshop richtet Tracing, Eval-Sätze und Freigabe-Gates ein. Wenn Sie den Stack darunter erst bauen: das LLM- und RAG-Lab beginnt bei Modell, Index und Retrieval-Baseline.
Die Aussagen zu Verzerrungen, Kalibrierungsgrößen und Einsatzgrenzen stützen sich unter anderem auf die folgenden Arbeiten.
Dr.-Ing. Grigory Devadze. Promotion in Elektrotechnik und Informationstechnik, Studium der Angewandten Mathematik. Ich baue und bewerte RAG-Systeme in Schulungen und Beratungsprojekten.
Schulungen und Projekte für Industrieunternehmen, Software- und IT-Firmen sowie Hochschulen.
→ Profil und Referenzen ansehen
Kurzes Vorgespräch zu Stack, Datenlage und Zielmetriken, danach ein konkreter Vorschlag für Beratung oder Schulung.