LeistungenIKI-Architektur und Model Engineering

MetrikgestützteEvaluation

Infrastruktur für vergleichende Modelltests

Technisches Problem

Die Leistung von Modellen wird nach oberflächlichem Eindruck beurteilt, und in produktiven Systemen lassen sich Genauigkeits- und Sicherheitsraten nicht analytisch verfolgen.

Architektonische Lösung

Vor Beginn der Entwicklung erstellen wir projektspezifische synthetische und reale Testdatensätze. Wir führen Modelle durch automatisierte Evaluationspipelines (Ragas, DeepEval u. a.) und messen technische Metriken: Kontextpräzision und -abdeckung, Faithfulness, Toxizität, Latenz sowie Token-Kosten-Verhältnis.

Operatives Ergebnis

Eine Modellauswahl, die ausschließlich auf mathematischen Daten beruht statt auf persönlichen Einschätzungen, und eine Nachvollziehbarkeit, die den Systemerfolg vor und nach jeder Aktualisierung belegt.

Ausgangsbedingungen

Diese Leistung wird gebraucht, wenn bereits ein Modell oder ein Prompt produktiv läuft und die Frage "ist die neue Version besser?" nach Eindruck beantwortet wird. Nur eines muss bei Ihnen liegen: die Zeit einer Fachperson — einige Stunden pro Woche von jemandem, der richtig von falsch unterscheiden kann. Ohne das bedeutet keine Kennzahl etwas; messen lässt sich nicht, solange offen ist, wessen Urteil als richtig gilt.

Arbeitsweise

Zuerst werden die Fragen, die das System beantworten muss, samt erwarteter Antworten festgehalten; ohne Kriterium gibt es keine Messung. Synthetische Beispiele stehen neben den echten, nie an ihrer Stelle. Der Ist-Zustand wird gemessen, damit der Ausgangspunkt feststeht. Die Kennzahlen richten sich nach der Entscheidung — Genauigkeit, Latenz oder Kosten; eine Änderung, die alle drei zugleich verbessert, ist selten. Die Testumgebung hängt in der CI, damit jede Änderung von selbst neu gemessen wird.

Nicht im Leistungsumfang

Diese Leistung entscheidet nicht, welches Modell Sie kaufen sollen; sie liefert den Vergleich, die Entscheidung bleibt bei Ihnen. Sie misst auch nicht, was sich nicht definieren lässt — der Wunsch nach "einem besseren Ton" muss erst zu einem prüfbaren Kriterium werden. Und sie ist kein einmaliger Bericht: Eine Testumgebung, die niemand ausführt, sagt binnen weniger Monate nicht mehr die Wahrheit; deshalb gehört die CI-Anbindung zur Arbeit.

Weitere Services

OpenAIGeminiAnthropicQwenGrokKimiGoogleAmazon S3Windows 365MetaHugging FaceAmazonAppleAndroidVisual StudioLLM