Funktionen
Sicherstellen, dass Agenten richtig funktionieren – vor und nach der Auslieferung
Bewerten der Schwächen von Agenten
Bewerten Sie Aktionsabschluss, Tool-Auswahl, Halluzinationen, RAG-Einhaltung und mehr. Verwenden Sie vorkonfigurierte Metriken oder definieren Sie eigene Kennzahlen und zeigen Sie die Bewertungen in einem Trace neben Latenz, Fehlern und Kosten an.
Inline-Optimierung eines Evaluators ohne Data Scientist
Korrekturen an einer falschen Bewertung sind direkt im Trace möglich, und Autotune aktualisiert den Evaluator damit. So müssen keine Projekte erstellt oder Aufgaben an das Prompt-Engineering-Team übergeben werden. Bei etwa fünf Beispielen liegt die Richtigkeit bei rund 95 %, mit Sprüngen um 10 bis 17 Punkte nach dem Formel 1-System.
Durchführen von Experimenten und A/B-Tests
Vergleich von Prompts, Modellen und Agentenversionen anhand derselben Bewertungen vor der Produktion. Stellen Sie fest, welche Änderung die Richtigkeit und Tool-Nutzung tatsächlich verbessert hat, anstatt anhand von Stichproben nur raten zu können.
Vertrauenswürdige Bewertungen werden zu Leitplanken
Eine Bewertung, die bei Tests zuverlässige Ergebnisse liefert, wird in der Produktion zur Kontrolle. Weiten Sie sie zur Laufzeitprüfung aus, die die fehlerhafte Aktion blockiert, bevor das Tool ausgeführt wird.