Hugging Face
Ein Agent löst 77,4 Prozent im Mittel und nur 53,0 Prozent in allen fünf Läufen
Vom Abgerufen
Gemessen wurde ein ReAct-Agent mit GPT-4.1 auf AppWorld test_normal. Den Abstand von 24,4 Punkten nennt der Beitrag Konsistenzlücke. Neue Konsistenzleitlinien aus dem offenen ALTK-Evolve drücken ihn auf 12,0 Punkte, der Mittelwert steigt dabei auf 81,0 Prozent.