Hugging Face
Agenten-Gedächtnis wirkt je nach Modell verschieden
Vom Abgerufen
IBM Research hat acht Modelle auf AppWorld mit selbst destillierten Leitsätzen aus früheren Läufen gemessen. gpt-oss-120b legt mit ausgewählten Leitsätzen je Aufgabe um 16,1 Punkte zu, DeepSeek-V3.2 mit dem vollen Satz um 9,5 Punkte, GLM-5 um nichts.