Cercetătorii au introdus TextQuests, un etalon (benchmark) conceput pentru a evalua cât de eficient pot funcționa modelele de limbaj de mari dimensiuni (LLM) ca agenți în cadrul jocurilor video bazate pe text. Spre deosebire de interfețele grafice, aceste jocuri solicită modelelor să proceseze descrieri în limbaj natural și să genereze comenzi logice, adaptate contextului, pentru a progresa în cadrul narațiunilor.
Măsurarea raționamentului și a strategiei
Studiul se concentrează pe intersecția dintre înțelegerea lingvistică și luarea deciziilor strategice. Prin plasarea modelelor LLM în medii dinamice, cercetarea evidențiază punctele forte și limitările actuale ale modelelor atunci când se confruntă cu planificarea pe termen lung, gestionarea inventarului și sarcini de navigare spațială care nu beneficiază de indicii vizuale.
Rezultatele sugerează că, deși modelele avansate dau semne promițătoare în respectarea instrucțiunilor, acestea întâmpină adesea dificultăți în „urmărirea stării” (state tracking) necesară pentru a rezolva puzzle-uri cu mai mulți pași. Această cercetare oferă un nou cadru pentru dezvoltarea agenților AI care pot înțelege mai bine logica secvențială complexă în formate pur textuale.








