Symulacje AI, które uczą. Wyzwania. 

Magda Kołodkiewicz

W drzwiach mojego gabinetu stoi Vera: dominująca, bezpośrednia i cholernie ambitna  analityczka, którą bardzo potrzebuję zatrzymać w zespole.
Przyszła właśnie zapytać o decyzje w sprawie awansu, na który ciężko pracowała ostatni rok. Bardzo bym chciała, żeby go otrzymała. Cenię ją za pracowitość, konkret, umiejętności techniczne.

Ale muszę jej dzisiaj powiedzieć „nie”.

Kompetencje menedżerskie Very nie są wystarczające. Zespół chowa się po kątach, kiedy widzi ją na korytarzu– jest ostra, obcesowa, a wczoraj zmieszała z błotem kolegę na wspólnym spotkaniu tylko dlatego, że zgłosił ciekawy, ale niedopracowany pomysł.

Wiem, że to będzie trudna rozmowa.

Rozmawiałam z Verą setki razy. 

Tak naprawdę nie jest ani moją podwładną, ani analityczką, ani nawet człowiekiem. Ale jest trochę moim wirtualnym „dzieckiem” – avatarem AI w symulacji, która ma nie tylko umożliwić mi doświadczenie trudnej, realistycznej rozmowy, ale też dać potem dokładny feedback, który sprawi, że w prawdziwym środowisku poczuję się pewniej w podobnych sytuacjach.

„Zaprogramowałam” Verę tak, żeby ćwiczący z nią menadżer mógł pracować nad:

  • radzeniem sobie z oporem,
  • reagowaniem na emocje (po obu stronach),
  • utrzymaniem decyzji,
  • jednoczesnym wzmacnianiu relacji (a przynajmniej nie traceniu jej).

Żeby przygotować Verę do wyprowadzenia mnie i innych z równowagi, a aplikację Metaskills do rozwinięcia umiejętności ćwiczącego, do klasycznego narrative design dodałam kilka nowych warstw i perspektyw: architekta systemów, psychologa, coacha, trenera i asesora.

Duże modele językowe są coraz częściej wykorzystywane nie tylko do symulowania interakcji interpersonalnych, ale także do oceny ludzkiego funkcjonowania w ich trakcie. Stwarza to możliwości prowadzenia skalowalnej oceny zachowań i kompetencji, ale jednocześnie sprawia wiele wyzwań.

Z jakimi paradoksami trzeba się zmierzyć, kiedy próbujemy zamienić LLM w wiarygodne środowisko do ćwiczenia kompetencji społecznych?

1. LLM a władza: kiedy ufać, a kiedy kontrolować?

Symulacja rozmowy rozwojowej nie polega na tym, żeby AI „ładnie odgrywało postać”. Dobry scenariusz musi jednocześnie stworzyć wiarygodną sytuację społeczną, dać użytkownikowi swobodę działania, reagować na jakość jego zachowania, utrzymywać napięcie, nie podpowiadać rozwiązania, doprowadzić do określonych doświadczeń edukacyjnych, dostarczyć obserwowalnych zachowań do późniejszej oceny.

Przykład: Manager ma poinformować Verę o braku awansu.

Jako projektantów symulacji szkoleniowej nie obchodzi nas pytanie:

„Co Vera ma dokładnie odpowiedzieć?”

Tylko:

„Jak świat rozmowy z Verą powinien się zmieniać, jeżeli manager komunikuje decyzję jasno – niejasno, patronizująco, defensywnie albo z dużą dojrzałością?”

W najprostszej wersji „rozgałęzionych” scenariuszy (branched scenarios) swoboda użytkownika była ograniczona do przestrzeni przewidzianej przez autora. Świat był bezpieczny, przewidywalny. I – w kategoriach uczenia się skomplikowanych kompetencji społecznych – raczej martwy.

LLM radykalnie poszerzył tę przestrzeń: użytkownik nie musi już wybierać jednej z przygotowanych odpowiedzi. Może wszystko. Może skłamać. Zamilknąć. Zaatakować. Przeprosić. Zmienić zdanie. Powiedzieć coś, czego autor scenariusza nigdy nie przewidział.

Jak pogodzić tę wolność z koniecznością panowania nad przebiegiem rozmowy?

Jeżeli oddamy całą kontrolę LLM-owi, postać może zbyt łatwo przechodzić do współpracy, tracić pierwotny poziom oporu albo nadmiernie dostosowywać się do użytkownika.
Jednym z pokrewnych zjawisk jest „sycophancy” — tendencja modeli do nadmiernego przytakiwania użytkownikowi. Modele konwersacyjne często mają silną tendencję do bycia pomocnymi i kooperacyjnymi — także wtedy, gdy logika symulacji wymaga utrzymania konfliktu.

Z drugiej strony – nie jestem w stanie skontrolować każdej wypowiedzi użytkownika. Od kiedy stał się on pełnoprawnym i kompletnie nieprzewidywalnym elementem współtworzącym przebieg symulacji, jako jej projektant mogę jedynie opracować granice, w których toczyć się ma rozmowa. Muszę stworzyć system społeczny, prawa, według których rozmowa „żyje” i ma sens.

Jako autor powinnam określić:

  • co w świecie danej rozmowy jest prawdą,
  • kim są bohaterowie,
  • czego chcą,
  • co jest nierozwiązaną stawką,
  • jakie wydarzenia muszą nastąpić,
  • jakie działania są możliwe,
  • jakie działania użytkownika i avatara zmieniają przebieg rozmowy,
  • czego nie wolno naruszyć.

Reszta może być improwizacją AI — ale improwizacją wewnątrz kontrolowanej przestrzeni możliwości.

2. LLM i pamięć– „do you remember?”

Ukochanym równaniu profesora Yoko Ogawy wybitny matematyk potrafi wykonywać niezwykle złożone operacje logiczne, ale po wypadku jego pamięć obejmuje tylko niewielki fragment rzeczywistości. Musi pozostawiać sobie w ciągu dnia znaki, żeby zachować ciągłość świata.

Z LLM-em bywa podobnie.

Potrafi przeprowadzić błyskotliwą analizę emocji w pojedynczej wypowiedzi, a jednocześnie kilka tur później zachowywać się tak, jakby wcześniejszy konflikt nigdy się nie wydarzył.

Jeżeli przed chwilą avatar został upokorzony, nie może trzy zdania później zachowywać  się jak gdyby nigdy nic. Jeżeli użytkownik przez pierwszą połowę rozmowy był unikający, a potem się skorygował, poprawa powinna mieć znaczenie — ale nie powinna wyzerować historii. I odwrotnie: jeżeli zaczął świetnie, a później stracił kontrolę i zaczął atakować rozmówcę, dobry początek nie może działać jak immunitet.

Dlatego część pamięci trzeba „wyjąć” z LLM-a.

I tu pojawia się koncepcja „silnika zachowania avatara” (state engine). Avatar potrzebuje nie tylko „osobowości”, ale również „stanu”, w którym aktualnie się znajduje, w zależności od potraktowania przez użytkownika. Innymi słowy: Vera cały czas musi pozostać sobą. Nie powinna też być zadowolona na końcu rozmowy – ostatecznie nie dostała awansu. Ale to, czy będzie w trakcie rozmowy bardziej czy mniej oporująca, bardziej czy mniej wściekła i złośliwa powinno zależeć od sposobu, w jaki z nią porozmawiam.

LLM może rozpoznać, że użytkownik był klarowny i konkretny, defensywny, protekcjonalny albo że właśnie naprawił wcześniejszy błąd. W systemie, w którym zależy nam na powtarzalności, krytyczny stan rozmowy warto utrzymywać poza swobodną generacją LLM-a — np. w warstwie backendowej lub ustrukturyzowanej pamięci. „State engine” dobrze działa w obrębie tzw. „beatów” rozmowy (storylets) – najmniejszych jej części, nazywanych też interakcją.
Nie zawsze jest to tylko akcja – reakcja, czyli „ a ona mi powiedziała, a ja jej powiedziałam”. To raczej jednostka akcji i reakcji, w której coś istotnego zmienia się w relacji, wiedzy lub przebiegu sceny.

3. LLM a odpowiedzialność: wszyscy za jednego czy jeden za wszystkich?

Kiedy jednemu LLM-owi powierzamy wiele równoległych i czasem sprzecznych odpowiedzialności, rośnie ryzyko, że przestanie konsekwentnie realizować wszystkie ograniczenia. Informacje zaczynają wtedy „przeciekać”: aktor zaczyna korzystać z wiedzy reżysera, asesor wpływa na przebieg sceny, a reguły świata ustępują naturalności dialogu. Rozdzielenie odpowiedzialności ogranicza ten efekt. W sukurs przychodzi nam tutaj orchestracja i rozdzielanie decyzyjności, czyli zabiegi rodem z filmu „W głowie się nie mieści”.

Wyobraźmy sobie więc stół reżyserski.

Nie siedzi przy nim jeden wszechwiedzący AI, który jednocześnie gra Verę, interpretuje zachowanie użytkownika, pilnuje fabuły, pamięta wszystkie fakty i jeszcze wystawia ocenę. Zamiast tego poszczególne funkcje są rozdzielone.

Przy stole może siedzieć Obserwator: Co właściwie zrobił użytkownik?

Czy uznał emocję? Czy zmienił strategię? Czy postawił granicę? Czy zaczął się bronić?

Obok niego siedzi Reżyser: Co powinno wydarzyć się teraz?

Czy Vera powinna jeszcze stawiać opór? Czy użytkownik zrobił już wystarczająco dużo, żeby rozmowa przeszła do kolejnego etapu? Czy powinien pojawić się następny moment próby?

Jest też Strażnik Świata: Co w tej historii jest prawdą?

Decyzja o awansie została podjęta. Vera jej nie znała przed rozmową. Nie można nagle wymyślić drugiego wolnego stanowiska tylko dlatego, że byłoby to wygodne dla dialogu.

Dopiero później do głosu dochodzi Aktor: Jak Vera, będąc Verą i znajdując się właśnie w takim stanie emocjonalnym, rzeczywiście by to powiedziała?

I wreszcie gdzieś z boku siedzi Asesor. On nie steruje Verą. Patrzy na użytkownika: Które z jego zachowań są rzeczywiście dowodem kompetencji?

To rozdzielenie jest ważne, bo cele tych ról nie zawsze są zgodne. Orchestracja nie oznacza koniecznie pięciu agentów ani pięciu modeli LLM. To może być jeden model wywoływany w różnych rolach. Część funkcji może być zwykłą logiką backendową. Niektóre decyzje mogą być deterministyczne. Inne — generatywne.

4. LLM i ocena kompetencji: nie wszystko złoto?

 Reakcja avatara jest pierwszą informacją o konsekwencji zachowania w świecie symulacji — ale nie powinna być utożsamiana z oceną kompetencji.

Żeby użytkownik mógł rozwijać swoje umiejętności potrzebuje trafnego feedbacku, i to najlepiej na kilku poziomach:

  • w konkretnym momencie w trakcie rozmowy– feedback do konkretnej wypowiedzi lub decyzji.
  • na poziomie całej rozmowy– ocena całej symulacji.
  • w zakresie wyłaniających się trendów– wzorce widoczne w wielu rozmowach.
  • aż do uchwyconego w dłuższym czasie obrazu zachowań, na bazie których można wnioskować ( z większym lub mniejszym prawdopodobieństwem) o poziomie umiejętności czy kompetencji.

Jestem właśnie w trakcie testowania AI Asessora, którego stworzyliśmy w Metaskills w ramach projektu Digital Twin EIT Health.

AI Assessor został zaprojektowany w logice metodologii Assessment/Development Center: nie ocenia deklaracji ani „ogólnego wrażenia” z rozmowy, lecz obserwowalne zachowania w konkretnych sytuacjach.

Punktem wyjścia było stworzenie wspólnego, przekrojowego modelu kompetencji, który następnie dopasowujemy dla różnych sytuacji i ról. Każda kompetencja została rozłożona na konkretne wymiary behawioralne oraz powiązana z sytuacjami, w których powinna się ujawniać, funkcją, jaką pełni w rozmowie, i przewidywanym wpływem na jej przebieg.

Podczas symulacji Assessor szuka więc nie samej „empatii” czy „klarowności”, ale dowodów (w naszej metodologii Evidence Events) — konkretnych momentów, w których użytkownik dane zachowanie rzeczywiście demonstruje albo go nie wykorzystuje. Szczególną wagę mają też tzw. „momenty prawdy”, czyli sytuacje, w których dana kompetencja jest kluczowa.

Jedna rozmowa daje ocenę sytuacyjną. Im bardziej wzorzec zachowania powtarza się w różnych sytuacjach (wiele rozmów, różne poziomy trudności, rożne avatary), tym silniejsze staje się dowody dla interpretacji kompetencyjnej — choć nadal pozostaje to wnioskowanie wymagające walidacji względem zewnętrznych kryteriów.

AI Assesor w Digital Twin nie tworzy więc średniej z wyników rozmów, lecz syntezę wzorców zachowania, ich stabilności, kontekstu i jakości zgromadzonych dowodów. Wyniki jego działania porównujemy z ocenami prawdziwych asesorów- ludzi.

Już widać (a potwierdzają to obserwacje innych podmiotów – patrz linki do badań w źródłach), że najtrudniejsze dla LLM-a nie jest wystawienie oceny. Najtrudniejsze jest ustalenie, które fragmenty rozmowy naprawdę są dowodem kompetencji, zinterpretowanie ich we właściwym kontekście i odróżnienie pojedynczego zachowania ze stabilną cechą człowieka.

W przypadku kompetencji społecznych LLM musi wykonać kilka trudnych operacji naraz:

  • Zrozumieć zachowanie w kontekście. 
  • Oddzielić dowody od ogólnego wrażenia. 
  • Nie pomylić konsekwencji z trafnością. 
  • Przenieść ludzką metodologię do modelu bez jej reinterpretowania.

    Z całą pewnością LLM jest w stanie przeanalizować wiele rzeczy naraz o wiele szybciej. Ale czy rzeczywiście trafniej? Zobaczymy.

Badania i inspiracje

WhatELSE: Shaping Narrative Spaces at Configurable Level of Abstraction for AI-bridged Interactive Storytelling

 

Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias Justin D. Norman and Michael U. Rivera and D. Alex Hughes

 

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges; Yihan Hong1 Huaiyuan Yao; Bolin Shen; Wanpeng Xu; Hua Wei Yushun Dong

 

PersonaEval: Are LLM Evaluators Human Enough to Judge Role-Play? Lingfeng Zhou, Jialing Zhang, Jin Gao, Mohan Jiang, Dequan Wan