Wyobraź sobie prostą scenę. Wchodzisz do wirtualnego sklepu, podchodzisz do sprzedawcy i zamiast wybierać jedną z trzech gotowych odpowiedzi pytasz własnymi słowami: „Masz coś tańszego, ale niebieskiego?”. Postać odpowiada. Dopytujesz, czy sama wybrałaby ten model. Odpowiada znowu. Potem zmieniasz temat i pytasz, dlaczego w mieście od rana wyją syreny.

W klasycznej grze taka rozmowa kończyłaby się tam, gdzie kończy się scenariusz. Coraz częściej pojawia się jednak inna możliwość: postać nie odtwarza kolejnej zapisanej linijki, lecz tworzy odpowiedź w trakcie rozmowy. W tym miejscu VR spotyka się z generatywną sztuczną inteligencją — czyli AI, która potrafi tworzyć nową treść na podstawie otrzymanego kontekstu. I robi się ciekawie nie dlatego, że wirtualna postać może powiedzieć więcej zdań, ale dlatego, że twórca przestaje znać każde z nich z góry.

Postacie w grach zwykle miały scenariusz

Postacie niezależne — w grach nazywane zwykle NPC, od angielskiego non-player character, czyli postaciami, którymi nie steruje gracz — od dawna potrafią sprawiać wrażenie rozmówców. Mogą pamiętać decyzję gracza, zmienić nastawienie, odblokować inną kwestię po wykonaniu zadania albo poprowadzić rozbudowane drzewko dialogowe, czyli zestaw wcześniej przygotowanych odpowiedzi i reakcji. Za kulisami nadal działa jednak zestaw reguł przygotowanych wcześniej. Jeśli gracz ma do wyboru pięć odpowiedzi, autor napisał pięć odpowiedzi. Jeśli NPC reaguje inaczej po zdradzie niż po pomocy, ktoś wcześniej zaprojektował oba warianty.

To nie jest wada. Dzięki temu scenarzysta kontroluje tempo, charakter postaci i informacje, które mogą paść w danym momencie. Żart może mieć dokładnie taką puentę, jaką powinien, sekret nie wyjdzie na jaw dwie godziny za wcześnie, a bohater nie zaprzeczy faktom ustalonym wcześniej przez fabułę.

Problem pojawia się wtedy, gdy chcemy rozmowy, której nie da się rozsądnie rozpisać na wszystkie możliwe warianty. Człowiek może zapytać o właściwie cokolwiek. Liczba potencjalnych zdań nie mieści się w drzewku dialogowym, choćby było ogromne.

I właśnie tutaj do gry wchodzą modele językowe — systemy AI, które potrafią analizować tekst i tworzyć na jego podstawie kolejne wypowiedzi.

A co, jeśli po prostu możesz coś powiedzieć?

W najprostszym wariancie gracz mówi do postaci przez mikrofon. System rozpoznawania mowy zamienia dźwięk na tekst. Model językowy dostaje nie tylko pytanie gracza, ale też instrukcje opisujące postać: kim jest, jak mówi, co wie, czego nie powinna wiedzieć, co wydarzyło się wcześniej i w jakiej sytuacji znajduje się teraz. Na tej podstawie tworzy odpowiedź. Potem synteza mowy zamienia tekst z powrotem w głos, a system animacji może dopasować ruch ust, twarzy czy gesty.

To ważne rozróżnienie, bo „NPC z AI” nie jest jedną magiczną skrzynką. To raczej łańcuch kilku elementów, które muszą działać razem i wystarczająco szybko. Współczesne narzędzia deweloperskie potrafią już łączyć właśnie taki zestaw: rozpoznawanie mowy, model językowy, tworzenie głosu, pamięć kontekstu oraz mechanizmy pozwalające postaci wykonać działanie w świecie gry.

Schemat pokazujący przepływ od mowy gracza przez rozpoznawanie mowy, model językowy z pamięcią i kontekstem oraz syntezę mowy do głosu, animacji i działania NPC.
Rozmowa z AI NPC to nie jeden model, lecz łańcuch kilku elementów — od rozpoznania mowy po odpowiedź głosową i ewentualne działanie postaci. Źródło: opracowanie własne WartaRiver.

W 2025 roku Meta zapowiadała w Horizon Worlds postacie oparte na modelach językowych, reagujące na głos gracza i łączące odpowiedzi generowane z dialogiem napisanym wcześniej. Rok później w narzędziach dla aplikacji na Quest pojawiły się moduły, które pozwalają deweloperom łączyć modele językowe, rozpoznawanie mowy i syntezę mowy w projektach VR i AR. NVIDIA rozwija podobny kierunek w grach poza samym VR: jej ACE łączy mowę, modele językowe, pamięć, animację i działania postaci.

Technicznie nie oznacza to, że wirtualny sprzedawca „rozumie” cię tak jak człowiek. Oznacza, że system potrafi przetworzyć twoją wypowiedź, uwzględnić dostarczony kontekst i wygenerować odpowiedź, której scenarzysta nie musiał wcześniej zapisać słowo po słowie. Dla gracza różnica może być jednak bardzo wyraźna: zamiast szukać właściwej opcji w menu, próbuje po prostu rozmawiać.

W VR rozmowa dostaje ciało

Z chatbotem też można prowadzić swobodną rozmowę, więc po co do tego gogle? Odpowiedź nie leży wyłącznie w grafice.

W VR rozmówca może znajdować się metr od ciebie. Ma wzrost, pozycję i kierunek spojrzenia. Gdy odwrócisz głowę, nadal stoi w tym samym miejscu. Jego głos może dochodzić z konkretnego punktu przestrzeni. Może spojrzeć na przedmiot, o którym mówisz, wykonać gest albo podejść do drzwi, które właśnie wskazałeś.

To zmienia charakter interakcji. W badaniach nad wirtualnymi postaciami sterowanymi przez AI uczestnicy reagują nie tylko na treść ich słów, ale również na osobowość, wygląd, głos i zachowanie niewerbalne. W jednym z badań z 2025 roku ta sama wirtualna postać sterowana modelem językowym była odbierana inaczej zależnie od tego, czy nadano jej bardziej ekstrawertyczny czy introwertyczny sposób bycia. Inne badanie wykazało większe poczucie obecności podczas rozmowy z wirtualną postacią w VR niż podczas kontaktu z tekstowym chatbotem.

Nie chodzi więc wyłącznie o wygodniejszy sposób zadawania pytań AI. AI przestaje być oknem z tekstem i staje się jednym z elementów przestrzeni, w której znajduje się użytkownik. A skoro ma ciało i miejsce w świecie, szybko zaczynamy oczekiwać od niej więcej niż poprawnych zdań. Chcemy, żeby patrzyła tam, gdzie trzeba, nie przerywała w dziwnym momencie, pamiętała, co wydarzyło się przed chwilą, i zachowywała się zgodnie z rolą.

Gdy odpowiedź ma zmienić świat

Sama rozmowa jest tylko pierwszym krokiem. Jeśli NPC powie: „Chodź, pokażę ci drogę”, a potem zostanie nieruchomo w miejscu, iluzja szybko się kończy. W wirtualnym świecie słowa powinny czasem mieć konsekwencje. Postać może wskazać przedmiot, podejść do niego, otworzyć drzwi, podać graczowi narzędzie albo zmienić swoje zachowanie po tym, co właśnie usłyszała.

To znacznie trudniejsze niż generowanie odpowiedzi tekstowej. Model musi dostać informację o tym, co rzeczywiście znajduje się w otoczeniu i jakie działania są w ogóle możliwe. Nie wystarczy, że „wie”, czym są drzwi. System musi rozpoznać konkretne drzwi w tej scenie, mieć do dyspozycji możliwość ich otwarcia i sprawdzić, czy postać ma prawo to zrobić. Badania nad postaciami AI w VR idą właśnie w tę stronę: oprócz rozmowy przekazują modelowi opis środowiska i zestaw dozwolonych interakcji, żeby odpowiedź mogła prowadzić do działania w przestrzeni.

Schemat łączący rozmowę, pamięć i kontekst, stan świata oraz dozwolone działania NPC, z przykładem drzwi, które postać może rozpoznać i otworzyć.
Żeby słowa NPC mogły zmieniać świat gry, model musi znać kontekst, aktualny stan sceny i listę działań, które postać rzeczywiście może wykonać. Źródło: opracowanie własne WartaRiver.

Wtedy różnica między klasycznym NPC a postacią sterowaną przez model językowy robi się większa. Strażnik nie musi mieć osobnej kwestii i osobnego skryptu dla każdej możliwej próby przekonania go. Może ocenić wypowiedź gracza w ramach ustalonych zasad i wybrać jedno z działań, które twórca mu udostępnił: odmówić, dopytać, wezwać pomoc albo otworzyć bramę.

Swoboda nie bierze się więc z tego, że AI może zrobić wszystko. Bierze się z tego, że może wybierać i łączyć zachowania w sytuacjach, których nie trzeba wcześniej rozpisać zdanie po zdaniu. Dlatego najciekawszy kierunek nie polega na doklejeniu chatbota do animowanej twarzy, lecz na połączeniu języka z pamięcią, stanem świata i możliwością działania.

Największa zaleta jest jednocześnie największym problemem

Swobodna rozmowa daje coś, czego klasyczny dialog nie potrafi dać w tej samej skali: improwizację. Gracz może zadać pytanie, którego projektant nie przewidział, spróbować przekonać postać własnym argumentem albo poprowadzić rozmowę w stronę, której nie ma w menu.

W 2026 roku Nima Zargham i współautorzy opisali eksperymentalną grę VR „Office Whispers”, w której gracz rozmawiał głosem z czterema postaciami sterowanymi przez generatywną AI. Kiedy NPC odpowiadał niespójnie albo rozmowa zaczynała brzmieć nienaturalnie, poczucie zanurzenia słabło. Ale gdy system sobie radził, możliwość mówienia własnymi słowami była dla uczestników jedną z mocnych stron takiej interakcji.

To dobry przykład podstawowego paradoksu tej technologii. Jeśli postać ma być naprawdę elastyczna, nie da się wcześniej zatwierdzić każdego zdania. Jeśli jednak nie można wcześniej zatwierdzić każdego zdania, twórca traci część kontroli nad tym, co gracz usłyszy.

Model może pomylić fakt z historii świata, wymyślić wydarzenie, które nigdy nie miało miejsca, zdradzić informację, której postać nie powinna znać, albo po dłuższej rozmowie zacząć zachowywać się inaczej niż na początku. Pamięć również nie pojawia się automatycznie. System musi zdecydować, które wydarzenia zachować, które streścić i co przekazać modelowi przy kolejnej odpowiedzi. W świecie z wieloma NPC dochodzi jeszcze trudniejsze pytanie: jeśli jedna postać, właśnie improwizując, wymyśliła anegdotę ze swojego dzieciństwa, skąd jej wirtualna matka ma później wiedzieć, że taka anegdota „istnieje”?

Jest też prozaiczny przeciwnik dobrej rozmowy: czas. Nienaturalna cisza po zwykłym pytaniu szybko zaczyna brzmieć jak usterka, a nie jak namysł rozmówcy. W jednym z eksperymentów z dwoma NPC w symulatorze przesłuchania VR pełny cykl — od wypowiedzi użytkownika do odpowiedzi postaci — trwał średnio około siedmiu sekund. Nowsze systemy próbują skracać ten czas, między innymi zaczynając tworzyć i odtwarzać odpowiedź kawałek po kawałku, zanim całość jest gotowa, oraz wykorzystując mniejsze modele. W badaniu zaprezentowanym w 2025 roku zastosowane optymalizacje zmniejszyły opóźnienie średnio o około dwie trzecie. To pokazuje, że „potrafi odpowiedzieć” i „potrafi rozmawiać naturalnie” to nadal dwie różne rzeczy.

Twórca nie znika. Zmienia mu się zadanie

Łatwo wyobrazić sobie skrajny wariant: skoro model może pisać dialog na bieżąco, scenarzysta przestaje być potrzebny. W praktyce właśnie wtedy jego rola może stać się jeszcze ważniejsza — tylko przesuwa się z poziomu pojedynczych zdań na poziom zasad.

Trzeba określić, kim jest postać, jaki ma temperament, czego chce, jakie fakty zna, czego nie wolno jej ujawnić, w jakich granicach może improwizować i co ma zrobić, kiedy użytkownik próbuje wyciągnąć ją poza scenariusz. Do tego dochodzi wiedza o świecie: historia miejsca, relacje z innymi postaciami, aktualny stan zadań i zdarzenia, które naprawdę zaszły podczas tej konkretnej rozgrywki.

Tu właśnie przydają się rozwiązania hybrydowe. Fabularnie ważne kwestie mogą pozostać napisane ręcznie, a AI wypełniać przestrzeń pomiędzy nimi. Można też pozwolić graczowi mówić własnymi słowami, a systemowi rozpoznawać sens wypowiedzi i wybierać jedną z wcześniej przewidzianych reakcji. Przy większej swobodzie modelu można z kolei zostawić mu pogawędkę, ale zablokować zmianę kluczowych faktów i etapów zadania.

To mniej efektowne niż hasło „NPC, który może powiedzieć wszystko”, ale prawdopodobnie dużo użyteczniejsze. Dobra postać nie musi mieć nieskończonej wolności. Musi sprawiać wrażenie, że rozumie sytuację, a jednocześnie pozostawać częścią świata, który ma własne reguły.

Nie tylko gry

Kiedy zabierzemy miecze, zadania i wirtualne tawerny, ta sama technologia nadal ma sens. Właśnie dlatego modele językowe połączone z wirtualnymi postaciami w VR pojawiają się w badaniach nad edukacją i treningiem zachowań.

W takim zastosowaniu najcenniejsze nie jest to, że postać zna tysiące odpowiedzi, lecz że można z nią ćwiczyć sytuację, której przebiegu nie da się w pełni przewidzieć. Student języka może wejść do wirtualnego sklepu i porozmawiać ze sprzedawcą zamiast odczytywać gotowy dialog. Przyszły nauczyciel może stanąć przed klasą, w której uczniowie reagują różnie. Osoba ćwicząca trudną rozmowę zawodową może powtarzać scenariusz kilka razy, a wirtualny rozmówca nie musi za każdym razem odpowiadać identycznie.

Badacze już budują takie prototypy. Powstały m.in. postacie wspierające naukę w środowiskach VR na uczelniach, wirtualni rozmówcy do ćwiczenia języka angielskiego w aplikacjach VR, w których spotykają się użytkownicy, oraz platformy do odgrywania scenariuszy i treningu rozwiązywania konfliktów interpersonalnych. Nie oznacza to jeszcze, że AI jest lepszym nauczycielem czy trenerem od człowieka. Pokazuje raczej, dlaczego połączenie obu technologii jest kuszące: VR daje sytuację i przestrzeń, a model językowy daje rozmówcy możliwość reagowania na coś więcej niż kilka wcześniej przewidzianych komend.

Czy naprawdę chcemy, żeby każda postać mogła powiedzieć wszystko?

Prawdopodobnie nie. W wielu grach dokładnie napisany dialog pozostanie lepszym rozwiązaniem. Autor może kontrolować rytm sceny, humor, napięcie i charakter. Gracz dostaje gotową wypowiedź — nie musi czekać, aż system wygeneruje ją w trakcie rozmowy. Czasem trzy dobrze napisane odpowiedzi są zwyczajnie lepsze niż nieskończona liczba przeciętnych.

Generatywna AI otwiera jednak inną możliwość. Zamiast projektować wyłącznie to, co postać powie, można projektować także obszar, w którym wolno jej improwizować. To subtelna, ale ważna zmiana. W klasycznym dialogu gracz szuka pytania, które przewidział autor. W dialogu generowanym autor próbuje przewidzieć granice odpowiedzi, których jeszcze nie zna.

Jeśli ten kierunek się przyjmie, najbardziej interesujące w wirtualnych postaciach może być nie to, że będą mówiły więcej, lecz że naprawdę nie będziemy wiedzieć, co za chwilę powiedzą.

Na dokładkę

Źródła i dalsza lektura

Wybrane materiały, na których opiera się artykuł i które pozwalają wejść głębiej w temat.

  1. Meta Horizon OS Developers — „Meet the Newest GenAI Tools: Environment Generation and Embodied LLM NPCs” Meta Horizon OS Developers

    Oficjalny materiał pokazujący, jak Meta rozwija konwersacyjne, ucieleśnione NPC oparte na LLM w Horizon Worlds.

  2. Meta Horizon OS Developers — „Agents and Building Blocks” Dokumentacja AI Building Blocks

    Dokumentacja pokazująca praktyczne łączenie rozpoznawania mowy, LLM i syntezy mowy w aplikacjach XR na Quest.

  3. Leon O.H. Kroczek i in. — „The influence of persona and conversational task on social interactions with a LLM-controlled embodied conversational agent” Computers in Human Behavior, 2025

    Badanie pokazujące, że sposób „bycia” wirtualnej postaci wpływa na to, jak jest odbierana przez użytkowników.

  4. Sue Lim, Ralf Schmälzle, Gary Bente — „Artificial social influence via human-embodied AI agent interaction in immersive virtual reality (VR)” Computers in Human Behavior: Artificial Humans, 2025

    Badanie przydatne do zrozumienia, jak ucieleśnienie agenta w VR wpływa na poczucie jego obecności.

  5. Ziming Li, Huadong Zhang, Chao Peng, Roshan Peiris — „Exploring Large Language Model-Driven Agents for Environment-Aware Spatial Interactions and Conversations in Virtual Reality Role-Play Scenarios” IEEE VR, 2025

    Pokazuje kierunek, w którym rozmowa LLM łączy się z wiedzą o scenie i możliwością działania w wirtualnym świecie.

  6. Nima Zargham i in. — „Dialogs with GenAI NPCs: Exploring Player Interactions with Speech Agents in a VR Game” International Journal of Human–Computer Interaction, 2026

    Źródło eksperymentu „Office Whispers” i dobry obraz zarówno potencjału, jak i obecnych ograniczeń swobodnych rozmów z NPC.

  7. Mikko Korkiakoski i in. — „An Empirical Evaluation of AI-Powered Non-Player Characters' Perceived Realism and Performance in Virtual Reality Environments” Preprint, 2025

    Preprint zawierający pomiary opóźnień pełnego cyklu rozmowy z AI NPC w VR.

  8. Konstantin W. Kühlem, Jonathan Ehret, Torsten W. Kuhlen, Andrea Bönsch — „A Latency-Optimized LLM-based Multimodal Dialogue System for Embodied Conversational Agents in VR” ACM IVA ’25, 2025

    Praca pokazująca, jak streaming i inne optymalizacje mogą wyraźnie skrócić czas odpowiedzi w rozmowie z ucieleśnionym agentem VR.

WartaRiver

A jak wygląda rozmowa z wirtualnym światem dzisiaj?

W WartaRiver nie obiecujemy NPC, które powiedzą wszystko — za to możesz sprawdzić na własnej skórze, jak wiele zmienia samo wejście do wirtualnego świata i możliwość reagowania na niego inaczej niż przez ekran.

Zajrzyj do WartaRiver Sprawdź wizytę