Google znów przesuwa granice tego, jak „ludzki” może być kontakt z AI. Najnowsza wersja Gemini Live, oznaczona jako 3.8, wprowadza awatary, które mają sprawić, że rozmowa z botem będzie przypominała kontakt z prawdziwą osobą. Brzmi to jak kolejny krok w stronę bardziej naturalnych asystentów, ale jednocześnie trudno nie odnieść wrażenia, że Google mocno flirtuje z czymś lekko niepokojącym.
Awatary zamiast samego głosu
Do tej pory asystenci głosowi opierali się głównie na dźwięku. Teraz Google dorzuca do tego warstwę wizualną, dzięki czemu użytkownik widzi wybrany model postaci, który „mówi” w rytmie generowanego przez AI tekstu. Sam mechanizm opiera się na połączeniu odpowiedzi w czasie rzeczywistym z niskolatencyjnym generowaniem wideo.
W praktyce wygląda to tak, jakby awatar poruszał ustami i mimiką w idealnym tempie do wypowiedzi Gemini. Według twórców rozwiązania ma to nadać sztucznej inteligencji bardziej wyrazistą, wizualną obecność. Innymi słowy: bot ma stać się trochę mniej botem.
Dla biznesu, nie dla zabawy
Nowe awatary nie są kierowane przede wszystkim do zwykłych użytkowników. Google pozycjonuje je jako narzędzie dla klientów biznesowych, którzy chcą tworzyć bardziej angażujące doświadczenia dla swoich odbiorców. Firma widzi dla nich zastosowanie między innymi w obsłudze klienta, recepcjach, szkoleniach czy różnego rodzaju cyfrowych punktach kontaktu.
Na starcie przedsiębiorstwa otrzymają dostęp do gotowej biblioteki awatarów. Mogą jednak pójść krok dalej i przygotować własne wersje dopasowane do identyfikacji marki, na przykład z logo umieszczonym na uniformie postaci. To wyraźny sygnał, że Google chce, by AI nie tylko odpowiadała na pytania, ale też „reprezentowała” firmę w bardziej spersonalizowany sposób.
To ciekawy kierunek, ale też taki, który łatwo może wymknąć się spod kontroli. Im bardziej AI udaje człowieka, tym większe ryzyko, że użytkownik zacznie przypisywać jej intencje i emocje, których tak naprawdę nie ma. Z drugiej strony właśnie ta pozorna „ludzkość” może sprawić, że wielu klientów poczuje się zwyczajnie wygodniej.
Zobacz też: Google Maps wprowadza przydatną aktualizację dla interfejsu Android Auto – oszczędzaj baterię podczas nawigacji.
Technologia, która ma udawać człowieka
Cały pomysł opiera się na zwiększeniu poczucia kontaktu z czymś żywym i obecnym. Z perspektywy klienta ma to sprawiać wrażenie bardziej naturalnej rozmowy niż zwykły czat czy suchy głos syntezatora. Z perspektywy firm może to być sposób na ocieplenie cyfrowej obsługi bez konieczności angażowania prawdziwych pracowników do każdej prostej interakcji.
Jednocześnie taki kierunek budzi pytania o granicę między użytecznością a próbą zbyt mocnego antropomorfizowania AI. Im bardziej system przypomina człowieka, tym łatwiej o zaufanie, ale też o mylne wrażenie, że po drugiej stronie naprawdę ktoś „jest”. I właśnie ten efekt może być dla części osób bardziej niepokojący niż imponujący.
Bezpieczeństwo i oznaczanie treści AI
Google podkreśla, że materiały generowane przez awatary są oznaczane za pomocą SynthID. To niewidoczny znak wodny osadzany w audio i wideo, który ma pomagać w wykrywaniu treści wygenerowanych przez sztuczną inteligencję. W teorii ma to ograniczyć ryzyko dezinformacji i błędnego przypisywania takich materiałów prawdziwym osobom.
To ważny element całej układanki, bo wraz z rosnącym realizmem treści AI rośnie też potrzeba ich identyfikacji. Jeśli bot zaczyna wyglądać i zachowywać się coraz bardziej „po ludzku”, zabezpieczenia tego typu stają się nie dodatkiem, ale koniecznością. W przeciwnym razie granica między symulacją a rzeczywistością może się szybko rozmyć.
Gemini coraz lepsze w rozmowach wielojęzycznych
Przy okazji Google ujawnił też inne usprawnienia w Gemini 3.8 Live. Model obsługuje teraz 97 języków i potrafi automatycznie przełączać się między nimi, co ma ułatwiać rozmowy prowadzone w środowiskach wielojęzycznych. To szczególnie istotne dla firm działających globalnie, gdzie użytkownicy często przechodzą z jednego języka na drugi w trakcie jednej interakcji.
Firma pochwaliła się również mocniejszą wersją modelu, określaną jako 3.8 Live Extended Thinking. W testach miała ona wypadać lepiej niż konkurencyjne rozwiązania, a przy tym być tańsza w utrzymaniu pod względem kosztu przetwarzania audio. Dla biznesu to kombinacja szczególnie atrakcyjna: lepsze wyniki i niższe koszty operacyjne.
Co to oznacza dla przyszłości obsługi klienta?
Wprowadzenie awatarów do Gemini Live pokazuje, że AI przestaje być tylko narzędziem do generowania tekstu lub odpowiadania głosem. Coraz częściej staje się pełnoprawnym „interfejsem kontaktu” między firmą a użytkownikiem. A jeśli to podejście się przyjmie, możemy wejść w etap, w którym cyfrowa obsługa będzie projektowana niemal jak obsada postaci w grze albo filmie.
Z biznesowego punktu widzenia to logiczny krok. Z perspektywy użytkownika może być zarówno wygodny, jak i dziwnie sztuczny. Bo choć celem jest uczynić boty bardziej ludzkimi, efekt końcowy może wywołać dokładnie odwrotne uczucie: wrażenie, że technologia nauczyła się zbyt dobrze naśladować człowieka.


Fajnie, że Google się rozwija, ale coraz bardziej czuję się niepewnie wobec tego, jak lifelike te boty się stają. Z jednej strony to może być cool, ale z drugiej… kto wie, co z tego wyniknie? Na pewno sporo firm to wykorzysta, ale osobiście czuję, że to zaczyna być na granicy absurdu.
Właściwie to nie widzę sensu w tym nowym systemie, jeśli nie będzie odpowiednich zabezpieczeń. Jestem sceptyczny co do oznaczania treści AI – to nic nie zmieni, jeśli ludzie i tak nie sprawdzą, z kim rozmawiają. Już teraz na rynku jest mnóstwo informacji, które wprowadzają w błąd, więc nie potrafię sobie wyobrazić, jak to będzie wyglądać z tymi awatarami.
Ciekawi mnie, jak to działa w praktyce. Testował już ktoś? Nie bardzo widzę, jak mogłoby to zadziałać w szkole czy na uczelni. Chciałbym usłyszeć opinie osób, które pracują w sektorze, czy to faktycznie coś zmienia, czy to bardziej marketingowy chwyt.
Tak właściwie to nie rozumiem, gdzie ta cały hype ma sens. To tylko kolejny sposób na „zmiany”, które tak naprawdę nic nie zmieniają. W branży IT tyle razy widziałem fikuśne rozwiązania, które okazały się kompletnym niewypałem. Nie podejrzewam, że te awatary będą czymś więcej niż tylko zabawką dla marketingowców.
Fajnie, że Gemini 3.8 obsługuje tyle języków, ale co z tego, jeśli sam system potrafi się tylko „udawać” człowieka? Nie oszukujmy się, wciąż to AI i dialogi będą miał wiele luk. Ciekawe to niby rozwiązanie, ale obawiam się, że w praktyce będzie to wyglądać inaczej.