Komentarz

Chronić ludzkie głosy i twarze. Komunikacja w epoce generatywnej AI

Twarz i głos od zawsze były znakiem konkretnej, niepowtarzalnej osoby. Generatywna sztuczna inteligencja potrafi dziś wiernie naśladować jedno i drugie – i to zmienia zasady gry w komunikacji.

Redakcja MAIOLA4 min czytania

Jeszcze kilka lat temu granica była oczywista: głos i twarz należały do konkretnego człowieka, a ich podrobienie wymagało dużego nakładu pracy i było łatwe do zdemaskowania. Dziś kilka sekund nagrania wystarczy, by wygenerować głos brzmiący identycznie jak głos realnej osoby, a jedno zdjęcie – by stworzyć przekonujący, poruszający się wizerunek twarzy, która nigdy nie wypowiedziała danych słów. To nie jest już science fiction, lecz codzienne narzędzie, dostępne w kilku kliknięciach – i coraz częściej temat, z którym redakcje i biura prasowe muszą się mierzyć wprost.

Symulowana bliskość

Sztuczna inteligencja potrafi dziś naśladować nie tylko treść wypowiedzi, ale też jej ton: troskę, empatię, przyjacielską uwagę. Bywa to pomocne – wystarczy wspomnieć narzędzia wspierające naukę czy towarzyszące w codziennych zadaniach. Problem zaczyna się wtedy, gdy naśladowanie ludzkiej rozmowy przestaje być rozpoznawalne jako naśladowanie. Największym ryzykiem nie jest to, że ktoś pomyli program komputerowy z drugim człowiekiem – ludzie zwykle wiedzą, z czym rozmawiają. Ryzykiem jest raczej stopniowe osłabienie potrzeby prawdziwej, wzajemnej relacji, gdy jej symulacja jest zawsze dostępna, zawsze cierpliwa i nigdy się nie sprzeciwia.

Deepfake i kradzież wizerunku

Ta sama technologia, która potrafi ożywić archiwalne nagranie w edukacyjnym filmie, potrafi też włożyć w usta prawdziwej osoby słowa, których nigdy nie wypowiedziała. Fałszywe nagrania wideo i audio – tak zwane deepfake – są dziś wykorzystywane do oszustw finansowych, wyłudzeń, fałszywych rekomendacji, a także do naruszania wizerunku konkretnych osób bez ich zgody. Skutki bywają bardzo konkretne: utracone pieniądze, nadszarpnięta reputacja, zafałszowany zapis tego, kto co powiedział. Twarz i głos, które od zawsze były podpisem osoby, przestają być niepodważalnym dowodem tego, że to naprawdę ona, która wypowiedziała dane słowa.

Algorytmy, które premiują emocje

Do tego dochodzi mechanizm, który z generatywną AI nie ma bezpośrednio nic wspólnego, ale działa z nią w parze: algorytmy mediów społecznościowych są zaprojektowane tak, by promować treści wywołujące szybkie, intensywne emocje – oburzenie, strach, poczucie zagrożenia. Fałszywy, poruszający materiał wideo ma w takim środowisku znacznie większą szansę na viralowy zasięg niż spokojne sprostowanie. W efekcie ten sam mechanizm, który miał ułatwiać komunikację między ludźmi, sprzyja polaryzacji i utrudnia wspólne trzymanie się faktów.

Prywatność jako pierwsza linia obrony

Głos i twarz to dziś także dane biometryczne – a więc jedne z najbardziej wrażliwych informacji, jakie o kimś istnieją. Nagranie głosu z rozmowy telefonicznej czy publicznie dostępne zdjęcie mogą wystarczyć jako materiał źródłowy do wygenerowania fałszywego nagrania. To zmienia sposób, w jaki warto myśleć o prywatności: nie chodzi już tylko o ochronę haseł czy danych finansowych, ale o świadome zarządzanie tym, gdzie i w jakiej jakości nasz głos oraz wizerunek są publicznie dostępne, oraz o realne prawo do tego, by domagać się usunięcia lub oznaczenia treści stworzonej bez naszej zgody.

Media i AI literacy jako nowa kompetencja

Krytyczne myślenie wobec obrazu i dźwięku było dotąd umiejętnością niszową – dziś staje się podstawową kompetencją obywatelską, obok czytania czy liczenia. Uczy się jej podobnie jak dawniej uczono odróżniać rzetelne źródło od plotki: pytaniem o pochodzenie materiału, sprawdzeniem, czy podają go też inne, niezależne źródła, oraz podstawową znajomością tego, jak działają narzędzia generatywne. Szkoły, redakcje i rodziny mają w tym do odegrania taką samą rolę, jaką kiedyś odgrywały w uczeniu czytania ze zrozumieniem – tyle że materiałem do uważnego czytania jest dziś także obraz i głos.

Co mogą zrobić redakcje i instytucje

Po stronie mediów i instytucji odpowiedzialność oznacza konkretne praktyki: jasne oznaczanie materiałów wygenerowanych lub zmodyfikowanych przez sztuczną inteligencję, dodatkową weryfikację nietypowych nagrań przed publikacją oraz szybkie i widoczne sprostowania, gdy fałszywy materiał zdąży się już rozejść. Redakcja, która sama konsekwentnie stosuje te zasady, ma też większe prawo, by oczekiwać ich od platform, twórców technologii i instytucji publicznych.

Twarz i głos pozostają jednym z ostatnich bezpośrednich znaków tego, że po drugiej stronie jest konkretny, niepowtarzalny człowiek. Żadna regulacja ani filtr nie zastąpią jednak podstawowej zasady: za każdą treścią, którą tworzymy i udostępniamy, stoi ludzka odpowiedzialność, której nie da się przenieść na algorytm. Ochrona tego znaku – prawna, technologiczna i kulturowa – to dziś jeden z podstawowych warunków tego, by komunikacja w epoce sztucznej inteligencji nadal służyła ludziom, a nie odwrotnie. To zdanie brzmi prosto, ale każda redakcja i każdy twórca treści podejmuje je na nowo za każdym razem, gdy publikuje kolejny materiał.