Architektura full-duplex: OpenAI uczy sztuczną inteligencję naturalnego dialogu

Architektura full-duplex: OpenAI uczy sztuczną inteligencję naturalnego dialogu
OpenAI wprowadza modele GPT-Live-1, które dzięki architekturze full-duplex umożliwiają płynną, dwustronną komunikację głosową w czasie rzeczywistym bez nienaturalnych opóźnień.

8 lipca 2026 roku amerykańska firma OpenAI zaprezentowała nową generację modeli głosowych GPT-Live-1 oraz GPT-Live-1 mini, które zasilają funkcję ChatGPT Voice na platformach mobilnych i przeglądarkowych. Inżynierowie z San Francisco odeszli od dotychczasowych schematów komunikacji turowej na rzecz systemu, który przetwarza sygnał audio w sposób ciągły. W praktyce oznacza to, że algorytm nie czeka na zakończenie wypowiedzi użytkownika, lecz analizuje strumień danych wiele razy na sekundę, podejmując decyzje o słuchaniu, mówieniu lub przerwaniu własnej wypowiedzi w czasie rzeczywistym.

Kluczowym osiągnięciem technicznym jest wdrożenie architektury full-duplex, która eliminuje wady systemów kaskadowych. W starszych rozwiązaniach proces składał się z trzech oddzielnych etapów: zamiany mowy na tekst, przetworzenia go przez model językowy i ponownej syntezy na mowę. Taka struktura generowała zauważalne opóźnienia i powodowała utratę informacji zawartych w tonie głosu czy emocjach. GPT-Live operuje bezpośrednio na sygnale audio, co pozwala na naturalne reakcje, takie jak potakiwanie w trakcie słuchania oraz natychmiastowe reagowanie na wtrącenia. System ten wykorzystuje mechanizm delegacji zadań: podczas gdy model GPT-Live zarządza płynnością interakcji, bardziej złożone operacje logiczne, wyszukiwanie informacji w sieci czy zadania agentyczne są przekazywane w tle do potężniejszych jednostek obliczeniowych, takich jak model GPT-5.5.

W testach porównawczych użytkownicy preferują nowe modele ze względu na lepszą obsługę tzw. turn-taking, czyli naturalnego przejmowania głosu w rozmowie. GPT-Live-1 wykazuje również wyższą skuteczność w benchmarkach rozumowania naukowego (GPQA) oraz agentycznego wyszukiwania danych (BrowseComp). OpenAI zaimplementowało systemy zabezpieczeń działające w czasie rzeczywistym, które blokują próby podszywania się pod głosy konkretnych osób oraz monitorują treści pod kątem bezpieczeństwa, szczególnie w przypadku użytkowników nieletnich. Nowa technologia radzi sobie z ignorowaniem szumów otoczenia i potrafi odróżnić pauzy myślowe od zakończenia wypowiedzi, co dotychczas stanowiło barierę dla asystentów głosowych.

Wdrożenie modeli GPT-Live-1 dla subskrybentów planów Go, Plus i Pro oraz wersji mini dla użytkowników darmowych to etap przejściowy przed udostępnieniem technologii w formie interfejsu programistycznego API. Pozwoli to zewnętrznym deweloperom na tworzenie aplikacji do nauki języków obcych, interaktywnych systemów pomocy technicznej czy narzędzi wspierających osoby z niepełnosprawnościami, wymagających obsługi bez użycia rąk. Kolejnym krokiem w rozwoju ma być pełna integracja z wizualnymi kartami odpowiedzi, dostarczającymi dane o pogodzie czy notowaniach giełdowych w trakcie trwania konwersacji audio. Szybka adaptacja systemu przez ponad 150 milionów użytkowników tygodniowo wskazuje, że interakcja głosowa staje się dominującym sposobem wykorzystania sztucznej inteligencji w codziennych zadaniach.

Źródła: https://openai.com/index/introducing-gpt-live/, https://deploymentsafety.openai.com/gpt-live, https://openai.com/form/gpt-live-1-in-the-api/