Architektura full-duplex: OpenAI uczy sztuczną inteligencję naturalnego dialogu
8 lipca 2026 roku amerykańska firma OpenAI zaprezentowała nową generację modeli głosowych GPT-Live-1 oraz GPT-Live-1 mini, które zasilają funkcję ChatGPT Voice na platformach mobilnych i przeglądarkowych. Inżynierowie z San Francisco odeszli od dotychczasowych schematów komunikacji turowej na rzecz systemu, który przetwarza sygnał audio w sposób ciągły. W praktyce oznacza to, że algorytm nie czeka na zakończenie wypowiedzi użytkownika, lecz analizuje strumień danych wiele razy na sekundę, podejmując decyzje o słuchaniu, mówieniu lub przerwaniu własnej wypowiedzi w czasie rzeczywistym.
Kluczowym osiągnięciem technicznym jest wdrożenie architektury full-duplex, która eliminuje wady systemów kaskadowych. W starszych rozwiązaniach proces składał się z trzech oddzielnych etapów: zamiany mowy na tekst, przetworzenia go przez model językowy i ponownej syntezy na mowę. Taka struktura generowała zauważalne opóźnienia i powodowała utratę informacji zawartych w tonie głosu czy emocjach. GPT-Live operuje bezpośrednio na sygnale audio, co pozwala na naturalne reakcje, takie jak potakiwanie w trakcie słuchania oraz natychmiastowe reagowanie na wtrącenia. System ten wykorzystuje mechanizm delegacji zadań: podczas gdy model GPT-Live zarządza płynnością interakcji, bardziej złożone operacje logiczne, wyszukiwanie informacji w sieci czy zadania agentyczne są przekazywane w tle do potężniejszych jednostek obliczeniowych, takich jak model GPT-5.5.
W testach porównawczych użytkownicy preferują nowe modele ze względu na lepszą obsługę tzw. turn-taking, czyli naturalnego przejmowania głosu w rozmowie. GPT-Live-1 wykazuje również wyższą skuteczność w benchmarkach rozumowania naukowego (GPQA) oraz agentycznego wyszukiwania danych (BrowseComp). OpenAI zaimplementowało systemy zabezpieczeń działające w czasie rzeczywistym, które blokują próby podszywania się pod głosy konkretnych osób oraz monitorują treści pod kątem bezpieczeństwa, szczególnie w przypadku użytkowników nieletnich. Nowa technologia radzi sobie z ignorowaniem szumów otoczenia i potrafi odróżnić pauzy myślowe od zakończenia wypowiedzi, co dotychczas stanowiło barierę dla asystentów głosowych.
Wdrożenie modeli GPT-Live-1 dla subskrybentów planów Go, Plus i Pro oraz wersji mini dla użytkowników darmowych to etap przejściowy przed udostępnieniem technologii w formie interfejsu programistycznego API. Pozwoli to zewnętrznym deweloperom na tworzenie aplikacji do nauki języków obcych, interaktywnych systemów pomocy technicznej czy narzędzi wspierających osoby z niepełnosprawnościami, wymagających obsługi bez użycia rąk. Kolejnym krokiem w rozwoju ma być pełna integracja z wizualnymi kartami odpowiedzi, dostarczającymi dane o pogodzie czy notowaniach giełdowych w trakcie trwania konwersacji audio. Szybka adaptacja systemu przez ponad 150 milionów użytkowników tygodniowo wskazuje, że interakcja głosowa staje się dominującym sposobem wykorzystania sztucznej inteligencji w codziennych zadaniach.
Źródła: https://openai.com/index/introducing-gpt-live/, https://deploymentsafety.openai.com/gpt-live, https://openai.com/form/gpt-live-1-in-the-api/