ChatGPT zawsze był szybki. Świetnie radzi sobie z przetwarzaniem tekstu z szybkością maszyny, ale kiedyś występowało wąskie gardło – bariera powodująca tarcie. Wprowadzanie głosu przebiegało według sztywnego rytmu: ty mówiłeś, sztuczna inteligencja robiła pauzę, słuchała, obliczała, a następnie odpowiedziała. To było jak mecz tenisowy, w którym jeden z zawodników był znacznie słabszy i musiał poczekać, aż piłka uderzy w ścianę, zanim wybrał kolejne miejsce na korcie.

To już nie jest prawdą.

OpenAI wypuściło dwie nowe architektury głosowe: GPT-Live-1 i lżejszą wersję GPT-Live-1 mini. Te modele są już dostępne dla każdego. Bezpłatni użytkownicy też. Tym bardziej dla abonentów. Następuje zasadnicza zmiana w sposobie, w jaki model postrzega czas, a przynajmniej w tym, jak myśli o nim.

Architektura do jednoczesnego słuchania i mówienia

Główną innowacją jest nie tylko ulepszona synteza mowy (choć rzeczywiście uległa poprawie). Mowa brzmi teraz płynniej i bardziej naturalnie podczas rozmowy. Atty Eleti, kierownik ds. produktów głosowych w ChatGPT, powiedział reporterom, że dźwięk naśladuje teraz rytm ludzkiej mowy. Pojawiły się wypełniacze mowy – te „um” i „uh”, które sygnalizują czas na refleksję, a nie zamieszanie.

Prawdziwy silnik pod maską to to, co OpenAI nazywa ciągłą interakcją.

Ramy te eliminują ograniczenia naprzemiennych zwojów. Sztuczna inteligencja przetwarza teraz przychodzący strumień audio jednocześnie generuje odpowiedź. Potrafi jednocześnie „słuchać” i „mówić”. To rozwiązuje najbardziej irytujący problem opóźnień w cyfrowych asystentach — pustą pauzę między końcem frazy a początkiem odpowiedzi bota.

“Dokładnie tak ludzie wchodzą w interakcje. Kontynuujemy rozmowę, podczas gdy w tle przetwarzane są myśli. ” — Atty Eletti

Nie musisz już czekać na ciszę. Możesz przerwać. Opóźnienie jest zminimalizowane, choć nie całkowicie wyeliminowane. Sztuczna inteligencja wychwytuje Twoją nową myśl, nawet gdy kończy poprzednie zdanie.

Tłumaczenie w czasie rzeczywistym, bez przerw

Ta architektura zmienia przypadki użycia tłumaczenia na żywo. Wcześniej trzeba było wypowiedzieć całe zdanie po angielsku, nacisnąć pauzę, poczekać, a następnie usłyszeć tłumaczenie na język hiszpański. To zabiło naturalny bieg rozmów międzynarodowych.

Teraz? Potrafisz mówić po angielsku. ChatGPT słucha Cię, gdy mówisz. Niemal natychmiast tłumaczy i wymawia wersję hiszpańską. Opóźnienie jest zmniejszone do minimalnego limitu mechanicznego. To samo dotyczy innych języków: hindi i wielu innych. Model ciągłej interakcji obsługuje przepływ. Nie możesz się zatrzymać i zacząć od nowa. Po prostu rozmawiasz.

Działa to w ten sposób:

  • Wejście: Użytkownik mówi w oryginalnym języku.
  • Przetwarzanie: model analizuje strumień audio w czasie rzeczywistym.
  • Wniosek: AI natychmiast generuje dźwięk w języku docelowym.
  • Pętla: Proces trwa tak długo, jak użytkownik mówi.

Dla podróżujących lub osób odbierających połączenia nie przypomina to korzystania z oprogramowania i jest mniej uciążliwy.

delegowanie skomplikowanych procesów myślowych bez utraty wątku rozmowy

Myślenie na głos i jednoczesne mówienie ma ukryty koszt. Gubisz wątek opowieści lub Twój rozmówca się nudzi.

GPT-Live wykorzystuje nowy system delegowania zadań wymagających dużej mocy obliczeniowej. Jeśli użytkownik zadaje złożone pytanie — coś, co wymaga głębokich poszukiwań lub wieloetapowego wnioskowania — model może zmienić te obliczenia. Ona nie przestaje mówić. Nie przestaje myśleć przez dziesięć sekund, wpatrując się w otchłań swoich sieci neuronowych.

Kundan Kumar, dyrektor ds. badań, wyjaśnia, że ​​GPT-Live może przenieść złożone zadania logiczne na wydajniejsze modele zaplecza. W szczególności zwraca uwagę na możliwość delegowania do modeli o większych możliwościach rozumowania. Działają równolegle. Tymczasem interfejs głosowy podtrzymuje rozmowę. Wypełnia pauzę naturalnymi dźwiękami wypełniającymi lub pokazuje, że wciąż słucha. Gdy złożona odpowiedź jest już gotowa, płynnie (tak, tak mówi tekst marketingowy) wplata ją w odpowiedź werbalną.

„Kiedy GPT-Live musi pomyśleć, deleguje zadanie… więc GPT-Live pozostaje w dialogu z użytkownikiem.”

Jednak najlepsze odpowiedzi nie zawsze muszą być wypowiadane na głos. Jeśli odpowiedzią jest prognoza pogody, wynik sportowy lub wykres, model może przełączać tryby. Zamiast tego wyświetli grafikę. Po co nudzić użytkownika „temperaturą siedemdziesięciu dwóch stopni”, skoro można mu pokazać pokrywę chmur? Model wybiera format na podstawie danych.

Dostępność, prywatność i kontrola

Te modele są już dostępne. Nie w czwartek. Żadnych listów zwiastunowych. Już tu są. Zaktualizowano aplikacje na urządzenia mobilne. Odświeżone interfejsy internetowe.

Jeśli nie widzisz tej opcji, poczekaj dzień. Maksymalnie dwa. Wdrożenie nie jest natychmiastowe na całym świecie, nawet jeśli twierdzą, że zasięg jest najszerszy. I na wszelki wypadek: ta wersja jest odrębna od oczekiwanej wersji GPT-5.6, która pojawi się jeszcze w tym tygodniu. Nie myl warstwy głosowej z aktualizacjami podstawowych informacji wywiadowczych, chociaż prawdopodobnie mają one wspólne komponenty zaplecza.

Zrzeczenie się prywatności głosu i szkoleń

OpenAI przyjmuje tutaj inne podejście do kwestii prywatności. Korzystanie z trybu głosowego automatycznie usuwa użytkowników z danych treningowych. Twój głos nie jest używany do uczenia kolejnej iteracji modelu.

Klipy audio są przechowywane przez 30 dni. Zapewnia to kontekst dla bieżącej sesji konwersacyjnej. Jeśli przerwiesz botowi na dziesięć minut, aby dokończył inną myśl i wrócisz do niej później w nocy, będzie wiedział, kim jesteś. A dokładniej o czym mówiłeś. Te 30-dniowe bufory można usunąć. Użytkownicy mogą usunąć swoją historię audio, jeśli przeszkadza im cyfrowe ucho.

Asystent obsługuje teraz także dedykowany tryb odsłuchu. Aktywuj go po nazwie. On czeka. Słucha. Pozostaje w stanie aktywnego słuchania, dopóki nie zostanie ręcznie wyłączony. Nie zasypia na komendę. To istotna różnica, jeśli potrzebujesz porozmawiać dwadzieścia minut sam na sam i potrzebujesz nieoceniającego, zawsze aktywnego rozmówcy.

Czy to naprawdę naturalne?

Możesz zauważyć przerwy. Nie są one tak idealne, jak naturalna fluktuacja prawdziwej osoby, która jest często podyktowana