ChatGPT is altijd snel geweest. Het is goed in het verwerken van tekst op machinesnelheid. Maar er was een knelpunt. Een wrijvingspunt. Steminvoer volgde vroeger een strak ritme: jij sprak. De AI stopte. De AI luisterde. De AI heeft berekend. De AI sprak terug. Het was een tenniswedstrijd met een ongelijke tegenstander die de bal nodig had om de muur te raken voordat ze naar de volgende plek op het veld konden kijken.

Niet meer.

OpenAI heeft twee nieuwe stemarchitecturen uitgerold: GPT-Live-1 en de lichtere GPT-Live-1 mini. Deze zijn nu live voor iedereen. Gratis gebruikers inbegrepen. Abonnees ook. Het is een fundamentele verandering in de manier waarop het model tijd waarneemt. Of tenminste, hoe het erover denkt.

Architectuur voor gelijktijdig luisteren en spreken

De headline-functie is niet alleen een betere stemsynthese. Hoewel die ook verbeterd zijn. Ze zijn soepeler en spraakzamer. Atty Eleti, hoofd van het stemproduct van ChatGPT, vertelde verslaggevers dat de audio nu de cadans van menselijke spraak nabootst. Je krijgt de vulstoffen. De “eh” en “likes” duiden eerder op denktijd dan op verwarring.

De echte motor onder de motorkap is wat OpenAI continue interactie noemt.

Dit raamwerk ontmantelt de turn-based beperking. De AI verwerkt nu binnenkomende audiogegevens terwijl deze uitvoer genereert. Het kan in één adem ‘luisteren’ en ‘praten’. Dit lost de meest vervelende latentie in digitale assistenten op: het dode luchtgat tussen het afmaken van een zin en het moment waarop de bot begint te reageren.

“Dit is precies hoe mensen met elkaar omgaan. We houden het gesprek gaande terwijl we op de achtergrond nadenken.” – Atty Eleti

Je wacht niet meer op stilte. Je kunt onderbreken. De vertraging wordt geminimaliseerd en niet geëlimineerd. De AI vangt uw nieuwe draad op, zelfs terwijl een clausule wordt afgerond.

Realtime vertaling zonder pauze

Deze architectuur verandert de bruikbaarheid van live vertaling. Vroeger moest je je hele zin in het Engels zeggen, op een pauzeknop drukken, wachten en dan de Spaanse vertaling horen. Het doodde de stroom van internationale gesprekken.

Nu? Je kunt Engels spreken. ChatGPT luistert terwijl u spreekt. Het vertaalt en spreekt de Spaanse versie vrijwel onmiddellijk. De vertraging wordt ingekort tot het absolute mechanische minimum. Dit geldt ook voor andere talen: Hindi en meer. Het continue interactie -model verwerkt de stroom. Je stopt niet en begint. Jij praat gewoon.

Het werkt als volgt:

  • Invoer: Gebruiker spreekt in de brontaal.
  • Verwerking: Model analyseert de audiostream in realtime.
  • Uitvoer: AI genereert onmiddellijk audio in de doeltaal.
  • Lus: Gaat door zolang de gebruiker praat.

Voor reizigers of iedereen die belt, voelt dit minder als het gebruik van software. Het voelt minder onhandig aan.

Zwaar nadenken delegeren zonder plaats te verliezen

Er zijn verborgen kosten verbonden aan het tegelijkertijd ‘hardop denken’ en praten. Je raakt de draad kwijt. Of uw gesprekspartner verveelt zich.

GPT-Live gebruikt voor deze zware momenten een nieuw delegatiesysteem. Als een gebruiker een complexe vraag stelt – iets dat diepgaand onderzoek of redeneren in meerdere stappen vereist – kan het model die verwerking ontlasten. Het houdt niet op met praten. Het is niet stil als hij tien seconden lang in de leegte van zijn neurale netwerken staart.

Kundan Kumar, onderzoeksleider, legt uit dat GPT-Live de harde logische taken naar sterkere back-endmodellen kan sturen. Hij merkt in het bijzonder op dat het kan worden gedelegeerd aan modellen met een hoger redeneervermogen. Deze werken parallel. Ondertussen onderhoudt de spraakinterface de chat. Het vult het gat met natuurlijke opvulgeluiden of bevestigt dat je nog steeds luistert. Wanneer het complexe antwoord klaar is, wordt het naadloos (ja, dat zegt de marketingtekst) in het gesproken antwoord verweven.

“Als GPT-Live moet nadenken, delegeert het… zodat GPT-Live in gesprek blijft met de gebruiker.”

De beste antwoorden worden echter niet altijd hardop uitgesproken. Als het antwoord een weersvoorspelling, een sportuitslag of een grafiek is, kan het model van modus wisselen. In plaats daarvan worden afbeeldingen weergegeven. Waarom de gebruiker vervelen met “de temperatuur is tweeënzeventig graden” als hij hem de bewolkingsoverlay kan laten zien? Het bepaalt het medium op basis van de gegevens.

Beschikbaarheid, privacy en controle

Deze modellen worden nu gedistribueerd. Komende donderdag niet. Niet met een teaser-e-mail. Ze zijn er al. Mobiele apps bijgewerkt. Webinterfaces vernieuwd.

Als je de optie niet ziet, geef het dan een dag de tijd. Twee dagen hooguit. De uitrol vindt niet onmiddellijk wereldwijd plaats, ook al beweren ze dat deze breed is. En voor de goede orde: deze release staat los van de verwachte GPT-5.6 -drop later deze week. Verwar de stemlaag niet met de basisintelligentie-updates, hoewel ze waarschijnlijk back-endcomponenten delen.

Spraakgegevens en training afmelden

OpenAI gaat hier anders om met de privacykant van de medaille. Bij gebruik van de spraakmodus worden gebruikers automatisch afgemeld voor trainingsgegevens. Je stem wordt niet gebruikt om de volgende iteratie aan te leren.

Audiofragmenten worden 30 dagen bewaard. Dit biedt context voor uw huidige gesprekssessie. Als je de bot na tien minuten laat vallen om nog een gedachte af te ronden en hem later op de avond weer oppakt, weet hij wie je bent. Of beter gezegd, waar je het over had. Deze buffers van 30 dagen kunnen worden verwijderd. Gebruikers kunnen hun audiogeschiedenis wissen als het digitale oor hen nerveus maakt.

De assistent ondersteunt nu ook een speciale luistermodus. Activeer het op zijn naam. Het wacht. Het luistert. Het blijft in een actieve luisterstatus totdat het handmatig wordt uitgeschakeld. Hij slaapt niet op commando. Dat onderscheid is van belang als je twintig minuten privé je hart moet luchten en een niet-oordelende, voortdurend actieve ontvanger nodig hebt.

Is het eigenlijk al natuurlijk?

Misschien merk je de pauzes op. Ze zijn niet zo perfect als de aarzeling van een echt persoon, die vaak wordt veroorzaakt door