ChatGPT byl vždy rychlý. Skvěle zpracovává text rychlostí stroje, ale bývalo zde úzké hrdlo – bariéra, která způsobovala tření. Hlasový vstup se řídil pevným rytmem: mluvili jste, AI se zastavila, poslouchala, počítala a poté odpověděla. Bylo to jako tenisový zápas, ve kterém byl jeden hráč výrazně slabší a musel čekat, až míček narazí na zeď, než si vybere další místo na hřišti.
To už neplatí.
OpenAI vydala dvě nové hlasové architektury: GPT-Live-1 a odlehčenou verzi GPT-Live-1 mini. Tyto modely jsou již dostupné všem. Bezplatní uživatelé také. Tím spíše pro předplatitele. Dochází k zásadnímu posunu v tom, jak model vnímá čas, nebo alespoň v tom, jak o něm přemýšlí.
Architektura pro simultánní poslech a mluvení
Hlavní inovací není jen vylepšená syntéza řeči (i když se skutečně zlepšila). Řeč nyní zní plynuleji a přirozeněji pro konverzaci. Atty Eleti, vedoucí hlasových produktů ChatGPT, řekl novinářům, že zvuk nyní napodobuje rytmus lidské řeči. Objevily se výplně řeči – takové „um“ a „uh“, které signalizují čas na reflexi spíše než zmatek.
Skutečným motorem pod kapotou je to, co OpenAI nazývá nepřetržitá interakce.
Tento rámec eliminuje omezení střídavých zatáček. AI nyní zpracovává příchozí audio stream současně a generuje odpověď. Dokáže „naslouchat“ a „mluvit“ zároveň. To řeší nejnepříjemnější problém s latencí v digitálních asistentech – prázdnou pauzu mezi koncem vaší fráze a začátkem odpovědi robota.
“Přesně tak lidé interagují. Pokračujeme v rozhovoru, zatímco myšlenky jsou zpracovávány na pozadí.” — Atty Eletti
Už nemusíte čekat na ticho. Můžete přerušit. Latence je minimalizována, i když ne zcela eliminována. AI zachytí vaši novou myšlenku, i když dokončí předchozí větu.
Překlad v reálném čase bez pauz
Tato architektura mění případy použití pro živý překlad. Dříve jste museli mluvit celou větu v angličtině, stisknout pauzu, počkat a pak si poslechnout překlad ve španělštině. To zabilo přirozený tok mezinárodní konverzace.
Teď? Můžete mluvit anglicky. ChatGPT vás poslouchá, když mluvíte. Španělskou verzi překládá a vyslovuje téměř okamžitě. Latence je snížena na minimální mechanický limit. Totéž platí pro další jazyky: hindštinu a mnoho dalších. Model nepřetržité interakce zpracovává tok. Nezastavíš a nezačneš znovu. Jen mluvíš.
Funguje to takto:
- Vstup: Uživatel mluví původním jazykem.
- Zpracování: Model analyzuje audio stream v reálném čase.
- Závěr: AI okamžitě generuje zvuk v cílovém jazyce.
- Smyčka: Proces pokračuje, dokud uživatel mluví.
Cestovatelům nebo příjemcům hovorů to připadá méně jako používání softwaru a je to méně těžkopádné.
delegování složitých myšlenkových procesů bez ztráty vlákna konverzace
Přemýšlení nahlas současně s mluvením má skrytou cenu. Ztratíte nit příběhu nebo se váš partner začne nudit.
GPT-Live používá nový systém delegování pro výpočetně náročné úlohy. Pokud uživatel položí složitou otázku – něco, co vyžaduje hluboké hledání nebo vícekrokové vyvozování – model může tyto výpočty posunout. Nepřestává mluvit. Nepřestane přemýšlet ani deset sekund a zírá do propasti svých neuronových sítí.
Kundan Kumar, ředitel výzkumu, vysvětluje, že GPT-Live dokáže přenést složité logické úlohy na výkonnější backendové modely. Zejména si všímá možnosti delegování na modely s vyššími schopnostmi uvažování. Pracují paralelně. Hlasové rozhraní mezitím udržuje konverzaci v chodu. Pauzu vyplňuje přirozenými výplňovými zvuky nebo dává najevo, že stále poslouchá. Jakmile je komplexní odpověď připravena, bezproblémově (ano, to říká marketingová kopie) ji vetkává do verbální odpovědi.
“Když GPT-Live potřebuje přemýšlet, deleguje úkol… takže GPT-Live zůstává v dialogu s uživatelem.”
Nejlepší odpovědi však nemusí být vždy vysloveny nahlas. Pokud je odpovědí předpověď počasí, sportovní skóre nebo graf, model může přepínat režimy. Místo toho zobrazí grafiku. Proč nudit uživatele „teplotou sedmdesát dva stupňů“, když mu můžete ukázat oblačnost? Model vybere formát na základě dat.
Dostupnost, soukromí a kontrola
Tyto modely jsou již k dispozici. Ne ve čtvrtek. Žádné upoutávky. Už jsou tady. Byly aktualizovány aplikace pro mobilní zařízení. Webová rozhraní aktualizována.
Pokud tuto možnost nevidíte, počkejte den. Maximálně dva. Zavedení není na celém světě okamžité, i když tvrdí, že pokrytí je nejširší. A pro každý případ: toto vydání je oddělené od očekávaného vydání GPT-5.6 koncem tohoto týdne. Nepleťte si hlasovou vrstvu s aktualizacemi základní inteligence, i když pravděpodobně sdílejí společné backendové komponenty.
Zřeknutí se ochrany soukromí a školení
OpenAI zde zaujímá jiný přístup k otázkám ochrany osobních údajů. Použití hlasového režimu automaticky odebere uživatele z tréninkových dat. Váš hlas neslouží k trénování další iterace modelu.
Zvukové klipy jsou uloženy po dobu 30 dnů. To poskytuje kontext pro vaši aktuální konverzační relaci. Pokud robota na deset minut přerušíte, abyste dokončili další myšlenku a vrátíte se k ní později v noci, bude vědět, kdo jste. Nebo přesněji, o čem jste mluvil. Tyto 30denní pufry lze odstranit. Uživatelé mohou vymazat svou zvukovou historii, pokud je digitální ucho znepokojuje.
Asistent nyní také podporuje vyhrazený režim poslechu. Aktivujte jej podle jména. Čeká. Poslouchá. Zůstává v aktivním poslechovém stavu, dokud není ručně vypnut. Na povel „neusne“. To je důležitý rozdíl, pokud potřebujete mluvit dvacet minut o samotě a potřebujete nesoudného, vždy aktivního partnera.
Je to opravdu přirozené?
Můžete zaznamenat pauzy. Nejsou tak ideální jako přirozená fluktuace skutečného člověka, která je často diktována
























