Co se stalo
Google DeepMind oznámil funkci Live Avatar jako součást modelu Gemini 3.8 Live. Funkce kombinuje hlasový dialog s generováním videa téměř v reálném čase — výsledkem je animovaná postava, která reaguje na to, co slyší i vidí, synchronizuje pohyby rtů a přizpůsobuje mimiku. Gemini 3.8 Live with Live Avatar je od dnešního dne dostupný v plánu Gemini Enterprise.
Systém zvládá asynchronní volání nástrojů: avatar může na pozadí načítat data nebo spouštět procesy, zatímco konverzace pokračuje bez přerušení. Příkladem je odbavení hosta v hotelu — agent zároveň mluví se zákazníkem a v pozadí kontroluje rezervaci.
Vizuální identitu lze přizpůsobit. Firmy si mohou vybrat z knihovny předpřipravených postav nebo nechat vygenerovat vlastní avatar z referenčního obrázku. Vlastní avatary jsou zatím dostupné pouze vybraným podnikovým zákazníkům přes allowlisting. Veškerý výstup — audio i video — je vodoznačen technologií SynthID, která označení vloží přímo do obsahu.
Proč je to důležité
Funkce míří na firmy, které provozují zákaznický servis, virtuální asistenty nebo interaktivní průvodce — typicky call centra, e-commerce nebo cestovní ruch. Vizuální přítomnost agenta může zvýšit důvěryhodnost a srozumitelnost komunikace tam, kde dosud stačil jen hlas nebo chat.
Klíčové je omezení: Live Avatar je dostupný výhradně v Gemini Enterprise, vlastní avatary pak jen pro předem schválené zákazníky. Firmy, které zvažují nasazení konverzačních agentů, by měly sledovat cenové podmínky a dostupnost API — dokumentace je již veřejná.
Podpora 97 jazyků s plynulým přechodem během jednoho hovoru je zajímavá pro mezinárodní nasazení, ale reálnou kvalitu překladu a synchronizace bude třeba otestovat v praxi.