Transcrição em tempo real com a API Gemini Live

A API Gemini Live oferece suporte à transcrição de fala em texto em tempo real e com baixa latência usando o modelo gemini-3.5-transcribe-live. Ao se conectar à API Live por WebSockets ou usar o SDK de IA generativa do Google, você pode transmitir entrada de áudio contínua e receber transcrições de texto incrementais em tempo real à medida que a fala ocorre.

Ao aproveitar a API Gemini Live, plataformas de desenvolvedores como Agora, Fishjam, LiveKit, Pipecat, Vercel e Vision Agents permitem que os desenvolvedores criem e implantem interfaces de alta performance controladas por voz com facilidade. Essas plataformas gerenciam uma infraestrutura complexa de streaming de mídia em tempo real nos bastidores, permitindo que os desenvolvedores se concentrem totalmente na criação da experiência do usuário.

Atendente x transcrição instantânea

Embora ambos usem a conexão de streaming bidirecional da API Live, a Transcrição instantânea funciona como um pipeline de reconhecimento de fala dedicado e de baixa latência, em vez de um agente de conversa.

Recurso Agente em tempo real Transcrição em tempo real
Função principal Assistente de conversa que ouve, raciocina e responde. Pipeline de voz em texto em tempo real que transcreve o áudio recebido.
Modalidade de resposta Áudio falado e texto (response_modalities=["AUDIO"]). Transcrição de texto por streaming (response_modalities=["TEXT"]).
Estilo de interação Diálogo por turnos com detecção de pausas e interrupções. Processamento contínuo de streams enquanto o falante fala.
Recursos compatíveis Chamada de função, Pesquisa Google, instruções do sistema. Preferência de fala (custom_vocabulary), detecção de idioma, VAD manual e híbrido, transcrição inteligente.
Fluxo de entrada Multimodal: áudio, vídeo, imagens, texto. Entrada de áudio (PCM bruto de 16 bits).

Primeiros passos

Os exemplos a seguir mostram como abrir uma sessão de streaming bidirecional com gemini-3.5-transcribe-live e receber transcrições em tempo real.

Python

import asyncio
from google import genai
from google.genai import types

client = genai.Client()
model = "gemini-3.5-transcribe-live"

config = types.LiveConnectConfig(
    response_modalities=