IA

Synthesia cria primeiro clone digital interativo voltado ao jornalismo

Startup avaliada em US$ 4 bilhões testa avatares interativos com IA para imprensa, demonstrando avanços e limites da tecnologia.

Compartilhar
Estúdio de gravação audiovisual com equipamentos de captura para criação de avatares digitais.
Estúdio de gravação audiovisual com equipamentos de captura para criação de avatares digitais.

A Synthesia, startup de avatares digitais avaliada em US$ 4 bilhões, desenvolveu pela primeira vez um clone interativo voltado a uma jornalista profissional. O projeto foi conduzido nos novos escritórios da empresa em Nova York com a repórter Dominic-Madori Davis, do veículo TechCrunch, poucas semanas após o chefe de relações corporativas da startup, Alexandru Voica, estrear seu próprio avatar virtual para responder a dúvidas rotineiras da imprensa sobre o funcionamento da ferramenta.

Estúdio de gravação audiovisual com equipamentos de captura para criação de avatares digitais.
Foto: TechCrunch AI

Com sede original no Reino Unido, a Synthesia ultrapassou a marca de US$ 100 milhões em receita recorrente anual (ARR) no ano passado e disputa a liderança de mercado com concorrentes diretos como D-ID, HeyGen e Colossyan. A expansão física para Nova York consolidou uma nova fase comercial da empresa, focada na distribuição de ferramentas corporativas de treinamento e agentes virtuais capazes de conduzir diálogos em tempo real.

A arquitetura dos avatares interativos

O ecossistema técnico desenvolvido pela Synthesia opera com base em quatro camadas computacionais sobrepostas. A primeira etapa utiliza um modelo de voice-to-text, responsável por capturar a fala do usuário e convertê-la em dados textuais. Na sequência, um modelo de linguagem agêntico processa o comando, avalia o contexto semântico e formula a resposta lógica, que é repassada a um componente de text-to-voice encarregado de gerar a fala sintética.

Por fim, entra em ação o motor proprietário de geração de vídeo da Synthesia, que sincroniza os movimentos labiais, a gesticulação e as expressões faciais da réplica tridimensional com o áudio resultante. Para dar flexibilidade às companhias clientes, a empresa permite que a infraestrutura substitua seus módulos nativos de áudio e linguagem por modelos externos desenvolvidos por laboratórios como OpenAI, Google, ElevenLabs e Cartesia.

Além de selecionar quais modelos alimentam o pipeline de processamento, as organizações contratantes podem optar por hospedar os avatares em seus próprios servidores em nuvem ou delegar a custódia computacional integralmente aos servidores da Synthesia. Essa flexibilidade de infraestrutura atende tanto a exigências de segurança corporativa quanto a demandas operacionais de baixa latência em fluxos contínuos de atendimento.

Portfólio comercial da Synthesia

A oferta de produtos da Synthesia está estruturada em três frentes principais de negócio. A modalidade clássica consiste em uma plataforma de criação e distribuição de vídeo, na qual o operador insere um texto prévio e o avatar reproduz fielmente a narrativa programada, sem margem para improviso ou interação dinâmica com o espectador.

A segunda linha é a plataforma agêntica intitulada Sessions, que inclui o recurso recente Roleplay Sessions. Esse sistema é direcionado a treinamentos internos em que funcionários corporativos realizam simulações operacionais — como testes de argumentos de vendas — diante de um avatar que escuta, rebate objeções e atribui notas ao desempenho do colaborador.

A terceira frente é a plataforma de API, desenvolvida para possibilitar que empresas terceiras conectem os modelos de vídeo e voz da Synthesia aos seus próprios bancos de dados e sistemas legados, integrando interfaces interativas em fluxos de trabalho externos sem a necessidade de operar a interface gráfica proprietária da startup.

O processo de captura técnica

A construção do clone digital de Dominic-Madori Davis ocorreu nas instalações de Nova York, dentro de um estúdio compacto de gravação montado na sede da Synthesia. O protocolo técnico exigiu o registro de dezenas de fotografias estáticas em múltiplos ângulos de iluminação, complementado pela captura de uma amostra de áudio de apenas dois minutos de duração com a voz da repórter.

Para garantir conformidade ética e jurídica, a Synthesia exigiu a formalização explícita de consentimento antes de iniciar o processamento dos dados biométricos. Ao término da ingestão dos arquivos, a equipe de engenharia gerou quatro variantes do clone: dois avatares pessoais (programados apenas para ler roteiros predefinidos) e dois avatares interativos com suporte a conversação contínua, distribuídos entre versões com e sem óculos de grau.

O ciclo completo de processamento e treinamento durou alguns dias. No primeiro teste prático do modelo pessoal, Dominic-Madori Davis submeteu um roteiro genérico sobre a chegada do outono a Nova York, confirmando que o sintetizador de voz reproduziu com precisão o timbre desejado, ignorando inclusive uma leve rouquidão física apresentada durante os dois minutos da gravação matriz original.

Treinamento e controle determinístico

Diferente de assistentes virtuais de conversação aberta, o modelo interativo criado para Dominic-Madori Davis foi configurado sob uma base estritamente determinística. O sistema foi alimentado com o conteúdo integral de uma reportagem investigativa assinada pela repórter a respeito dos motivos que levam startups financiadas por capital de risco (venture capital) a cometerem mais fraudes contábeis e corporativas do que empresas sem aporte institucional.

Em decorrência desse escopo rígido, o avatar foi calibrado para solucionar apenas questionamentos diretamente vinculados ao artigo jornalístico, respondendo tópicos como o motivo da apuração, as conclusões dos pesquisadores acadêmicos citados e a metodologia do levantamento empírico. Todas as tentativas de conduzir o diálogo para temas pessoais ou assuntos externos foram sumariamente bloqueadas pelo modelo agêntico.

Quando a jornalista tentou questionar o próprio avatar sobre suas passagens de trabalho anteriores à entrada no TechCrunch ou o bairro em que residia em Nova York, a máquina recusou os desvios e redirecionou a conversa imediatamente para a reportagem sobre fraudes em empresas investidas por capital de risco.

Reações humanas e o estranhamento

A exibição do clone a círculos sociais gerou impressões divididas entre o fascínio tecnológico e a sensação de estranheza visual. Amigos de Dominic-Madori Davis apontaram que, embora a versão estática de leitura de roteiro mantivesse fidelidade notável, o avatar interativo apresentou um timbre levemente divergente da voz real, classificando a experiência de interação como desconfortável.

Em contrapartida, os familiares da repórter submeteram a réplica a testes exaustivos na tentativa de obter dados confidenciais que apenas a filha saberia responder. Diante das recusas mecânicas e das respostas padronizadas que insistiam em retornar aos dados da investigação de startups de venture capital, a mãe da jornalista resumiu a experiência com bom humor:

“Eu não me lembro de ter dado à luz duas de você.”

A reação reflete a distância existente entre a reprodução algorítmica de traços visuais e a capacidade de espelhar nuances cognitivas individuais, expondo como respostas estritamente ancoradas em documentos específicos limitam qualquer percepção autêntica de personalidade humana em agentes desse porte.

Fronteiras entre automação e jornalismo

O teste prático na Synthesia levanta debates objetivos sobre o papel de ferramentas de inteligência artificial generativa na imprensa corporativa, sobretudo em um período marcado pelo avanço de conteúdos superficiais e desinformação automatizada, frequentemente categorizados pelo setor como AI slop.

A possibilidade de colocar avatares sintéticos ancorando telejornais ou conduzindo entrevistas encontra forte resistência no mercado financeiro e na indústria de mídia; investidores consultados por Dominic-Madori Davis descartaram prontamente a aceitação de telejornais apresentados por duplos virtuais. Além disso, permanece incerto se executivos-chefes (CEOs) aceitariam conceder entrevistas a clones digitais em substituição a profissionais humanos.

O exercício jornalístico fundamenta-se historicamente na construção de confiança mútua e contato interpessoal, características que não podem ser transferidas ou terceirizadas para modelos sintéticos operados por APIs de empresas como ElevenLabs ou Cartesia. No contexto corporativo geral, no entanto, réplicas interativas oferecem aplicações práticas evidentes, eliminando acúmulo de demandas funcionais após períodos de férias por meio de agentes virtuais capazes de responder dúvidas recorrentes de equipes de trabalho.

O futuro das réplicas interativas

A barreira técnica entre modelos determinísticos e sistemas autônomos não determinísticos estabelece limites claros para a adoção em massa da tecnologia desenvolvida pela Synthesia. Enquanto o avatar restrito à reportagem de fraudes mantém respostas previsíveis, especialistas advertem para o perigo de distorções e alucinações cognitivas caso agentes conversacionais sejam autorizados a emitir opiniões livres sem ancoragem factual prévia.

Membros da chamada Geração Z tendem a manifestar ceticismo frente à normalização de réplicas humanas geradas por computador, tratando a tecnologia como um elemento de ficção científica transposto prematuramente para o cotidiano. Contudo, avatares gráficos bidimensionais mantêm uma vantagem psicológica relevante sobre robôs humanoides físicos: a preservação do controle pelo usuário, que pode encerrar o sistema instantaneamente com um simples comando de desconexão da plataforma.

#synthesia#avatar-digital#inteligencia-artificial#jornalismo#tecnologia
Compartilhar

Artigos Relacionados