Documento técnico de testes, engenharia de prompt e integração de modelo generativo para os totens de aeroporto.
O fluxo opera de forma autônoma. O usuário participa da interação no totem com roupas habituais de viagem e recebe sua foto em proporção 9:16 ambientada no gramado da Cidade do Rock em frente ao Palco Mundo.
A câmera vertical captura a foto sob iluminação de saguão, com roupas de viagem e bagagens.
Foto enviada ao modelo de IA em inferência direta (~30s), aplicando o cenário oficial do festival.
O sistema aplica automaticamente a máscara circular e os grafismos no centro seguro da foto.
O usuário recebe a foto pronta. O enquadramento centralizado permite desdobramentos multiformato.
Bateria completa cobrindo fotos reais da equipe interna, situações cotidianas, grupos e acessibilidade. (Clique em qualquer foto para ampliar).
Barba, armação dos óculos e sorriso aberto preservados 1:1; gesto das mãos sintetizado com dedos perfeitos; remoção total do estande.
Preservação dos figurinos originais; sinais de paz ("V") mantidos com mãos limpas; cabelos preservados sem fusão entre os rostos.
Isolamento cirúrgico da protagonista (pessoa desfocada no fundo eliminada); blazer de tweed e camiseta rosa mantidos com fidelidade.
Smartphone empunhado na orelha eliminado com mãos abaixadas e vazias; óculos e traços faciais 1:1; hoodie branco preservado.
Copo descartável completamente removido com mãos 100% limpas; microexpressão de piscadela preservada com fidelidade biométrica.
Sorriso aberto e corte platinado retidos 1:1; estampa gráfica complexa com smileys preservada; sinal de paz com anatomia limpa.
Smartphone empunhado na mão totalmente removido; textura dos dreadlocks loiros e calça xadrez preservados com precisão.
Garrafa de água eliminada; preservação simultânea das 4 identidades faciais sem fusão; figurinos individuais mantidos.
Cachos volumosos e sorriso radiante mantidos 1:1; braço reposicionado para postura natural; conjunto preto e bege preservado.
Jaqueta de couro, colares e tatuagem no pulso preservados com exatidão; gesto de "rock" sintetizado com dedos íntegros.
Mandíbula e traços faciais nativos preservados sem distorções; jaqueta substituída por camiseta de festival.
Coto natural preservado com manga fechada; zero criação de braço robótico ou membros extras.
Muletas mantidas com apoio real no gramado; perna única respeitada com a barra dobrada; mochila removida.
Estrutura mecânica da cadeira integrada com sombras no gramado; roupas trocadas por peças urbanas.
Manchas naturais de despigmentação mantidas sob a luz do flash; colete utilitário adicionado.
Véu religioso mantido 100% intocado; reestilização aplicada apenas nas roupas do corpo.
Proporções corporais e feições maduras preservadas com precisão, sem infantilização.
Rugas e cabelos grisalhos mantidos sem rejuvenescimento; mala de viagem removida da cena.
Malas deletadas; coletes formais substituídos por roupas casuais; óculos e traços preservados.
Mochila removida; camisas convertidas em corta-ventos; gargalhadas e dentes preservados.
Mochila infantil removida; proporções de altura mantidas; sorrisos naturais nos 3 rostos.
Quem estava sério ficou de boca fechada; quem estava rindo manteve o riso; malas eliminadas.
Crachás de trabalho e malas de rodinha removidos; peças de roupas com cortes e cores variadas.
Camisa social e crachá trocados por corta-vento estampado; expressão séria mantida sem sorrisos forçados.
Smartphone mantido nas mãos; dedos e postura anatômica 100% íntegros sem fusão com o corpo.
Bolsa de ombro removida; jaqueta jeans trocada por agasalho retrô; sorriso escancarado preservado.
Colar artesanal no pescoço preservado; alças da mochila cargueira removidas; sorriso radiante mantido.
Bolsa transversal removida; colete utilitário sobre camisa estampada adicionado; lábios selados mantidos.
Três tipos de sorrisos preservados de forma independente; óculos mantidos; roupas variadas de festival.
Avaliamos os principais motores generativos diretamente contra o desafio técnico do totem (reter o rosto da webcam, preservar o Palco Mundo e responder rápido):
Manteve a identidade facial em disparo único, gerou textura de pele real sob flash e ancorou sombras duras no gramado com o Palco Mundo estático.
Qualidade visual muito alta e ótima interpretação, mas com acabamento de pele mais polido/ilustrado e custo de inferência mais elevado.
Exigiram fluxos complexos de inpainting encadeado para segurar o palco, o que dobrou a latência e gerou artefatos nas bordas dos cabelos.
Geração muito rápida, porém com alta instabilidade facial (trocou traços de usuários) e tendência a criar pessoas extras no fundo.
Abaixo estão documentadas as formulações para execução em Passagem Única (solução principal) e em Dupla Passagem (alternativa modular):
Etapa 01: Renderização do Sujeito (Foco em Biometria e Luz de Flash)
Etapa 02: Recomposição e Travamento do Cenário Master
Elimina a textura plástica de IA e entrega o grão fotográfico de câmera real.
Curva as laterais e o solo com curvatura óptica realista, mantendo o eixo central nítido.
Cria respiro periférico para suportar o corte circular do totem sem decepar cabeças.
Impede a criação de acompanhantes fantasmas em fotos de usuários individuais.
Mantém dentes em quem sorri e lábios fechados em quem posou com semblante neutro.
Gera sombras duras no gramado e reflexo na pele para eliminar efeito de montagem colada.
Contorna ombros e cabelos com a luz do palco, amarrando o sujeito ao ambiente.
Mantém as roupas originais da pessoa com caimento despojado, evitando roupas extravagantes.
Remove copos e bloqueia qualquer logotipo ou marca comercial não autorizada.
Bloqueia a IA de alucinar logos de festivais concorrentes ou textos nos telões de LED.
Histórico completo de problemas identificados durante os testes de estresse e a respectiva regra técnica inserida no prompt para blindar a geração:
O modelo tentava recriar o fundo quando o texto descrevia o festival de forma aberta.
Tentar subir ou descer a câmera quebrava a geometria da foto de referência do palco (com horizonte baked-in).
Lentes fisheye de 8mm em formato vertical exigem área superior para curvar o chão realisticamente.
A IA forçava dentes visíveis em rostos sérios por causa do contexto festivo.
Flash frontal isolado sem iluminação de fundo fazia a pessoa parecer colada no Photoshop.
Espaços vazios em fotos individuais eram preenchidos com pessoas geradas.
A IA gerava copos de redes de fast-food e bebidas não autorizadas na mão do usuário.
Bagagens de viagem apareciam fundidas às pernas dos participantes no meio do festival.
O motor gerava membros extras ou robóticos ao receber comandos de poses.
O motor tentava substituir peças casuais de viagem por roupas extravagantes de passarela.
A IA tentava trocar hijabs ou quipás por bonés ou cabelos soltos.
Comandos restritivos excessivos asfixiavam os passos de difusão, gerando derme borrada.
Pessoas no fundo do saguão do aeroporto eram fundidas ao primeiro plano da foto gerada.
A plateia ao fundo parecia uma imagem 2D desconectada do espaço físico.
A IA ativava a memória de outros festivais e desenhava tipografias incorretas nos telões.
Análise prática de tempo e estabilidade para a operação real nos totens:
A foto do usuário entra na API com o prompt e sai pronta em uma chamada direta (~30s).
Gera a pessoa em uma chamada e recorta o palco oficial por cima em uma segunda chamada de inpainting.
Direcionamento: Operar em Passagem Única é a melhor escolha para balancear qualidade visual com a agilidade necessária no totem.