Concatenação de Mídias no WhatsApp: A Base de um Bot que Não Quebra
Humberley Cezilio
O episódio 08 foi puro código, resolvendo a dor número um de quem constrói bot de atendimento no WhatsApp: o cliente que manda áudio, depois texto, depois foto, tudo picado — e o bot tenta responder cada pedaço separado, virando uma bagunça.
A lógica do 'simplãozão'
Quando as mensagens chegam fragmentadas, a IA comum quebra: responde ao áudio, depois ao texto, depois à foto, como se fossem três conversas. O cliente recebe três respostas desconexas.
A solução é acumular antes de responder. Usando laços de repetição e atrasos estruturados — com banco de dados realtime, tipo Firebase via JSONB — você junta todas as mídias da rajada, converte os áudios em texto, agrupa tudo e só então manda pra IA processar uma resposta única e coerente.
Limpeza de logs com Regex
Tem um truque vital que evita dor de cabeça: usar expressão regular (o \n global) pra substituir quebras de linha invisíveis por tags HTML (<br>).
Sem isso, a formatação da resposta da IA gera erro de leitura quando passa por plataformas de envio como a Evolution API. É detalhe pequeno que quebra bot em produção — e que quase ninguém documenta.
A diferença entre um bot que parece humano e um que irrita o cliente está justamente aqui: na capacidade de receber a bagunça do jeito que a pessoa manda e devolver uma resposta única, limpa e coerente.
- 1.Acumule as mídias da rajada antes de responder.
- 2.Use banco realtime (Firebase/JSONB) + loops + delays para agrupar.
- 3.Converta áudio em texto e processe tudo numa resposta só.
- 4.Trate quebras de linha com Regex para não quebrar o envio.
Café com Lágrimas
Toda semana eu discuto automação, IA e os bastidores de negócio no podcast — sem enrolação.
Assistir no YouTube ↗