Você tem duas versões de um botão. Roda A/B test por 3 dias. A converteu 4,5%, B converteu 5,0%. Comemora, joga B pra 100% do tráfego, escala. Um mês depois a conversão não mudou. Por que? Porque a diferença que você viu era ruído estatístico. Não era B melhor. Era sorte.
Esse erro custa caro. E a maioria das PMEs no Brasil comete ele todo dia. Este guia mostra como testar de verdade — sem virar estatístico, sem parar de ser prático.
O problema fundamental: amostra pequena engana
Jogue uma moeda 10 vezes. Pode dar 7 caras e 3 coroas — a moeda continua justa. É só a variação natural em amostra pequena.
Mesma coisa em A/B test: com 100 visitantes por variante, uma diferença de 20% na conversão pode ser 100% acaso. Precisa de volume pra separar sinal de ruído.
Quantos visitantes você precisa
Regra geral (calculadora simples):
| Conversão base | Ganho detectável | Visitantes por variante |
|---|---|---|
| 2% | +50% (ex: 2% → 3%) | ~2.500 |
| 2% | +25% (ex: 2% → 2,5%) | ~10.000 |
| 5% | +50% (ex: 5% → 7,5%) | ~900 |
| 5% | +25% (ex: 5% → 6,25%) | ~3.700 |
| 10% | +25% (ex: 10% → 12,5%) | ~1.700 |
Se sua LP recebe 500 visitantes/mês, um A/B test com 2 variantes precisa de 250 visitantes por variante — matematicamente impossível detectar diferenças pequenas. Você só consegue medir ganhos enormes (50%+).
Isso não é motivo pra desistir. É motivo pra testar mudanças grandes (headline totalmente diferente, layout radicalmente diferente) em vez de testar cor de botão.
O erro clássico: parar quando "deu certo"
Dia 1: A tá ganhando 10%. Ah que bom.
Dia 2: B empatou. Estranho.
Dia 3: B tá 5% na frente. Vou dar mais uns dias.
Dia 5: A voltou a ganhar 12%. Bora escalar A!
Você acabou de fazer peeking, o erro nº 1 em A/B test. A cada vez que você olha e decide se para, a probabilidade de "achar" uma vitória falsa dobra. Se olhar 5 vezes, tem 30% de chance de ver uma "vitória" que não existe.
Fix: decida antes do teste começar quantos dias vai rodar E quantos visitantes por variante. Não olhe até bater o limite. Só decida depois.
Ferramentas simples pra PME
Google Optimize (fechou em 2023, esqueça)
Muita gente ainda procura. Foi descontinuado.
VWO / Convert / AB Tasty
SaaS pago, R$ 200-2000/mês. Boa interface, calculadora embutida, tudo automático. Vale se você faz teste toda semana.
Split simples via URL
Gerencia no seu servidor: 50% das visitas vê /pagina-a, 50% vê /pagina-b. Grava no cookie qual variante caiu. GA4 mede conversão por segmento (variante). Custo zero. Bom pra teste ocasional.
Rotação por horário do dia
Gambiarra útil pra volume baixo: A roda de manhã, B roda de tarde, alterna por 30 dias. Compara métricas. Não é rigoroso mas é rápido pra decisões grosseiras.
O que testar em PME (por ordem de impacto)
- Headline principal (H1) — mudança de mensagem move o ponteiro mais que qualquer outra coisa
- Botão principal (texto + cor) — "Solicitar orçamento" vs "Falar no WhatsApp" muda muito
- Prova social (com vs sem depoimentos) — em setor de baixa confiança (obras, saúde) vira decisão
- Formulário (curto vs longo) — cada campo a menos costuma subir 5% de conversão
- Imagem principal (foto real vs banco de imagens vs sem foto)
- Bloco de preço (com vs sem)
- Ordem das seções (prova social antes ou depois do CTA)
O que NÃO testar (pouco ROI pra volume PME)
- Cor exata do botão (verde 40C4A2 vs 3EBE9E). Sem volume pra detectar.
- Tamanho da fonte em 1-2px
- Texto de links secundários
- Detalhes de rodapé
Framework prático em 4 passos
- Hipótese específica: "Trocar 'Enviar mensagem' por 'Chamar no WhatsApp' vai aumentar conversão em pelo menos 30% porque nosso público prefere WA."
- Calcule tamanho da amostra: use calculadora tipo VWO A/B test duration. Ex: conversão base 5%, ganho de 30% = ~700 visitas por variante = ~14 dias com 100 visitas/dia.
- Rode até o fim. Não olhe todo dia. Não decida antes.
- Decida com base no resultado + significância. Se p-valor < 0.05, a diferença é real. Se maior, resultado inconclusivo — você aprendeu que essa mudança específica não move o ponteiro no seu volume.
Alternativa pra volume muito baixo (< 500/mês)
Se você não tem volume, A/B test não vai funcionar matematicamente. Alternativas:
- Testes qualitativos: 5 pessoas do público navegam na LP enquanto explicam em voz alta o que estão pensando (usar Maze, UserTesting ou pedir pra amigos parecidos com público). Aprende muito com 5 sessões.
- Testes de mensagem A/B em ad copy: bem mais rápido, Meta e Google Ads já calculam significância pra você.
- Iteração baseada em feedback direto: quem virou cliente conta na entrevista o que fez ele fechar. Mais qualitativo mas útil.
Como a Uma Nova Imagem ajuda
- Setup de A/B testing (a partir de R$ 800): infraestrutura de split + tracking + dashboard, no seu volume real. Sem SaaS caro se não precisa.
- Programa mensal de otimização (a partir de R$ 1.500/mês): 1 teste rodando por vez, revisão dos resultados, aplicação do vencedor, próximo teste. Ganho composto ao longo dos meses.
- Consultoria pontual de decisão: você tem os dados mas não sabe se pode confiar. Analisamos e dizemos: escalar B, manter A, ou rodar mais.
A/B test bem feito é uma das maiores alavancas de crescimento — 3-5% de melhoria por teste, compostos ao longo de 20 testes por ano, viram 60-100% de conversão a mais. A/B test mal feito é ilusão organizada e custa dinheiro escalando o que não funciona.