Dados & Testes

Teste A/B: como planejar, rodar e interpretar experimentos sem se enganar com os dados

Do desenho da hipótese à leitura da significância: o passo a passo para testar sem tirar conclusões erradas.

Foto de Yara IenciusYara IenciusSócia e Head de Estratégia — KCLOCKPublicado em 9 min de leituraCompartilhar este artigoWhatsApp
Dois painéis 3D idênticos, um laranja e um branco, separados por um feixe de luz, representando um teste A/B

Teste A/B mal feito é pior do que nenhum teste: ele produz certeza sobre algo falso. Este guia cobre o ciclo completo — hipótese, amostra, duração, leitura de significância e os erros que invalidam experimentos — para que cada teste devolva uma decisão confiável.

O que é teste A/B

Teste A/B é um experimento controlado que divide o tráfego entre duas versões (controle e variante) para medir qual gera melhor resultado em uma métrica definida antes do início. É a ferramenta central de qualquer processo de CRO.

A divisão precisa ser aleatória e simultânea. Comparar "esta semana com a anterior" não é teste A/B — é comparação contaminada por sazonalidade, mídia e comportamento.

Como escrever a hipótese

Uma hipótese sem evidência é palpite. Antes de testar, colete o sinal: gravações de sessão, mapas de rolagem, taxa de abandono de formulário ou objeções relatadas pelo comercial.

Amostra, duração e poder estatístico

  1. Defina a métrica primária — uma só. Métricas secundárias servem de guarda-corpo.
  2. Estime o efeito mínimo detectável (MDE) que justifica a mudança, por exemplo +10%.
  3. Calcule o tamanho de amostra necessário por variação antes de iniciar.
  4. Rode por ciclos completos de comportamento — em geral 2 a 4 semanas.
  5. Não interrompa ao ver o primeiro pico: variação inicial é ruído.
Relação aproximada entre taxa base, efeito buscado e amostra necessária
Taxa baseEfeito mínimoOrdem de grandeza por variação
2%+20% relativoDezenas de milhares de visitantes
5%+20% relativoMilhares a dezenas de milhares
10%+20% relativoPoucos milhares
20%+20% relativoOrdem de centenas a milhares

Se o volume não permite atingir a amostra, mude a estratégia: teste mudanças grandes (oferta, proposta de valor, público), que produzem efeitos maiores e exigem menos tráfego para aparecer.

Como ler o resultado

Significância estatística

O padrão de mercado é 95% de confiança (valor-p < 0,05). Isso significa aproximadamente 5% de chance de o resultado observado ser fruto do acaso. Reporte também o intervalo de confiança: um ganho de "+12% entre +1% e +25%" é bem diferente de "+12% entre −8% e +32%".

Significância prática

Nem todo ganho estatístico compensa. Se a implementação definitiva custa caro e o ganho projetado é marginal, o resultado correto é arquivar com aprendizado registrado.

7 erros que invalidam o teste

Confira antes de declarar um vencedor

  • Encerrar o teste assim que aparece diferença (peeking).
  • Rodar por menos de um ciclo semanal completo.
  • Mudar a variante ou a mídia durante o experimento.
  • Testar em amostra pequena demais para o efeito buscado.
  • Medir cliques quando o objetivo real é venda qualificada.
  • Ignorar o desempenho separado de mobile e desktop.
  • Não registrar o aprendizado — e repetir o mesmo teste meses depois.

Conclusão

Testar bem é uma disciplina de honestidade intelectual: definir o critério antes, respeitar o tempo e aceitar o resultado. Feito assim, cada experimento melhora a página de hoje e a decisão de amanhã sobre novas landing pages.

Perguntas frequentes sobre teste a/b

O que é teste A/B?

É um experimento controlado que divide o tráfego entre duas ou mais versões de uma página ou elemento para medir qual delas produz melhor resultado em uma métrica definida antes do teste.

Quanto tempo deve durar um teste A/B?

No mínimo um ciclo completo de comportamento, geralmente entre 2 e 4 semanas, e até atingir o tamanho de amostra planejado. Encerrar antes disso costuma gerar falsos positivos.

O que é significância estatística em um teste A/B?

É a probabilidade de o resultado observado não ser fruto do acaso. O padrão de mercado é 95% de confiança, o que corresponde a um valor-p menor que 0,05.

Posso testar mais de uma mudança ao mesmo tempo?

Pode, mas então o teste responde se o conjunto é melhor, não qual elemento causou o ganho. Para isolar causas, teste uma variável por vez ou use um desenho multivariado com volume suficiente.

O que fazer quando o teste dá empate?

Empate também é aprendizado: significa que a variável testada não é a alavanca. Registre o resultado e passe para uma hipótese de maior impacto, como oferta, público ou proposta de valor.

Foto de Yara Iencius, Sócia e Head de Estratégia — KCLOCK

Sobre a autora

Yara Iencius

Sócia e Head de Estratégia — KCLOCK

Estrategista de aquisição e funis. Lidera o planejamento de campanhas, ofertas e arquitetura de conversão dos projetos da KCLOCK.

  • #testes
  • #dados
  • #cro

Quer aplicar isso no seu funil com quem faz todo dia?

A KCLOCK constrói funis, landing pages, sites e e-commerces de alta conversão. Fazemos o diagnóstico do seu funil atual e mostramos onde está a receita que você está deixando na mesa.

Próximas leituras

Conteúdos do mesmo cluster para aprofundar teste a/b.