QuQi
MÉTRICAS E RELATÓRIOS

Leitura de resultados de teste A/B

Use quando um teste terminou e precisa de saber se o resultado significa alguma coisa.

ab-test-result-reading.md
Transferir .md
Estás a rever criticamente o resultado de um teste A/B antes de alguém lançar o vencedor.

Teste: {{TEST_DESCRIPTION}}
Hipótese tal como escrita antes do teste: {{HYPOTHESIS}}
Resultados por variante: {{RESULTS_WITH_SAMPLE_SIZES}}
Duração e divisão de tráfego: {{RUNTIME_AND_SPLIT}}
Métrica principal declarada antecipadamente: {{PRIMARY_METRIC}}
Métricas de guarda: {{GUARDRAILS}}

Responde:
1. O teste foi válido? Verifica a dimensão da amostra, a duração face a ciclos de negócio completos, o equilíbrio da divisão, a discrepância no rácio de amostra e se a métrica principal foi definida antes do teste.
2. O que diz de facto o resultado da métrica principal? Dá a diferença observada, a incerteza e uma frase simples que um não analista perceba.
3. Métricas de guarda: alguma coisa piorou? Di-lo mesmo que a métrica principal tenha ganho.
4. Lançar, não lançar ou correr mais tempo. Uma destas três, com o motivo.
5. Se alguém apontar para um segmento onde o resultado parece mais forte, explica porque é ou não é evidência.

Regras:
- Não chames significativo a um resultado sem indicares as dimensões das amostras e a métrica a que se aplica.
- Trata qualquer métrica não declarada antecipadamente como exploratória e identifica-a como tal.
- Se o teste correu menos do que um ciclo semanal completo, diz que o resultado não é fiável, independentemente dos números.
- Nunca recomendes lançar apenas com base num resultado indicativo. Diz o que custaria obter certeza.

Preencher antes de executar

Substitua cada espaço pelos seus próprios dados. Quanto mais específico for, menos o modelo inventa.

  • {{TEST_DESCRIPTION}}
  • {{HYPOTHESIS}}
  • {{RESULTS_WITH_SAMPLE_SIZES}}
  • {{RUNTIME_AND_SPLIT}}
  • {{PRIMARY_METRIC}}
  • {{GUARDRAILS}}

Como obter um resultado melhor

  1. Cola a hipótese pré-teste tal e qual. Reescrevê-la depois é a forma mais comum de os testes mentirem.
  2. Inclui as métricas de guarda mesmo que pareçam bem; um ganho de conversão com subida de devoluções não é um ganho.
  3. Pergunta qual era o efeito mínimo detetável e se o teste alguma vez poderia ter encontrado o efeito alegado.