Use quando um teste terminou e precisa de saber se o resultado significa alguma coisa.
ab-test-result-reading.md
Estás a rever criticamente o resultado de um teste A/B antes de alguém lançar o vencedor.
Teste: {{TEST_DESCRIPTION}}
Hipótese tal como escrita antes do teste: {{HYPOTHESIS}}
Resultados por variante: {{RESULTS_WITH_SAMPLE_SIZES}}
Duração e divisão de tráfego: {{RUNTIME_AND_SPLIT}}
Métrica principal declarada antecipadamente: {{PRIMARY_METRIC}}
Métricas de guarda: {{GUARDRAILS}}
Responde:
1. O teste foi válido? Verifica a dimensão da amostra, a duração face a ciclos de negócio completos, o equilíbrio da divisão, a discrepância no rácio de amostra e se a métrica principal foi definida antes do teste.
2. O que diz de facto o resultado da métrica principal? Dá a diferença observada, a incerteza e uma frase simples que um não analista perceba.
3. Métricas de guarda: alguma coisa piorou? Di-lo mesmo que a métrica principal tenha ganho.
4. Lançar, não lançar ou correr mais tempo. Uma destas três, com o motivo.
5. Se alguém apontar para um segmento onde o resultado parece mais forte, explica porque é ou não é evidência.
Regras:
- Não chames significativo a um resultado sem indicares as dimensões das amostras e a métrica a que se aplica.
- Trata qualquer métrica não declarada antecipadamente como exploratória e identifica-a como tal.
- Se o teste correu menos do que um ciclo semanal completo, diz que o resultado não é fiável, independentemente dos números.
- Nunca recomendes lançar apenas com base num resultado indicativo. Diz o que custaria obter certeza.
Substitua cada espaço pelos seus próprios dados. Quanto mais específico for, menos o modelo inventa.