Ebook Salll · Nº 32 · Decisão e dados

O dashboard conta histórias que não aconteceram.

Uma curva detecta mudança. Uma correlação sugere uma relação. A causa só aparece quando existe um contrafactual defensável.

Leitura de 19 minutos · Pesquisa verificada · Aplicação em e-commerce e experiência do consumidor

Personagem Salll separando um sinal real de várias curvas possíveis em dashboards
O gráfico termina onde a investigação deveria começar.
A moeda não tem memória

Três caras seguidas. A quarta continua sem dívida.

Você joga uma moeda e saem três caras. Em poucos segundos aparecem duas histórias opostas. "Está vindo cara" ou "agora precisa vir coroa". A moeda não ouviu nenhuma delas. Se os lançamentos forem independentes, a próxima jogada continua com a mesma probabilidade.

CCC

O padrão existe na sequência. A causa pode não existir.

Um padrão observado é um fato descritivo. Atribuir memória, impulso ou compensação é uma hipótese sobre o mecanismo. Confundir os dois é o primeiro atalho que o dashboard oferece.

No negócio, as moedas ganham nomes mais respeitáveis. Share of search, conversão, preço, ruptura, ranking, ROAS. O gráfico registra o que aconteceu. A sala completa o resto: "foi a campanha", "foi o conteúdo", "o algoritmo gostou", "o shopper reagiu ao preço".

Tese central. O dashboard não precisa mentir para produzir uma história falsa. Basta mostrar uma variação sem o contrafactual que separaria uma explicação das demais.
01
Capítulo 1 · O cérebro fecha a história cedo demais

O ruído incomoda. Uma narrativa devolve controle.

Falk e Konold mostraram que julgamentos de aleatoriedade acompanham a facilidade de codificar uma sequência. Whitson e Galinsky encontraram que a falta de controle pode aumentar a percepção de relações em estímulos não relacionados. É uma base plausível para entender a sala de performance, mas não uma licença para diagnosticar qualquer gestor.

606

participantes em três estudos sobre produção e julgamento de sequências aleatórias.

Falk & Konold, 1997
60,7%

de falsos positivos em simulação quando quatro graus de liberdade analítica foram combinados.

Simmons et al., 2011
73/20

foi a concentração média observada em 238 marcas de 22 categorias CPG, não 80/20.

Kim et al., 2017

A disponibilidade também pesa. Uma campanha recente, um pico grande e um print compartilhado no grupo vêm à mente com facilidade. Isso pode ocupar o lugar de uma contagem completa. O que é vívido parece mais frequente. O que é recente parece mais explicativo.

Limite da evidência. Os estudos cognitivos explicam mecanismos em laboratório. Não estimam quantas decisões de e-commerce são erradas nem provam que pressão sempre produz apofenia.
O contraponto necessário

A mão quente era uma ilusão. Até a análise ser corrigida.

1985

O estudo clássico não encontrou evidência convincente de sequência de acertos.

Amostra. Uma temporada do Philadelphia 76ers, dois anos de lances livres do Celtics e 26 atletas de Cornell fazendo 100 arremessos cada.

Conclusão original. A crença de atletas e torcedores na mão quente foi tratada como percepção equivocada de sequências aleatórias.

2018

Uma correção mostrou viés no teste usado para sequências finitas.

Reanálise. No experimento de Cornell, a diferença média após séries de três passou de 3 para 13 pontos percentuais, p < 0,01.

Lição. O erro não é só ver padrão onde há ruído. Também é rejeitar padrão real porque a régua estatística estava enviesada.

Essa história impede uma conclusão preguiçosa: "todo padrão é apofenia". Há momentos em que três pontos iniciam uma mudança real. O dashboard pode encontrar o sinal. O que ele não pode fazer sozinho é escolher o mecanismo correto.

Humildade estatística funciona nos dois sentidos: não coroar ruído como causa e não descartar sinal porque ele parece conveniente demais.Síntese editorial Salll

A pergunta que falta no slide

“O que teria acontecido sem a intervenção?”

Sem essa comparação, o gráfico descreve. Ainda não atribui causa.

02
Capítulo 2 · Cinco máquinas de fabricar histórias

O erro raramente está no dado. Está no recorte.

Uma narrativa causal pode nascer sem fraude, planilha quebrada ou má intenção. Basta uma escolha aparentemente pequena em cada etapa.

Máquina 01

Janela curta

Três dias formam uma seta. Doze meses podem mostrar que a seta era uma terça-feira comum dentro de uma série sazonal.

Antídoto: série completa, frequência adequada e comparação com o mesmo ciclo anterior.

Máquina 02

Extremo escolhido

A intervenção começa depois do pior resultado. A recuperação natural vira case de sucesso por regressão à média.

Antídoto: pré-período, grupo comparável e medidas repetidas antes da ação.

Máquina 03

Muitos cortes

Canal, SKU, região, semana, criativo e device criam centenas de chances para um achado acidental parecer especial.

Antídoto: família de testes declarada, FDR quando aplicável e confirmação separada.

Máquina 04

Sazonalidade compartilhada

Mídia e venda sobem na mesma semana porque a Black Friday moveu as duas. A correlação recebe o crédito que pertence ao calendário.

Antídoto: tendência, sazonalidade, datas placebo e controle não tratado.

Máquina 05

Feedback do sistema

Ranking gera clique. Clique pode alimentar ranking. Estoque influencia venda. Venda influencia reposição. A seta causal não é única.

Antídoto: desenhar o circuito, medir exposição e procurar variação exógena ou randomizada.

Pareto sem superstição

O 80/20 é uma pergunta. Não uma resposta pronta.

Uma análise de seis anos de compras, cerca de 18 mil lares completos, 238 marcas e 22 categorias de CPG encontrou razão média de 73%, com desvio-padrão de 7 pontos. Detergentes ficaram em 64%. Cigarros, 89%. A concentração existe. O número muda.

0,64
menor média entre as categorias estudadas, em detergentes
Kim et al., 2017
0,73
razão média de vendas vindas dos 20% de consumidores superiores
238 marcas
0,89
maior média entre as categorias estudadas, em cigarros
22 categorias CPG

O uso correto de Pareto é ordenar contribuições e observar a curva cumulativa real. O uso indevido é desenhar uma linha em 80%, selecionar tudo que cabe antes dela e chamar o recorte de lei.

Para priorizar SKUs. Calcule concentração por receita, margem, tráfego e potencial perdido separadamente. O top 20% de vendas pode não ser o top 20% de oportunidade.
03
Capítulo 3 · Sinal, hipótese e prova

Três estados. Três linguagens diferentes.

A maior melhoria de qualidade não exige um modelo novo. Exige impedir que a legenda pule uma etapa.

Bonequinhos mostram a passagem de um gráfico observado para hipóteses concorrentes e comparação entre tratamento e controle
O mesmo dado muda de estatuto quando ganha explicações concorrentes e um contrafactual.

Estado 01

Sinal

Uma diferença apareceu e merece investigação. Pode ser real, erro de captura, sazonalidade ou ruído.

Diga: “a conversão subiu 8% nesta janela”.

Estado 02

Hipótese

Uma explicação é coerente com o sinal, mas ainda concorre com preço, estoque, mix, mídia e algoritmo.

Diga: “a nova PDP pode ter contribuído”.

Estado 03

Prova causal

Tratamento e contrafactual foram comparados sob um desenho cujas premissas podem ser auditadas.

Diga: “o teste estimou lift de X, com este intervalo”.

Regra de linguagem. O título de um gráfico nunca deve carregar mais certeza do que o desenho que produziu o dado.
O contrafactual

Causa é a diferença entre dois mundos. Um deles não foi observado.

Para a mesma campanha, o mesmo SKU e o mesmo período, não conseguimos observar simultaneamente “com ação” e “sem ação”. O trabalho causal é construir uma comparação que aproxime o segundo mundo sem contaminar o primeiro.

A/B randomizado

Distribui tratamento por sorteio e equilibra, em expectativa, causas observadas e não observadas.

Use quando usuário, sessão, loja, região ou SKU puderem receber tratamentos diferentes sem vazamento.

Geo holdout

Compara regiões expostas e não expostas, pareadas por histórico, e estima lift incremental.

Use em retail media e campanhas quando exposição individual não estiver disponível.

Diferenças em diferenças

Compara a mudança do tratado à mudança do controle. Depende de tendência paralela plausível.

Use quando existir grupo não tratado com histórico comparável e intervenção definida.

Controle sintético

Combina unidades não tratadas para reproduzir o histórico do tratado antes da intervenção.

Use em um varejo, região ou marca tratada quando houver bom pool de doadores.

Série temporal interrompida

Estima mudança de nível ou tendência depois de uma data, modelando autocorrelação e sazonalidade.

Use quando o timing for nítido e não houver outro choque simultâneo relevante.

Teste placebo

Repete a análise em datas ou unidades onde nenhum efeito deveria aparecer.

Use como teste de fragilidade, não como substituto automático de controle.

Em um estudo de campanha do Google, um modelo estrutural estimou 88.400 cliques incrementais, enquanto o experimento randomizado original estimou 84.700. A proximidade foi uma validação útil. Nas regiões não tratadas, o mesmo modelo retornou efeito de 2%, com intervalo de -6% a 10%, um resultado nulo que a narrativa correta precisa preservar.

04
Capítulo 4 · Onde a história se esconde no e-commerce

Seis métricas. Seis perguntas que o gráfico não responde.

Share of search

História tentadora

“A campanha criou demanda de marca.”

O que falta

Google Trends é amostrado, relativo, normalizado a 0-100 e contém ruído. Compare base total, categoria, PR, concorrência e repetição da coleta.

Conversão

História tentadora

“A nova PDP converteu melhor.”

O que falta

Mix de tráfego, device, preço, frete, estoque e composição de clientes. Randomize e confira SRM, MDE e guardrails.

Preço

História tentadora

“O desconto gerou o volume.”

O que falta

Promoção, mídia, posição, concorrente, distribuição e elasticidade heterogênea. O preço costuma ser decidido em resposta à demanda.

Ruptura

História tentadora

“A demanda caiu.”

O que falta

Venda observada é censurada pelo estoque. Separe indisponibilidade real, produto não encontrado e erro de captura.

Ranking

História tentadora

“O conteúdo fez o algoritmo subir.”

O que falta

Posição gera clique e clique pode retroalimentar posição. Ads, buy box, preço e estoque também mudam exposição.

Retail media

História tentadora

“O ROAS prova retorno incremental.”

O que falta

Atribuição distribui crédito. Lift estima o que não ocorreria sem mídia. Use holdout, conversion lift ou desenho geo.

Ruptura não é ausência

Uma queda de venda pode esconder uma alta de intenção.

Quando o produto fica sem estoque, o funil deixa de observar parte da demanda. O shopper pode procurar, clicar, chegar à PDP e abandonar porque não consegue comprar. Se o dashboard olha apenas pedidos, transforma limitação de oferta em fraqueza de demanda.

Não encontrado

O coletor não localizou o SKU, a página ou o dado esperado. Pode ser remoção, URL alterada ou busca sem retorno.

Fora de estoque

O produto foi encontrado e há sinal verificável de indisponibilidade, sem buy box ou sem opção de compra.

Erro de captura

Timeout, CAPTCHA, bloqueio, mudança de DOM, lazy load ou falha de XHR impediram a leitura.

Não colapse os três. “Sem dado” não significa “sem produto”. “Sem venda” não significa “sem demanda”. O estado de captura precisa sobreviver até a análise.

A legenda honesta

“O resultado é compatível com a hipótese.” Não: “o gráfico provou”.

05
Capítulo 5 · O protocolo SINAL

Cinco perguntas antes de contar a história.

SINAL é uma síntese editorial Salll. Não é escala científica. Serve para obrigar a reunião a atravessar desenho, alternativas e limites antes da conclusão.

S

Série

Qual janela, frequência, sazonalidade, base e nível de agregação?

I

Intervenção

O que mudou, quando, para quem e com qual exposição real?

N

Não tratados

Quem aproxima o contrafactual sem receber spillover?

A

Alternativas

Preço, estoque, mídia, mix, concorrência e algoritmo foram verificados?

L

Limites

Qual MDE, intervalo, família de testes e regra de parada?

Sem resposta, mude o verbo. “Observamos” e “suspeitamos” são conclusões válidas. Inventar certeza para parecer executivo custa mais do que admitir incerteza.
Checklist da reunião

Dez perguntas que reduzem o teatro da precisão.

Qual é a unidade?

Usuário, sessão, pedido, SKU, loja, termo, região ou dia não são intercambiáveis.

Qual é o denominador?

Toda taxa precisa de volume, cobertura e regra de exclusão ao lado.

Por que essa janela?

Ela foi definida antes de olhar o gráfico ou escolhida porque a história ficou melhor?

Quantos cortes foram examinados?

O achado é o único teste ou o vencedor entre dezenas?

Quais duas explicações concorrem?

Preço, estoque, calendário, canal, mix, tracking e concorrência precisam entrar na sala.

Qual é o contrafactual?

Quem representa o que teria acontecido sem a ação?

O controle ficou intacto?

Spillover, mudança de composição e choque estrutural quebram a comparação.

Qual efeito mínimo importa?

Amostra e duração nascem do MDE, da taxa-base, do alfa e do poder, não de “uma semana”.

Qual resultado nulo precisa aparecer?

Ausência de efeito em controle ou guardrail é parte da evidência, não rodapé.

O que faria a decisão mudar?

Registre premissa, prazo de revisão e condição de reversão.

Fechamento

O melhor dashboard não explica tudo. Ele preserva a dúvida certa.

Dados de negócio precisam gerar decisão. Mas decisão não exige fingir que observação é causa. Uma equipe madura age em camadas: reage ao risco operacional, testa a hipótese e atualiza a crença quando o contrafactual chega.

01 Decida com estado explícito

Marque cada conclusão como sinal, hipótese ou prova. A linguagem passa a carregar a incerteza do desenho.

02 Preserve alternativas

Uma boa narrativa inclui as explicações que perderam e diz por que perderam.

03 Procure o nulo

Controles sem efeito, guardrails estáveis e replicações fracas calibram a história.

04 Feche com decisão reversível

Defina o próximo teste, a condição de parada e o sinal que mudará o rumo.

O gráfico pode abrir a investigação. Quando ele encerra a investigação sozinho, começa a inventar.Ebook Salll nº 32
06
Notas metodológicas e limites

O que esta pesquisa sustenta e não sustenta.

Escopo

Esta revisão combina psicologia da aleatoriedade, estatística, séries temporais, mensuração publicitária e documentação de plataformas. Ela não estima uma taxa universal de erro em dashboards.

Generalização

Estudos laboratoriais explicam mecanismos, não magnitude em negócio. Estudos de publicidade e CPG têm contexto, período e infraestrutura específicos. Efeitos numéricos não devem virar benchmark.

Resultados nulos

Foram preservados: p = 0,09 na percepção de imagens inexistentes de Whitson e Galinsky; ausência de interação por foco do cenário, p = 0,98; controle não tratado em Brodersen et al., 2%, intervalo de -6% a 10%; baixa sensibilidade a efeitos de 1% nas simulações.

Causalidade

Randomização continua sendo a comparação mais direta quando viável. Métodos observacionais podem estimar efeitos quando suas premissas são plausíveis e auditadas. Nenhum modelo compensa controle contaminado ou choque não medido por decreto.

Fontes verificáveis

Referências principais.

  1. Falk, R., & Konold, C. (1997). Making Sense of Randomness. Psychological Review, 104(2), 301-318.
  2. Whitson, J. A., & Galinsky, A. D. (2008). Lacking Control Increases Illusory Pattern Perception. Science, 322(5898), 115-117.
  3. Gilovich, T., Vallone, R., & Tversky, A. (1985). The Hot Hand in Basketball. Cognitive Psychology, 17(3), 295-314.
  4. Miller, J. B., & Sanjurjo, A. (2018). Surprised by the Hot Hand Fallacy? Econometrica, 86(6), 2019-2047.
  5. Tversky, A., & Kahneman, D. (1973). Availability: A Heuristic for Judging Frequency and Probability. Cognitive Psychology, 5(2), 207-232.
  6. Barnett, A. G., van der Pols, J. C., & Dobson, A. J. (2005). Regression to the Mean. International Journal of Epidemiology, 34(1), 215-220.
  7. Simmons, J. P., Nelson, L. D., & Simonsohn, U. (2011). False-Positive Psychology. Psychological Science, 22(11), 1359-1366.
  8. Benjamini, Y., & Hochberg, Y. (1995). Controlling the False Discovery Rate. JRSS B, 57(1), 289-300.
  9. Yule, G. U. (1926). Why Do We Sometimes Get Nonsense-Correlations between Time-Series? JRSS, 89(1), 1-63.
  10. Abadie, A., Diamond, A., & Hainmueller, J. (2010). Synthetic Control Methods for Comparative Case Studies. JASA, 105(490), 493-505.
  11. Brodersen, K. H. et al. (2015). Inferring Causal Impact Using Bayesian Structural Time-Series Models. Annals of Applied Statistics, 9(1), 247-274.
  12. Kim, B. J., Singh, V., & Winer, R. S. (2017). The Pareto Rule for Frequently Purchased Packaged Goods. Marketing Letters, 28, 491-507.
  13. Joachims, T. et al. (2005). Accurately Interpreting Clickthrough Data as Implicit Feedback. SIGIR, 154-161.
  14. Johnson, G. A., Lewis, R. A., & Nubbemeyer, E. I. (2017). Ghost Ads. Journal of Marketing Research, 54(6), 867-884.
  15. Hernán, M. A., & Robins, J. M. Causal Inference: What If. Livro aberto.
  16. NIST/SEMATECH. Sample sizes required.
  17. Google Trends. FAQ about Google Trends data.
  18. Google Ads. Conversion Lift measurement.

Amostras, métodos, efeitos, contrapontos e limitações estão detalhados no dossiê de pesquisa deste tema. Data de corte: 2026-09-30.