Ebook Salll · Nº 34 · Método

Como testar uma PDP sem laboratório.

Pare de perguntar se a pessoa entendeu. Peça para encontrar, lembrar, distinguir e explicar. Um protocolo de pesquisa que cabe numa tela, num roteiro e numa planilha.

Leitura de 24 minutos · Protocolos copiáveis · Pesquisa verificada

Personagem Salll mede uma página de produto com cronômetro, escala, cartões e registro de contexto
Não é um laboratório. É um sistema de comparação.
A pergunta que falha

"Entendeu?" quase sempre produz um sim inútil.

Depois de explicar um caminho, perguntar se a pessoa entendeu é confortável. Pedir que ela repita o caminho mostra o que realmente ficou. A mesma diferença separa uma reunião de aprovação de uma pesquisa.

Uma PDP não precisa de câmera ocular, espelho falso ou laboratório para ser testada. Precisa de uma tarefa que possa dar certo ou errado, de uma medida compatível com a pergunta e de uma comparação que não mude tudo ao mesmo tempo.

Diagrama com bonequinhas medindo uma página de produto por tempo, memória, reconhecimento, esforço, afeto, contexto e entrevista
Uma página, medidas diferentes. Cronômetro, memória, discriminação, esforço, afeto, contexto e incidente respondem a perguntas diferentes.
Tese central. Opinião não desaparece. Ela deixa de ser o veredito e vira uma medida entre outras.
01
Capítulo 1 · Uma pergunta, uma medida

Uma PDP não tem uma nota só.

ISO 9241-11 trata usabilidade como eficácia, eficiência e satisfação dentro de um contexto de uso. Essa separação é a defesa contra a conclusão preguiçosa. Uma página pode ser rápida e errada. Pode ser lembrada e desagradável. Pode parecer fácil e não permitir concluir a tarefa.

01

Primeira impressão

O que apareceu primeiro? Teste de exposição curta. Não mede interação.

02

Acerto

A tarefa terminou certa? Variante, preço, condição e prova precisam fechar.

03

Tempo

Quanto custou? Só vale junto com o critério de sucesso.

04

Recall

O que ficou sem pista? Produção espontânea depois que a tela some.

05

Reconhecimento

O que foi distinguido? Alvos e distratores, incluindo falsos alarmes.

06

Esforço

Quanto trabalho pareceu exigir? NASA-TLX depois de tarefa concreta.

07

Afeto

Como a pessoa se sentiu? Valência, ativação e controle, separadamente.

08

Contexto

Quando a dúvida aparece? Registros próximos de episódios reais.

A regra da medida. Se a pergunta é "encontrou a variante?", a resposta é acerto e tempo. Se a pergunta é "o benefício ficou?", a resposta é recall. Gostar não substitui nenhum dos dois.
02
Capítulo 2 · Cinco segundos não são veredito

Serve para saliência. Não serve para uso.

Lindgaard e colegas mostraram que pessoas formam avaliações de apelo visual em 50 milissegundos. Isso é evidência de primeira impressão rápida, não de entendimento rápido. Em 2016, Gronier comparou 68 participantes expostos por cinco segundos a 78 com tempo livre. O grupo de cinco segundos não capturou todos os objetivos da página e avaliou pior dimensões pragmáticas.

5 segundosUse para

Produto, formato, quantidade, benefício dominante e elemento mais saliente.

Mostre uma captura estática, cubra a tela e comece com recall livre. Perguntas específicas entram depois para não contaminar o que veio espontaneamente.

10 segundosUse como contraponto

PDP densa, público mais heterogêneo ou hipótese de complexidade.

Kuric e colegas, com 120 participantes, mostraram que memória de trabalho, velocidade perceptual e complexidade visual alteram o feedback em exposições de 2, 5 e 10 segundos.

Tarefa realUse para decidir

Encontrar preço, escolher variante, verificar compatibilidade, comparar opções ou localizar prova.

Quando há interação, cronometre acerto, erro e abandono. Uma captura de cinco segundos não substitui a página em uso.

Resultado nulo que importa

Nem tudo mudou entre cinco segundos e tempo livre.

No estudo de Gronier, identificação do objetivo principal, AttrakDiff total e avaliação de design não apresentaram diferença significativa. O efeito apareceu em dimensões pragmáticas e qualidade da informação. A conclusão útil não é "cinco segundos funcionam" nem "não funcionam". É que o método mede outra camada.

Protocolo mínimo. Não anuncie o que está testando. Exponha. Cubra. Pergunte "que produto era?", "o que ficou?" e "o que pareceu mais importante?". Só depois pergunte sobre campos específicos.
03
Capítulo 3 · Cronometre o acerto, não a pressa

O tempo só existe depois do sucesso.

Uma pessoa pode responder em nove segundos porque escolheu o pacote errado. Outra pode levar quarenta porque conferiu a condição de assinatura. Sem definir o final correto, o cronômetro premia atalho, erro e abandono.

Tarefa copiável

Você precisa de café para prensa francesa, sem acidez alta. Descubra se este produto serve e qual é o preço final da opção de 250 g.

Escreva o critério antes

Sucesso, sucesso parcial, erro crítico, abandono, início e fim do relógio.

Cronometre em silêncio

Think-aloud pode alterar duração. Se a fala for necessária, use o mesmo protocolo em todas as versões e trate o tempo como dado daquele protocolo.

Registre o caminho

Cliques, voltas, mudança de variante, consulta à galeria, expansão do A+ e ponto da hesitação.

Separe falha de lentidão

Quem errou ou abandonou não entra na mesma mediana de quem concluiu corretamente.

Mostre a distribuição

Mediana, dispersão e trajetórias individuais. Uma média sozinha esconde dois modos de falha.

Falha real. A tarefa pode ficar mais rápida depois de remover uma condição necessária. Eficiência sem completude vira velocidade para uma decisão pior.
04
Capítulo 4 · O que ficou e o que só parece familiar

Recall e reconhecimento não são sinônimos.

O primeiro pede produção sem pista. O segundo apresenta alternativas. Koriat e Goldsmith mostraram que formato do teste, quantidade recuperada e precisão precisam ser separados. Em PDP, isso impede chamar familiaridade de memória espontânea.

Recall livre

O que sobreviveu?

"Conte tudo o que você lembra da oferta, na ordem que vier."

Codifique produto, formato, quantidade, benefício, condição, preço, review e prova como correto, aproximado, ausente ou falso.

Risco: ausência não prova que a informação nunca foi vista.

Reconhecimento

O que foi distinguido?

"Quais destas informações apareceram na página?"

Misture alvos e distratores plausíveis. Registre acertos, rejeições corretas e falsos alarmes.

Risco: contar apenas acertos premia quem marca tudo.

Ordem corretaPor quêExemplo em PDP
1. Recall livrePreserva o que veio sem pista."O que você lembra do café?"
2. Pergunta específicaTesta uma unidade que pode ter sido omitida no relato."Qual era a quantidade?"
3. ReconhecimentoMede discriminação diante de alternativas.250 g / 500 g; baixa acidez / cítrica.
4. ConfiançaMostra se certeza e acerto caminham juntos.Escala de 1 a 5.
O erro mais valioso. A pessoa lembrar a promessa e esquecer a condição é diferente de esquecer as duas. O primeiro caso denuncia uma assimetria editorial.
05
Capítulo 5 · Esforço e afeto sem atalho

Duas escalas. Duas perguntas.

NASA-TLX

Workload

Mede carga de trabalho subjetiva depois de uma tarefa. A média pode esconder fontes diferentes de dificuldade, por isso as subescalas precisam continuar visíveis.

mentalfísicatemporaldesempenhoesforçofrustração

SAM

Afeto

Mede reação afetiva por figuras. Valência agradável não é confiança. Ativação alta pode ser entusiasmo ou tensão. Dominância representa sensação de controle e merece leitura cautelosa.

valênciaativaçãodominância

NASA-TLX nasceu de 16 experimentos de fatores humanos. SAM foi comparado a um diferencial semântico de 18 itens e mostrou alta convergência para prazer e ativação. Ambos são instrumentos subjetivos. Nenhum substitui acerto, tempo ou observação.

Contraponto recente

O instrumento conhecido também falha.

Uma revisão de 2025 sobre NASA-TLX em HCI encontrou problemas de definição, aplicação, validade convergente e sensibilidade. Em 2026, uma revisão de 522 artigos CHI encontrou grande variação de uso e menor distinção entre subescalas do que no desenvolvimento original. Use para comparar tarefas dentro do estudo, não como nota universal.

Leitura defensiva. Aplique imediatamente depois de uma tarefa concreta. Preserve cada dimensão. Depois pergunte, sem sugerir a causa: "o que na página mais contribuiu para essa avaliação?".
06
Capítulo 6 · Quando a PDP sai da sala

O contexto explica o que a sessão não viu.

Experience sampling e ecological momentary assessment pedem registros curtos perto do evento real. Em vez de "como você compra café online?", a pessoa registra a PDP que abriu, a dúvida que apareceu, o dispositivo, o canal e o que fez depois.

GatilhoPor evento

Abrir uma PDP, abandonar, salvar ou adicionar ao carrinho.

O registro precisa acontecer logo depois, sem depender da reconstrução de uma semana inteira.

45-60 sCarga controlada

Categoria, canal, dispositivo, objetivo, dúvida, informação faltante, confiança e desfecho.

Formulário longo reduz adesão e pode mudar o próprio comportamento que se deseja observar.

Dados aninhadosRegra de análise

Vários eventos pertencem à mesma pessoa.

Cem registros de dez pessoas não equivalem a cem participantes independentes. Analise variação dentro e entre pessoas.

Piloto operacional. Oito a doze pessoas, cinco a sete dias e três a cinco eventos por pessoa servem para testar o instrumento e descobrir padrões. Não servem para estimar prevalência de mercado.
07
Capítulo 7 · Quem vive no limite mostra antes

Usuário extremo revela mecanismo. Não frequência.

Uma pessoa que compra a categoria toda semana enxerga diferenças que o iniciante nem sabe nomear. Uma pessoa com baixa visão expõe dependência de cor. Quem já devolveu o SKU errado reconstrói o incidente que uma pergunta genérica não alcança.

1

Especialista da categoria

Compara atributos finos, ignora explicações básicas e cria atalhos próprios.

2

Primeira compra

Expõe vocabulário interno, hierarquia presumida e falta de contexto.

3

Tela pequena ou rede lenta

Mostra o que some quando a página degrada, empilha ou carrega tarde.

4

Baixa visão ou leitor de tela

Testa se estado, relação e sequência sobrevivem fora do arranjo visual.

5

Comparador de muitas abas

Revela quais atributos permitem voltar e distinguir uma oferta da outra.

6

Erro ou devolução recente

Reconstrói um incidente real de tamanho, sabor, compatibilidade ou quantidade.

Pergunta de incidente

Conte a última vez em que você quase comprou a variante errada. O que apareceu primeiro, o que você esperava e onde percebeu o erro?

Defina a dimensão extrema antes do recrutamento. Entreviste também pessoas do mainstream. O extremo amplia a falha; o centro mostra se a correção cria outro custo.

08
Capítulo 8 · O protocolo de 25 minutos

Uma sala comum. Um roteiro incomum.

2 min. Proteja a pessoa

"Estamos testando a página, não você. Eu não criei esta versão. Algumas tarefas podem ser impossíveis."

3 min. Primeira impressão

Exposição de cinco segundos, recall livre e três perguntas específicas escritas antes.

10 min. Tarefas silenciosas

Escolher variante, fechar preço e condição, localizar prova e responder com base na página.

5 min. Esforço e afeto

NASA-TLX, SAM e uma pergunta neutra sobre o que contribuiu para a avaliação.

5 min. Reconhecimento e incidente

Alvos e distratores, depois um episódio recente de compra ou abandono da categoria.

Moderador pode dizerModerador não pode dizer durante a tarefa
"O que você faria agora?""Você viu o preço ali?"
"O que você esperava que acontecesse?""Tente a galeria."
"O que fez você pensar isso?""Acho que você entendeu errado."
"Continue como faria sozinho.""Essa versão está mais clara?"
Ajuda é dado. Se o moderador intervier, registre o momento e a frase. A tarefa deixa de representar desempenho autônomo, mas continua mostrando onde a página exigiu resgate.
09
Capítulo 9 · O playbook por componente

Cada pedaço da PDP pede uma prova.

P1

Imagem principal

Cinco segundos + recall. Acerto de produto, formato e quantidade.

T

Título

Recall + reconhecimento. Atributos necessários e falsos alarmes.

V

Variantes

Tarefa cronometrada. SKU correto, estado selecionado, erro crítico e tempo.

B

Bullets

Recall. Benefício e condição precisam sobreviver como par correto.

G

Galeria

Tarefa + caminho. Encontrar a prova necessária, não apenas navegar.

A+

Conteúdo enriquecido

Tarefa + reconhecimento. Localizar detalhe e interpretar corretamente.

R$

Preço

Resposta final + confiança. Valor, variante e condição no mesmo escopo.

C

Confiança

SAM + incidente. Sensação de controle e causa narrada, sem chamar valência de compra.

Não misture tudo. Se uma versão altera imagem, título, preço e galeria ao mesmo tempo, o teste pode dizer que a experiência mudou. Não pode dizer qual mudança causou o efeito.
10
Capítulo 10 · Amostra e decisão

O número depende do que você vai afirmar.

Faulkner testou 60 pessoas e reamostrou grupos menores. Alguns conjuntos de cinco encontraram 99% dos problemas; outros, apenas 55%. Cinco pessoas podem abrir uma rodada. Não podem fechar qualquer decisão.

5-8

Rodada formativa

Por segmento. Localiza falhas, melhora roteiro e gera hipótese. Não estima porcentagem de mercado nem declara uma versão vencedora.

8-12

Primeira impressão e campo

Por segmento no teste de exposição; ou pessoas por 5-7 dias no diário. Serve para padrões qualitativos e teste do instrumento.

12-20

Piloto pareado

Mostra direção, variabilidade e trajetórias individuais. Não garante significância nem prova equivalência.

Poder

Comparação formal

Dimensione pelo menor efeito relevante, métrica primária e desenho. Binário, tempo, escala e dados repetidos pedem cálculos diferentes.

Os intervalos acima são recomendações operacionais Salll para pesquisa formativa, não thresholds científicos universais.

ResultadoDecisão permitidaDecisão proibida
4 de 5 erraram a varianteTratar como sinal grave e corrigir antes da próxima rodada.Publicar que 80% do mercado erra.
Tempo caiu em 6 de 8 pessoasManter a hipótese viva e estimar variabilidade.Declarar ganho universal de eficiência.
Diferença não significativaReportar incerteza e intervalo.Concluir que A e B são equivalentes.
NASA-TLX total igualExaminar subescalas e desempenho.Concluir que o esforço foi idêntico.
11
Capítulo 11 · A planilha que impede a memória criativa

Se não foi definido antes, vira história depois.

Uma planilha simples preserva o protocolo, separa estados e deixa o resultado auditável. Dado ausente, erro de captura, tarefa impossível e resposta errada não podem compartilhar a mesma célula vazia.

participantestarefasmemóriaescalasesmdicionário
AbaCampos mínimosRegra defensiva
participantesID, segmento, extremo, dispositivo, familiaridade, ordemSem nome no arquivo de análise.
tarefasversão, tarefa, início, fim, tempo, status, resposta, erro críticoFalha separada de tempo válido.
memóriamodo, item, alvo, resposta, classificação, confiançaPreservar resposta original.
escalasinstrumento, dimensão, valor, escala, varianteRaw TLX declarado; SAM sem soma global.
esmevento, horário, canal, dispositivo, dúvida, confiança, desfechoEventos continuam ligados à pessoa.
dicionáriodefinição, valores permitidos, unidade, código de ausênciaNada fica implícito.
Comparação limpa. Metade vê A-B, metade B-A. Mesma câmera, dispositivo, resolução, instrução e limite de ajuda. Quando a primeira versão ensina a segunda, use produtos equivalentes ou grupos diferentes.
12
Capítulo 12 · Café Salll Manaus em duas rodadas

O antes e depois é do teste.

Café Salll Manaus é uma marca-demo fictícia. O exercício abaixo mostra como uma equipe sai de "parece clara" para uma decisão rastreável sem inventar conversão.

Rodada 1 · hipótese
250 g
R$ 29,90
condição distante da variante
  • 5 segundos: lembraram café e embalagem; poucos citaram intensidade.
  • Tarefa: preço foi atribuído à variante errada em casos críticos.
  • Recall: benefício apareceu sem a condição.
  • Decisão: reorganizar escopo, não adicionar mais copy.
Rodada 2 · confirmação
250 g
R$ 29,90
250 g · compra avulsa · condição visível
  • Mesmas tarefas, instruções e critérios.
  • Acerto de variante e preço analisados antes do tempo.
  • Recall e reconhecimento continuam separados.
  • Se o efeito for incerto, a página entra em nova rodada, não em discurso de vitória.
Payoff. Testar não é produzir um número. É reduzir a quantidade de histórias que a equipe consegue contar sobre o mesmo comportamento.
Salll

Pesquisa só vale quando entra no ciclo.

A Salll transforma o achado em regra de cadastro, correção por canal e monitoramento. O teste não termina na apresentação. Termina quando a versão correta foi publicada, confirmada e passou pela próxima rodada.

01 Executar

Hipótese, versão, tarefa, critérios, conteúdo, adaptação por canal e correção da PDP.

02 Monitorar

Confirmação do publicado, regressão, mudança de varejo e recorrência da falha.

Caio Salim

Ex-sócio de operação Amazon na Europa, hoje à frente da metodologia Salll de execução em digital shelf. Este ebook é parte da série que documenta o método, capítulo a capítulo.

Fontes verificadas

Base metodológica

  1. NIST. Usability Testing. Fonte oficial.
  2. ISO 9241-11:2018. Ergonomics of human-system interaction. Página oficial.
  3. Lindgaard, G. et al. (2006). Attention web designers. DOI.
  4. Gronier, G. (2016). Measuring the First Impression. Artigo.
  5. Kuric, E. et al. (2024). Cognitive abilities and visual complexity impact first impressions. DOI.
  6. Faulkner, L. (2003). Beyond the five-user assumption. DOI.
  7. Koriat, A., & Goldsmith, M. (1994). Memory in naturalistic and laboratory contexts. DOI.
  8. Hart, S. G., & Staveland, L. E. (1988). Development of NASA-TLX. DOI. Instrumento oficial.
  9. Babaei, E. et al. (2025). Should we use the NASA-TLX in HCI? DOI.
  10. Lee, J. et al. (2026). NASA-Task Load Index in CHI. DOI.
  11. Bradley, M. M., & Lang, P. J. (1994). Measuring emotion. DOI.
  12. Shiffman, S., Stone, A. A., & Hufford, M. R. (2008). Ecological Momentary Assessment. DOI.
  13. Myin-Germeys, I. et al. (2018). Experience sampling methodology. DOI.
  14. von Hippel, E. (1986). Lead Users. DOI.
  15. Flanagan, J. C. (1954). The Critical Incident Technique. DOI.
  16. Malterud, K., Siersma, V. D., & Guassora, A. D. (2016). Information power. DOI.

Nota metodológica: estudos de HCI, psicologia, fatores humanos e pesquisa de campo sustentam instrumentos e limites. A aplicação a imagem principal, título, variantes, bullets, galeria, A+, preço e confiança é uma tradução operacional Salll para teste. Nenhuma medida isolada prova conversão.