Metodologias & Qualidade

Teste de hipóteses na qualidade: qual teste para cada pergunta do chão de fábrica

O valor-p diz se a diferença é difícil de explicar pelo acaso. Ele não diz se ela importa, não diz o tamanho dela e não diz se vale investir

Thiago Coutinho
Publicado em 26 de set de 2026  ·  Atualizado em 26 de set de 2026  ·  17 min de leitura

O teste de hipóteses na qualidade costuma ser ensinado de trás para frente. Primeiro vem a família estatística, depois alguém procura uma pergunta que caiba nela. No chão de fábrica a ordem é inversa: existe uma dúvida concreta, com dono, prazo e dinheiro atrás.

A tese deste texto é curta. O valor-p responde uma pergunta estreita, e ela não é a pergunta que a fábrica tem. Ele diz se a diferença observada é difícil de explicar pelo acaso. Não diz se ela importa, não diz o tamanho dela e não diz se vale investir.

Projeto de melhoria que para no "deu significativo" tomou meia decisão. A outra metade mora no tamanho do efeito, no intervalo de confiança e no custo de agir. Nenhuma dessas três informações sai de um valor-p, e as três são o que a diretoria pergunta.

Aqui não se explica o que é hipótese nula nem de onde vem a distribuição t. Isso está resolvido no artigo de teste de hipóteses, que trata da teoria e do passo a passo. Este texto começa onde aquele termina: na escolha do teste por pergunta e na leitura do resultado.

Sobre a procedência dos números: todos os valores-p, intervalos de confiança e tamanhos de amostra foram calculados em Python, com SciPy e statsmodels, a partir dos dados impressos em cada exemplo. As taxas de rejeição do teste de normalidade saíram de simulação, com 20.000 repetições por tamanho de amostra até n igual a 1.000. Os conjuntos são didáticos.

A pergunta que o valor-p responde, e a que a fábrica faz

O valor-p tem definição precisa e uso impreciso. Ele é a probabilidade de observar um resultado tão extremo quanto o seu, ou mais, num mundo onde a hipótese nula é verdadeira. Repare no que está dentro da frase: um mundo hipotético, uma medida de surpresa, nenhuma referência ao tamanho da diferença.

A fábrica pergunta outra coisa. Ela quer saber se compensa comprar a máquina, se vale trocar o fornecedor, se o ajuste deve virar padrão. Isso depende de quanto a diferença vale em reais ou em peças, e o valor-p é mudo sobre isso. A declaração da American Statistical Association sobre valores-p registra exatamente esse limite.

A confusão fica cara porque o valor-p é sensível ao tamanho da amostra. Com amostra suficiente, qualquer diferença diferente de zero fica significativa. A saída é usar o teste no lugar certo, na fase de análise do método DMAIC, como filtro contra o acaso e nunca como decisor econômico.

Comece pela pergunta prática, não pela família estatística

A tabela abaixo é o índice deste artigo. Cada linha traz uma pergunta de reunião de produção, o teste que a responde, o pressuposto que precisa valer e o que a saída entrega. O manual de estatística aplicada do NIST organiza as mesmas famílias por tipo de comparação.

Pergunta do chão de fábricaTeste indicadoPressuposto que precisa valerO que a saída entrega
A máquina nova ganha da antiga?t de duas amostrasGrupos independentes, diferença quase normalDiferença de médias com faixa
O ajuste melhorou nesta peça?t pareadoMesmas unidades antes e depoisMédia das diferenças individuais
Os três turnos entregam o mesmo?ANOVA de um fatorVariâncias parecidas entre gruposSe há grupo diferente, sem dizer qual
O fornecedor B refuga mais?Duas proporçõesCinco sucessos e cinco falhas por grupoDiferença em pontos percentuais
A taxa de defeito caiu?Duas proporções no tempoSó a mudança separou os períodosQueda sujeita a confundimento
Turno e defeito estão associados?Qui-quadradoEsperado de cinco ou mais por célulaSe o perfil muda, e onde
A variação diminuiu?Teste F ou LeveneF exige normalidade; Levene tolera desvioRazão entre variâncias e a faixa dela
Meus dados são normais?Anderson-DarlingObservações independentesEvidência que depende do n

Leia a coluna do pressuposto com atenção. É ali que a maioria dos testes desanda, e não na conta. Software nenhum avisa que a amostra foi escolhida depois.

Falta uma coluna, e ela é de propósito. Nenhum desses testes diz o que fazer. Todos devolvem uma medida de surpresa e, quando bem pedidos, uma estimativa com faixa. Relação entre variáveis contínuas muda de família e vira regressão linear.

A máquina nova é melhor que a antiga?

Esta é a pergunta de duas médias independentes, e o instrumento é o teste t de duas amostras. Independentes quer dizer que nenhuma peça da máquina nova tem par na antiga: dois conjuntos separados, medidos no mesmo período.

Tempo de ciclo em segundos, 40 peças de cada máquina. A antiga entregou média de 62,4 segundos com desvio padrão de 4,8. A nova entregou 59,1 com desvio de 5,2. A diferença observada é de 3,3 segundos.

Com desvio agrupado de 5,004 e erro padrão de 1,1189, a estatística t vale 2,949 com 78 graus de liberdade. O valor-p bilateral é 0,0042 e o intervalo de confiança de 95% vai de 1,072 a 5,528 segundos.

Repare no salto de informação. O valor-p diz que 3,3 segundos são difíceis de atribuir ao acaso. O intervalo diz que o ganho real está entre um segundo e cinco e meio por peça, e é com essa faixa que o financeiro decide.

O ajuste melhorou? Por que parear muda tudo

Quando as mesmas peças são medidas antes e depois de uma intervenção, o teste correto é o t pareado. A escolha não é preciosismo: ela muda o resultado de forma brutal. Doze peças foram medidas antes e depois de um ajuste de ferramenta.

A média antes foi 14,25 milímetros, com desvio padrão de 2,459. A média depois foi 13,30, com desvio de 2,300. Tratando os conjuntos como independentes, a estatística t vale 0,977 e o valor-p é 0,3390. Nada provado.

Agora olhe as diferenças individuais, peça por peça. Elas têm média de 0,95 e desvio padrão de apenas 0,2067 milímetro. A estatística t pareada vale 15,921, o valor-p é da ordem de 0,00000001 e o intervalo de 95% vai de 0,8187 a 1,0813 milímetro.

A explicação é simples. As peças diferem muito entre si, e essa variação entra inteira no denominador do teste independente. O pareamento a cancela, porque cada peça vira a sua própria referência. Havendo par natural, perder o pareamento é jogar fora poder estatístico de graça.

Os três turnos entregam a mesma coisa? E o que vem depois da ANOVA

Comparar três ou mais grupos com testes t sucessivos infla o alarme falso: três comparações a 5% cada levam o risco real para 14,3%. A ANOVA de um fator testa tudo de uma vez, com um alfa só.

Dez medições de dureza por turno. O turno A ficou em 48,60, o B em 48,65 e o C em 50,06. A ANOVA devolve F igual a 37,48, com valor-p de 1,6 vezes dez elevado a menos oito. Mas ela não diz qual turno é o diferente.

Esse é o limite que quase ninguém comenta. A ANOVA rejeita a igualdade geral e devolve o problema. O passo seguinte é uma comparação múltipla com correção, e a mais usada é o teste de Tukey.

Par comparadoDiferença de médiasIntervalo de Tukey a 95%Leitura para o projeto
Turno A contra turno B-0,05de -0,525 a 0,425Indistinguíveis; nada a investigar entre eles
Turno A contra turno C-1,46de -1,935 a -0,985C entrega dureza maior, e a diferença é grande
Turno B contra turno C-1,41de -1,885 a -0,935O turno C é o único fora do padrão

O quadro muda a conversa. Em vez de "os turnos são diferentes", a equipe leva uma frase acionável: o turno C está cerca de 1,4 ponto acima dos outros dois. Isso é insumo direto para a análise de causa raiz.

O fornecedor B refuga mais que o A?

Quando a saída é aprovado ou reprovado, a média não serve. O parâmetro é a proporção, e o pressuposto prático é ter pelo menos cinco peças de cada tipo em cada grupo.

Fornecedor A com 12 refugos em 200 peças, ou 6,0%. Fornecedor B com 20 em 200, ou 10,0%. A diferença é de 4 pontos percentuais, o que significa refugo 67% maior no fornecedor B.

A proporção agrupada é 0,08 e o erro padrão é 0,027129. A estatística z vale 1,4744 e o valor-p é 0,1404. A 5%, não se rejeita a igualdade. Muita reunião termina aqui com a frase "os fornecedores são equivalentes", e ela está errada.

O intervalo de 95% para a diferença, porém, cobre de menos 1,30 ponto percentual até mais 9,30. Os dados admitem o fornecedor B sendo 9,3 pontos pior. O caso volta fechado adiante.

A taxa de defeito caiu depois da mudança?

Tecnicamente é o mesmo teste de duas proporções. Na prática é outro problema, porque os grupos não foram sorteados: são dois pedaços do tempo, e o tempo carrega tudo o que aconteceu junto.

Antes da mudança, 96 defeitos em 4.000 peças, ou 2,40%. Depois, 68 em 4.000, ou 1,70%. A estatística z vale 2,209, o valor-p é 0,0272 e o intervalo para a queda vai de 0,08 a 1,32 ponto percentual.

O teste está certo e a conclusão pode estar errada. Entre os períodos também mudou o lote de matéria-prima, entrou verão e o cliente afrouxou um critério de inspeção. O teste não sabe de nada disso.

A defesa não é inferência, é gráfico no tempo. Uma carta de controle mostra se a queda foi um degrau na data da mudança ou uma deriva que já vinha antes, e as regras de decisão do CEP dizem quando o degrau é sinal.

Existe associação entre turno e tipo de defeito?

Às vezes a pergunta não é quanto, é se o perfil muda. Turnos diferentes produzem defeitos diferentes? Isso é tabela cruzada, e o teste é o qui-quadrado de independência.

Uma tabela de inspeção com três turnos e três tipos de defeito soma 228 ocorrências. O turno A registrou 42 riscos, 18 rebarbas e 15 dimensionais. O B registrou 38, 21 e 17. O C registrou 19 riscos, 46 rebarbas e 12 dimensionais.

O qui-quadrado vale 26,528 com 4 graus de liberdade, e o valor-p é 2,5 vezes dez elevado a menos cinco. A menor frequência esperada é 14,5, acima do mínimo de cinco. O teste é válido e a associação existe.

Só que o valor-p não diz onde ela está. Quem diz são os resíduos padronizados: o turno C tem mais 3,23 em rebarba e menos 2,50 em risco. O V de Cramér vale 0,241, e é esse número, não o valor-p, que decide se vale montar um diagrama de Pareto por turno.

A variação diminuiu? O teste mais esquecido

Quase todo projeto testa média e ignora variância. É um erro caro: o cliente sente dispersão antes de sentir deslocamento, e processo centrado e espalhado gera refugo nas duas pontas sem que nenhum teste de média perceba.

Vinte e cinco peças por condição. Antes, desvio padrão de 0,42 milímetro. Depois, 0,28. A razão de variâncias é 2,25, e o teste F devolve valor-p de 0,0524. Pelo critério de 5%, não rejeitou por pouco.

Agora traduza. Com tolerância de mais ou menos 1,2 milímetro, o Cp sai de 0,952 para 1,429 e o refugo esperado cai de 4.275 partes por milhão para 18. É uma redução de mais de duzentas vezes, com valor-p de 0,05.

Esse é o retrato da tese deste artigo. O intervalo da razão de desvios vai de 0,996 a 2,260, e essa largura é o recado real. Vale cruzar o achado com capabilidade do processo e com a diferença entre limites de controle e de especificação.

Uma advertência técnica: o teste F é muito mais sensível a desvios de normalidade que o teste t. Na dúvida, use o teste de Levene, que aguenta cauda pesada.

Meus dados são normais? A pergunta que quase todo mundo responde errado

O teste de normalidade é o mais usado e o pior interpretado do arsenal. Ele inverte o hábito: aqui a hipótese nula é o resultado que você quer, e não rejeitar é bom sinal.

O problema é que o poder de qualquer teste cresce com a amostra. Como nenhum processo real é exatamente normal, com amostra grande a rejeição é praticamente certa. A tabela mostra isso por simulação, sempre com a mesma população.

Tamanho da amostraVezes em que rejeita a normalidadeO que concluir
20 peças7,2%Quase nada detecta; não rejeitar não prova nada
50 peças8,0%Começa a enxergar, ainda muito pouco
100 peças10,5%Uma rejeição em dez, sem que nada tenha mudado
300 peças23,9%Quase um quarto das vezes acusa o desvio leve
1.000 peças68,6%Rejeição vira o resultado esperado
5.000 peças100,0%Rejeita sempre, e o desvio continua irrelevante

A população simulada tem assimetria de apenas 0,258 e não muda de uma linha para a outra. O que muda é quantas peças foram medidas. O teste não ficou mais certo com n grande: ficou mais sensível a um desvio que não atrapalha nada.

A conduta correta tem três partes. Olhe o histograma antes do valor-p. Pergunte se o desvio muda a decisão. E lembre que o teste t tolera desvios moderados acima de trinta observações, porque o teorema central do limite trabalha a seu favor.

Significância estatística contra relevância prática

As duas dimensões são independentes, e cruzá-las gera quatro cenários. Três deles são mal conduzidos na prática. O quadro abaixo é o que eu peço para colar no relatório de análise.

CenárioComo está o valor-pComo está o tamanho do efeitoConduta correta
Sinal verdadeiro e útilAbaixo do alfaGrande em unidade de negócioImplante, padronize e leve ao plano de controle
Verdadeiro e inútilAbaixo do alfaPequeno demais para pagar a açãoRegistre e não invista
Promissor e não provadoAcima do alfaGrande o bastante para interessarNão descarte; aumente a amostra e repita
Nem sinal nem efeitoAcima do alfaPequeno mesmo no melhor canto da faixaEncerre a linha e siga para outra causa

A segunda linha é a que mais queima orçamento. Alguém roda o teste com meio milhão de registros de sistema, acha p abaixo de 0,001 e aprova um projeto que devolve 0,3% de ganho. O valor-p estava certo e a decisão estava errada.

A terceira destrói boas ideias. A equipe testa com trinta observações, não rejeita e arquiva a hipótese. A pergunta que separa as quatro linhas não é estatística: qual é a menor diferença que mudaria a minha decisão?

Exemplo resolvido 1: o valor-p é minúsculo e o efeito é irrelevante

Linha de envase, especificação de 500 mililitros com tolerância de mais ou menos 5. Duas linhas paralelas medidas durante uma semana, com 2.000 garrafas cada, na mesma balança calibrada. A linha A entregou média de 500,42 mililitros e a B entregou 500,30, com desvio padrão de 1,20 nas duas.

  1. Erro padrão da diferença: 1,20 vezes a raiz de dois sobre 2.000, ou 0,037947 mililitro.
  2. Estatística de teste: 0,12 dividido por 0,037947, ou t igual a 3,1623 com 3.998 graus de liberdade.
  3. Valor-p bilateral: 0,001577, altamente significativo a qualquer alfa usual.
  4. Valor crítico de t a 95%: 1,9606, bem abaixo dos 3,1623 calculados.
  5. Intervalo de confiança de 95%: de 0,0456 a 0,1944 mililitro.

Agora a leitura que importa. O pior canto do intervalo é 0,1944 mililitro, ou 3,89% da metade da tolerância. Mesmo no cenário mais pessimista compatível com os dados, a diferença consome menos de 4% da folga disponível.

O d de Cohen vale 0,100, fronteira do efeito pequeno. Nenhum cliente detecta 0,12 mililitro numa garrafa. Rode a mesma diferença com 60 garrafas por linha: t cai para 0,548 e o valor-p sobe para 0,5849, com efeito físico idêntico.

Conclusão em ata: existe diferença real entre as linhas, ela é estatisticamente sólida e é operacionalmente irrelevante. Nenhuma ação é aberta. Esse tipo de frase economiza mais dinheiro que muita melhoria implantada.

Exemplo resolvido 2: não rejeitar não prova que são iguais

Volta o caso dos dois fornecedores, agora fechado. Doze refugos em 200 peças do fornecedor A, vinte em 200 do fornecedor B, recebimentos do mesmo mês e mesmo critério de inspeção.

  1. Proporções observadas: 6,00% no fornecedor A e 10,00% no B, diferença de 4 pontos percentuais.
  2. Proporção agrupada: 32 refugos em 400 peças, ou 0,0800.
  3. Erro padrão agrupado: raiz de 0,08 vezes 0,92 vezes a soma de um sobre 200 duas vezes, ou 0,027129.
  4. Estatística z: 0,04 dividido por 0,027129, ou 1,4744, com valor-p bilateral de 0,1404.
  5. Intervalo de confiança de 95%: de menos 1,30 a mais 9,30 pontos percentuais.

O valor-p de 0,1404 não rejeita a igualdade a 5%. Quem lê só essa linha escreve que os fornecedores são equivalentes. O intervalo desmente na hora: os dados admitem o fornecedor B sendo até 9,30 pontos percentuais pior.

Sobre 120 mil peças por ano, 4 pontos percentuais equivalem a 4.800 refugos a mais, e no pior canto do intervalo passa de 11 mil. Chamar isso de equivalência é decisão tomada por engano de leitura.

O que faltou foi amostra. O poder desse teste para detectar 4 pontos percentuais, com 200 peças por grupo, é de apenas 31,3%. Para chegar a 80% seriam necessárias 721 peças por fornecedor. O estudo foi inconclusivo, e inconclusivo não é sinônimo de igual.

Reporte o intervalo de confiança, não o valor-p

Se tivesse que escolher um único número para levar à reunião, não seria o valor-p. Seria o intervalo de confiança do efeito, que contém tudo o que o valor-p diz e acrescenta o que ele esconde.

O intervalo responde três perguntas de uma vez. A diferença é compatível com zero? Veja se o zero está dentro. Qual o tamanho plausível do efeito? Está nos extremos. Vale investir? Compare o pior canto com o limiar de relevância.

Compare duas frases sobre o mesmo dado. A primeira: "a diferença foi significativa, com p igual a 0,0042". A segunda: "a máquina nova economiza entre 1,1 e 5,5 segundos por peça, com 95% de confiança". Só a segunda permite decidir.

Há ainda um caso em que o intervalo é insubstituível. Quando o objetivo é provar equivalência, o teste clássico não serve: é preciso definir uma margem e verificar se o intervalo inteiro cabe dentro dela. É assim que se qualifica um segundo fornecedor.

Erro tipo 1 e erro tipo 2 traduzidos para a decisão de negócio

Os dois erros têm nome estatístico e conta bancária. Vale escrever a matriz com o custo real em cada casa antes de fixar o alfa, porque os 5% de praxe não são lei da natureza.

Situação real do processoSe você rejeitar a hipótese nulaSe você não rejeitar a hipótese nulaOnde a conta aparece
Nada mudou de verdadeErro tipo 1: investe em solução que não resolveDecisão correta: segue procurando a causaCapex desperdiçado e credibilidade do projeto
Alguma coisa mudouDecisão correta: age sobre a causa certaErro tipo 2: descarta a causa verdadeiraRefugo que continua e meses de projeto perdidos

Em triagem de causas, onde depois vem confirmação, o erro tipo 2 é o mais caro. Descartar cedo a causa verdadeira manda a equipe caçar no lugar errado por meses, e ali faz sentido afrouxar o alfa para 10%.

Em decisão cara e irreversível, como parar uma linha ou recolher um lote, o erro tipo 1 domina e o alfa de 1% se justifica. A maioria dos projetos fixa 5% por hábito e nunca menciona o beta, que é aceitar um risco sem saber o tamanho dele.

Poder do teste: a variável que você controla antes de coletar

Poder é a probabilidade de detectar um efeito que realmente existe. Ele é um menos beta e depende de quatro coisas: o efeito que interessa, a dispersão do processo, o alfa escolhido e o tamanho da amostra.

Das quatro, só duas estão sob controle direto. O alfa você fixa e a amostra você compra. O efeito é o que é, e a dispersão só muda se o processo mudar. Por isso a conversa sobre poder termina sempre em tamanho de amostra.

O caso dos fornecedores é a demonstração completa. Com 200 peças por grupo, o poder para detectar 4 pontos percentuais é de 31,3%. Com 721 peças por grupo sobe para 80%. Nada mudou além do número de peças inspecionadas.

Existe ainda o poder calculado depois do teste, que virou moda em relatório. Ele é circular, porque usa o efeito observado para justificar o resultado observado. Poder se calcula antes, com o efeito mínimo de interesse.

O p-hacking involuntário: testar dez coisas e contar uma

Ninguém acorda decidido a fraudar uma análise. O p-hacking de chão de fábrica é involuntário: a equipe cruza a saída com tudo o que tem em planilha e reporta o cruzamento que deu significativo.

Cada teste isolado a 5% tem 5% de chance de alarme falso quando nada existe. Rodando vários, a chance de ao menos um falso positivo cresce rápido, e o relatório só mostra o vencedor.

Quantos testes foram rodadosChance de ao menos um alarme falsoAlfa individual por Bonferroni
2 testes9,8%0,0250
3 testes14,3%0,0167
5 testes22,6%0,0100
10 testes40,1%0,0050
20 testes64,2%0,0025

Com vinte cruzamentos, pouco para uma planilha de qualidade, a chance de achar ao menos uma associação inexistente passa de 64%. O achado reportado tem mais chance de ser ruído do que de ser causa.

Três defesas funcionam. Declare as hipóteses antes de olhar o dado, no charter. Corrija o alfa quando os testes são muitos. E separe o dado em duas partes, uma para gerar hipótese e outra para testar, como faz qualquer exemplo de DMAIC que sustentou o ganho na fase de controle.

Independência das observações e o que fazer quando o pressuposto não vale

Todos os testes deste artigo assumem observações independentes. O chão de fábrica viola esse pressuposto o tempo todo, sem que ninguém perceba: peças consecutivas saem da mesma bobina, da mesma panela e do mesmo setup.

Com autocorrelação, o erro padrão calculado fica menor do que deveria e o valor-p fica artificialmente pequeno. Com correlação de 0,5 entre observações vizinhas, cem medições valem como 33 independentes. Com 0,7, valem como 18, e o erro padrão sai subestimado em 2,38 vezes.

A defesa é de coleta, não de conta. Espace as medições no tempo, sorteie a ordem e registre lote, turno e setup. O controle estatístico de processo revela a estrutura temporal antes do teste.

Quando outros pressupostos falham, existe caminho. Para normalidade violada com amostra pequena, use Mann-Whitney ou Wilcoxon. Para variâncias muito diferentes, use Welch. Para célula esperada abaixo de cinco, use o teste exato de Fisher. E quando nada se encaixar, o bootstrap constrói o intervalo direto do dado.

Por último, o pressuposto que nenhum teste conserta: dado ruim. Comece pelos seus indicadores de qualidade e por um plano de controle que defina como cada número nasce. O teste de hipóteses é uma das ferramentas do Lean Seis Sigma, e ele só elimina a explicação do acaso. O tamanho, o valor e a decisão continuam sendo trabalho de gente.

Perguntas frequentes

Qual teste de hipóteses usar na qualidade quando comparo duas máquinas?
Se as peças de cada máquina são grupos separados, use o teste t de duas amostras independentes. Se as mesmas peças passaram pelas duas condições, use o t pareado. O pareamento cancela a variação entre peças e costuma multiplicar o poder do teste.
O valor-p deu 0,03. Posso implantar a melhoria?
Não com essa informação sozinha. O valor-p apenas indica que a diferença é difícil de explicar pelo acaso. Antes de implantar, veja o tamanho do efeito em unidade de negócio e o intervalo de confiança, e compare o pior canto do intervalo com o custo da ação.
Não rejeitei a hipótese nula. Isso prova que os dois grupos são iguais?
Não. Não rejeitar é falta de evidência, e não evidência de ausência. No exemplo dos fornecedores deste artigo, o valor-p de 0,1404 convive com um intervalo que admite até 9,3 pontos percentuais de diferença. Para provar equivalência é preciso um teste desenhado para isso.
Por que o teste de normalidade rejeita sempre quando tenho muitos dados?
Porque nenhum processo real é exatamente normal e o poder do teste cresce com a amostra. Na simulação deste artigo, um desvio de assimetria de 0,258 é rejeitado em 7,2% das vezes com 20 peças e em 100% das vezes com 5.000. Olhe o histograma antes do valor-p.
Posso comparar três turnos com três testes t, dois a dois?
Não deveria. Três comparações a 5% cada levam o risco de alarme falso para 14,3%. Use ANOVA de um fator para saber se existe diferença e, havendo, um teste de comparações múltiplas como o de Tukey para descobrir qual grupo é o diferente.
Por que o teste de variância é tão importante e tão esquecido?
Porque o cliente sente dispersão antes de sentir deslocamento de média. No exemplo deste artigo, reduzir o desvio padrão de 0,42 para 0,28 milímetro derruba o refugo esperado de 4.275 para 18 partes por milhão, e o valor-p do teste F ficou em 0,0524.
O que é p-hacking involuntário em projeto de qualidade?
É cruzar a variável de saída com tudo o que existe na planilha e reportar apenas o cruzamento que deu significativo. Com 20 testes, a chance de ao menos um falso positivo passa de 64%. A defesa é declarar as hipóteses antes e corrigir o alfa quando os testes são muitos.
Como saber se minha amostra é grande o suficiente?
Calcule o poder antes de coletar, a partir do menor efeito que mudaria a sua decisão. No caso dos fornecedores, 200 peças por grupo dão apenas 31,3% de poder para detectar 4 pontos percentuais, e seriam necessárias 721 peças por grupo para chegar a 80%.
Meus dados não são normais. O que faço?
Primeiro verifique se o desvio é grande o bastante para mudar a decisão, porque o teste t tolera bem desvios moderados acima de trinta observações. Se o desvio for forte, use Mann-Whitney no lugar do t independente, Wilcoxon no lugar do pareado ou bootstrap.
Por que reportar o intervalo de confiança é melhor que reportar o valor-p?
Porque o intervalo contém a informação do valor-p e acrescenta o que ele esconde. Ele mostra se o zero está dentro, qual o tamanho plausível do efeito e qual o pior cenário compatível com os dados. Só com essa faixa dá para comparar o ganho com o custo da ação.
Thiago Coutinho
Escrito por
Thiago é engenheiro de produção, pós-graduado em estatística e mestre em administração pela UFJF. Especialista Black Belt em Lean Six Sigma, trabalhou na Votorantim Metais e MRS Lo…

Conteúdos de Metodologias & Qualidade

Materiais, resumos e podcasts para você se aprofundar no tema.

Ver todos os conteúdos de Metodologias & Qualidade