Como calcular tamanho de amostra: os quatro números que definem o n
O n não é escolha de bom senso. Ele sai de quatro decisões tomadas antes da coleta, e quem chuta 30 está tomando essas quatro decisões sem perceber
A pergunta sobre como calcular tamanho de amostra quase sempre chega tarde. Alguém já coletou trinta peças, já rodou o teste, não deu diferença, e agora quer saber se trinta bastava. Nessa ordem, a resposta não serve para nada.
O tamanho de amostra não é escolhido, é calculado. Ele sai de quatro coisas decididas antes do primeiro dado: que diferença importa detectar, quanta variação o processo tem, quanto risco de alarme falso você aceita e quanto risco de não enxergar a diferença você aceita.
Quem diz trinta peças porque é o que a gente sempre faz está escolhendo esses quatro números do mesmo jeito, só que no escuro. Trinta peças com desvio padrão de 1,2 Nm só enxergam diferença a partir de 0,61 Nm.
Um aviso antes de seguir: calcular o n é outro problema, diferente de montar um plano de amostragem. O plano define de onde, quando e como tirar a peça, e está tratado em amostragem. Aqui a pergunta tem resposta numérica: quantas peças.
Sobre a procedência: todos os valores de n, poderes e intervalos deste artigo foram calculados em Python, com a distribuição normal padrão da biblioteca statistics. Os intervalos de capabilidade usaram qui-quadrado por função gama incompleta, conferida contra valores tabelados.
Tamanho de amostra não se escolhe, se calcula
Quem pergunta como calcular tamanho de amostra espera uma fórmula, e ela existe: uma conta fechada que devolve o número de peças. Ela não depende de experiência nem do que a equipe acha razoável. Depende de quatro entradas, e cada uma é uma decisão de negócio disfarçada de parâmetro estatístico.
A lógica é separar sinal de ruído. O sinal é a diferença que importa; o ruído é a variação que o processo já tem. Quanto menor o sinal diante do ruído, mais observações são necessárias.
Por isso a conta vem antes. Depois da coleta, o único cálculo possível é o inverso: que diferença aquela amostra conseguia detectar. É o que acontece na maioria dos testes de hipótese que terminam sem conclusão.
Os quatro insumos que definem o n
Antes de ver como calcular tamanho de amostra na prática, vale fixar o que cada entrada significa na decisão, não na estatística. Os nomes técnicos atrapalham mais do que ajudam, e a tabela traduz os quatro para a pergunta que cada um realmente responde.
| Insumo | Que pergunta ele responde | O que acontece se você errar |
|---|---|---|
| Efeito mínimo relevante, o delta | Qual é a menor diferença que mudaria a sua decisão? | Delta grande gera amostra barata e inútil; delta pequeno gera amostra impagável. |
| Desvio padrão do processo, o sigma | Quanta variação o processo já tem sem causa nova? | Subestimado, gera estudo sem poder; superestimado, gasta coleta à toa. |
| Alfa, o risco de alarme falso | Que chance você aceita de declarar melhoria onde não houve? | Frouxo, aprova mudança inútil; apertado, exige mais dados e enterra melhoria real. |
| Poder, o complemento do risco de não ver | Que chance você quer de enxergar a diferença, se ela existir? | Poder baixo produz estudo inconclusivo, depois de gastar a coleta inteira. |
Nenhuma das quatro perguntas é estatística. Todas são de negócio. Quem define o delta é quem paga pelo refugo; quem define o poder é quem banca o piloto. Não falta fórmula: falta alguém assinar embaixo.
Efeito mínimo relevante: a decisão mais difícil das quatro
O delta é a menor diferença que, se for real, muda alguma coisa. Não é a diferença esperada nem a prometida pelo fornecedor. É o ponto a partir do qual vale a pena agir.
Uma forma prática de chegar nele é inverter a pergunta. Se a melhoria for de meio por cento, você implanta? Se a resposta for não, suba até ela virar sim.
Esse número quase sempre tem lastro financeiro. Se cada ponto percentual de refugo custa quarenta mil reais por ano e o projeto custa sessenta mil, o delta defensável está perto de dois pontos. Abaixo disso, detectar não paga a conta.
Sem histórico para ancorar o delta, um histograma da situação atual mostra a escala do problema. Registre a decisão por escrito, porque ela será questionada depois que o resultado sair.
Desvio padrão: o insumo que o processo entrega
O sigma é o único dos quatro que você não negocia. É propriedade do processo, e o cálculo só precisa de uma estimativa honesta. O problema é que quase ninguém tem essa estimativa guardada.
Com histórico, use a variação de curto prazo, nunca o desvio da série inteira. A série longa inclui deslocamentos de média e turnos diferentes, e superestima o ruído. Uma planilha de coleta de dados organizada por subgrupo já entrega o número certo.
Sem histórico, existem quatro saídas defensáveis. Todas são melhores do que chutar o n direto.
- Piloto de 20 a 30 medições em condição normal: calcule o desvio amostral e some 20% de folga, porque sigma estimado com poucos dados costuma sair curto.
- Amplitude dividida por d2: com subgrupos de cinco peças, o sigma vale a amplitude média dividida por 2,326. Para subgrupos de quatro, o divisor é 2,059.
- Tolerância dividida por seis, assumindo capabilidade igual a 1: se a tolerância total é 3,0 Nm, o sigma presumido é 0,50 Nm. É otimista, então use com cautela.
- Delta padronizado: trabalhe em desvios padrão. Para detectar meio desvio com alfa de 5% e poder de 80%, o n é 32, em qualquer unidade de medida.
Alfa e poder: os dois riscos que você está comprando
Todo estudo erra de duas maneiras. Pode gritar diferença onde não há, e pode ficar calado onde há. Alfa e poder são os preços pagos para limitar cada um desses erros.
Alfa é a chance de alarme falso. Com 5%, um em cada vinte estudos feitos em processo que não mudou vai acusar melhoria. É o erro que aprova mudança inútil e vira caso de sucesso.
Poder é a chance de detectar a diferença quando ela existe no tamanho do delta. Poder de 80% aceita 20% de chance de não ver. É o erro que mata melhoria boa, e ele raramente aparece em relatório.
Por que o poder de 80% virou convenção, e por que ela é discutível
O valor tem origem conhecida. Jacob Cohen propôs 80% em 1965 como referência de trabalho: um risco de 20% de errar por omissão seria quatro vezes o risco de 5% aceito no alarme falso. Era proporção plausível, não dedução.
O problema é que a proporção quatro para um raramente corresponde aos custos reais. Num piloto de redução de refugo, não detectar uma melhoria que funciona costuma custar muito mais do que aprovar uma que não funciona.
Quando é assim, 80% é pouco. Subir para 90% no exemplo de média deste artigo leva o n de 46 para 61, aumento de 33% na coleta. É caro, mas comparável ao custo de repetir o piloto inteiro.
O cálculo para uma média, resolvido passo a passo
Saber como calcular tamanho de amostra começa pelo caso mais simples: comparar a média do processo com um valor alvo. A fórmula: n é igual a z alfa sobre dois mais z beta, vezes sigma dividido por delta, e o resultado elevado ao quadrado.
Exemplo. Torque de aperto com alvo de 12,0 Nm, e a suspeita é que a média saiu do alvo. O delta relevante é 0,5 Nm, o sigma histórico é 1,2 Nm, o alfa é 5% bilateral e o poder é 80%.
- Levante os dois valores z: 1,959964 para alfa de 5% bilateral, e 0,841621 para poder de 80%.
- Some os dois: 1,959964 mais 0,841621 resulta em 2,801585.
- Divida sigma por delta: 1,2 dividido por 0,5 resulta em 2,4.
- Multiplique: 2,801585 vezes 2,4 resulta em 6,723804.
- Eleve ao quadrado: 6,723804 ao quadrado resulta em 45,2095.
- Arredonde sempre para cima: 46 peças.
A verificação confirma: com 45 peças o poder real é 79,8%; com 46, sobe para 80,7%. Arredondar para baixo perde a especificação combinada.
Falta um ajuste honesto. A fórmula assume sigma conhecido, e na prática ele é estimado. Refeita com a distribuição t, a conta pede 47 peças para o mesmo poder. A regra prática é somar duas a três unidades ao resultado.
O que cada insumo faz com o n, em números
Com o exemplo do torque na mão, dá para ver o peso de cada entrada. A linha de base é sempre a mesma: delta de 0,5 Nm, sigma de 1,2 Nm, alfa de 5% e poder de 80%, que juntos produzem 46 peças.
| Insumo alterado | Valor usado no lugar | Peças necessárias | Leitura da mudança |
|---|---|---|---|
| Nenhum, linha de base | delta 0,5 / sigma 1,2 / alfa 5% / poder 80% | 46 | Referência das demais linhas |
| Delta | 1,0 Nm | 12 | Dobrar o efeito detectável corta a amostra para um quarto |
| Delta | 0,25 Nm | 181 | Detectar metade do efeito custa quatro vezes mais coleta |
| Sigma | 0,6 Nm | 12 | Reduzir a variação pela metade equivale a dobrar o delta |
| Alfa | 10% | 36 | Aceitar o dobro de alarme falso economiza 22% da coleta |
| Alfa | 1% | 68 | Exigir rigor de 1% custa 48% a mais de peças |
| Poder | 90% | 61 | Baixar o risco de não ver de 20% para 10% custa 33% a mais |
| Poder | 50% | 23 | Metade do n, e um estudo que erra tanto quanto acerta |
Delta e sigma têm exatamente o mesmo peso, porque a fórmula usa a razão entre eles. Alfa e poder são ajustes finos diante desses dois.
O cálculo para uma proporção e o pior caso de p igual a 0,5
Quando a medida é passa ou não passa, como calcular tamanho de amostra vira um problema de proporção. A fórmula de estimação: n é igual a z ao quadrado vezes p vezes um menos p, dividido pela margem de erro ao quadrado.
Aparece um problema circular: para calcular n você precisa de p, que é o que quer descobrir. A saída é usar o pior caso. O produto p vezes um menos p é máximo quando p vale 0,5, e ali vale 0,25.
Exemplo resolvido. Você quer estimar a taxa de retrabalho com margem de 5 pontos e 95% de confiança, sem ideia do valor atual. O z de 95% vale 1,959964, cujo quadrado é 3,841459.
- Multiplique z ao quadrado por p vezes um menos p: 3,841459 vezes 0,25 resulta em 0,960365.
- Eleve a margem ao quadrado: 0,05 ao quadrado resulta em 0,0025.
- Divida: 0,960365 dividido por 0,0025 resulta em 384,15.
- Arredonde para cima: 385 unidades inspecionadas.
Se você já sabe que a taxa gira em torno de 8%, o mesmo cálculo pede apenas 114 unidades. Conhecer p economiza 70% da coleta, e por isso vale rodar uma folha de verificação antes.
A margem de erro é implacável. Apertar de 5 para 3 pontos percentuais leva o n de 385 para 1.068. Apertar para 1 ponto leva a 9.604 unidades, o que inviabiliza quase qualquer inspeção manual.
Comparação de duas médias: o piloto com medida contínua
O piloto de melhoria é outro caso. Você compara dois grupos: antes e depois, ou máquina A e máquina B. A fórmula ganha um fator dois, porque existem duas fontes de incerteza.
O n por grupo é dois vezes o quadrado de z alfa sobre dois mais z beta, vezes sigma sobre delta. O resultado é por grupo, não no total, e esse é um dos erros de leitura mais comuns.
Exemplo. Tempo de ciclo com sigma de 6,0 minutos, e a meta é reduzir 3,0 minutos. Com alfa de 5% e poder de 80%: 2 vezes 7,848880 vezes o quadrado de 6,0 sobre 3,0, ou seja, 2 vezes 7,848880 vezes 4, igual a 62,79.
São 63 medições em cada grupo, 126 no total. Se o delta subir para 4,0 minutos, caem para 36 por grupo. Em projetos de DMAIC, essa conta pertence à fase Measure, não à Improve.
Um atalho legítimo: se der para parear as medições na mesma máquina, antes e depois, o sigma que entra é o da diferença. No exemplo do torque, o n cai de 91 por grupo para 21 pares.
Comparação de duas proporções: o caso mais usado na prática
Este é o cálculo que mais aparece quando alguém pergunta como calcular tamanho de amostra, e é o que mais assusta. Você tem refugo de 8%, quer provar que a mudança leva para 5%, e precisa saber quantas peças medir em cada condição.
A fórmula: n por grupo é o quadrado da soma dos dois z, vezes a soma de p1 vezes um menos p1 com p2 vezes um menos p2, dividido pelo quadrado da diferença entre p1 e p2.
- Calcule a constante de risco: 1,959964 mais 0,841621 é 2,801585, e o quadrado é 7,848880.
- Calcule a variância de cada grupo: 0,08 vezes 0,92 é 0,0736, e 0,05 vezes 0,95 é 0,0475.
- Some as duas: 0,0736 mais 0,0475 resulta em 0,1211.
- Multiplique pela constante: 7,848880 vezes 0,1211 resulta em 0,950499.
- Eleve a diferença ao quadrado: 0,08 menos 0,05 é 0,03, e o quadrado é 0,0009.
- Divida: 0,950499 por 0,0009 resulta em 1.056,11, ou seja, 1.057 peças por grupo.
São 2.114 peças no total, e o poder verificado nesse n é de exatamente 80,0%. É a razão pela qual tantos pilotos de redução de refugo terminam sem conclusão.
O motivo é aritmético. Contar defeito joga fora quase toda a informação de cada peça. Um projeto de DMAIC que mede a característica contínua costuma precisar de dez a cinquenta vezes menos peças.
A relação quadrática: metade do delta, quatro vezes o n
O delta entra na fórmula elevado ao quadrado e no denominador. A consequência não tem contorno: dividir por dois o efeito que você quer detectar multiplica por quatro o número de peças.
| Efeito detectável | Equivalente em desvios padrão | n por amostra | Multiplicador ante a linha acima |
|---|---|---|---|
| 2,00 Nm | 1,67 sigma | 3 | - |
| 1,00 Nm | 0,83 sigma | 12 | 4 vezes |
| 0,50 Nm | 0,42 sigma | 46 | 4 vezes |
| 0,25 Nm | 0,21 sigma | 181 | 4 vezes |
| 0,125 Nm | 0,10 sigma | 724 | 4 vezes |
A tabela usa o exemplo do torque, com sigma de 1,2 Nm, alfa de 5% e poder de 80%. O fator quatro não é aproximação: a razão entre os valores exatos de n é 4,0000000000 em todos os degraus, antes do arredondamento.
Em proporções a relação é parecida, mas não idêntica, porque a variância muda junto com p. Detectar 8% contra 4% pede 550 peças por grupo. Detectar 8% contra 6%, metade do efeito, pede 2.551, um fator de 4,6.
É a explicação da frustração mais comum da melhoria contínua. Ganho grande é barato de comprovar; ganho pequeno, que é a maioria em processo maduro, exige amostra que ninguém quer pagar.
População finita e o fator de correção
Todas as fórmulas de como calcular tamanho de amostra vistas até aqui assumem população infinita. Quando o lote é pequeno, elas pedem mais peças do que o necessário, porque cada peça inspecionada elimina uma parcela relevante da incerteza restante.
A correção: divida o n calculado por um mais a razão entre n menos um e o tamanho da população. O efeito só aparece quando a amostra representa fatia grande do lote.
| Tamanho da população | Fração amostrada antes da correção | n depois da correção | Peças economizadas |
|---|---|---|---|
| 100.000 | 0,4% | 384 | 1 |
| 10.000 | 3,9% | 371 | 14 |
| 2.000 | 19,2% | 323 | 62 |
| 500 | 77,0% | 218 | 167 |
| 300 | Acima de 100% | 169 | 216 |
A regra prática é fácil de guardar. Se a amostra representa até 5% da população, a correção reduz o n em menos de 5% e ignorar é defensável. Acima de 20%, ignorar é desperdício puro de inspeção.
Quando o n calculado supera a população, não significa inspecionar tudo. No lote de 300 unidades, bastam 169 para alcançar a precisão que 385 entregaria num lote infinito, e o American Society for Quality trata a correção como etapa padrão.
Tamanho de amostra para estimar capabilidade
Para capabilidade, como calcular tamanho de amostra leva ao número que mais surpreende. Estimar um índice de capabilidade do processo com precisão útil exige muito mais medições do que a prática corrente usa, e a prática corrente usa trinta.
O índice depende do desvio padrão, e desvio padrão com poucos dados é instável. A tabela traz o intervalo de 95% para um Cp estimado em 1,33, conforme o número de medições.
| Medições no cálculo | Intervalo de 95% para um Cp estimado em 1,33 | Incerteza relativa | O que dá para afirmar |
|---|---|---|---|
| 10 | de 0,73 a 1,93 | mais ou menos 45% | Nada. Pode ser incapaz ou excelente |
| 30 | de 0,99 a 1,67 | mais ou menos 26% | Nada de útil. O limite inferior encosta em 1,00 |
| 50 | de 1,07 a 1,59 | mais ou menos 20% | Dá para afirmar que é capaz, com folga estreita |
| 100 | de 1,14 a 1,51 | mais ou menos 14% | Dá para defender a aprovação com margem razoável |
| 200 | de 1,20 a 1,46 | mais ou menos 10% | Precisão suficiente para homologação de processo |
A linha de 30 merece atenção. Um Cp de 1,33 calculado com trinta peças é compatível com 0,99, que reprova, e com 1,67, que aprova com sobra. A conta foi feita, o número saiu, e ele não decide nada.
Para precisão de mais ou menos 10% no índice são 194 medições; para mais ou menos 20%, são 50. Escolher entre os dois é decisão de custo. Escolher 30 por hábito é decidir sem saber o que se comprou.
Carta de controle: quantos subgrupos e de que tamanho
Em controle estatístico de processo, como calcular tamanho de amostra se divide em duas perguntas. Quantos subgrupos para os limites, e quantas peças dentro de cada subgrupo. São respostas independentes, com propósitos diferentes.
Para os limites iniciais de uma carta de controle, a referência é 25 subgrupos. Com 25 subgrupos de 5 peças são 125 medições, e limites feitos com menos de 20 subgrupos devem ser tratados como provisórios.
O tamanho do subgrupo resolve outra coisa: a sensibilidade. A escolha da família de carta por variável depende justamente desse número. Como o erro padrão da média cai com a raiz de n, aumentar o subgrupo estreita os limites e faz a carta enxergar deslocamentos menores.
| Peças por subgrupo | Chance de flagrar 1,0 sigma num subgrupo | Chance de flagrar 1,5 sigma | Subgrupos até o alarme a 1,5 sigma |
|---|---|---|---|
| 1 | 2,3% | 6,7% | 15,0 |
| 2 | 5,6% | 19,0% | 5,3 |
| 3 | 10,2% | 34,4% | 2,9 |
| 4 | 15,9% | 50,0% | 2,0 |
| 5 | 22,2% | 63,8% | 1,6 |
| 8 | 43,2% | 89,3% | 1,1 |
O subgrupo de cinco é convenção por causa dessa tabela: flagra metade dos deslocamentos de 1,5 sigma já no primeiro subgrupo e não custa caro. Ela vale só para a regra dos três desvios, e as demais regras de decisão do CEP melhoram a detecção de deslocamentos pequenos.
Uma ressalva: a carta de controle por atributo exige subgrupos de 50 a 200 unidades, pela mesma razão aritmética das proporções.
Pesquisa de satisfação e o erro da taxa de resposta
Em pesquisa com cliente, como calcular tamanho de amostra usa a mesma fórmula de proporção. Para margem de 5 pontos percentuais com 95% de confiança e sem estimativa prévia, são 385 respostas válidas. Não 385 convites: 385 respostas.
Esse é o erro mais caro da área. A empresa envia 2.000 formulários, recebe 400 respostas e relata que pesquisou 2.000 clientes. A amostra efetiva é 400, e a margem real é a de 400.
O ajuste é aritmético: divida o n desejado pela taxa de resposta esperada. Com 20%, chegar a 385 respostas exige 1.925 convites. Com 10%, 3.850. Com 5%, 7.700, e aí vale rever o instrumento.
Existe um problema que nenhum n resolve. Quem responde é sistematicamente diferente de quem não responde. Por isso vale cruzar a pesquisa com indicadores de qualidade que não dependem de adesão, como reclamação registrada e devolução.
Quando o n calculado é inviável: as três saídas honestas
Você calculou 1.057 peças por grupo e a linha produz 300 por dia. A tentação é coletar o que der e rodar assim mesmo. Isso não é uma quarta saída: é gastar a coleta e não saber o resultado.
| Saída | O que você abre mão | Efeito no piloto de 8% contra 5% | Quando é defensável |
|---|---|---|---|
| Detectar só efeito maior | Melhoria pequena deixa de ser detectável | Alvo de 4% pede 550 por grupo; alvo de 3% pede 323 | Quando a mudança é estrutural e promete muito |
| Aceitar menos poder | Cresce a chance de dar inconclusivo | Poder de 70% pede 831; de 60% pede 660; de 50% pede 517 | Quando o piloto é exploratório e haverá confirmação depois |
| Reduzir a variação antes | Adia o teste e exige um projeto anterior | Trocar contagem de defeito por medida contínua derruba o n em uma ordem de grandeza | Quando o sigma alto é conhecido e tem causa tratável |
As três exigem admitir o que está sendo abandonado. A terceira é a única que melhora o processo em vez de rebaixar a pergunta, e é a mais ignorada.
No exemplo do torque, reduzir o sigma de 1,2 para 0,8 Nm leva o n de 46 para 21 peças, queda de 54%. Isso passa por padronizar método e calibrar instrumento, e um plano de controle bem feito resolve boa parte antes de coleta adicional.
Os erros mais comuns no cálculo do tamanho de amostra
Depois de acertar as quatro entradas, sobram armadilhas de execução. Todas anulam o cálculo, e nenhuma aparece no resultado da fórmula.
- Calcular o n depois de coletar: a conta vira justificativa, não planejamento. O único cálculo válido nesse ponto é descobrir que efeito a amostra conseguia detectar.
- Usar o desvio de longo prazo: ele inclui deslocamentos de média e infla o sigma. O cálculo pede a variação de curto prazo, medida dentro de subgrupos homogêneos.
- Confundir margem de erro com efeito detectável: estimar uma taxa com 5 pontos de margem e detectar uma diferença de 5 pontos são problemas distintos, com fórmulas distintas.
- Esquecer que em comparações o n é por grupo: 1.057 na fórmula significa 2.114 peças coletadas, e o erro dobra o custo real do piloto sem aviso.
- Não inflar o n para perdas: se 10% das peças serão descartadas por medição inválida, divida o n por 0,90. No piloto do exemplo, 1.057 vira 1.175 por grupo.
- Trocar para teste unilateral só para reduzir o n: a economia é real, mas só é legítima quando a hipótese de piora é irrelevante, e isso raramente é verdade.
- Ignorar a estrutura dos dados: peças do mesmo lote não são observações independentes, e o n efetivo fica menor do que o n coletado.
Quando o objetivo é medir relação entre variáveis, e não diferença entre grupos, a fórmula muda por completo, e a regressão linear tem regras próprias de dimensionamento.
O fio comum é o mesmo: saber como calcular tamanho de amostra é fácil, difícil é sustentar as decisões que a conta exige. Em Lean Seis Sigma elas fazem parte do escopo do projeto, e o manual de estatística aplicada do NIST traz as fórmulas completas para conferência.
