Atualizado em 25 de setembro de 2026.
A inferência estatística reúne os métodos que permitem tirar conclusões sobre uma população a partir de uma amostra. É cobrada em Estatística nos concursos fiscais, de bancos, de controle, do IBGE e de áreas técnicas, especialmente pelo Cebraspe e pela FGV, com questões sobre tipos de amostragem, distribuição normal, intervalo de confiança e testes de hipóteses. Este guia resume os pontos mais cobrados, com exemplos. As medidas de posição e dispersão estão no guia de estatística básica.
População, amostra, parâmetro e estatística
A população é o conjunto de todos os elementos com a característica que se quer estudar, e a amostra é um subconjunto dessa população. Quando todos os elementos são pesquisados, tem-se um censo. O parâmetro é uma medida da população, como a média populacional, representada por μ, e o desvio padrão populacional, representado por σ. A estatística, ou estimador, é uma medida calculada na amostra, como a média amostral, representada por x̄, usada para estimar o parâmetro.
Os tipos de amostragem
| Tipo | Como funciona |
|---|---|
| Aleatória simples | Todos os elementos têm a mesma probabilidade de ser escolhidos, como em um sorteio |
| Sistemática | Os elementos são escolhidos em intervalos regulares, a partir de um ponto de partida sorteado, como um a cada dez de uma lista |
| Estratificada | A população é dividida em estratos homogêneos internamente e heterogêneos entre si, e sorteiam-se elementos de cada estrato, muitas vezes de forma proporcional |
| Por conglomerados | A população é dividida em grupos heterogêneos internamente, como bairros ou escolas, e sorteiam-se grupos inteiros |
Esses quatro tipos são probabilísticos, porque cada elemento tem probabilidade conhecida de ser selecionado. As amostragens não probabilísticas, como a por conveniência, a intencional ou por julgamento, a por cotas e a bola de neve, não permitem calcular essa probabilidade e dificultam a generalização dos resultados.
Erro amostral e não amostral
O erro amostral é a diferença natural entre a estatística da amostra e o parâmetro da população, que decorre do fato de se observar só uma parte dela e diminui com o aumento do tamanho da amostra. O erro não amostral decorre de falhas no planejamento ou na coleta, como questionários mal formulados, amostras viciadas e erros de registro, e não diminui simplesmente com o aumento da amostra.
A distribuição normal
A distribuição normal tem forma de sino, é simétrica em torno da média, e nela a média, a mediana e a moda coincidem. Pela regra empírica, cerca de 68% dos valores estão a até um desvio padrão da média, cerca de 95% a até dois desvios padrão e cerca de 99,7% a até três desvios padrão. Para usar a tabela da normal padrão, os valores são padronizados pela fórmula Z = (X − μ) ÷ σ. Exemplo: se as notas de uma prova têm média 60 e desvio padrão 10, uma nota 80 corresponde a Z = 2, ou seja, está dois desvios padrão acima da média; pela regra empírica, cerca de 2,5% das notas ficam acima dela.
O teorema central do limite
O teorema central do limite afirma que, para amostras suficientemente grandes, a distribuição da média amostral se aproxima da distribuição normal, qualquer que seja a distribuição da população, com média igual à média populacional e desvio padrão igual a σ ÷ √n, chamado de erro padrão. Na prática, amostras com 30 ou mais elementos costumam ser consideradas grandes. Quanto maior a amostra, menor o erro padrão e mais precisa a estimativa.
O intervalo de confiança
O intervalo de confiança é uma faixa de valores que, com determinado nível de confiança, contém o parâmetro populacional. Para a média, com desvio padrão populacional conhecido, o intervalo é x̄ ± z × σ ÷ √n. Os valores críticos mais usados são:
| Nível de confiança | Valor de z |
|---|---|
| 90% | 1,645 |
| 95% | 1,96 |
| 99% | 2,576 |
Exemplo: com média amostral 50, desvio padrão 10 e amostra de 100 elementos, o erro padrão é 10 ÷ 10 = 1, e o intervalo de 95% de confiança vai de 50 − 1,96 a 50 + 1,96, ou seja, de 48,04 a 51,96. Para a proporção, o intervalo é p̂ ± z × √[p̂(1 − p̂) ÷ n]. Quando o desvio padrão populacional é desconhecido e a amostra é pequena, usa-se a distribuição t de Student no lugar da normal.
O tamanho da amostra
Para estimar a média com um erro máximo E, o tamanho da amostra é dado por n = (z × σ ÷ E)². Exemplo: com desvio padrão 20, erro máximo de 4 e confiança de 95%, n = (1,96 × 20 ÷ 4)² = 9,8², aproximadamente 96,04, ou seja, 97 elementos, arredondando sempre para cima.
Os testes de hipóteses
O teste de hipóteses verifica, com base na amostra, se há evidência para rejeitar uma afirmação sobre a população. A hipótese nula, H0, geralmente expressa igualdade ou ausência de efeito, e a hipótese alternativa, H1, expressa o que se quer demonstrar. O teste pode ser bilateral, quando H1 afirma que o parâmetro é diferente de um valor, ou unilateral, quando afirma que é maior ou menor.
| Decisão | H0 verdadeira | H0 falsa |
|---|---|---|
| Rejeitar H0 | Erro tipo I, com probabilidade α | Decisão correta, com probabilidade 1 − β, o poder do teste |
| Não rejeitar H0 | Decisão correta | Erro tipo II, com probabilidade β |
O nível de significância, α, é a probabilidade máxima aceita de cometer o erro tipo I, geralmente 5% ou 1%. O p-valor é a probabilidade de obter um resultado tão extremo quanto o observado, supondo H0 verdadeira; também pode ser entendido como o menor nível de significância com o qual H0 seria rejeitada. A regra de decisão é: se o p-valor for menor que α, rejeita-se H0. Reduzir α, mantido o tamanho da amostra, aumenta a probabilidade do erro tipo II.
Correlação e regressão
O coeficiente de correlação de Pearson mede a força e o sentido da relação linear entre duas variáveis e varia de −1 a 1: valores próximos de 1 indicam correlação positiva forte; próximos de −1, negativa forte; e próximos de 0, ausência de relação linear. Correlação não implica causalidade. A regressão linear simples ajusta uma reta, y = a + bx, para prever uma variável a partir da outra, e o coeficiente de determinação, R², indica a proporção da variação de y explicada pelo modelo.
Como estudar
Memorize as definições dos tipos de amostragem e dos erros tipo I e II e os valores de z mais usados. Depois, treine o cálculo do intervalo de confiança e do tamanho da amostra, que são os cálculos mais cobrados. Revise antes a probabilidade, que é a base da inferência.
Exemplos de como cai
Afirmação: "Na amostragem por conglomerados, os grupos são homogêneos internamente." Errado. Os conglomerados são heterogêneos internamente; homogêneos são os estratos.
Afirmação: "Mantidas as demais condições, aumentar o tamanho da amostra reduz a amplitude do intervalo de confiança." Certo. O erro padrão diminui.
Afirmação: "O erro tipo II consiste em rejeitar a hipótese nula verdadeira." Errado. Esse é o erro tipo I.
Resumo para revisar antes da prova
População, amostra, censo, parâmetro e estatística; amostragem aleatória simples, sistemática, estratificada com estratos homogêneos e por conglomerados heterogêneos, todas probabilísticas, e as não probabilísticas; erro amostral e não amostral; distribuição normal com 68%, 95% e 99,7% e padronização Z; teorema central do limite e erro padrão σ ÷ √n; intervalo de confiança com z de 1,645, 1,96 e 2,576; tamanho da amostra (zσ ÷ E)²; H0 e H1, erro tipo I com α, erro tipo II com β, poder 1 − β e rejeição de H0 quando o p-valor é menor que α; e correlação de −1 a 1, sem implicar causalidade.
Perguntas frequentes
Qual a diferença entre amostragem estratificada e por conglomerados?
Na estratificada, a população é dividida em estratos homogêneos internamente, e sorteiam-se elementos de todos os estratos. Na por conglomerados, a população é dividida em grupos heterogêneos internamente, e sorteiam-se grupos inteiros.
O que é erro tipo I?
É rejeitar a hipótese nula quando ela é verdadeira. A sua probabilidade é o nível de significância, representado por alfa. O erro tipo II é não rejeitar a hipótese nula quando ela é falsa.
Como se calcula o intervalo de confiança para a média?
Com desvio padrão populacional conhecido, pela média amostral mais ou menos o valor crítico z multiplicado pelo erro padrão, que é o desvio padrão dividido pela raiz do tamanho da amostra. Para 95% de confiança, z é aproximadamente 1,96.

