Understanding the Beta Distribution and Its Uses in Bayesian Statistics
Table of Contents
A distribuição Beta é uma pedra angular da inferência Bayesiana, oferecendo uma estrutura flexível para modelar variáveis aleatórias restritas ao intervalo [0, 1]. É particularmente valiosa quando se trata de probabilidades – como a taxa de sucesso de um ensaio clínico, a taxa de conversão de um teste A/B, ou a proporção de itens defeituosos em um lote de fabricação. Ao contrário de algumas outras distribuições de probabilidade que podem exigir transformações complexas para lidar com dados limitados, a distribuição Beta naturalmente acomoda toda a gama de valores de probabilidade possíveis. Seus dois parâmetros de forma, alfa (α) e beta (β), permitem que os praticantes codificem conhecimentos prévios e atualizem crenças sem problemas à medida que novas evidências se acumulam. Neste artigo, vamos explorar a distribuição Beta em profundidade, entender sua base matemática e examinar suas aplicações generalizadas em estatísticas Bayesianas.
O que é a distribuição beta?
A distribuição Beta é uma distribuição contínua de probabilidade definida ao longo do intervalo [0, 1]. É parametrizada por dois parâmetros de forma positiva, α e β, que determinam a forma e a localização da curva de densidade. A flexibilidade destes parâmetros permite à distribuição Beta modelar uma variedade de formas — desde uniforme e simétrica até altamente distorcida e em forma de U. Por exemplo, quando α = β = 1, a distribuição é uniforme; quando α = β > 1, é simétrico e em forma de sino; quando α < 1 e β < 1, torna-se em forma de U com alta densidade perto dos limites.
Parâmetros de Forma e seus efeitos
Os parâmetros α e β são muitas vezes interpretados como contagens de "sucessos" e "fracassamentos" em um contexto bayesiano. Especificamente:
- α (alfa) representa o número de sucessos (ou o peso colocado sobre sucessos).
- β (beta) representa o número de falhas (ou o peso colocado sobre falhas).
Aumentando α desloca a densidade para a direita (para a direita 1), enquanto aumenta β desloca- a para a esquerda (para a esquerda, em direcção a 0). Quando ambos os parâmetros são grandes, a distribuição torna- se mais concentrada em torno da média α / (α + β) Essa interpretação intuitiva faz da distribuição Beta um precedente conjugado natural para as probabilidades binomiais e de Bernoulli.
Média e Variância
A média de um Beta (α, β) distribuição é:
E[X] = α / (α + β)
A variância é:
Var[X] = αβ / [(α + β)2(α + β + 1)]
Estas fórmulas são úteis para resumir crenças anteriores antes da coleta de dados. Por exemplo, um Beta(2, 8) anterior tem uma média de 0,2 e variância relativamente alta, indicando incerteza sobre a probabilidade verdadeira. α + β aumenta, a variância diminui, representando maior confiança na estimativa prévia.
Definição Matemática
A função densidade de probabilidade (PDF) da distribuição Beta com parâmetros α > 0 e β > 0 é:
f( x; α, β) = [ xα - 1 (1 - x)β - 1 ] / B(α, β)
em que B(α, β) é a função Beta, que serve como uma constante de normalização para garantir que a área total sob a curva de densidade é igual a 1. A função Beta é definida pela integral:
B(α, β) = ∫01 tα - 1 (1 - t)β - 1 dt
Relação com a função Gamma
A função Beta pode ser expressa em termos da função Gama:
B(α, β) = Ι(α) Ι(β) / Ι(α + β)
Esta relação é especialmente conveniente para computação. Ι·), generaliza a função fatorial para números reais (por exemplo, Γ(n) = (n-1)! Ao substituir isto no PDF, obtemos uma representação alternativa:
f( x; α, β) = [Γ( α + β) / (Ι( α) Ι(β)] xα - 1 (1 - x)β - 1
Este formulário destaca a conexão da distribuição Beta com a família de distribuições exponenciais e simplifica muitos cálculos bayesianos.
Usos em Estatísticas Bayesianas
Em estatísticas bayesianas, a distribuição Beta é valorizada por seu papel como um conjugar anterior Para várias funções de verossimilhança comuns, um prévio conjugado garante que a distribuição posterior pertence à mesma família anterior, tornando as atualizações analíticas simples. Especificamente, a distribuição Beta é conjugada com as distribuições Bernoulli, binomial, binômio negativo e geométrica.
Explicados os Priores Conjugadores
Ao usar antecedentes conjugados, atualizar crenças anteriores com dados observados envolve simplesmente ajustar os parâmetros anteriores. Por exemplo, se a probabilidade é binomial (número de sucessos em n ensaios com probabilidade de sucesso p), e o anterior é Beta (α, β), então a posterior é Beta (α + k, β + n - k), em que k Esta elegante propriedade elimina a necessidade de integração numérica ou métodos de cadeia de Markov Monte Carlo (MCMC) em casos simples.
Atualizando crenças com dados binomiais
Suponha que uma equipe queira estimar a taxa de cliques (CTR) de um banner do site. Eles começam com um Beta(1, 1) anterior, refletindo ignorância completa (distribuição uniforme). Depois de mostrar o banner 500 vezes e observando 32 cliques, eles atualizam:
- Previous: Beta(1, 1)
- Dados: s = 32 sucessos (cliques), f = 468 falhas (sem cliques)
- Posterior: Beta(1 + 32, 1 + 468) = Beta(33, 469)
A média posterior é 33 / (33 + 469) .0657, representando a estimativa posterior do CTR. A variância agora reflete a informação combinada do anterior e dos dados. Esta regra de atualização não é apenas simples, mas também fornece uma distribuição completa para o parâmetro em vez de uma estimativa de ponto único, permitindo intervalos credíveis e testes de hipóteses.
Aplicações Práticas
A distribuição Beta encontra uso em muitos campos onde as probabilidades em um intervalo limitado precisam ser modeladas. Abaixo estão várias aplicações chave com contexto real.
Estimativa da taxa de conversão em ensaios A/B
Em marketing e análise da web, as taxas de conversão são tipicamente resultados de Bernoulli (a visita leva à conversão ou não). Ao usar um Beta prévio para cada variante em um teste A/B, os analistas podem calcular distribuições posteriores para cada taxa de conversão e compará- las diretamente. Por exemplo, a variante A pode ter um Beta posterior(120, 980) e a variante B a Beta posterior(145, 855). Simulando a partir destas distribuições, permite calcular a probabilidade de que a variante B seja superior, uma alternativa Bayesiana para testes de significância frequente. Este método é conhecido como Ensaio Bayesiano A/B e é amplamente implementado em ferramentas como o Google Optimize e VWO. (Ver o Artigo da Wikipédia sobre distribuição Beta para propriedades adicionais.)
Ensaios Clínicos e Monitorização da Segurança
Em ensaios clínicos, a proporção de pacientes que experimentam um evento adverso é um ponto crítico de segurança. A distribuição Beta pode modelar essa proporção, ao incorporar conhecimento prévio de estudos anteriores ou opinião de especialistas.A Administração de Alimentos e Medicamentos (FDA) e outras agências reguladoras dos EUA aceitam cada vez mais métodos bayesianos para o desenvolvimento de dispositivos médicos e medicamentos.A capacidade de atualizar continuamente a distribuição posterior à medida que os dados do ensaio se acumulam torna a distribuição Beta ideal para monitoramento sequencial de sinais de segurança.
Previsão de votação e eleição
Os dados de sondagem envolvem frequentemente resultados binários (o voto pretende votar no candidato A ou não). Os modelos beta-binomiais permitem que os pollsters incorporem padrões de votação históricos como uma actualização prévia com os resultados da pesquisa actual. Por exemplo, um Beta anterior (α, β) pode ser obtido a partir de margens eleitorais anteriores, e após a pesquisa n Esta abordagem não só produz estimativas pontuais, mas também intervalos de probabilidade que são mais honestos do que os intervalos de confiança clássicos, especialmente quando os tamanhos das amostras são pequenos.
Aprendizagem de máquina e modelagem probabilística
A distribuição Beta aparece em muitos contextos de aprendizagem de máquina, incluindo:
- Alocação de Dirichlet Latent (LDA): LDA usa distribuições de Dirichlet (uma generalização multivariada do Beta) para modelar proporções temáticas e distribuições de palavras.
- Amostragem de Thompson: Em problemas de bandidos multi-armados, as distribuições Beta são usadas para modelar as probabilidades de recompensa de cada braço, permitindo trade-offs de exploração-exploração eficientes.
- Regressão linear bayesiana: Quando a variância de erro é desconhecida, um Beta precipício no parâmetro de variância pode ser usado em conjunto com outras famílias conjugadas.
Comparando diferentes distribuições beta
A escolha de parâmetros prévios apropriados é uma parte essencial da análise bayesiana. Abaixo examinamos vários antecedentes Beta comumente usados e suas implicações.
Precedente uniforme: Beta(1, 1)
Isto atribui a mesma densidade a todos os valores de p entre 0 e 1. É um pretérito plano, não-informativo, frequentemente usado quando não existe um conhecimento prévio forte. No entanto, não é o único pretérito não-informativo; o pretérito Jeffreys para o parâmetro binomial é Beta(0,5; 0,5), que também é não-informativo sob uma parametrização diferente.
Jeffreys Previor: Beta(0. 5; 0.5)
O anterior de Jeffreys é invariante sob reparameterização e tem a propriedade de ser proporcional à raiz quadrada da informação de Fisher. Para uma probabilidade de Bernoulli, o anterior de Jeffreys é Beta(0,5, 0,5). Esta distribuição é em forma de U com alta densidade perto de 0 e 1, refletindo menos certeza sobre probabilidades extremas do que um anterior uniforme pode sugerir. Muitos bayesianos preferem-na pelas suas propriedades teóricas.
Preferências Informativas
Quando os dados históricos ou conhecimentos especializados estão disponíveis, podem ser construídos antecedentes informativos. Por exemplo, se um estudo piloto der 10 sucessos em 50 ensaios, um Beta anterior(10, 40) pode ser usado para refletir essa evidência. α + β: uma soma maior indica mais peso anterior. Na prática, é comum usar um pouco informativo prévio como Beta(1.1, 1.1) para fornecer regularização sem dominar os dados.
Extensões e distribuições relacionadas
A distribuição Beta faz parte de uma família maior de distribuições definidas no intervalo unitário, cuja generalização multivariada é a distribuição de Dirichlet, que se conjuga à probabilidade multinomial e é utilizada extensivamente em modelos de processamento de linguagem natural e mistura bayesiana. Além disso, a distribuição beta-binomial modela o número de sucessos em n ensaios quando a probabilidade de sucesso em si segue uma distribuição Beta. Esta distribuição composta surge naturalmente em modelos bayesianos hierárquicos e dados de contagem sobredispersos.
Distribuição Beta Inversa
Para as razões de modelagem, a distribuição inversa Beta (ou Beta prime) pode ser derivada do Beta. É definida em (0, .) e frequentemente usada como um parâmetro de variância prévio em modelos de análise de variância Bayesiana. Suas propriedades refletem as da distribuição Beta, mas em uma escala não limitada.
Conclusão
A distribuição Beta oferece uma ferramenta poderosa e intuitiva para a inferência Bayesiana sobre probabilidades. Sua relação conjugada com a família binomial simplifica o processo de atualização de crenças anteriores com dados, tornando-a acessível mesmo para praticantes com fundos estatísticos limitados. Desde testes A/B e ensaios clínicos até votação e aprendizado de máquina, a distribuição Beta continua sendo um bloco fundamental da prática bayesiana moderna. Ao entender seus parâmetros de forma, estrutura de variação média e fórmulas de atualização, analistas podem construir modelos probabilísticos robustos que refletem com precisão tanto o conhecimento prévio quanto as evidências empíricas. Para mais informações, consulte "Doing Bayesian Data Analysis" de John Kruschke (link) e a entrada da Enciclopédia de Stanford na Epistemologia Bayesiana (link).