Understanding the Beta Distribution and Its Uses in Bayesian Statistics
Table of Contents
La distribution bêta est une pierre angulaire de l'inférence bayésienne, offrant un cadre souple pour la modélisation de variables aléatoires limitées à l'intervalle [0, 1]. Elle est particulièrement utile pour traiter les probabilités – comme le taux de réussite d'un essai clinique, le taux de conversion d'un test A/B ou la proportion d'éléments défectueux dans un lot de fabrication. Contrairement à d'autres distributions de probabilités qui peuvent nécessiter des transformations complexes pour traiter des données limitées, la distribution bêta permet naturellement toute la gamme des valeurs de probabilité possibles.
Qu'est-ce que la distribution bêta?
La distribution bêta est une distribution de probabilité continue définie sur l'intervalle [0, 1]. Elle est paramétrée par deux paramètres de forme positive, α et β, qui déterminent la forme et l'emplacement de la courbe de densité. La flexibilité de ces paramètres permet à la distribution bêta de modéliser une variété de formes, de l'uniformisation et de la symétrie à la très asymétrique et en U. Par exemple, lorsque α = β = 1, la distribution est uniforme; α = β > 1, il est symétrique et en forme de cloche; α < 1 et β < 1, il devient en U avec une haute densité près des limites.
Paramètres de forme et leurs effets
Les paramètres α et β sont souvent interprétés comme des comptes de « réussites » et d'« échecs » dans un contexte bayésien.
- α (alpha) représente le nombre de réussites (ou le poids accordé aux réussites).
- β (bêta) représente le nombre de défaillances (ou le poids placé sur les défaillances).
Augmentation α déplace la densité vers la droite (vers la droite) tout en augmentant β La distribution est plus concentrée autour de la moyenne. α / (α + β). Cette interprétation intuitive fait de la distribution bêta un précédent conjuguant naturel pour les probabilités binomiales et bernoulli.
Moyenne et écarts
La moyenne d'un bêta(α, β) distribution est:
E[X] = α/ (α + β)
La variation est la suivante :
Var[X] = αβ / [(α + β)2(α + β + 1)]
Ces formules sont utiles pour résumer les croyances antérieures avant la collecte de données. Par exemple, un Beta(2, 8) précédent a une moyenne de 0,2 et une variance relativement élevée, ce qui indique une incertitude sur la probabilité réelle. α + β Les écarts sont plus importants, ce qui représente une plus grande confiance dans l'estimation précédente.
Définition mathématique
La fonction de densité de probabilité (PDF) de la distribution Beta avec paramètres α > 0 et β > 0 est:
f(x; α, β) = [ xα - 1 (en milliers de dollars)β - 1 ] / B(α, β)
où B(α, β) est la fonction Beta, qui sert de constante de normalisation pour s'assurer que la surface totale sous la courbe de densité est égale à 1. La fonction Beta est définie par l'intégrale:
B(α, β) = φ01 tα - 1 (1 - t)β - 1 Dt
Relation avec la fonction Gamma
La fonction Beta peut être exprimée en fonction de la fonction Gamma:
B(α, β) = ι(α) ι(β) / ι(α + β)
Cette relation est particulièrement pratique pour le calcul. * *), généralise la fonction factorielle aux nombres réels (par exemple, ι(n) = (n-1) En remplaçant ce dernier par le PDF, nous obtenons une représentation alternative :
f(x; α, β) = [^(α + β) / (^(α) ι(β))] xα - 1 (en milliers de dollars)β - 1
Ce formulaire met en évidence la connexion de la distribution bêta à la famille des distributions exponentielles et simplifie de nombreux calculs bayésiens.
Utilisations dans les statistiques bayésiennes
Dans les statistiques bayésiennes, la distribution bêta est appréciée pour son rôle en tant que conjugués Un précédent conjugué garantit que la distribution postérieure appartient à la même famille que le précédent, ce qui rend les mises à jour analytiques simples. Plus précisément, la distribution bêta est conjuguée aux distributions bernoulli, binomiale, binomiale négative et géométrique.
Précédants conjugués expliqués
Lorsque vous utilisez des antécédents conjugués, mettre à jour les croyances antérieures avec les données observées implique simplement de modifier les paramètres antérieurs. n essais avec probabilité de succès p) et le précédent est Beta(α, β) et puis l'après est Beta(α + k, β + n - k), où k Cette propriété élégante élimine le besoin d'intégration numérique ou de méthodes de la chaîne Markov Monte Carlo (MCMC) dans des cas simples.
Mise à jour des croyances avec les données binomiales
Supposons qu'une équipe veuille estimer le taux de clic (CTR) d'une bannière du site Web. Ils commencent par un Beta(1, 1) précédent, reflétant l'ignorance complète (distribution uniforme). Après avoir montré la bannière 500 fois et observer 32 clics, ils mettent à jour:
- Précédent: Beta(1, 1)
- Données : s = 32 succès (cliquez), f = 468 échecs (sans clics)
- A posteriori: Beta(1 + 32, 1 + 468) = Beta(33, 469)
La moyenne postérieure est 33 / (33 + 469) -0,0657, représentant l'estimation postérieure du CTR. La variance reflète maintenant l'information combinée du précédent et des données. Cette règle de mise à jour est non seulement simple, mais fournit également une distribution complète pour le paramètre plutôt qu'une estimation ponctuelle, permettant des intervalles crédibles et des tests d'hypothèse.
Applications pratiques
La distribution Beta trouve son utilisation dans de nombreux champs où les probabilités sur un intervalle délimité doivent être modélisées. Ci-dessous sont plusieurs applications clés avec contexte réel.
Estimation du taux de conversion dans les essais A/B
En utilisant un avant Beta pour chaque variante dans un test A/B, les analystes peuvent calculer les distributions postérieures pour chaque taux de conversion et les comparer directement. Par exemple, la variante A pourrait avoir un avant Beta(120, 980) et la variante B un après Beta(145, 855). Simulant à partir de ces distributions permet de calculer la probabilité que la variante B soit supérieure, une alternative bayésienne aux tests de signification fréquentiste. Essais Bayésiens A/B et est largement implémenté dans des outils comme Google Optimisez et VWO. (Voir le Wikipédia article sur Beta distribution pour les propriétés supplémentaires.)
Essais cliniques et surveillance de l'innocuité
Dans les essais cliniques, la proportion de patients qui ont subi un événement indésirable est un critère critique de sécurité. La distribution bêta peut modéliser cette proportion tout en intégrant les connaissances antérieures d'études antérieures ou l'opinion d'experts. La Food and Drug Administration (FDA) des États-Unis et d'autres organismes de réglementation acceptent de plus en plus les méthodes bayésiennes pour le développement des instruments médicaux et des médicaments.
Sondage et prévisions électorales
Les données de sondage impliquent souvent des résultats binaires (voter a l'intention de voter pour le candidat A ou non). Les modèles béta-binomiaux permettent aux électeurs d'intégrer les habitudes de vote historiques comme un précédent et une mise à jour avec les résultats actuels du sondage. n Selon cette approche, les intervalles de probabilités sont plus honnêtes que les intervalles de confiance classiques, surtout lorsque la taille de l'échantillon est faible.
Apprentissage automatique et modélisation probabiliste
La distribution Beta apparaît dans de nombreux contextes d'apprentissage automatique, notamment:
- Allocation de dirichlet latent (LDA): LDA utilise les distributions de Dirichlet (une généralisation multivariée de la bêta) pour modéliser les proportions de sujets et les distributions de mots.
- Échantillonnage de Thompson: Dans les problèmes de banditisme multi-armés, les distributions bêta sont utilisées pour modéliser les probabilités de récompense de chaque bras, permettant des compromis efficaces exploration-exploitation.
- Régression linéaire bayésienne: Lorsque la variance d'erreur est inconnue, un Beta previous sur le paramètre de variance peut être utilisé en conjonction avec d'autres familles conjuguées.
Comparaison des différentes distributions bêta
Le choix de paramètres antérieurs appropriés est une partie essentielle de l'analyse bayésienne. Ci-dessous, nous examinons plusieurs antécédents bêta couramment utilisés et leurs implications.
Précédant uniforme: Beta(1, 1)
Cette valeur a été attribuée à toutes les valeurs de densité p Il s'agit d'un précédent plat, non informatif, souvent utilisé lorsqu'il n'existe pas de connaissance préalable solide. Cependant, il n'est pas le seul précédent non informatif; le précédent Jeffreys pour le paramètre binôme est Beta(0.5, 0.5), qui est également non informatif sous une paramétrisation différente.
Jeffreys Précédent: Beta(0,5, 0,5)
Le précédent Jeffreys est invariant sous reparamétérisation et a la propriété d'être proportionnel à la racine carrée de l'information Fisher. Pour une probabilité Bernoulli, le précédent Jeffreys est Beta(0,5, 0,5). Cette distribution est en U avec une densité élevée près de 0 et 1, reflétant moins de certitude sur les probabilités extrêmes qu'un précédent uniforme pourrait suggérer.
Antérieurs informatifs
Lorsque des données historiques ou des connaissances d'experts sont disponibles, des antécédents d'information peuvent être construits. Par exemple, si une étude pilote a permis de recueillir 10 résultats sur 50 essais, on pourrait utiliser un Beta(10, 40) antérieur pour refléter ces preuves. α + β: une somme plus grande indique un poids plus élevé. Avant peu informatif comme Beta(1.1, 1.1) pour assurer la régularisation sans dominer les données.
Extensions et distributions connexes
La distribution bêta fait partie d'une plus grande famille de distributions définies sur l'intervalle unitaire. Sa généralisation multivariée est la distribution de Dirichlet, qui est conjuguée à la probabilité multinomiale et largement utilisée dans le traitement du langage naturel et les modèles de mélange Bayésien. n La distribution de ces composés se fait naturellement dans des modèles bayésiens hiérarchiques et des données de dénombrement surdispersées.
Distribution bêta inverse
Pour les ratios de modélisation, la distribution inverse Beta (ou Beta prime) peut être dérivée de la Beta. Elle est définie sur (0, -) et souvent utilisée comme un précédent pour les paramètres de variance dans l'analyse Bayésienne des modèles de variance.
Conclusion
La distribution Beta offre un outil puissant et intuitif pour l'inférence bayésienne sur les probabilités. Sa relation conjuguée avec la famille binomiale simplifie le processus de mise à jour des croyances antérieures avec des données, la rendant accessible même pour les praticiens ayant des antécédents statistiques limités. Des tests A/B et des essais cliniques au vote et à l'apprentissage automatique, la distribution Beta continue d'être un élément fondamental de la pratique bayésienne moderne. lien) et l'entrée de l'Encyclopédie de Stanford sur l'épistémologie bayésienne ( lien) .