Die Beta-Verteilung ist ein Eckpfeiler der Bayesschen Inferenz und bietet einen flexiblen Rahmen für die Modellierung von Zufallsvariablen, die auf das Intervall [0, 1] beschränkt sind. Sie ist besonders wertvoll, wenn es um Wahrscheinlichkeiten geht, wie die Erfolgsrate einer klinischen Studie, die Konversionsrate eines A/B-Tests oder den Anteil defekter Gegenstände in einer Fertigungscharge. Im Gegensatz zu einigen anderen Wahrscheinlichkeitsverteilungen, die komplexe Transformationen erfordern, um begrenzte Daten zu verarbeiten, umfasst die Beta-Verteilung natürlich den gesamten Bereich der möglichen Wahrscheinlichkeitswerte. Ihre beiden Formparameter, Alpha (α) und Beta (β), ermöglichen es den Praktikern, Vorkenntnisse zu kodieren und Überzeugungen reibungslos zu aktualisieren, wenn sich neue Beweise ansammeln. In diesem Artikel werden wir die Beta-Verteilung eingehend untersuchen, ihre mathematische Grundlage verstehen und ihre weit verbreiteten Anwendungen in der Bayesschen Statistik untersuchen.

Was ist die Beta-Distribution?

Die Beta-Verteilung ist eine kontinuierliche Wahrscheinlichkeitsverteilung, die über das Intervall [0, 1] definiert wird und durch zwei positive Formparameter parametriert wird. α und βDie Flexibilität dieser Parameter ermöglicht es der Beta-Verteilung, eine Vielzahl von Formen zu modellieren - von einheitlich und symmetrisch bis hin zu stark verzerrten und U-förmigen Formen. α = β = 1Die Verteilung ist einheitlich; wenn α = β > 1, ist es symmetrisch und glockenförmig; wenn α < 1 und β < 1, wird es U-förmig mit hoher Dichte in der Nähe der Grenzen.

Formparameter und ihre Auswirkungen

Die Parameter α und β werden oft als "Erfolge" und "Misserfolge" im Bayes-Kontext interpretiert, insbesondere:

  • α (alpha) steht für die Anzahl der Erfolge (oder das Gewicht, das auf Erfolge gelegt wird).
  • β (beta) steht für die Anzahl der Fehler (oder das Gewicht, das auf Fehler gelegt wird).

Zunehmend α verschiebt die Dichte nach rechts (zu 1), während sie zunimmt β Wenn beide Parameter groß sind, wird die Verteilung um den Mittelwert konzentrierter. α/α + βDiese intuitive Interpretation macht die Beta-Verteilung zu einer natürlichen Konjugat-Priorität für Binomial- und Bernoulli-Wahrscheinlichkeiten.

Mittelwert und Varianz

Der Mittelwert eines Beta()α, β) Verteilung ist:

E[X] = α / (α + β)

Die Varianz ist:

Var[X] = αβ / [(α + β)2(α + β + 1)

Diese Formeln sind nützlich, um frühere Überzeugungen vor der Datenerhebung zusammenzufassen. Zum Beispiel hat ein Beta(2, 8) einen Mittelwert von 0,2 und eine relativ hohe Varianz, was auf Unsicherheit über die wahre Wahrscheinlichkeit hinweist. α + β erhöht, die Varianz sinkt, was ein größeres Vertrauen in die vorherige Schätzung darstellt.

Mathematische Definition

Die Wahrscheinlichkeitsdichtefunktion (PDF) der Beta-Verteilung mit Parametern α > 0 und β > 0 ist:

f(x; α, β) = [x]α - 1 (1 - x)β - 1 ] / B(α, β)

wo B(α, β) ist die Beta-Funktion, die als Normierungskonstante dient, um sicherzustellen, dass die Gesamtfläche unter der Dichtekurve 1 entspricht.

B(α, β) = ∫01 tα - 1 (1 - t)β - 1 dt

Beziehung zur Gamma-Funktion

Die Beta-Funktion kann in Form der Gamma-Funktion ausgedrückt werden:

B(α, β) = Γ(α) Γ(β) / Γ(α + β)

Diese Beziehung ist besonders komfortabel für die Berechnung. Γ(·)verallgemeinert die Faktorfunktion auf reelle Zahlen (z.B., Γ(n) = (n-1)! Durch die Substitution in das PDF erhalten wir eine alternative Darstellung:

f(x; α, β) = [Γ(α + β) / (Γ(α) Γ(β)] xα - 1 (1 - x)β - 1

Dieses Formular hebt die Verbindung der Beta-Distribution mit der Familie der exponentiellen Verteilungen hervor und vereinfacht viele Bayessche Berechnungen.

Verwendung in Bayesian Statistics

In der Bayes-Statistik wird die Beta-Distribution für ihre Rolle als konjugiert vor Für mehrere allgemeine Wahrscheinlichkeitsfunktionen. Ein konjugierter Prior stellt sicher, dass die hintere Verteilung zur gleichen Familie gehört wie die vorherige, was analytische Aktualisierungen einfach macht. Insbesondere ist die Beta-Verteilung konjugiert mit den Bernoulli-, Binomial-, Negativ-Binomial- und Geometrieverteilungen.

Konjugierte Prioritäten erklärt

Bei der Verwendung von konjugierten Prioren bedeutet das Aktualisieren von vorherigen Überzeugungen mit beobachteten Daten einfach das Anpassen der vorherigen Parameter, z. B. wenn die Wahrscheinlichkeit binomial ist (Anzahl der Erfolge in der n Versuche mit Erfolgswahrscheinlichkeit p), und der vorherige ist Beta (α, β), dann ist der hintere Beta(α + k, β + n - k, wobei k Diese elegante Eigenschaft eliminiert die Notwendigkeit der numerischen Integration oder Markov-Kette Monte Carlo (MCMC) Methoden in einfachen Fällen.

Aktualisieren von Überzeugungen mit Binomialdaten

Angenommen, ein Team möchte die Klickrate (CTR) eines Website-Banners schätzen. Sie beginnen mit einer Beta (1, 1) vor, die völlige Unwissenheit widerspiegelt (einheitliche Verteilung). Nachdem es das Banner 500 Mal gezeigt und 32 Klicks beobachtet hat, aktualisieren sie:

  • Vorherig: Beta (1, 1)
  • Daten: s = 32 Erfolge (Klicks), f = 468 Ausfälle (keine Klicks)
  • Posterior: Beta(1 + 32, 1 + 468) = Beta(33, 469)

Die Varianz spiegelt nun die kombinierte Information aus der vorherigen und den Daten wider. Diese Aktualisierungsregel ist nicht nur einfach, sondern bietet auch eine vollständige Verteilung für den Parameter anstelle einer Einzelpunktschätzung, was glaubwürdige Intervalle und Hypothesentests ermöglicht.

Praktische Anwendungen

Die Beta-Distribution findet Anwendung in vielen Bereichen, in denen Wahrscheinlichkeiten in einem begrenzten Intervall modelliert werden müssen.

Conversion Rate Estimation in A/B Testing

In Marketing und Webanalysen sind Conversion-Raten typischerweise Bernoulli-Ergebnisse (Besuch führt zu Conversion oder nicht). Indem Analysten für jede Variante in einem A/B-Test eine Beta-Vorher-Verteilung für jede Conversion-Rate berechnen und direkt vergleichen können. Beispielsweise könnte Variante A eine posteriore Beta(120, 980) und Variante B eine posteriore Beta(145, 855) haben. Die Simulation dieser Verteilungen ermöglicht die Berechnung der Wahrscheinlichkeit, dass Variante B überlegen ist, eine bayesianische Alternative zu frequentistischen Signifikanztests. Diese Methode ist bekannt als Bayessche A/B-Prüfung und ist weit verbreitet in Tools wie Google Optimize und VWO implementiert.

(Siehe die Wikipedia-Artikel zur Beta-Verteilung für zusätzliche Eigenschaften.

Klinische Studien und Sicherheitsüberwachung

In klinischen Studien ist der Anteil der Patienten, bei denen ein unerwünschtes Ereignis auftritt, ein kritischer Sicherheitsendpunkt. Die Beta-Verteilung kann diesen Anteil unter Einbeziehung von Vorkenntnissen aus früheren Studien oder Expertenmeinungen modellieren. Die US-amerikanische Food and Drug Administration (FDA) und andere Aufsichtsbehörden akzeptieren zunehmend Bayes-Methoden für die Entwicklung von Medizinprodukten und Medikamenten. Die Fähigkeit, die hintere Verteilung kontinuierlich zu aktualisieren, wenn Studiendaten anfallen, macht die Beta-Verteilung ideal für die sequentielle Überwachung von Sicherheitssignalen.

Wahlbeobachtung und Wahlprognosen

Umfragedaten beinhalten oft binäre Ergebnisse (der Wähler beabsichtigt, für Kandidat A zu stimmen oder nicht). Beta-Binomialmodelle ermöglichen es den Meinungsforschern, historische Abstimmungsmuster als vorheriges zu integrieren und mit aktuellen Umfrageergebnissen zu aktualisieren. n Wahrscheinliche Wähler, die hinteren spiegeln sowohl die vorherigen als auch die neuen Daten wider. Dieser Ansatz liefert nicht nur Punktschätzungen, sondern auch Wahrscheinlichkeitsintervalle, die ehrlicher sind als klassische Konfidenzintervalle, insbesondere wenn die Stichprobengrößen klein sind.

Machine Learning und probabilistische Modellierung

Die Beta-Distribution erscheint in vielen maschinellen Lernkontexten, einschließlich:

  • Latente Dirichlet Allocation (LDA)LDA verwendet Dirichlet-Distributionen (eine multivariate Verallgemeinerung des Beta), um Themenproportionen und Wortverteilungen zu modellieren.
  • Thompson-ProbenahmeBei mehrarmigen Banditenproblemen werden Beta-Distributionen verwendet, um die Belohnungswahrscheinlichkeiten jedes Arms zu modellieren, was effiziente Kompromisse bei der Exploration und Nutzung ermöglicht.
  • Bayessche lineare RegressionWenn die Fehlervarianz unbekannt ist, kann eine Beta-Priorität des Varianzparameters in Verbindung mit anderen konjugierten Familien verwendet werden.

Vergleich verschiedener Beta-Distributionen

Die Wahl geeigneter Vorparameter ist ein wesentlicher Bestandteil der Bayesschen Analyse. Im Folgenden untersuchen wir einige häufig verwendete Beta-Prioritäten und ihre Auswirkungen.

Uniform Prior: Beta (1, 1)

Dieser Vorherige ordnet allen Werten von p Es ist ein flaches, uninformatives Prior, das oft verwendet wird, wenn kein starkes Vorwissen vorhanden ist, aber es ist nicht das einzige uninformative Prior; die Jeffreys Prior für den binomialen Parameter ist Beta (0,5, 0,5), was auch unter einer anderen Parametrierung uninformativ ist.

Jeffreys Prior: Beta(0,5, 0,5)

Die Jeffreys-Vorherse ist invariant unter Reparametrisierung und hat die Eigenschaft, proportional zur Quadratwurzel der Fisher-Information zu sein. Für eine Bernoulli-Wahrscheinlichkeit ist die Jeffreys-Vorherse Beta(0,5, 0,5). Diese Verteilung ist U-förmig mit hoher Dichte nahe 0 und 1, was weniger Sicherheit über extreme Wahrscheinlichkeiten widerspiegelt, als eine einheitliche Vorhersehung vermuten lässt. Viele Bayesianer bevorzugen sie wegen ihrer theoretischen Eigenschaften.

Informative Prioritäten

Wenn historische Daten oder Expertenwissen verfügbar sind, können informative Priors erstellt werden. Wenn eine Pilotstudie beispielsweise 10 von 50 Versuchen zu Ergebnissen führte, könnte eine vorherige Beta(10, 40) verwendet werden, um diese Beweise widerzuspiegeln. Die Stärke der vorherigen wird durch die Summe gesteuert α + β: eine größere Summe zeigt mehr Vorgewicht an. In der Praxis ist es üblich, eine schwach informativ vor Beta (1.1, 1.1) zur Regularisierung, ohne die Daten zu dominieren.

Erweiterungen und verwandte Distributionen

Die Beta-Verteilung ist Teil einer größeren Familie von Verteilungen, die auf dem Einheitsintervall definiert sind. Seine multivariate Verallgemeinerung ist die Dirichlet-Verteilung, die konjugiert ist mit der multinomialen Wahrscheinlichkeit und umfassend in der Verarbeitung natürlicher Sprache und Bayes-Vermischungsmodellen verwendet wird. n Versuche, bei denen die Erfolgswahrscheinlichkeit selbst einer Beta-Verteilung folgt, diese zusammengesetzte Verteilung entsteht natürlich in hierarchischen Bayes-Modellen und überdispersen Zähldaten.

Inverse Beta-Verteilung

Für die Modellierung von Verhältnissen kann die inverse Beta-Verteilung (oder Beta-Primärverteilung) aus der Beta-Verteilung abgeleitet werden. Sie ist definiert in (0, ∞) und wird häufig als Vorab-Varianzparameter in der Bayesschen Analyse von Varianzmodellen verwendet. Ihre Eigenschaften spiegeln die der Beta-Verteilung wider, jedoch auf einer unbegrenzten Skala.

Schlussfolgerung

Die Beta-Distribution bietet ein leistungsfähiges und intuitives Werkzeug für Bayessche Inferenz auf Wahrscheinlichkeiten. Seine konjugierte Beziehung zur Binomialfamilie vereinfacht den Prozess der Aktualisierung früherer Überzeugungen mit Daten, macht sie auch für Praktiker mit begrenztem statistischem Hintergrund zugänglich. Von A/B-Tests und klinischen Studien bis hin zu Umfragen und maschinellem Lernen ist die Beta-Distribution weiterhin ein grundlegender Baustein der modernen Bayesschen Praxis. Durch das Verständnis ihrer Formparameter, der Struktur der Mittelwertvarianz und der Aktualisierung von Formeln können Analysten robuste probabilistische Modelle erstellen, die sowohl Vorkenntnisse als auch empirische Beweise genau widerspiegeln. Weitere Informationen finden Sie in John Kruschkes "Doing Bayesian Data Analysis" (Doing Bayesian Data Analysis).

Verbindungsleitung) und der Stanford Encyclopedia Eintrag auf Bayesian Epistemology (Verbindungsleitung.