La distribución Beta es una piedra angular de la inferencia Bayesiana, ofreciendo un marco flexible para modelar variables aleatorias limitadas al intervalo [0, 1]. Es particularmente valioso cuando se trata de probabilidades, como la tasa de éxito de un ensayo clínico, la tasa de conversión de un examen A/B, o la proporción de elementos defectuosos en un lote de fabricación.

¿Qué es la distribución de Beta?

La distribución Beta es una distribución continua de probabilidad definida a lo largo del intervalo [0, 1]. Está parametizada por dos parámetros de forma positiva, α y β, que determina la forma y la ubicación de la curva de densidad. La flexibilidad de estos parámetros permite a la distribución Beta modelar una variedad de formas, desde uniformes y simétricos hasta altamente segados y en forma de U. Por ejemplo, cuando α = β = 1, la distribución es uniforme; cuando α = β √≥ 1, es simétrico y en forma de campana; cuando α < 1 y β < 1, se convierte en U-forma con alta densidad cerca de los límites.

Diámetros de la forma y sus efectos

Los parámetros α y β a menudo se interpretan como conteos de "sucesos" y "failures" en un contexto Bayesiano. Específicamente:

  • α (alfa) representa el número de éxitos (o el peso colocado sobre los éxitos).
  • β (beta) representa el número de fallos (o el peso colocado sobre los fallos).

Aumento α cambia la densidad a la derecha (a la derecha 1), mientras aumenta β lo desplaza a la izquierda (a la izquierda 0). Cuando ambos parámetros son grandes, la distribución se vuelve más concentrada alrededor del medio α / (α + β)Esta interpretación intuitiva hace que la distribución de Beta sea un conjugado natural antes de las probabilidades binomiales y berenoulli.

Significado y variación

La media de un Beta(α, β) distribución es:

E[X] = α / (α + β)

La diferencia es:

Var[X] = αβ / [(α + β)2(α + β + 1)]

Estas fórmulas son útiles para resumir creencias previas antes de la recopilación de datos. Por ejemplo, un Beta(2, 8) anterior tiene una media de 0,2 y una varianza relativamente alta, indicando incertidumbre sobre la verdadera probabilidad. α + β aumentos, la diferencia disminuye, lo que representa una mayor confianza en la estimación anterior.

Definición matemática

Función de densidad de probabilidad (PDF) de la distribución Beta con parámetros α √≥ } y β √≥ 0 es:

f(x; α, β) = [ xα - 1 (1 a x)β - 1 ] / B(α, β)

Donde B(α, β) es la función Beta, que sirve como constante de normalización para asegurar que el área total bajo la curva de densidad sea igual 1. La función Beta se define por la integral:

B(α, β) = ∫01 tα - 1 (1 a t)β - 1 ♪

Relación con la función Gamma

La función Beta se puede expresar en términos de la función Gamma:

B(α, β) = lumina(α)

Esta relación es especialmente conveniente para la computación. La función Gamma, Dimensiones, generaliza la función factorial a números reales (por ejemplo, ¡N-1! Por sustitución de esto en el PDF, obtenemos una representación alternativa:

f(x; α, β) = [la anchura (α + β) / (la anchura (α) la caja (β)] xα - 1 (1 a x)β - 1

Este formulario destaca la conexión de la distribución Beta con la familia de distribuciones exponenciales y simplifica muchos cálculos Bayesianos.

Usos en Estadísticas Bayesianas

En las estadísticas Bayesianas, la distribución Beta es apreciada por su papel como un conjugado anterior Para varias funciones comunes de probabilidad. Un conjugado anterior asegura que la distribución posterior pertenece a la misma familia que el anterior, haciendo actualizaciones analíticas directas. Específicamente, la distribución Beta está conjugada a las distribuciones binomiales, negativas y geométricas de Bernoulli.

Priores Conjugados Explicados

Al utilizar los antecedentes conjugados, actualizar las creencias previas con datos observados implica simplemente ajustar los parámetros anteriores. Por ejemplo, si la probabilidad es binomial (número de éxitos en n ensayos con probabilidad de éxito p), y el anterior es Beta(α, β), entonces el posterior es Beta(α + k, β + n - k), donde k es el número de éxitos observados. Esta elegante propiedad elimina la necesidad de integración numérica o métodos de la cadena Markov Monte Carlo (MCMC) en casos simples.

Creencias Actualizadoras con Datos Binomios

Supongamos que un equipo quiere estimar la tasa de clic a través (CTR) de un banner de sitio web. Comienzan con un Beta(1, 1) antes, reflejando la ignorancia completa (distribución uniforme). Después de mostrar el banner 500 veces y observando 32 clics, se actualizan:

  • Prior: Beta(1, 1)
  • Datos: S = 32 éxitos (clics), f = 468 fallos (sin clics)
  • Posterior: Beta(1 + 32, 1 + 468) = Beta(33, 469)

La media posterior es 33 / (33 + 469) ♥ 0,0657, representando la estimación posterior del CTR. La varianza ahora refleja la información combinada de lo anterior y los datos. Esta regla de actualización no es sólo simple, sino que también proporciona una distribución completa para el parámetro en lugar de una estimación de puntos únicos, permitiendo intervalos creíbles y pruebas de hipótesis.

Aplicaciones Prácticas

La distribución Beta encuentra uso en muchos campos donde las probabilidades en un intervalo limitado deben ser modeladas. A continuación se presentan varias aplicaciones clave con contexto real-world.

Tasa de conversión Estimación en A/B Testing

En marketing y análisis web, las tasas de conversión son generalmente resultados Bernoulli (visit conduce a la conversión o no). Mediante el uso de un Beta antes de cada variante en un test A/B, los analistas pueden calcular las distribuciones posteriores para cada tasa de conversión y compararlas directamente. Por ejemplo, la variante A podría tener un Beta posterior(120, 980) y la variante B a posterior Bay(145, 855). Pruebas Bayesian A/B y se implementa ampliamente en herramientas como Google Optimize y VWO. (Ver el Artículo de Wikipedia sobre distribución de Beta para propiedades adicionales.)

Ensayos clínicos y vigilancia de la seguridad

En ensayos clínicos, la proporción de pacientes que experimentan un evento adverso es un punto final de seguridad crítico. La distribución Beta puede modelar esta proporción al incorporar conocimientos previos de estudios anteriores o opinión experta. La Administración de Alimentos y Medicamentos de los Estados Unidos (FDA) y otras agencias reguladoras aceptan cada vez más métodos Bayesian para el desarrollo de dispositivos médicos y medicamentos. La capacidad de actualizar continuamente la distribución posterior como datos de ensayo hace que la distribución Beta sea ideal para el monitoreo secuencial.

Contaminación y Pronóstico Electoral

Los datos de votación suelen implicar resultados binarios (el voto tiene la intención de votar por el candidato A o no). Los modelos beta-binomial permiten a los encuestadores incorporar patrones de votación histórica como un prior y actualizar con los resultados de la encuesta actual. Por ejemplo, un Beta anterior (α, β) puede ser obtenido de márgenes de elecciones anteriores, y después de la encuesta n probables votantes, el posterior refleja tanto el anterior como los nuevos datos. Este enfoque produce no sólo estimaciones de puntos, sino también intervalos de probabilidad que son más honestos que los intervalos de confianza clásicos, especialmente cuando los tamaños de muestra son pequeños.

Aprendizaje de máquinas y modelado probabilístico

La distribución Beta aparece en muchos contextos de aprendizaje automático, incluyendo:

  • Asignación de dirichlet de latente (ALD): LDA utiliza distribuciones Dirichlet (una generalización multivariada de la Beta) para modelar proporciones temáticas y distribuciones de palabras.
  • Thompson sampling: En problemas de bandido multiarmado, las distribuciones de Beta se utilizan para modelar las probabilidades de recompensa de cada brazo, permitiendo un intercambio eficiente de exploración-explotación.
  • Regreso lineal Bayesian: Cuando se desconoce la variabilidad de error, un Beta anterior al parámetro de varianza se puede utilizar junto con otras familias conjugadas.

Comparación de Diferentes Distribución de Beta

Elegir parámetros anteriores apropiados es una parte esencial del análisis Bayesiano. A continuación examinamos varios anteriores Beta usados comúnmente y sus implicaciones.

Uniforme anterior: Beta(1, 1)

Este anterior asigna la misma densidad a todos los valores de p entre 0 y 1. Es un plano, uninformativo previo usado a menudo cuando no existe un conocimiento previo fuerte. Sin embargo, no es el único antes ininformativo; el Jeffreys anterior al parámetro binomial es Beta(0.5, 0.5), que también es uninformativo bajo una parametrización diferente.

Jeffreys Prior: Beta(0,5, 0.5)

El Jeffreys prior es invariable bajo reparametración y tiene la propiedad de ser proporcional a la raíz cuadrada de la información Fisher. Para una probabilidad Bernoulli, el Jeffreys prior es Beta(0.5, 0.5). Esta distribución es en forma de U con alta densidad cerca de 0 y 1, reflejando menos certeza sobre probabilidades extremas que un uniforme anterior podría sugerir. Muchos Bayesianos lo prefieren por sus propiedades teóricas.

Prioridades informativas

Cuando se dispone de datos históricos o conocimientos especializados, se pueden construir antecedentes informativos. Por ejemplo, si un estudio piloto dio 10 éxitos de 50 ensayos, se podría utilizar un Beta anterior(10, 40) para reflejar esa evidencia. La fuerza del anterior está controlada por la suma α + β: una suma mayor indica más peso anterior. En la práctica, es común utilizar una débilmente informativo antes como Beta(1.1, 1.1) para proporcionar regularización sin dominar los datos.

Extensiones y distribuciones conexas

La distribución Beta forma parte de una familia de distribuciones más grande definidas en el intervalo de unidad. Su generalización multivariada es la distribución Dirichlet, que se conjuga a la probabilidad multinomia y se utiliza ampliamente en el procesamiento de idiomas naturales y modelos de mezcla Bayesian. Además, la distribución Beta-binomial modela el número de éxitos en el proceso de elaboración de idiomas naturales y los modelos de mezcla Bayesian. n ensayos cuando la probabilidad de éxito en sí misma sigue una distribución Beta. Esta distribución compuesta surge naturalmente en modelos jerárquicos Bayesian y datos de cuenta sobredispersos.

Distribución de la beta inversa

Para las ratios de modelado, la distribución inversa Beta (o Beta prime) puede derivarse de la Beta. Se define en (0, ∞) y a menudo se utiliza como un prior para parámetros de varianza en el análisis bayesiano de modelos de varianza. Sus propiedades reflejan las de la distribución Beta pero a una escala sin límites.

Conclusión

La distribución Beta ofrece una herramienta poderosa e intuitiva para la inferencia Bayesiana sobre probabilidades. Su relación con la familia binomial simplifica el proceso de actualización de creencias anteriores con datos, haciéndolo accesible incluso para los profesionales con antecedentes estadísticos limitados. Desde pruebas A/B y ensayos clínicos hasta la votación y el aprendizaje automático, la distribución Beta sigue siendo un bloque fundamental de construcción de la práctica Bayesiana moderna.enlace) y la entrada de la Enciclopedia de Stanford en la Epistemología Bayesiana (enlace).