Este libro ha sido concebido como un recurso integral para el estudio riguroso y aplicado de la inferencia estadística. Está dirigido a estudiantes de programas de estadística, matemáticas aplicadas y disciplinas afines, y busca fortalecer la comprensión conceptual y técnica de los fundamentos que sustentan el análisis estadístico moderno.
A lo largo de sus capítulos, el lector encontrará un desarrollo progresivo de los siguientes temas:
Fundamentos de la probabilidad y los modelos estadísticos.
Propiedades de las variables aleatorias y familias paramétricas comunes.
Principios clave para la reducción de datos: suficiencia, completitud y verosimilitud.
Construcción y evaluación de estimadores puntuales.
Estimación por intervalos y su interpretación inferencial.
Contrastes de hipótesis y principios de optimalidad en pruebas estadísticas.
Introducción a la teoría de la decisión y sus aplicaciones en inferencia.
El material combina el rigor formal con ejemplos y aplicaciones que ilustran cómo los métodos estadísticos permiten extraer conclusiones válidas a partir de datos.
Este libro se encuentra en construcción. Los capítulos se irán publicando progresivamente y pueden estar sujetos a revisiones o mejoras. Por ahora, son sólo trozos de contenido de otros libros o notas de clase de una selección personal y que se irán referenciando en cada capítulo.
1.1 ¿Cómo navegar este libro?
Usa el índice lateral izquierdo para acceder a cada capítulo y subcapítulo.
Haz uso del buscador para encontrar conceptos o términos clave.
Revisa los apartados de “Lista de problemas” incluidos al final de cada sección para practicar.
1.2 ¡Bienvenida/o!
Te invito a recorrer este texto con atención, curiosidad y sentido crítico.
Espero que este libro te acompañe, rete y apoye en tu formación como profesional en ciencias de datos o áreas relacionadas.
1.3 DATOS Y MODELOS
En esta sección establecemos la base conceptual para el análisis estadístico, diferenciando claramente entre el fenómeno aleatorio observado y la medida de probabilidad que lo describe.
1.3.1 Fenómeno aleatorio y variable observada
“Se observa una realización de un fenómeno aleatorio, digamos X. Este puede ser un elemento aleatorio de varios tipos: número (variable aleatoria), un vector de dimensión finita (vector aleatorio), una función, etc.
La premisa principal es que el carácter aleatorio de X se concibe como una realización de un fenómeno aleatorio que tiene una distribución de probabilidad P, donde la distribución P es desconocida ya sea en su totalidad o en algún detalle específico (por ejemplo, su soporte, su media, etc.). Es de interés conocer P. Si la medida de probabilidad P fuese conocida, entonces no hay problema estadístico propiamente, pues el problema estadístico tiene que ver con inferir la propiedad desconocida de P con base en X.” [Ver referencia 1]
Definición de X
X puede ser un valor real \(X \in \mathbb{R}\), un vector en \(\mathbb{R}^n\), o incluso una función \(\;X: [0,1]\to\mathbb{R}\).
Medida de probabilidad P
Desconocida: soporte, media, varianza, etc.
Objetivo estadístico: inferir características de (P) a partir de la muestra (la realización de X).
1.3.2 Incertidumbre inductiva vs. estocástica
“La observación X está dada, por lo que no hay incertidumbre tal como la hay en la teoría de probabilidad desarrollada anteriormente en el curso. Antes, fue concebida una estructura \((\Omega, \mathcal{F}, P)\) para enfrentar el que haya incertidumbre acerca del valor de X. En el problema estadístico, el valor de X ha sido observado, y la incertidumbre radica en otro punto: radica en que existe duda acerca de cuál P es la que produjo el valor X. En algunas ocasiones se utilizan los términos incertidumbre estocástica e incertidumbre inductiva para distinguir estos dos tipos. Es común que estos se confundan entre sí, porque en estadística matemática la teoría de probabilidad constituye también una de las maneras naturales de afrontar la cuantificación de incertidumbre inductiva. En cualquier caso, el concebir a P como medida de probabilidad es la base para formular soluciones a la incertidumbre inductiva. Con este lenguaje, probabilidad y estadística son problemas diferentes y de cierta manera inversos. Teoría de probabilidad tiene que ver con cuantificar incertidumbre acerca de X y teoría estadística con cuantificar incertidumbre acerca de P a la luz de haber ya observado X.”[Ver referencia 1]
Incertidumbre estocástica: duda previa sobre el valor de X, modelada por \((\Omega,\mathcal{F},P)\).
Incertidumbre inductiva: tras observar X, la incertidumbre se desplaza a la ley generadora P.
1.3.2.1 Ejemplos en Matemática Aplicada e Ingeniería de Sistemas
Modelado de tiempos de respuesta en redes
\(X\): tiempo de llegada de paquetes (variable continua).
\(P\): distribución de retardo desconocida; objetivo: estimar parámetros de una ley de colas M/M/1.
Estimación de parámetros en ecuaciones diferenciales estocásticas
\(X(t)\): trayectoria observada de un proceso de Itô.
\(P\): ley del proceso (por ejemplo, coeficientes de difusión y deriva), inferidos a partir de trayectorias discretas.
Calibración de sensores en sistemas de control
\(X\): lecturas del sensor (vector aleatorio).
\(P\): distribución conjunta desconocida de ruido; se estima para diseñar filtros de Kalman óptimos.
Con esta distinción clara entre dato observado y modelo probabilístico, estamos listos para construir estimadores y desarrollar la inferencia estadística en las secciones siguientes.
1.4 VARIABLE ALEATORIA
1.4.1 Variables y vectores aleatorios
Consideramos un experimento aleatorio cuyos resultados pertenecen al espacio muestral Ω. Modelamos este proceso suponiendo que existe una terna \((\Omega, \mathcal{A}, P),\) donde:
\(\Omega\) es el espacio muestra,
\(\mathcal{P}(\Omega)\) es el conjunto de partes de Ω,
\(\mathcal{A}\in\mathcal{P}(\Omega)\) es una σ-álgebra,
\(P\colon \mathcal{A} \to [0,1]\) es una medida de probabilidad que refleja las características aleatorias del experimento realizado.
A esta terna se le llama espacio de probabilidad.
Los resultados de un experimento aleatorio no son analizados “en bruto”, sino que se les da una representación numérica que facilita su tratamiento. Esto se logra introduciendo variables aleatorias, que asocian cada resultado \(\omega\in \Omega\) con un valor numérico o vectorial, y sobre las cuales luego aplicamos técnicas de inferencia estadística.
En todo estudio estadístico partimos de un experimento aleatorio cuyo conjunto de resultados posibles se denomina espacio muestral Ω. Para cuantificar dichos resultados definimos las siguientes estructuras:
Definition 1.1(Variables Aleatorias) Sea \((\Omega,\mathcal{A},P)\) un espacio de probabilidad. Una variable aleatoria es una función \(X\colon (\Omega,\mathcal{A})\;\longrightarrow\; (\mathbb{R},\mathcal{B}),\) tal que para todo \(B\in\mathcal{B}\) (la \(\sigma\)-álgebra de Borel en ℝ), \(X^{-1}(B)\;=\;\{\omega\in\Omega : X(\omega)\in B\}\;\in\;\mathcal{A}.\)
Si el espacio muestral \(\Omega\) es finito o numerable, diremos que es un espacio discreto y las variables aleatorias asociadas al experimento normalmente estarán definidas como \(X\colon \Omega \;\longrightarrow\; \mathbb{Z}.\)
Si \(\Omega\) es no numerable, entonces diremos que es un espacio continuo y \(X\colon \Omega \;\longrightarrow\; \mathbb{R}.\)
Definition 1.2 Un vector aleatorio de dimensión \(n\) es \(\mathbf{X} = (X_1,\dots,X_n)\colon(\Omega,\mathcal{A})\longrightarrow(\mathbb{R}^n,\mathcal{B}^n),\) donde cada componente \(X_i\) es variable aleatoria y \(\mathcal{B}^n\) la \(\sigma\)-álgebra de Borel en ℝⁿ.
EjemplosLanzamiento de dos monedas
Sea \(\Omega =\{\,CC,\;C-,\;-C,\;--\},\) donde \(C\) = “cara” y \(-\) = “cruz”. Podemos definir: \(X_1(\omega) = \text{número de caras en }\omega.\)\(X_2(\omega) = 2 - X_1(\omega)\;=\; \text{número de cruces}.\)\(X_3(\omega) = \bigl(X_1(\omega)\bigr)^2.\)
Entonces \((X_1,X_2,X_3)\) es un vector aleatorio de dimensión 3.
Tiempos de servicio en un servidor
Sean \(T_i\) los tiempos de servicio (en segundos) de las peticiones \(i=1,2,3\). Definimos \(\mathbf{T}=(T_1,T_2,T_3),\quad S = T_1 + T_2 + T_3,\quad M = \max\{T_1,T_2,T_3\}.\)
Lecturas de sensores en red distribuida
En tres nodos \(i=1,2,3\) medimos temperatura \(X_{i,1}\), presión \(X_{i,2}\) y humedad \(X_{i,3}\). El vector global es \(\mathbf{X} = (X_{1,1},X_{1,2},X_{1,3},\,X_{2,1},\dots,X_{3,3}) \in \mathbb{R}^9.\)
Con estas definiciones rigurosas disponemos ya de los objetos básicos para, en las siguientes secciones, construir estimadores, estudiar su comportamiento asintótico y contrastar hipótesis sobre la distribución subyacente \(P\).
1.5 Distribución de una variable aleatoria. Funciones de distribución, de probabilidad y de densidad
Distribución de una Variable Aleatoria
La realización de un experimento aleatorio da lugar a un resultado \(\omega\in\Omega\) que es aleatorio. Por lo tanto, \(X(\omega)\) es un valor de \(\mathbb{R}\) también aleatorio. Es decir, la variable aleatoria \(X\) induce una medida de probabilidad en \(\mathbb{R}\). A esa medida de probabilidad se le llama distribución de \(X\) o ley de \(X\). Una de las formas de caracterizar la distribución de una variable aleatoria es dar su función de distribución \(F_X\), que está definida así:
En el caso de que \(X\) sea una variable aleatoria discreta, es decir, en el caso de que \(X\) solo tome una cantidad finita o numerable de valores de \(\mathbb{R}\), su distribución también puede caracterizarse por su función de probabilidad (o función de masa de probabilidad) \(f_X\), definida como
Esa función solo es no nula en un conjunto finito o numerable. Supondremos en adelante, sin pérdida de generalidad, que ese conjunto está contenido en \(\mathbb{Z}\). A partir de la función de masa de probabilidad se puede calcular la probabilidad de que la variable aleatoria \(X\) tome valores en cualquier elemento \(A \subseteq \mathbb{B}\):
\(P(X \in A) = \sum_{x \in A} f_X(x).\) me
La función de distribución y la función de masa de probabilidad se relacionan de la siguiente forma:
Una clase relevante de variables aleatorias no discretas son las que poseen función de densidad, es decir, aquellas cuya distribución de probabilidad puede caracterizarse por una función \(f_X(x) \geq 0\) que cumple que:
\(P(X \in A) = \int_{x \in A} f_X(x) \, dx, \quad \text{para todo } A \subseteq \mathbb{B}.\)
La relación entre \(F_X\) y \(f_X\) es la siguiente:
salvo quizás en un número finito de puntos \(x \in \mathbb{R}\). Las variables aleatorias que poseen función de densidad se llaman variables aleatorias absolutamente continuas. Abusando del lenguaje, aquí nos referiremos a ellas como variables aleatorias continuas.
1.6 Esperanza y varianza
Si se desea describir totalmente la distribución de probabilidad de una variable aleatoria \(X\) acabamos de ver que podemos dar su función de distribución o su función de masa o de densidad, según el caso. Una descripción parcial puede efectuarse calculando algunas características de la variable aleatoria \(X\), como por ejemplo medidas de posición o de dispersión. Estudiaremos algunas de ellas.
Se define la esperanza de una variable aleatoria \(X\) como la integral de Lebesgue de \(X\):
\(E(X) = \int_{\Omega} X(w) dP(w).\)
En el caso de variables aleatorias discretas la esperanza puede calcularse como:
Por otro lado, la esperanza de una variable aleatoria continua se puede calcular así:
\(E(X) = \int_{\mathbb{R}} x f_X(x) dx.\)
La esperanza de una variable aleatoria \(X\) es una medida de posición de \(X\): es el centro de gravedad de la distribución de probabilidad de \(X\).
Si \(h\) es una función medible \(h : \mathbb{R} \rightarrow \mathbb{R}\), entonces \(Y = h(X)\) es también variable aleatoria y su esperanza se puede calcular a partir de la distribución de \(X\):
\(E(h(X)) = \int_{\Omega} h(X(w)) dP(w)\) que en el caso de que \(X\) sea discreta puede reescribirse como
Si \(X\) es una variable aleatoria continua entonces
\(E(h(X)) = \int_{\mathbb{R}} h(x) f_X(x) dx.\)
Si existe \(\mu = E(X)\) y es finita puede definirse una medida de dispersión de la variable aleatoria \(X\) a partir de una transformación \(h\) de \(X\). Es lo que se denomina varianza de \(X\) y se define así:
Dada una variable aleatoria \(X\), o su función de distribución \(F\), vamos a definir otra función generadora, como
\(M_X(t) = \mathbb{E}(e^{tX}),\) siempre que este valor esperado exista.
Notemos que cuando \(X\) toma valores en los enteros no-negativos, \(M_X(t) = \phi_X(e^t)\), donde \(\phi_X(s)=E[s^X]=\sum_{k=0}^{\infty}p_ks^k\) para \(s\in[0,1]\) es la función generadora de probabilidad (f.g.p.) de la variable \(X\), con \(p_k=P(X=k)\). Si \(X\) está acotada, \(M_X\) está bien definida para todo \(t\) real; en cambio, si \(X\) no está acotada, es posible que el dominio de \(M_X\) no sea el conjunto de todos los reales. En todo caso, \(\phi\) siempre está definida en cero, y \(M(0) = 1\).
Es posible demostrar que si la f.g.m. de la v.a. \(X\) existe en un entorno de 0, entonces para todo \(k > 0\),
Es por esta última propiedad que esta función se conoce como función generadora de momentos (f.g.m.).
🎲 Ejemplo: f.g.m. de la distribución Binomial
Sea \(X \sim \text{Binomial}(n, p)\), es decir, la suma de \(n\) ensayos de Bernoulli con probabilidad de éxito \(p\). La función generadora de momentos es: Ejemplo fgm binomial
\(M_X(t) = \mathbb{E}[e^{tX}] = (1 - p + p e^t)^n\)
````
📈 Ejemplo: f.g.m. de la distribución Normal Estándar
Sea \(X \sim \mathcal{N}(0, 1)\). Su función generadora de momentos es:
Esta expresión se obtiene usando la forma cerrada del momento de una normal estándar.
````
❓ Preguntas guía sobre la gráfica de la función generadora de momentos
📌 ¿Qué representa la gráfica de la f.g.m. \(M_X(t)\)?
La gráfica muestra cómo evoluciona el valor esperado de \(e^{tX}\) cuando \(t\) varía. Esta función codifica todos los momentos de la variable aleatoria\(X\), y por tanto, contiene información completa sobre su distribución (si existe un entorno donde la f.g.m. es finita).
🧭 ¿Qué se observa en la f.g.m. de una distribución Binomial?
![Gráfica MGF Binomial]
#Preguntas y respuestas
¿Cómo es el comportamiento de la f.g.m. cerca de \(t = 0\)?
En \(t = 0\), siempre se cumple que \(M_X(0) = 1\), ya que:
La curvatura refleja el crecimiento exponencial de los momentos. Si la curva crece rápidamente hacia la derecha, significa que los momentos (media, varianza, etc.) también crecen con rapidez.
¿Por qué la gráfica es convexa?
Todas las funciones generadoras de momentos son estrictamente convexas en el intervalo donde están definidas. Esto es una consecuencia de que derivadas sucesivas representan momentos positivos.
¿Qué pasa si cambio los parámetros \(n\) y \(p\)?
Aumentar $ n $ o \(p\) tiende a elevar la f.g.m. en el lado derecho, reflejando una mayor media y varianza.
📈 ¿Cómo se comporta la f.g.m. para la Normal Estándar?
![Gráfica MGF Normal]
Preguntas y respuestas
¿Por qué es simétrica respecto al eje $ t = 0 $?
Porque la normal estándar es simétrica alrededor de su media $ = 0 $, y su f.g.m. tiene la forma:
\(M_X(t) = e^{t^2 / 2}\)
lo cual es una función par: \(M_X(-t)= M_X(t)\).
¿Qué tan rápido crece la función?
Muy rápido. El crecimiento es exponencial cuadrático. Esto implica que los momentos de la normal crecen rápidamente en magnitud.
¿Cómo se relaciona esta gráfica con los momentos de la normal?
Derivando sucesivamente la f.g.m. en $ t = 0 $, se obtiene:
\(\mathbb{E}[X^k] = M_X^{(k)}(0)\)
Por tanto, la gráfica “encierra” toda la información sobre los momentos.
🧠 Conclusión
Estas gráficas te permiten visualizar la información estadística codificada en una variable aleatoria. La f.g.m. no es solo una herramienta algebraica para obtener momentos, sino una forma poderosa de describir el comportamiento global de la variable.
¿Qué pasa si dos variables tienen la misma f.g.m.?
¡Tienen la misma distribución! (si la f.g.m. está definida en un entorno de 0).
Ejemplo: Distribución uniforme \(U(a,b)\)
Si \[X \sim U(a,b),\]
su densidad es \[f(x) = \frac{1}{b - a}\quad\text{para }a < x < b,\]
y su función generadora de momentos viene dada por
Theorem 1.1(fgm de suma de v.a.s) Si \(X\) tiene función generadora de momentos \(M(t)\) que está definida en un entorno \((-a,a)\) de 0, entonces \(M(t)\) caracteriza a la distribución de \(X\); es decir, si otra variable \(Y\) tiene la misma función generadora de momentos, las distribuciones de \(X\) e \(Y\) coinciden.
Si \(X,Y\) son variables aleatorias con funciones generadoras de momentos respectivas \(M_X\) y \(M_Y\) que existen en un dominio común \(|t| < d\), entonces la f.g.m. de la suma \(X+Y\) está dada por \[
\begin{align}
M_{X+Y}(t)&= \mathbb{E}\bigl[e^{t(X+Y)}\bigr]\\
&= \mathbb{E}\bigl[e^{tX}\,e^{tY}\bigr]\\
&=\mathbb{E}\bigl[e^{tX}\bigr]\mathbb{E}\bigl[e^{tY}\bigr]\\
&= M_X(t)\,M_Y(t).
\end{align}
\tag{1}
\]
Este resultado se extiende a la suma de \(n\) variables aleatorias independientes. Si
La función generadora de momentos resulta particularmente útil cuando consideramos sucesiones de variables aleatorias, como lo muestra el siguiente teorema que enunciamos sin demostración:
Theorem 1.2(de Continuidad) Sea \(F_n(x)\), \(n\ge1\), una sucesión de funciones de distribución con funciones generadoras de momentos respectivas \(M_n(t)\), definidas en \(|t|<b\). Supongamos que cuando \(n\to\infty\),
\[
M_n(t)\,\longrightarrow\,M(t)
\quad\text{para }|t|\le a,
\]
donde \(M(t)\) es la función generadora de momentos de la distribución límite \(F(x)\). Entonces
Como \(e^{t^2/2}\) es la mgf de \(\mathcal{N}(0, 1)\), y por el teorema de unicidad de la función generadora de momentos:
\[
Z_n \xrightarrow{d} \mathcal{N}(0, 1)
\]
Esto concluye la demostración del Teorema de Laplace–Moivre utilizando funciones generadoras de momentos.
1.8 Muestra aleatoria simple
Sea \(\underset{\sim}{X} =(X_1 ,..., X_n)\) un vector aleatorio. Se dice que sus componentes \(X_1 ,..., X_n\) son si \(P(X_1\leq x_1 ,..., X_n\leq x_n)=P(X_1\leq x_1)...P(X_n\leq x_n)\) para cualesquiera valores \(x_1,..., x_n\) .
Si además la distribución de las \(n\) variables aleatorias \(X_i\) es la misma, se dice que \(X_1 ,...,X_n\) son variables aleatorias independientes e idénticamente distribuidas, o bien que son v.a.i.i.d o simplemente i.i.d.
Si \(\underset{\sim}{X} =(X_1 ,..., X_n)\) y \(X_1 ,..., X_n\) son i.i.d. con función de densidad (en su caso, de masa) \(f_X\) , la distribución conjunta de \(\underset{\sim}{X}\) viene dada por la función de densidad (en su caso, de masa) conjunta \[
\begin{align*}
f_{\underset{\sim}{X}}(\underset{\sim}{x})&=f_{(X_1 ,..., X_n)}(x_1 ,..., x_n)\\
&=f_{(X_1)}(x_1)...f_{(X_n)}(x_n)\\
&=\prod_{i=1}^{n}f_{(X_i)}(x_i)
\end{align*}
\]
A un vector \(\underset{\sim}{X} =(X_1 ,..., X_n)\) de v.a.i.i.d. con distribución igual a la de la variable aleatoria \(X\) se le denomina también muestra aleatoria simple de \(X\) (m.a.s de \(X\)).
Esto responde al hecho siguiente. Supongamos que se desea estudiar la característica \(X\) de los individuos de una población de tamaño infinito. Definimos el experimento consistente en elegir aleatoriamente un individuo de la población y llamamos \(X\) al valor de la característica de interés en ese individuo. X es una variable aleatoria.
Si definimos un nuevo experimento consistente en elegir una muestra aleatoria de n individuos y se anota \(X_i\), el valor de la característica en el individuo i-ésimo, entonces X\(=(X_1 ,..., X_n)\) es una colección de n v.a.i.i.d. con distribución igual a la de la variable aleatoria \(X\), es decir, \(X_1 ,..., X_n\) es una m.a.s. de X.
1.9 Modelo paramétrico
Usualmente la ley de probabilidad de una variable aleatoria se supone perteneciente a un modelo matemático que depende sólo de un número finito de parámetros: \(f_X \in\{f(x|\theta):\theta \in \Theta \subseteq \mathbb{R}^k\}\). Escribiremos alternativamente \(f(x;\theta)\), \(f(x|\theta)\) o \(f_\theta(x)\).
Definition 1.3 El conjunto de distribuciones dadas por \(f_\theta(x)\), \(\theta \in \Theta\) se llama familia paramétrica de distribuciones. \(\Theta\) es el conjunto de parámetros.
Definition 1.4 La correspondiente distribución conjunta de una muestra aleatoria simple de \(X\) viene dada por la función de densidad (o función de masa de probabilidad, según el caso)
A esta función la llamaremos función de verosimilitud de la muestra \(X_{\sim}\). Utilizaremos este término para referirnos indistintamente a la función de densidad conjunta (si las variables aleatorias son continuas) o a la función de masa conjunta (si son discretas).
1.10 Sumas de variables aleatorias
Cuando se obtiene una muestra aleatoria simple \(X_{1},X_{2},\ldots,X_{n}\) normalmente se calculan a partir de ellas cantidades que resumen los valores observados. Cualquiera de estos resúmenes se puede expresar como una función \(T(x_1,\ldots,x_n)\) definida en el espacio \(\mathcal{X}^n\subseteq\mathbb{R}^n\) donde están las imágenes del vector \((X_{1},X_{2},\ldots,X_{n})\).
Esta función \(T\) puede devolver valores de \(\mathbb{R}\), \(\mathbb{R}^2\) o, en general, \(\mathbb{R}^k\).
Definition 1.5(Definición de estadísticos) Las funciones \(T\) que dependen de una muestra aleatoria simple \(X_1 , \ldots, X_n\) se llaman estadísticos. Dependen de los valores observados, pero no de los parámetros desconocidos que determinan la distribución de \(X_i\) .
Cuando un estadístico \(T\) es utilizado con el propósito de estimar un parámetro \(\theta\) diremos que \(T\) es un estimador de \(\theta\).
Ejemplo de estadístico
\(T(X_1 , \ldots, X_n)=\bar{X}\) es un estimador de \(E(X)=\mu\).
En inferencia estadística interesa saber qué estadísticos son suficientes para recoger toda la información que la muestra aporta sobre la distribución de la variable aleatoria X muestreada. La respuesta depende de la distribución de X.
Definition 1.6(Definición distribución en el muestreo) Dado que \(\underset{\sim}{X} =(X_1 ,..., X_n)\) es una variable aleatoria, se tiene que \(Y=T(\underset{\sim}{X})=T(X_1 ,..., X_n)\) será también una variable aleatoria. La ley de probabilidad de \(Y\) se denomina distribución en el muestreo de \(Y\) (o distribución muestral). Los siguientes resultados dan información sobre algunas características de estadísticos definidos a partir de sumas de variables aleatorias.
1.11 Estadísticos definidos a partir de sumas de variables aleatorias
Theorem 1.4 Sean \(X_1,\ldots, X_n\),n números reales, sea \(\bar{x} = \frac{1}{n} \sum_{i=1}^{n}x_i\) su media aritmética y sea \(S_n^2=\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}\) su varianza muestral.
Lemma 1.1 Sea \(X_1,\ldots, X_n\) una muestra aleatoria simple de \(X\) y sea \(g(x)\) una función tal que \(E(g(X))\) y \(Var(g(X))\) existen. Entonces,
\(E(\sum_{i=1}^{n}g(X_i))=nE(g(X))\),
\(Var(\sum_{i=1}^{n}g(X_i))=nVar(g(X))\).
Proof. Para la demostración ver Gómez et al. (2006)
Theorem 1.5 Sea \(X 1,\ldots, X_n\) una muestra aleatoria simple de una población \(X\) con esperanza \(\mu\) y varianza \(\sigma^2 < \infty\). Sean \[
\begin{align*}
&\bar{X}=\frac{1}{n}\sum_{i=1}^{n}X_i,\ \
S^2=\frac{\sum_{i=1}^{n}(X_i-\bar{X})^2}{n-1},
\end{align*}
\] la media y la varianza muestrales, respectivamente. Entonces,
\(E(\bar{X}) = \mu,\)
\(Var(\bar{X}) = \frac{\sigma^2}{n},\)
\(E(S^2) = \sigma^2\).
Theorem 1.6 Sea \(X 1,\ldots, X_n\) una muestra aleatoria simple de una población \(X\) con función generadora de momentos \(M_X(t)\). La función generatriz de momentos de \(X\) es \[\begin{align*}
&M_{\bar{X}}(t)=\left(M_X\left(\frac{t}{n}\right)\right)^n
\end{align*}
\]
Theorem 1.7(Combinación lineal de normales es normal) (Wackerly et al. (2008)) Sean \(Y_1,\,Y_2,\cdots,\,Y_n\) variables aleatorias independientes normalmente distribuidas \(E(Y_i)=\mu_i\) y \(V(Y_i)=\sigma_i^2\)ara \(i=1,\cdots,\,n\) y sean \(a_1,\,a_2,\cdots,\,a_n\) constantes. Si \[U=\sum_{i=1}^na_iY_i\]
entonces \(U\) es una variable aleatoria normalmente distribuida con \[E(U)=\sum_{i=1}^na_i\mu_i\] y \[V(U)=\sum_{i=1}^na_i^2\sigma^2_i\]
Ejemplo\(X 1,\ldots, X_n\) m.a.s. de \(X \sim N(\mu,\sigma^2)\). Entonces, \(M_{X}(t)=\exp\left\{\mu t+ \frac{\sigma^2t^2}{2}\right\}\). De ahí que
\(X 1,\ldots, X_n\) m.a.s. de \(X \sim N(\mu,\sigma^2)\). Entonces, \(M_{X}(t)=\exp\left\{\mu t+ \frac{\sigma^2t^2}{2}\right\}\). De ahí que \[
\begin{align*}
M_{\bar{X}}(t)&=\exp\left\{\mu t+ \frac{\sigma^2t^2}{2n}\right\}
\end{align*}
\] De ahí que \(\bar{X}\sim N(\mu,\frac{\sigma^2}{n})\).
1.12 Muestreo de una distribución normal
1.12.1 Definición de distribución Chi cuadrada
Definition 1.7 (Wackerly et al. (2008)) Sea \(\nu\) un entero positivo. Se dice que una v.a \(Y\) tiene distribución chi cuadrada con \(\nu\) grados de libertad si y sólo si \(Y\) es una vriable aleatoria con distribución gamma y parámetros \(\alpha=\nu/2\) y \(\beta=2\).
Theorem 1.8(Teorema de Fisher) En el resto del tema supondremos que \(X 1,\ldots, X_n\) m.a.s. de una \(N(\mu, \sigma^2)\).
\(\bar{X}\) y \(S_n^2\) son variables aleatorias independientes.
Theorem 1.9 (Wackerly et al. (2008)) Sean \(Y_1,\,Y_2,\cdots,\,Y_n\) definidas como en el Teorema Theorem 1.7 de Wackerly et al. (2008) y definimos \(Z_i\) por \[Z_i=\frac{Y_i-\mu_i}{\sigma_i}\] con \(i=1,\,2,\cdots,\,n\). Entonces \(\sum_{i=1}^nZ_i^2\) tiene distribuición \(\chi^2\) con \(n\) grados de libertad.
Theorem 1.10 (Wackerly et al. (2008)) Si \(Y_1,\,Y_2,\cdots,\,Y_n\) es una muestra aleatoria de una distribución normal con media \(\mu\) y varianza \(\sigma^2\), \(Y_i\), \(i=1,\,2,\cdots,n\) son v.a’s independientes distribuídas normalmente, con \(E(Y_i)=\mu\) y \(V(Y_i)=\sigma^2\).
Entonces \[Z_i=\frac{Y_i-\mu}{\sigma}\] son v.a’s independientes, \(i=1,\,2,\cdots,n\) y \[\sum_{i=1}^nZ_i^2=\sum_{i=1}^n\left(\frac{Y_i-\mu}{\sigma}\right)^2\]tienen una distribución \(\chi^2\) con \(n\) grados de libertad (gl).
Theorem 1.11 (Wackerly et al. (2008)) Sea \(Y_1,\,Y_2,\cdots,\,Y_n\) una muestra aleatoria con media \(\mu\) y varianza \(\sigma^2\). Entonces \[\frac{(n-1)S^2}{\sigma^2}=\frac{1}{\sigma^2}\sum_{i=1}^n(Y_i-\overline{Y})^2\] tiene una distribución \(\chi^2\) con \((n-1)\) gl. \(\overline{Y}\) y \(S^2\) son v.a independientes.
Definition 1.8 (Wackerly et al. (2008)) Sea \(Z\) una v.a normal estándar y sea \(W\) una v.a con distribución \(\chi^2_\nu\). Entonces, si \(W\) y \(Z\) son ind \[T=\frac{Z}{\sqrt{W/\nu}}\] se dice que tiene una distribución \(t\) con \(\nu\) grados de libertad.
Observación 1
Si \(Y_1,\,Y_2,\cdots,\,Y_n\sim N(\mu,\sigma^2)\) del Teorema (Combinación lineal de normales es normal)\[Z=\frac{\sqrt{n}(\overline{Y}-\mu)}{\sigma}\sim N(0,1)\] El teorema Observación 1 nos dice que \[W=\frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1}\] y que \(Z\) y \(W\) son ind.
Observación 2
Por tanto, de la definición 7.2 se tiene la siguiente expresión: \[
\begin{aligned}
T &= \frac{Z}{\sqrt{W/\nu}} \\
&= \frac{\sqrt{n}(\overline{Y}-\mu)/\sigma}{\sqrt{\left[\frac{(n-1)S^2}{\sigma^2}\right]/(n-1)}} \\
&= \sqrt{n}\left(\frac{\overline{Y}-\mu}{S}\right)
\end{aligned}
\]
Tiene distribución \(t\) con \((n-1)\) grados de libertad.
Definition 1.9 Sean \(W_1\) y \(W_2\) v.a’s independientes con distribución \(\chi^2\), con \(\nu_1\) y \(\nu_2\) grados de libertad respectivamente. Entonces se dice que: \[F=\frac{W_1/\nu_1}{W_2/\nu_2}\] tiene una distribución \(F\) con \(\nu_1\) grados de libertad en el numerador y \(\nu_2\) grados de libertad en el denominador.
Remark 1.1. Considerando dos muestras aleatorias independientes tomadas de distribuiciones normales \[W_1=\frac{(n_1-1)S_1^2}{\sigma_1^2}\sim\chi^2_{n_1-1}\]\[W_1=\frac{(n_2-1)S_2^2}{\sigma_2^2}\sim\chi^2_{n_2-1}\]\(W_1\bot W_2\).
Remark 1.2. \[
\begin{eqnarray*}
F&=&\frac{W_1/\nu_1}{W_2/\nu_2}\\
&=&\frac{[(n_1-1)S_1^2/\sigma_1^2]/(n_1-1)}{[(n_2-1)S_2^2/\sigma_2^2]/(n_2-1)}\\
&=&\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}
\end{eqnarray*}
\] tiene distribución \(F\) con \((n_1-1)\) gl en el numerador y \((n_2-1)\) gl en el denominador
library(ggplot2)figura_densidad_asimetrica<-function(alpha=0.05){shape<-2rate<-1# Cuantil de interésF_alpha<-qgamma(1-alpha, shape =shape, rate =rate)# Datos para la densidadx_vals<-seq(0, 10, length.out =1000)df<-data.frame( x =x_vals, y =dgamma(x_vals, shape =shape, rate =rate))# Datos para el sombreadodf_shaded<-subset(df, x>=F_alpha)# Altura de la flechay_arrow<-dgamma(F_alpha, shape, rate)ggplot(df, aes(x, y))+geom_line(linewidth =1.2)+geom_area(data =df_shaded, aes(x, y), fill ="black", alpha =0.3)+# Flecha verticalannotate("segment", x =F_alpha, xend =F_alpha, y =0, yend =y_arrow, arrow =arrow(length =unit(0.15, "cm")), color ="black")+# Etiqueta F_αannotate("text", x =F_alpha, y =0, label =expression(F[alpha]), vjust =1.5, hjust =1.1, size =5)+# Etiqueta αannotate("text", x =F_alpha, y =y_arrow, label =expression(alpha), vjust =-1, size =5)+labs(x ="u", y =expression(f(u)))+theme_minimal(base_size =14)}figura_densidad_asimetrica()
Warning in is.na(x): is.na() aplicado a un objeto que no es (lista o vector) de
tipo 'expression
Warning in is.na(x): is.na() aplicado a un objeto que no es (lista o vector) de
tipo 'expression
Ejercicios con la distribución F en R
A continuación se presentan dos ejercicios típicos en los que anteriormente se utilizaban tablas de valores críticos de la distribución F. Ahora, gracias a funciones como qf() y var.test() en R, estos análisis pueden hacerse de manera precisa y automática.
Ejercicio 1: Contrastar dos varianzas
Enunciado:
Se tienen dos muestras independientes con: - Tamaños: \(n_1 = 6\), \(n_2 = 10\) - Varianzas muestrales: \(s_1^2 = 25\), \(s_2^2 = 10\)
¿Existe evidencia para afirmar que las varianzas poblacionales son diferentes al nivel de significancia del 5%?
Solución en R:
# Datoss1_sq<-25s2_sq<-10n1<-6n2<-10# Estadístico F observado (mayor varianza sobre menor)F_obs<-s1_sq/s2_sqgl1<-n1-1gl2<-n2-1# Cuantiles críticos para prueba bilateral al 5%alpha<-0.05F_inf<-qf(alpha/2, df1 =gl1, df2 =gl2)F_sup<-qf(1-alpha/2, df1 =gl1, df2 =gl2)# Decisióncat("F observado:", round(F_obs, 3), "\n")
F observado: 2.5
cat("Intervalo de aceptación: [", round(F_inf, 3), ",", round(F_sup, 3), "]\n")
Intervalo de aceptación: [ 0.15 , 4.484 ]
if(F_obs<F_inf||F_obs>F_sup){cat("Se rechaza H0: las varianzas son significativamente diferentes.\n")}else{cat("No se rechaza H0: no hay evidencia suficiente para afirmar diferencia de varianzas.\n")}
No se rechaza H0: no hay evidencia suficiente para afirmar diferencia de varianzas.
Ejercicio 2: Obtener un valor crítico F directamente
Enunciado:
Calcular el valor crítico \(F_{0.05,\,5,\,9}\) para una prueba unilateral con nivel de significancia del 5%.
Este valor se usa, por ejemplo, cuando se contrasta si una varianza es significativamente mayor que otra, con: - \(\alpha = 0.05\) - \(\text{gl}_1 = 5\) (grados de libertad del numerador) - \(\text{gl}_2 = 9\) (grados de libertad del denominador)
Cálculo en R:
# Valor crítico F para prueba unilateral con alpha = 0.05qf(0.95, df1 =5, df2 =9)
[1] 3.481659
El valor crítico es \(F_{0.05,\,5,\,9}=3.478\). Si el estadístico F observado es mayor que este valor, se rechaza la hipótesis nula de igualdad de varianzas a favor de que la varianza del numerador es mayor.
Example 1.1\[Y_1^1,\,Y_2^1\,\cdots,\,Y_{n_1}^1\sim N(\mu_1,\,\sigma^2)\]\[Y_1^2,\,Y_2^2\,\cdots,\,Y_{n_2}^2\sim N(\mu_2,\,\sigma^2)\]\(P\left(\frac{S_1^2}{S_2^2}\leq b\right)=0.95\) con \(n_1=6\) y \(n_2=10\), ?`\(b\)?
Como \(n_1=6\) y \(n_2=10\) y las varianzas poblacionales son iguales, entonces \(\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2}=\frac{S_1^2}{S_2^2}\sim F_{5,9}\)\[P\left(\frac{S_1^2}{S_2^2}\leq b\right)= F_{5,9}(b)=0.95\] entonces \(qf(0.95,\,5,\,9)=b\), \(b=3.48\).
Simulación del comportamiento del promedio muestral
Simulamos 1000 repeticiones del promedio muestral a partir de una distribución exponencial con media ( = 10 ), para distintos tamaños de muestra ( n ).
Theorem 1.12 Sean \(Y_1,\,Y_2,\cdots,\,Y_n\) v.a’s con funciones generadoras de momentos \(m(t)\) y \(m_1(t),\,m_2(t),\cdots,\) respectivamente. Si \[\lim_{n\rightarrow\infty}m_n(t)=m(t)\mbox{ para toda $t$ real,}\] entonces la función de distribución de \(Y_n\) converge hacia la función de distribución de \(Y\) cuando \(n\rightarrow\infty\)
1.13 Leyes de los Grandes Números y Teorema Central del Límite
1.13.1 Leyes de los grandes números
Definition 1.10 Una sucesión de variables aleatorias converge en media a \(X\), y se denota por \(X_{n}\xrightarrow{cm}X\) , si para cualquier \(\epsilon>0\) se tiene que:
[{n}E(|X{n}-X|)=0,] siempre que dicha esperanza exista.\
De forma análoga se define convergencia en media de orden r si: \[\lim _{n\to \infty }E(\left|X_{n}-X\right|^r)=0,\]
Cuando \(r=2\) se dice que se tiene convergencia en media cuadrática
1.14.1 Diagrama de relaciones entre tipos de convergencia
Diagrama de convergencias
1.14.2 Ley débil de los grandes números
Theorem 1.13 Sea \(X 1,\ldots, X_n\) una sucesión de variables aleatorias incorreladas con momentos de segundo orden acotados por una constante \(C\), independiente de \(n\). Sea \(S_n = \sum_{i=1 }^{n}X_i\). Entonces \[
\begin{align}
E\left(\left|\frac{S_n-E(S_n)}{n}\right|^2\right)\leq \frac{C}{n}
\end{align}
\] y, como consecuencia \[\lim _{n\to \infty }\frac{S_n-E(S_n)}{n}=0\] en el sentido de la convergencia en media cuadrática.
Los resultados que garantizan la convergencia casi segura de la media muestral se conocen como leyes fuertes de los grandes números. Se enuncia a continuación una ley fuerte para variables con segundos momentos finitos e incorreladas.
1.14.3 Ley fuerte de los grandes números
Theorem 1.14 Sea \(X 1,\ldots, X_n\) una sucesión de variables aleatorias incorreladas con momentos de segundo orden acotados por una constante \(C\), independiente de \(n\). Sea \(S_n = \sum_{i=1 }^{n}X_i\). Entonces \[
\begin{align}
E\left(\left|\frac{S_n-E(S_n)}{n}\right|^2\right)\leq \frac{C}{n}
\end{align}
\] y, como consecuencia \[\lim _{n\to \infty }\frac{S_n-E(S_n)}{n}=0\] en el sentido de la casi segura.
1.15 Teorema central del límite
Theorem 1.15Central de Límite Sean \(Y_1,\,Y_2,\cdots,\,Y_n\) v.a’s iid ( no se precisa de que distribución se generan) con \(E[Y_i]=\mu\) y \(V[Y_i]=\sigma^2<\infty\). Definamos \[U_n=\frac{\sum_{i=1}^nY_i-n\mu}{\sigma\sqrt{n}}=\frac{\overline{Y}-\mu}{\sigma/\sqrt{n}}\mbox{ donde} \overline{Y}=\frac{1}{n}\sum_{i=1}^nY_i\] Entonces la función de distribución de \(U_n\) converge hacia la función de distribución normal estándar cuando n tiende a infinito . Esto es, \[\lim_{n\rightarrow\infty}P(U_n\leq u)=\int_{-\infty}^u\frac{1}{\sqrt{2\pi}}e^{-t^2/2}dt, \forall u\]
1.16 Ejercicio
Exercise 1.1 Para \(i=1,...,n\) sea \(\{X_{i}\}\) variables aleatorias independientes. Tal que \[\begin{align*}
P(X_n=1)&=p_n,\\
P(X_n=0)&=1-p_n.
\end{align*}\]
¿Bajo qué condiciones de \(p_n\), \(X_{n}\xrightarrow{P}0\) cuando \(n\to \infty\)?
Exercise 1.2 Sea \(\{X_{i}\}\) v.a.i.i.d, tal que \(E(X_{i})=\mu\) y \(Var(X_{i})=\sigma^2\) para todo \(i=1,...,n\). Muestre que \(E(\hat{X}_{n}-\mu)^2\xrightarrow{}0\) cuando \(n\to \infty\).
Exercise 1.3 Para \(i=1,...,n\) sea \(\{X_{i}\}\) variables aleatorias reales. Supongase que \(\sqrt{n}(X_n-\mu)\xrightarrow{d}N(0,\sigma^2)\). Demostrar que \(X_n\xrightarrow{P}\mu\), cuando \(n\to \infty\).
Exercise 1.4 Sea \(S={1,2,3,4}\) y sobre los subconjuntos de \(S\) se definen las siguientes variables aleatorias con función de distribución uniforme discreta de la siguiente manera: \[\begin{align*}
&X_{n}(1)=X_{n}(2)=1,\ \
X_n(3) = X_n(4) = 0, n=1,2,...\\
&X(1)=X(2)=0,\ \
X(3) = X(4) = 1.
\end{align*}\],
X(3) = X(4) = 1. \end{align*} Muestre que \(X_n\xrightarrow{d}X\), pero no converge en probabilidad cuando \(n\to \infty\)
Exercise 1.5 Demuestre la Desigualdad de Chebychev que establece los siguiente. Si \(X\) es una variable aleatoria tal que \(\exists E(X^2)\), se tiene \[\begin{align*}
P(|X-E(X)|\geq k)\leq \frac{Var[X]}{k^2}, \forall k > 0
\end{align*}\]
Exercise 1.6 Sea \(g(Y)=Y-\mu\), donde \(Y\) es una v.a normalmente distribuida con media \(\mu\) y varianza \(\sigma^2\). Encuentre la función generadora de momento para \(g(Y)\).
Exercise 1.7 %Denotemos con \(m_X(t)\) y \(m_Y(t)\) las funciones generadoras de momentos de las v.a’s \(X\) y \(Y\), respectivamente. Demuestre que si existen funciones generadoras de momento y \(M_X(t)=M_Y(t)\) para toda \(t\), entonces \(X\), y \(Y\) tienen la misma distribución de probabilidad.
Exercise 1.8 Sea \(Y\) una variable aleatoria normalmente distribuida con media \(\mu\) y varianza \(\sigma^2\). Demuestre que \[Z=\frac{Y-\mu}{\sigma}\] tiene una distribución normal estándar, una distribución con media 0 y varianza 1.
Exercise 1.9 Demostrar el siguiente teorema.
Theorem 1.16 Sea \(X 1,\ldots, X_n\) una muestra aleatoria simple de una población \(X\) con función generadora de momentos \(M_X(t)\). La función generatriz de momentos de \(X\) es \[\begin{align*}
&M_{\bar{X}}(t)=\left(M_X\left(\frac{t}{n}\right)\right)^n
\end{align*}\] .
Exercise 1.10 Una máquina embotelladora puede ser regulada para que descargue un promedio de \(\mu\) onzas por botella. Se ha observado que la cantidad de líquido dosificado por la m'aquina está distribuida normalmente con \(\sigma=1\) onza. Una muestra de \(n=9\) botellas se selecciona aleatoriamente de la producción de la máquina en un día determinado (todas embotelladas con el mismo ajuste de la máquina) y las onzas de contenido líquido se miden para cada una. Determine la probabilidad de que la media muestral se encuentre a no más de .3 onza de la verdadera media \(\mu\) para el ajuste seleccionado de la máquina
Exercise 1.11 Bajo el mismo contexto del Ejemplo 7.1. Determinar ?`Cuántas observaciones deben de estar incluídas en la muestra si deseamos que \(\overline{Y}\) se encuentre a no más de 0.3 onzas de \(\mu\) con probabilidad 0.95?
Exercise 1.12 La resistencia a la tensión para un tipo de alambre se distribuye \(N(\mu,\,\sigma^2)\). \(Y_i\): La resistencia a la tensión para el trozo \(i\), se mide para \(i=1,\cdots,\,6\).
La media \(\mu\) y la varianza \(\sigma^2\) pueden ser estimadas por \(\overline{X}\) y \(S^2\), respectivamente \(\sigma_{\overline{Y}}^2=\frac{\sigma^2}{n}\) puede ser estimada por \(\frac{S^2}{n}\). Encuentre la probabilidad aproximada de que \(\overline{Y}\) esté dentro de \(\frac{2S}{n}\) de la verdadera media poblacional \(\mu\).
Exercise 1.13 Sean \(Y_1,\,Y_2,\cdots,\,Y_n\) v.a’s con funciones generadoras de momentos \(m(t)\) y \(m_1(t),\,m_2(t),\cdots,\) respectivamente. Si \[\lim_{n\rightarrow\infty}m_n(t)=m(t)\mbox{ para toda $t$ real,}\] entonces la función de distribución de \(Y_n\) converge hacia la función de distribución de \(Y\) cuando \(n\rightarrow\infty\)
1.17 Referencias
Gómez, Guadalupe, & Delicado, Pedro (2006). Curso de Inferencia y Decisión. Departament d’Estadística i Investigació Operativa, Universitat Politècnica de Catalunya.
Wackerly, D. D., Mendenhall, W., & Scheaffer, R. L. (2008). Estadística matemática con aplicaciones (7ª ed.). Cengage Learning.
Roussas, G. G. (1997). A Course in Mathematical Statistics (2nd ed.). Academic Press.