Archivo del Autor: estadisticallopis

Solución Situación 11

Con la información que tenemos no podemos contestar a esta pregunta. Es evidente que 30 y 40 son más distintos matemáticamente que 30 y 31. Pero estadísticamente no necesariamente. Estadísticamente puede haber más diferencia entre 30 y 31 que entre 30 y 40. En Estadística lo que marca la diferencia es la significación. Y la diferencia entre la media de dos poblaciones no la podemos certificar sin una prueba de significación. Porque es importante que en Estadística aunque tengamos valores muestrales las afirmaciones pretenden ser poblacionales.

Observemos que en el planteamiento de la Situación tenemos medias de muestras pero la pregunta no es si la diferencia mayor es de las medias muestrales sino de las medias poblacionales. Es evidente que 30 y 40 como medias muestrales son más diferentes que 30 y 31, pero la pregunta es sobre las medias poblacionales.

Para contestar a esta pregunta es imprescindible, además de las medias muestrales, las desviaciones estándar muestrales y el tamaño muestral. Diferencia de medias, desviación estándar y tamaño muestral son decisivos para hablar de la diferencia de medias entre poblaciones. Los tres factores deben tenerse en cuenta articularmente, conjuntamente, integralmente. Es la valoración conjunta de estos tres factores lo que nos permite tomar decisiones en Estadística. Y en el planteamiento de la Situación únicamente tenemos las medias muestrales. Así es imposible tomar decisiones en Estadística. Necesitamos los tres elementos para tomar decisiones.

La Estadística es como un partido de baloncesto

La Estadística es como un partido de baloncesto. En Estadística buscamos la significación, que es equivalente a preguntarnos en qué momento, a lo largo de un partido de baloncesto, podemos decir que el partido está ganado.

En Estadística casi todo gira en torno a la noción de contraste de hipótesis: una decisión entre dos afirmaciones. A una de ellas, que es la preferente, que afirma lo que podemos decir antes de empezar cualquier estudio, la llamamos Hipótesis nula. A la otra, la que aceptaremos sólo cuando rechacemos la Hipótesis nula, la llamamos Hipótesis alternativa. Otra forma de decisión en Estadística es a través de un intervalo de confianza, que, desde otro punto de vista, es otra forma de contrastar. Si dentro del intervalo está lo afirmado en la Hipótesis nula, la mantenemos, sino la rechazamos y aceptamos la Hipótesis alternativa.

En los contrastes de hipótesis contrastamos: Igualdad versus diferencia, No relación versus relación, Odds ratio igual a uno versus Odds ratio diferente de uno, Pendiente de una recta de regresión igual a cero versus Pendiente de la recta distinta de cero, Distribución normal versus Distribución no normal, etc. Partiendo, siempre, de que, «a priori», es cierta la Hipótesis nula. O sea, que lo que podemos decir, antes de hacer cualquier estudio, son cosas como: las poblaciones que comparamos son iguales, las variables que estamos estudiando no tienen relación, la Odds ratio es uno, la pendiente de una recta de regresión es cero, la distribución de una variable es la normal, etc.

En Ciencias, son las diferencias, las relaciones, la no normalidad, lo que debe demostrarse. Las igualdades, las no relaciones o la normalidad parten como ciertas. La Estadística, como lenguaje de las Ciencias que es, está centrada en esta fundamental actividad de contraste de hipótesis.

Bueno, y ¿todo esto que tiene que ver con el baloncesto? Pues mucho. Muchísimo. Veamos.

Una cosa muy importante: en baloncesto no existe el empate. Siempre gana un equipo u otro. Si se acaba con los mismos puntos se hace una prórroga de 5 minutos. Si aún así no gana ninguno se continúa haciendo prórrogas hasta que uno acabe ganando.

En los contrastes de hipótesis podemos decir claramente que, en realidad, siempre es cierta la Hipótesis alternativa. Sorprendente, ¿no? O sea, las medias de dos poblaciones que comparamos son siempre distintas, la correlación entre dos variables nunca es cero, siempre es distinta de cero. Una Odds ratio nunca es uno, es siempre distinta de uno. La pendiente de una recta nunca es cero. Una variable nunca sigue una campana de Gauss. Siempre la cierta es, en realidad, la Hipótesis alternativa. El problema es en qué momento lo podemos decir. En qué momento podemos decir que una población es mayor que la otra y no al revés. En qué momento podemos decir que la correlación es positiva y no negativa. En qué momento podemos decir que la Odds ratio es mayor o menor que 1. Que la pendiente no es cero. Que la distribución no es normal. Etc.

También es así en un partido de baloncesto. En qué momento podemos decir, con pocas probabilidades de equivocarnos, que el que está ganando ahora va a ganar.

Si el resultado de un partido lo expresáramos en términos estadísticos, lo haríamos así:

H0: Empate.

H1: Gana algún equipo de los dos.

Sabemos ciertamente que la nula (H0) no es cierta, que la cierta es la alternativa (H1). El problema es en qué momento podemos decir que la nula la rechazamos porque ya sabemos, con muchas posibilidades de acertar, cómo es lo afirmado en la Hipótesis alternativa. A la Hipótesis alternativa vamos a ir únicamente cuando sea fiable lo que podamos decir. Como en un partido de baloncesto: únicamente diremos que no se empata (que, en realidad, no se acabará empatando nunca) cuando podamos concretar con precisión qué equipo romperá el empate.

Antes de empezar el partido no podemos decir quién va a ganar, por lo que es razonable partir de una hipótesis nula como ésta. Pero sabiendo que no es cierta, sabiendo que es una provisionalidad que mantendremos hasta que no podamos concretar con mucha verosimilitud quién va a ganar. El problema, pues, es en qué momento lo podremos decir. En qué momento del partido podremos decir quién lo ganará. En qué momento podremos decir quién ganará y que tal afirmación esté hecha con una probabilidad muy baja de equivocarnos. Sólo en ese momento rechazaremos la H0, a pesar de que sabemos que no es cierta.

A los 10 minutos de partido si nuestro equipo gana de 15 puntos no diremos que ya hemos ganado, porque muchas veces, en situaciones como ésta, faltando 30 minutos de partido, y con una diferencia de 15 puntos, el equipo que iba ganando ha acabado perdiendo. Esta misma diferencia de 15 puntos faltando dos minutos sí que muy posiblemente nos permita decir que el partido está ganado.

Si pudiéramos ver entre millones de partidos de baloncesto en cuántos partidos, faltando el tiempo que falta para acabar y con la diferencia de puntos que hay en ese momento, ha acabado perdiendo el equipo que estaba ganando, podríamos decidir con más criterio. Por ejemplo, se podría establecer el protocolo siguiente: si ha cambiado el resultado final en menos del 5% de los casos, podemos decir que el partido está ya ganado. Si hiciéramos esto estaríamos haciendo algo equivalente al procedimiento seguido en la decisión estadística en un contraste de hipótesis.

Si la diferencia de puntos es muy pequeña deberemos esperar siempre mucho para hacer un pronóstico fiable, un pronóstico significativo. A veces, en ciertos partidos muy igualados, necesitaremos mucho tiempo de partido para decir, con significación, quién ganará. En Estadística para decir que hay una diferencia significativa o que hay una correlación significativa, necesitamos, a veces, una muestra muy grande. Otras veces, con un tamaño de muestra relativamente pequeño nos bastará para afirmar diferencias o relaciones significativas. Dependerá, como en el baloncesto, de la cantidad de muestra que tengamos y de la diferencia que haya entre las medias de las muestras a comparar, del valor de correlación muestral o de la Odds ratio que tengamos.

La Estadística es, pues, como un partido de baloncesto. La equivalencia está en la voluntad de pronosticar qué sucederá al final del partido (cuando tengamos toda la población) durante el partido (con una muestra). Y hacer no un pronóstico cualquiera, no un pronóstico un tanto al azar, sino un pronóstico significativo, un pronóstico casi seguro, un pronóstico que tenga muy pocas posibilidades de ser erróneo, porque en miles y miles de circunstancias equivalentes casi nunca ha sucedido algo diferente a lo que se está afirmando en el pronóstico.

El concepto de significación es nuclear en la Estadística. Posiblemente pueda definirse a la Estadística como la ciencia de la significación.

Solución Situación 10

Ninguna de las tres correlaciones es significativa. En las dos primeras los p-valores son mayores que 0,05. En la tercera correlación no tenemos p-valor pero sí un intervalo de confianza del 95% de su estimación. Como ese intervalo incluye al cero, se trata de una correlación no significativa. No es descartable una correlación poblacional de cero, por lo tanto el cálculo de r=0.46 no nos ofrece un valor fiable de correlación. La correlación poblacional podría ser incluso de signo contrario. Con la información que tenemos, pues, ninguna de las tres correlaciones es mayor a otra, porque en los tres casos se aceptaría la Hipótesis nula de que la correlación, a nivel poblacional, es igual cero. No tenemos suficientes razones para creer ni en la correlación 0.78, ni en la 0.82 ni en la 0.46.

Tema 4: INTRODUCCIÓN A LAS TÉCNICAS DE RELACIÓN

El siguiente vídeo explica el tema:

1. En las técnicas de relación el objetivo básico es detectar relación entre variables. La focalización está puesta, en este tipo de técnicas, en las variables, no en las poblaciones que pueda haber en el estudio. Los protagonistas son las variables y detectar covariación entre ellas, detectar que la variación que vemos en una de ellas tiene conexión con la de la otra.

 2. El primer paso, como veremos en temas sucesivos, será, en primer lugar, valorar si existe o no esta relación (si es estadísticamente significativa), si esta relación la podemos cualificar entre diferentes tipos de relación (relación directa, inversa, etc) y, finalmente, si la podemos cuantificar a través de un procedimiento estandarizado que nos permita saber entre qué valores se puede mover esta relación desde un mínimo a un máximo.

 3. Veremos que cuando hayamos hecho este primer orden de cosas pasaremos a tratar de modelizar matemáticamente esta relación mediante la Regresión. Con ella, además de modelizar esa relación, de crear un dibujo de su morfología, podremos hacer previsiones de unas variables a partir del conocimiento de valores de otras variables, y esto tiene una importante trascendencia en Ciencia.

 4. Para introducir las técnicas de relación que iremos viendo en temas sucesivos es importante ahora ya destacar que es fundamental diferenciar si la relación es entre variables cuantitativas, entre variables cualitativas o entre variables cualitativas y cuantitativas.

 5. Iremos viendo con detalle las peculiaridades de estas diferentes situaciones. A modo de introducción planteo el gráfico siguiente:

 Foto 20-10-12 17 58 17

6. Se trata de un gráfico muy importante que irá saliendo en diversos temas donde se hable de aspectos concretos de las técnicas de relación.

7. Observemos en él que hay tres filas de datos. En la primera se visualizan tres situaciones de relación entre variables cuantitativas. En la segunda fila se ven tres situaciones de relación entre variables cualitativas. En la tercera fila, finalmente, se ven tres situaciones donde se relaciona una variables cualitativa con una de cuantitativa.

8. Estos tres casos ejemplifican e introducen conceptos esenciales en todo lo que vamos a ver en las técnicas de relación.

9. Observemos que el caso central, en las tres filas, es un caso en el que no parece haber relación entre las variables. Se trata de dos variables sin relación, sin covariación conjunta, donde cualquier valor de una variable puede estar combinado con cualquier valor de la otra variable. Esto, precisamente, es lo característico de una situación donde dos variables no tienen relación. En Estadística hablamos, en casos así, de dos variables independientes.

10. En las tres filas, por el contrario, a la izquierda y a la derecha nos encontramos con casos donde sí parece haber relación. Saber el valor de una variable de ellas nos parece informar del valor que pueda llegar a tener la otra variable. Esto es indicativo de relación y de lo que en Estadística llamamos variables dependientes.

11. Observemos, también, que a izquierda y a derecha, podemos decir que la relación es como opuesta, es cualitativamente distinta, como invertida. Esto también nos podrá interesar detectarlo porque nos indicará tipos diferentes de relación entre variables.

12. A esta relación que se aprecia en los ejemplos de la izquierda y de la derecha, en las tres situaciones posibles, también le podríamos valorar una cantidad que midiera el grado de esta conexión entre variables.

13. Pues con todo ello hemos visto, de momento muy intuitivamente, lo esencial de las técnicas de relación: detectar si existe o no esta relación, si esta relación la podemos cualificar en tipos de relación y, finalmente, si la podemos cuantificar de alguna forma.