Archivo del Autor: estadisticallopis

Solución Situación 77

1. Se trata de un ANOVA de dos factores, uno fijo (Sistema) y el otro aleatorio (Operario) y anidado en el primero.

Los resultados del ANOVA aplicado son los siguientes:

IMG_0547

 

Se cumplen las condiciones del modelo: normalidad, igualdad de varianzas e independencia.

El modelo es un ANOVA de dos factores anidados a efectos mixtos.

Únicamente resulta significativo el factor fijo «Sistema». Por eso aplicamos unas comparaciones múltiples y podemos ver que es el control C (el grupo al que no se aplica ningún tratamiento) el que se aparta de los otros dos niveles.

El factor Operario no es significativo. No obstante, hemos estimado su componente de la varianza, que es 3,24.

La media general es 13,95 y los tres parámetro del factor sistema son: -10,03, 8,23 y 1,80.

2. Se trata de un ANOVA de tres factores, dos fijos (Sistema y Calentar), cruzados, y uno aleatorio (Operario) anidado en la interacción de los dos factores fijos y cruzados.

El modelo es el mismo que el visto en el problema de la Situación 45, podemos verlo en la Solución Situación 45.

Los resultados son los siguientes:

IMG_0548

 

Todo es significativo excepto Operario. No obstante, hemos estimado también la componente de la varianza de operario que es 2,55. La componente de la varianza residual es 3,17.

Podemos ver también la estimación de los parámetros de los factores fijos del modelo. La media general es 21,49, los parámetros del factor Sistema son -10,36, 8,18 y 2,18, y los parámetros de la interacción -4,62, 4,62, 5,06, -5,06, -0,44 y 0,44.

Respecto a la pregunta de la probabilidad de que la medición sea superior a 31 en el caso de tratarse del Tratamiento 1 con calentamiento, debemos calcular la media muestral de este grupo (que es 32,495) y tomar como varianza la suma de la residual y de la debida a operario (esta es cuestionable por el hecho de no ser significativa): Por lo tanto, sería o la Raíz cuadrada de 3,17 ó la Raíz cuadrada de 3,17+2,55. Se trataría pues de una normal N(32,495; 1.78) o de una normal N(32,495; 2.39). Entonces, se trata de calcular en una de estas dos campanas de Gauss la probabilidad de tener valores por encima de 31. Vamos a calcularlo con la segunda opción que posiblemente sea la más razonable, debido a que los operarios alguna fuente de variación introducen, aunque no sea suficientemente grande como para que el contraste de hipótesis lo marque como significativo. El área a la derecha de 31 en una normal N(32,495; 2.39) es 0,7342.

3. Se trata, ahora, de un ANOVA de tres factores, dos fijos (Sistema y Calentar) y uno aleatorio (Operario) anidado esta vez dentro del factor Sistema, no de la interacción como antes. El modelo sería el del problema de la Situación 41. Ver la Solución Situación 41.

4. Se trata de un ANOVA de tres factores, dos fijos (Sistema y Calentar) y uno aleatorio (Operario) y los tres factores están ahora cruzados.

Situación 77: Examen (Tema 15)

1. La medición de una determinada variable sanguínea se sabe que puede estar influida por un previo tratamiento de la muestra y, también, por el operario que la realiza. Para ello en un laboratorio de análisis clínicos se hace un experimento para evaluar la importancia de estos efectos.

Se toma una muestra homogénea y se divide en doce partes. A cuatro no se le realiza tratamiento previo (C), a otras cuatro se les hace un tratamiento previo T1 y otras cuatro un tratamiento T2. Se toman 6 operarios al azar. Cada uno de ellos hace el análisis de uno de los tipos dos veces; o sea, en dos de las muestras. Se obtienen los siguientes resultados:

Sistema Operario Medición
C 1 4,22
C 1 7,83
C 2 0,04
C 2 3,57
T1 3 19,55
T1 3 20,77
T1 4 22,98
T1 4 25,44
T2 5 13,85
T2 5 18,05
T2 6 14,06
T2 6 17,05

Estudiar las influencia del tratamiento previo y de la acción del operario en el resultado de la medición de la variable sanguínea.

2. A continuación se quiere ver lo mismo pero introduciendo una variante: haciendo el análisis previo calentamiento de la muestra o no, porque se piensa que también puede ser un factor que influya en el resultado final. El procedimiento del experimento es el mismo: cada una de las muestras de los tres sistemas anteriores se dividir en dos calentando una y no haciéndolo en la otra. Ahora se necesitan tomar, no obstante, 12 operarios. El cuadro de resultados es el siguiente:

Sistema Calentar Operario Medición
C No 1 5,65
C No 1 3,24
C No 2 2,06
C No 2 5,54
C Si 3 21,93
C Si 3 21,11
C Si 4 15,67
C Si 4 13,86
T1 No 5 27,15
T1 No 5 25,96
T1 No 6 28,25
T1 No 6 26,07
T1 Si 7 33,42
T1 Si 7 32,92
T1 Si 8 32,16
T1 Si 8 31,48
T2 No 9 8,86
T2 No 9 12,28
T2 No 10 14,3
T2 No 10 9,22
T2 Si 11 36,83
T2 Si 11 35,73
T2 Si 12 37,54
T2 Si 12 34,6

Estudiar la influencia ahora del tratamiento, del calentar o no la muestra y del operario.

Interesa también conocer la probabilidad de que al aplicar el tratamiento T1 con calentamiento de la muestra el valor de la medición sea superior a 31.

3. Si el experimento del apartado anterior se hubiera hecho con 6 operarios de la forma que marca el siguiente cuadro de datos, ¿cuál hubiera sido el modelo? Responder sin analizar los datos (por eso la medición no tiene valores):

Sistema Calentar Operario Medición
C No 1
C No 1
C No 2
C No 2
C Si 1
C Si 1
C Si 2
C Si 2
T1 No 3
T1 No 3
T1 No 4
T1 No 4
T1 Si 3
T1 Si 3
T1 Si 4
T1 Si 4
T2 No 5
T2 No 5
T2 No 6
T2 No 6
T2 Si 5
T2 Si 5
T2 Si 6
T2 Si 6

4. Plantear el modelo que tendríamos si el experimento se hubiera hecho sólo con dos operarios, según el siguiente planteamiento:

Sistema Calentar Operario Medición
C No 1
C No 1
C No 2
C No 2
C Si 1
C Si 1
C Si 2
C Si 2
T1 No 1
T1 No 1
T1 No 2
T1 No 2
T1 Si 1
T1 Si 1
T1 Si 2
T1 Si 2
T2 No 1
T2 No 1
T2 No 2
T2 No 2
T2 Si 1
T2 Si 1
T2 Si 2
T2 Si 2

 

Situación 76: Examen (Tema 1-8)

1. Si en una muestra tenemos un índice de Gini es 0.95, podemos decir:

a. Que existe menor dispersión de valores en la muestra que en una que tuviéramos un índice de 0.3.

b. Que existe una correlación positiva entre las variables.

c. Que no es un valor significativo.

d. Que existe mucha desigualdad de valores dentro de la muestra.

2. En la muestra (8, 6, 0, 16, 8, 6, 0, 16):

a. La mediana es 7.

b. El rango intercuartílico es 12.

c. El rango es 6.

d. El primer cuartil es 0.

3. En una muestra de tamaño 100 con media 100 y desviación estándar 10 es cierto:

a. Un intervalo de confianza de la media del 95% sería (97, 103).

b. Un intervalo de confianza de la media del 99.5% sería (98, 102).

c. Un intervalo de confianza de valores individuales del 95% sería (80, 120).

d. Un intervalo de confianza de valores individuales del 99.5% sería (90, 110).

4. Si en una muestra donde hemos evaluado dos variables cuantitativas tenemos una correlación r=0.2 (p<0.05) podemos decir:

a. El tamaño de muestra es menor de 5.

b. Como la correlación es menor de 0.5 no es significativa.

c. Una regresión entre estas dos variables nos daría poca capacidad pronóstica.

d. Ninguna de las tres afirmaciones anteriores es cierta.

5. ¿Qué correlación es mayor?

a. r=-0.6 (p=0.001)

b. r=0.90 (p=0.001)

c. r=-0.45 (p=0.001)

d. r=-0.95 (p=0.0001)

6. Si la correlación entre dos variables es r=-0.9 (p<0.05), es cierto:

a. El coeficiente de determinación es 90%.

b. El contraste de hipótesis de la pendiente de la recta de regresión puede no ser significativo.

c. El contraste de hipótesis de la pendiente de la recta de regresión será significativo y la pendiente será negativa.

d. El coeficiente de determinación no es lo suficientemente grande como para hacer predicciones con error aceptable.

7. En una muestra donde sabemos que la desviación estándar es 0:

a. El índice de Gini será 0.

b. El índice de Gini puede ser 0.5.

c. El índice de Gini será muy próximo a 0 porque hay muy poca desviación estándar.

d. El índice de Gini será 1.

8. El Box-Plot siguiente:

IMG_0265

corresponde a la muestra:

a. (1, 1, 2, 3, 3, 3, 12, 12)

b. (1, 1, 3, 3, 3, 3, 12, 12)

c. (1, 1, 2, 2, 7.5, 7.5, 12 12)

d. (1, 1, 3, 7.5, 7.5, 12, 12, 12)

9. Si en la relación entre dos variables tenemos un valor de la ji-cuadrado (cálculo de la suma de los cuadrados de observado menos esperado divididos por el esperado) igual a 0:

a. El p-valor será 1.

b. El p-valor será menor que 0.05.

c. El p-valor será 0.

d. El p-valor puede ser cualquier valor entre 0 y 1.

10. Entre la variable sexo y padecer o no diabetes podemos decir lo siguiente:

a. La correlación de Pearson nos medirá el grado de relación muy adecuadamente.

b. Necesitamos aplicar un test de la ji-cuadrado para evaluar si hay o no relación entre esas variables.

c. No podemos tener un p-valor porque hablamos de la relación entre variables cualitativas.

d. En la relación entre variables cualitativas siempre la relación es estadísticamente significativa.

Solución Situación 76

1d: Valores altos de índice de Gini reflejan elevada dispersión de valores. Un índice de Gini de 0.95 indica que la mayor parte de valores de la variable estudiada están concentrados en un o en unos pocos individuos de la muestra.

2a: La mediana es 7 porque si ordenamos la muestra quedan en medio un 6 y un 8 cuyo promedio es 7.

3c: Como la DE es 10 en un intervalo de confianza del 95% de valores individuales deberemos coger la media y sumarle y restarle dos veces esa DE, quedando el intervalo (80, 120).

4c: Tendríamos poca capacidad pronóstica porque el coeficiente de determinación sería del 4%, muy por debajo del 50% necesario.

5d: Las cuatro correlaciones son significativas, por lo tanto escogemos la que tenga un valor absoluto mayor que es este -0.95.

6c: Si una correlación es significativa también será significativa la pendiente de la regresión que hagamos. Además, el signo será el mismo: Un correlación positiva genera una pendiente positiva y una correlación negativa una pendiente negativa.

7a: Una muestra con DE igual a 0 indica que todos sus valores son iguales. Una muestra así genera una curva de Lorenz diagonal, por lo tanto con índice de Gini igual a 0.

8b: Mínimo=1, Primer cuartil=2, Mediana=3, Tercer cuartil=7.5 y Máximo=12.

9a: Si el valor es 0, a la derecha queda todo el área de la curva de la distribución ji-cuadrado, por lo tanto el p-valor es 1. Total coherencia de la hipótesis nula puesto que tenemos una tabla de contingencias observada que es exactamente igual a la esperada en el caso de ser cierta la hipótesis nula.

10b: El test de la ji-cuadrado es el procedimiento estadístico adecuado para evaluar la relación entre variables cualitativas como es este caso.

 

Solución Situación 75

1c: La variable dependiente es dicotómica y hay una única variable independiente que es continua. Estamos ante un caso de Regresión logística simple.

2c: Tenemos una variable dependiente y tres independientes, lineales, por lo tanto se trata de una Regresión múltiple.

3d: En una Regresión lineal simple lo que le sucede a la pendiente le sucede igual a la correlación. Como la pendiente es significativa también lo será la correlación.

4c: Esto no es cierto porque la primera de los dos variables independientes no tiene una relación significativa con la variable dependiente. Vemos que su intervalo de confianza incluye al 0, por lo tanto no podemos establecer ningún tipo de asociación entre la dependiente y esta variable independiente. La opción b, por el contrario, es cierta, porque ahora sí se trata de una relación significativa, puesto que el intervalo de confianza no incluye al 0 y como la OR será menor que 1, al aumentar el valor de la variable independiente disminuye la probabilidad del fenómeno codificado con un 1 en la variable dependiente.

5b: Sólo las dos primeras OR son significativas y 5 es mayor que 4 (1/0.25=5).

6d: El coeficiente de determinación si no va acompañado de una relación significativa no es indicador de nada.

7b: Como el coeficiente de la primera variable independiente es significativo, porque no incluye al 0, y positivo, la relación entre la variable dependiente y esta variable es una relación directa, por lo tanto, habrá una correlación positiva entre ellas.

8a: Como la relación que hay entre la OR y el coeficiente es exponencial, podemos ver que si elevamos el número e a 0.6 y a 1.1 obtenemos, respectivamente, el 1.82 y el 3.0.

9b: El coeficiente de correlación positivo va asociado a una pendiente positiva y el coeficiente de correlación negativo va asociado a una pendiente negativa. Además, la significación es paralela: cuando una lo es la otra también, y al revés. Por lo tanto, como el intervalo de la pendiente no contiene al 0 la correlación será significativa.

10c: Una correlación significativa no nos lleva automáticamente a una regresión con buena o suficiente capacidad predictiva. El coeficiente de determinación es el que solemos usar como criterio para esto último. Si es menor del 50% su capacidad predictiva es baja. En nuestro caso tenemos un valor del 25%, muy por debajo de ese 50%.

 

Situación 75: Examen (Temas 4-9, 11 y 12)

1. Si tenemos que pronosticar la probabilidad de que una persona que pide una hipoteca acabe siendo moroso en función de los años que lleva cotizados tenemos que hacer una:

a. Regresión logística múltiple.

b. Regresión lineal simple.

c. Regresión logística simple.

d. Regresión múltiple.

 

2. Si tenemos el modelo y=2x1+3x2-5x3 es cierto:

a. Se trata de una Regresión no lineal.

b. Se trata de una Regresión logística múltiple.

c. Se trata de una Regresión múltiple.

d. Se trata de una Regresión multivariante.

 

3. Si en una Regresión simple con el modelo y=2x-3 con un p-valor para la pendiente: p<0.05, podemos afirmar:

a. El error es menor de 3.

b. La pendiente no es significativa.

c. La correlación es positiva pero no sabemos si es significativa.

d. El p-valor de la correlación será menor que 0.05.

 

4. En una Regresión logística múltiple con dos variables independientes donde el coeficiente a1 tiene un intervalo de confianza del 95%: (-0.5, 2.1) y el coeficiente a2 tiene un intervalo de confianza del 95%: (-0.8, -0.3), no podemos decir lo siguiente:

a. En un Stepwise se acabará eligiendo un modelo con únicamente la variable x2 como independiente.

b. Al aumentar el valor de x2 disminuye la probabilidad del fenómeno codificado con un 1 en la variable dependiente.

c. Al aumentar el valor de x1 disminuye la probabilidad del fenómeno codificado con un 1 en la variable dependiente.

d. La Odds ratio que evalúa la relación entre x2 y la variable dependiente es un valor significativo y menor que 1.

 

5. Elegir la Odds ratio que indique mayor grado de relación:

a. OR=0.25; IC 95%: (0.05, 0.67)

b. OR=5; IC 95%: (4.2, 7.3)

c. OR=0.2; IC 95%: (0.01, 1.67)

d. OR=10; IC 95%: (0.5, 62.3)

 

6. ¿Cuál de las siguientes afirmaciones no es cierta?

a. Si la correlación de Pearson no es significativa la R2 aunque sea muy grande no tiene valor como medida de la calidad de los pronósticos.

b. Si la correlación de Pearson es significativa una R2 de un 20% indica muy poca calidad pronóstica de nuestro modelo de Regresión.

c. La R2 es una medida del nivel de determinación de la variable dependiente por parte de la o de las variables independientes.

d. Una R2 del 90% es siempre un indicador de relación significativa.

 

7. Una Regresión múltiple con el modelo y=3x1-5x2+4, con intervalos de confinaza del 95% de (2, 4), de (-6, -4) y de (3, 5) respectivamente, para los tres parámetros del modelo nos indica:

a. Que en un Stepwise se tomaría sólo la x1 como variable independiente del modelo.

b. Que existe una correlación positiva significativa entre la variable dependiente y la variable independiente x1.

c. Que no existe relación entre la variable dependiente y esas dos variables independientes.

d. No podemos decir nada acerca de la relación entre la variable dependiente y las dos variables independientes.

 

8. En una Regresión logística simple en la que la Odds ratio tiene un IC del 95%: (1.82, 3.0), ¿cuál de los siguientes IC del 95% para el coeficiente que multiplica a la variable independiente continua es el correcto?

a. (0.6, 1.1).

b. (-0.3, 3.4).

c. (0.1, 5.5).

d. (-2.1, -0.5).

 

9. En una Regresión lineal simple con un modelo y=2x-3, con intervalo de confianza para la pendiente de (1.5, 2.5) podemos afirmar:

a.La correlación entre las dos variables es significativa porque el intervalo de confianza de la pendiente no contiene al 1.

b. La correlación entre las dos variables es significativa porque el intervalo de confianza de la pendiente no contiene al 0.

c. No podemos decir nada sobre la significación de la correlación. Necesitamos tener su p-valor.

d. Si tenemos un individuo con el valor x=10 tendrá un valor de y=17.

 

10. Si entre dos variables tenemos una correlación de r=-0.5 con una p=0.001, no podemos decir los siguiente:

a. El coeficiente de determinación es del 25%.

b. La correlación es negativa y significativa.

c. Al tratarse de una correlación significativa podemos realizar una regresión con suficiente capacidad de predicción.

d. La pendiente de la regresión lineal simple que hagamos será también negativa y con un p-valor inferior a 0.05.

 

 

 

 

 

 

 

Solución Situación 74

El modelo de este problema es el mismo de la Situación 45. Ver, por lo tanto, las indicaciones de la Solución de la Situación 45.

El factor «Ciencias» y el factor «Letras» es fijo. El factor «Alumno» es aleatorio y anidado dentro de la interacción.

En este problema la salida de ordenador es la siguiente:

IMG_0529

 

Como puede apreciarse, después de hacer los cocientes correspondientes, los factores significativos son «Letras» y «Alumnos». Al hacer las comparaciones múltiples en el factor «Letras» puede apreciarse que es un profesor el que da niveles de motivación por debajo, significativamente. Y sin interacción. No es pues la combinación con otros. Es siempre igual. Él hace bajar las valoraciones siempre.

Veamos el cálculo de la componente de la varianza:

IMG_0528

Solución Situación 73

El modelo de ANOVA es el mismo que el de la Situación 41. Ver, por lo tanto, el modelo en la Solución de la Situación 41.

«Centro» es un factor fijo, «Método» también. «Grupo», anidado dentro de «Centro», es aleatorio. «Método» está cruzado con «Centro» y con «Grupo».

En concreto la salida de ordenador para este problema es:

IMG_0531

 

No hay diferencias entre centros, sí entre métodos y sí entre grupos. No hay interacción significativa.

El cálculo de las componentes de la varianza es el siguiente:

IMG_0530

Evidentemente la componente de la varianza negativa se acabará dando como 0. De hecho, ya se trataba de un efecto no estadísticamente significativo.

 

Situación 74: Un problema de ANOVA

En una escuela se pretende establecer un sistema de tutorización mediante una combinación de dos profesores: uno de ciencias y uno de letras. Se han tomado los tres profesores de ciencias y los tres profesores de letras que harían esta labor para hacer un ensayo que busca detectar diferencias en cuanto a las combinaciones a hacer entre ellos. Se han tomado dos alumnos por combinación de profesores. Durante el trimestre de seguimiento se ha realizado tres encuestas donde los alumnos valoraban el nivel de estímulo obtenido por la autorización recibida. Los resultados son los siguientes:

IMG_0527

Analizar las principales fuentes de variación.

Situación 73: Un problema de ANOVA

Se ha hecho el siguiente experimento didáctico. Se tomaron tres escuelas (Una pública, otra privada y otra concertada) y dos grupos de 2º de ESO en cada uno de estos tres centros educativos con la finalidad de hablar de la diferencia entre todos los grupos de este nivel de secundaria. Un mismo profesor fue a explicar en dos días distintos dos temas diferentes utilizando dos métodos de explicación muy distintos: uno el tradicional con pizarra y el otro mediante un PowerPoint. Después de cada clase se les pasó a cinco alumnos una encuesta donde se evaluaba, mediante diferentes preguntas, el nivel de atención prestado durante la clase. Mediante un Análisis de componentes principales se consiguió detectar una componente que valoraba el nivel de atención de los alumnos durante la clase.

Los resultados fueran los siguientes:

IMG_0525

Analizar las principales fuentes de variación del experimento.