Archivo del Autor: estadisticallopis

Solución Situación 140

1c. Usando la fórmula del tema 3 se obtiene este resultado.

2d. El intervalo de confianza incluye al 0, por lo tanto hay igualdad.

3a. Mínimo 0. Primer cuartil 3. Mediana 4. Tercer cuartil 5. Máximo 7.

4a. De las correlaciones significativas es la que tiene un valor absoluto de la correlación mayor.

5c. La OR y su intervalo de confianza indican que hay significación. Sin embargo, la ji-cuadrado no supera el umbral, lo que indica que, según ella, no habría relación. Esto es contradictorio.

6ac. Hay dos soluciones correctas, por error. En ambos casos se está  dando un intervalo de confianza que no incluye al 0 y un p-valor inferior a 0.05.

A quien haya contestado a una de las dos opciones le contaré como buena. Quien no haya contestado a esta pregunta el examen le contaré sobre 19 preguntas, para no penalizar a quien haya podido despistarle la situación.

7b. Como el intervalo no contiene al cero rechazamos la igualdad de proporciones. Por lo tanto, se trata de una diferencia significativa.

8b. En una tabla 3×3 el umbral es 9.48. Como 7.89 es menor que el umbral no hay relación significativa.

9d. La correlación de Pearson no tiene aplicación en variables cualitativas.

10a. Hay normalidad en las dos muestras. Hay diferencia de desviaciones estándar. Por lo tanto, debe aplicarse una t de Student de variantes desiguales.

11c. Son muestras independientes. El tamaño de muestra es mayor que 30 pero el valor esperado por grupo es 3, que es menor que 5. Debemos aplicar el test exacto de Fisher.

12c. Medicamente es significativo. Sexo no. Y hay claramente interacción.

13c. No zona, ni tratamiento es significativo. Por lo tanto, sólo hay un grupo homogéneo.

14c. Para estar a la derecha hay que tener valores grandes de la primera y cuarta variable y pequeños de la segunda y tercera. Esto sucede en b y c. Pero para estar arriba debe ser grande la segunda variable y pequeña la tercera, cosa que sucede en c.

15c. El individuo a y b son los que están más cerca. Los valores son muy iguales. Luego d y e. Finalmente c está más cerca de d y e que de a y b.

16c. Si las medias son más distantes aumentaremos la potencia del estudio.

17d. Si aumentamos el tamaño de muestra y la OR no se modifica el intervalo de confianza se hará más estrecho por lo dos lados del intervalo, no sólo por uno.

18c. Si aplicamos la fórmula de la determinación del tamaño de muestra en una proporción, con 9 en el numerador, por ser un intervalo del 99.5% y con un valor de 0.5 como p prevista, el resultado es 900.

19c. DJ y LP están a la derecha. Deben tener ambos valores bastantes grandes de las cuatro variables originales. Esto sucede tanto en a como en b. Sin embargo como DJ está arriba y LP está abajo, viendo la segunda componente DJ debe tener valores grandes de la segunda variable y pequeños de la tercera y LP lo contrario. Esto sucede en c y no en a. La b es incorrecta porque MM estaría a la derecha de LP y la d no es correcta porque aunque MM estaría a la izquierda y LP a la derecha, LP estaría muy arriba no abajo.

20d. En un ANOVA de dos factores cruzados, hay interacción y por lo tanto hay tres p-valores a evaluar.

Situación 140: Examen (Temas 1-16, 17 y 19)

1.Estamos interesados en predecir cuántas personas tienen trastornos de la alimentación en España. Para ello se toma al azar una muestra de tamaño 1000. Observamos que 150 tienen algún tipo de estos trastornos. Un intervalo de confianza del 95% del porcentaje poblacional es el siguiente:

a.(11.61, 18.39).

b.(12.50, 17.50).

c.(12.74, 17.26).

d.(13.25, 16.75).

2.¿Cuál de estas afirmaciones hay incompatibilidad?

a.En un contrate de hipótesis de igualdad de medias una p=0.44 y un IC del 95% de la diferencia de medias entre ambas poblaciones de (-0.9, 1.39).

b.En una Odds ratio una p=0.03 y un IC del 95% de (0.22, 0.91).

c.En una correlación de Pearson una p=0.12 y un IC del 95% de (-0.38, 0.22).

d.En una comparación de proporciones un p-valor: p=0.02 y un IC del 95% de la diferencia de proporciones entre ambas poblaciones de  (-0.12, 0.34).

3.¿A cuál de las siguientes cuatro muestras tiene el siguiente Box-Plot?

a.(0, 3, 4, 5, 7))

b.(0, 3, 5, 7)

c.(0, 4, 5, 7)

d.(0, 3, 3, 5, 7)

4.¿Cuál de las siguientes correlaciones corresponde a una regresión con una mayor capacidad predictiva?

a.r=-0.71 IC 95%: (-0.99, -0.12)

b.r=0.8 IC 95%: (-0.08, 0.99)

c.r=0.55 IC 95%: (0.25, 0.90)

d.r=-0.34; p=0.001

5.¿En cuál de las siguientes Odds ratio hay una incompatibilidad?

a.OR=2; IC 95%: (1.00, 3.33); Ji-cuadrado=3.84.

b.OR=1.45; IC 95%: (0.82, 2.82); Ji-cuadrado=0.84.

c.OR=0.25; IC 95%: (0.13, 0.54); Ji-cuadrado=2.84.

d.OR=0.78; IC 95%: (0.69, 0.88); Ji-cuadrado=8.34.

6.¿Cuál de las siguientes afirmaciones es cierta?

a.Una pendiente con un IC 95%: (0.85, 5.45) es compatible con una correlación con p-valor 0.02.

b.Una OR de 1.34 con p=0.04 es compatible con un IC del 95% de la OR de (0.97, 1.99).

c.Una correlación con un IC 95%: (0.23, 0.43) es compatible con una p=0.001.

d.Una diferencia de medias significativa (p=0.11) es compatible con unos IC del 95% de las ambas medias de las dos poblaciones como los siguientes: (23, 34) y (36, 47).

7.¿Cuál de las siguientes afirmaciones es cierta?

a.Si la potencia de un estudio de comparación de dos poblaciones es del 50% si el p-valor es superior a 0.05 podemos decir que no hay diferencias significativas.

b.Si un Intervalo de confianza del 95% de la diferencia entre dos proporciones poblacionales es (0.08, 0.23) podemos decir que hay diferencias estadísticamente significativas entre ambas proporciones poblacionales.

c.Una OR de 10 será estadísticamente significativa porque es muy grande.

d.En un ANOVA con un factor con siete niveles como mínimo encontraremos que uno de los niveles es distinto a los demás.

8.Estamos relacionando tres niveles distintos de depresión con tres niveles de afectación de un determinado trastorno psiquiátrico. El valor de la ji-cuadrado es 7.89. Entonces:

a.Podemos decir que hay relación significativa porque 7.89 es menor que 9.48.

b.Podemos decir que no hay relación significativa porque 7.89 es menor que 9.48.

c.Podemos decir que hay relación significativa porque 7.89 es menor que 16.91.

d.Podemos decir que no hay relación significativa porque 7.89 es menor que 16.91.

9.Estamos relacionando tener o no una determinada enfermedad autoinmunitaria con tener o no un determinado trastorno psiquiátrico. Entonces, ¿cuál de las siguientes afirmaciones no es cierta?:

a.Podremos aplicar una ji-cuadrado para ver si hay relación entre ambos trastornos.

b.Podremos calcular una Odds ratio para evaluar qué tipo de relación hay, si es que la hay.

c.Podremos calcular una V de Crámer para medir la relación entre ambas variables.

d.Podremos calcular una correlación de Pearson para evaluar la cantidad de relación y para evaluar si la relación es directa o inversa.

10.En un estudio donde se quiere comparar dos psicoterapias tenemos 400 pacientes que repartimos en dos grupos de igual tamaño. A cada grupo le aplicamos sólo uno de los dos tratamientos a comparar. El test de Shapiro-Wilk de la primera muestra tiene una p=0.23 y el de la segunda muestra tiene una p=0.34. El test de Fisher-Snedecor nos proporciona una p=0.01. Es cierto lo siguiente:

a.Debemos aplicar el test de la t de Student para varianzas desiguales.

b.Debemos aplicar el test de Mann-Whitney.

c.Debemos aplicar el test de la t de Student para varianzas iguales.

d.Debemos aplicar el test de la t de Student de datos apareados.

11.Hemos de comparar dos formas de rehabilitación psicológica a pacientes que han sufrido un infarto cerebral. La variable analizada es si después de un año el paciente consigue superar un umbral previamente establecido en un test psicotécnico. Se ha trabajado con 100 pacientes. 50 en cada grupo. Cada paciente recibe un único tratamiento. Después del año en un grupo un 8% consigue la rehabilitación psicológica. En el otro grupo un 4% lo consigue. Para ver si esas diferencias son estadísticamente significativas debemos:

a.Aplicar un Test de Wilcoxon.

b.Aplicar un Test de proporciones.

c.Aplicar un Test exacto de Fisher.

d.Aplicar un Test de McNemar.

12.Tenemos los siguientes datos en un estudio donde se aplican tres medicamentos distintos (A, B y C) a un grupo de pacientes que tienen una determinada patología y que se han diferenciado en hombres y mujeres.  Con los datos obtenidos se pretende ver la diferencia entre tratamientos, entre sexos y si hay o no interacción. ¿Cuál es la afirmación más razonable respecto a los resultados que podríamos obtener en el ANOVA?:

a.Factor Medicamento: p<0.05. Factor Sexo: p<0.05. Interacción: p<0.05.

b.Factor Medicamento: p<0.05. Factor Sexo: p<0.05. Interacción: p>0.05.

c.Factor Medicamento: p<0.05. Factor Sexo: p>0.05. Interacción: p<0.05.

d.Factor Medicamento: p<0.05. Factor Sexo: p>0.05. Interacción: p>0.05.

13.Tenemos los siguientes datos en un estudio donde se aplican tres tratamientos psicoterapéuticos (P1, P2, P3) en pacientes con la misma patología de tres zonas del mundo muy distintas (Z1, Z2, Z3).  Con los datos obtenidos se pretende ver la diferencia entre tratamientos, entre zonas y ver, finalmente, si hay o no interacción. ¿Cuál es la afirmación más razonable respecto a los resultados que podríamos obtener en el ANOVA?:

a.Factor Tratamiento: p<0.05. Con tres grupos homogéneos.

b.Factor Tratamiento: p>0.05. Con dos grupos homogéneos.

c.Factor Zona: p>0.05. Con un grupo homogéneo.

d.Factor Zona: p<0.05. Con dos grupos homogéneos.

14.¿Cuál es el punto d en un Análisis de Componentes Principales con las dos siguientes primeras componentes principales: Y1=0.5X1-0.5X2-0.5X3+0.5X4 e Y2=0.01X1+0.5X2-0.5X3-0.01X4?

a.(2, 5, 5, 1)

b.(5, 1, 3, 5)

c.(5, 3, 1, 5)

d.(1, 5, 4, 2)

15.¿Cuál de los siguientes repertorios de puntos, de un espacio de cinco dimensiones, va asociado al siguiente dendrograma?

a.(4, 4, 4, 4, 1), (4, 4, 7, 7, 3), (4, 4, 6, 6, 2), (1, 3, 5, 5, 6), (1, 3, 5, 6, 5)

b.(1, 3, 5, 6, 5), (4, 4, 4, 4, 1), (4, 4, 7, 7, 3), (4, 4, 6, 6, 2), (1, 3, 5, 5, 6)

c.(1, 3, 5, 5, 6), (1, 3, 5, 6, 5), (4, 4, 4, 4, 1), (4, 4, 7, 7, 3), (4, 4, 6, 6, 2)

d.(1, 3, 5, 6, 5), (4, 4, 4, 4, 1), (4, 4, 7, 7, 3), (1, 3, 5, 5, 6), (4, 4, 6, 6, 2)

16. Tenemos el siguiente análisis de potencia en una comparación de dos poblaciones:

¿Qué afirmación es cierta?

a.La potencia es suficiente porque es superior al 50%.

b.Si la desviación estándar común la cambiamos de 3 a 2 la potencia disminuirá.

c.Si las medias muestras en lugar de ser 6 y 8 fueran 6 y 9 la potencia subiría.

d.Si el tamaño de muestra por grupo pasa a ser de 30 la potencia disminuirá.

17.En un estudio para ver si había relación entre un determinado comportamiento y una determinada enfermedad teníamos una OR=2.15, con un intervalo de confianza del 95%: (0.65, 8.35). ¿Qué afirmación es cierta?

a.Si aumentamos el tamaño de muestra y la OR no se modifica un intervalo del 95% factible sería (1.12, 9.85).

b.Si aumentamos el tamaño de muestra y la OR no se modifica un intervalo del 95% podría ser perfectamente el mismo: (0.65, 8.35)..

c.Si aumentamos el tamaño de muestra y la OR no se modifica un intervalo del 95% factible sería (0.3, 6.1).

d.Si aumentamos el tamaño de muestra y la OR no se modifica un intervalo del 95% factible sería (1.3, 6.5).

18.Se quiere hacer un pronóstico del porcentaje de personas que tienen un determinado trastorno psiquiátrico en España. Es un tipo de trastorno que sabemos que es muy abundante y que en estudios similares en otros países similares se ha visto que la mitad de la población lo tenían. ¿Qué tamaño muestral necesitamos tomar para tener un intervalo del 99.5% con un radio de 5%?:

a.100.

b.450.

c.900.

d.400.

19.Hemos realizado un Análisis de componentes principales de un test que consta de cuatro ítems. Hemos hecho una representación de los pacientes con sus iniciales en las dos primeras componentes principales:

Las componentes son:

Y1=0.5X1+0.5X2+0.5X3+0.5X4

Y2=0.01X1+0.5X2-0.5X3+0.01X4

¿Cuál de las cuatro respuestas es la más razonable?

a.DJ es (5, 6, 7, 5) y LP es (4, 5, 6, 7).

b.MM es (5, 6, 7, 5) y LP es (2, 2, 3, 4).

c.DJ es (5, 7, 4, 5) y LP es (4, 4, 7, 7).

d.MM es (2, 1, 5, 5) y LP es (4, 5, 2, 7).

20.¿Cuál de las siguientes afirmaciones es cierta?

a.Una potencia del 90% se corresponden con un error de tipo II del 0.9.

b.Un Test de McNemar es un test para muestras independientes de variables cuantitativas.

c.Una Odds ratio de 10 se corresponde, como intensidad de relación, con una Odds ratio de 0.5.

d.En un ANOVA de dos factores cruzados tendremos tres p-valores a valorar.

Situación 139: Trabajo práctico con una base de datos

Tenemos la siguiente base de datos de pacientes con demencias diagnosticadas:

Variables:

P=Paciente

S=Sexo (h=hombre; m=mujer)

E=Edad

EVC=Enfermedad vascular central (s=sí; n=no)

EVP=Enfermedad vascular periférica (s=sí; n=no)

D=Diabetes (s=sí; n=no)

MM0=Mini Mental en el diagnóstico

MM3=Mini Mental a los 3 años

MM5=Mini Mental a los 5 años

P S E EVC EVP D MM0 MM3 MM5
1 h 60 s n n 21 20 18
2 h 79 n n n 20 19 16
3 h 71 n s s 23 20 17
4 h 66 n s s 22 19 16
5 m 69 n n s 21 19 16
6 m 62 n n s 24 22 19
7 m 60 s n n 21 19 16
8 m 63 s n n 24 22 19
9 m 77 n s n 23 21 18
10 h 63 n s n 20 18 15
11 h 79 n s n 24 22 19
12 h 55 n s s 23 21 18
13 m 72 n n s 21 19 16
14 m 68 n n n 21 21 20
15 h 81 n n s 23 21 18
16 h 71 n n n 20 19 19
17 m 61 n s s 24 23 20
18 m 76 s s s 23 22 19
19 m 72 s s n 22 21 18
20 m 63 n n n 24 23 20
21 m 67 n n n 21 20 17
22 h 69 n n n 23 22 19
23 h 60 n n n 21 20 17
24 m 64 n n s 22 21 18
25 m 73 n n s 21 20 17
26 m 66 s n n 23 21 18
27 m 76 s n n 22 20 17
28 h 75 n n n 23 21 18
29 m 62 n n s 21 19 16
30 m 78 n n n 24 22 19
31 h 57 n s s 23 21 18
32 h 58 n s s 21 19 16
33 m 63 s s n 23 21 18
34 m 65 n s n 24 22 19
35 m 74 s s n 20 17 14
36 m 61 n n n 24 22 19
37 h 71 n n s 23 21 18
38 m 71 n n n 22 21 18
39 m 63 n n s 24 23 20
40 h 67 n n s 21 20 17
41 h 69 n n n 21 20 17
42 m 63 n n n 21 20 17
43 m 75 n s n 22 21 18
44 m 69 n s n 21 20 17
45 m 62 s s n 24 20 17
46 m 66 s s s 24 20 16
47 h 57 n s n 23 22 19
48 h 62 n s s 21 18 16
49 h 59 n n n 21 20 17
50 m 72 n n s 28 27 24
51 m 78 n n s 24 23 20
52 m 73 s n n 24 23 20
53 m 63 n n n 23 24 21
54 h 65 s n n 23 22 19
55 m 67 n s n 23 22 21
56 m 66 n s n 24 23 20
57 h 75 n n s 22 21 18
58 h 62 n n n 21 20 17
59 m 71 n n s 23 22 19
60 m 59 s s n 22 17 16
61 m 66 n n s 24 23 20
62 m 64 n n s 23 22 19
63 m 65 n n n 22 21 18
64 h 71 n n n 24 23 20
65 h 68 n n n 21 20 17
66 h 73 n n n 21 20 17
67 m 64 n n n 21 20 17
68 m 60 s s s 22 18 15
69 m 76 n n n 21 21 18
70 m 64 n n s 23 23 20
71 h 68 n n n 22 19 16
72 m 63 n n s 23 19 16
73 m 68 n n s 21 19 16
74 h 73 n n n 21 22 16
75 h 62 n n n 23 19 16
76 m 65 n n n 24 23 20
77 m 76 n n n 20 19 16
78 m 61 n n n 24 23 20
79 m 67 n n s 22 20 17
80 m 64 n n n 22 21 18
81 h 64 n n s 23 21 18
82 m 69 n s s 20 17 15
83 m 74 n n n 22 21 20
84 m 57 n n n 24 23 20
85 h 67 n n n 23 22 19
86 h 73 n n n 22 21 18
87 m 74 n n s 21 20 17
88 m 72 s s n 23 20 17
89 m 78 n n s 24 23 20
90 m 68 s s s 22 20 18
91 h 73 n n n 21 20 17
92 m 64 n n n 21 20 17
93 h 75 n n n 23 22 19
94 h 63 n n n 23 23 21
95 m 79 n n n 20 19 16
96 m 77 s n s 24 20 16
97 m 76 n n s 23 22 19
98 m 62 n s n 22 21 19
99 h 70 n n s 24 23 21
100 m 73 n n s 20 20 16

1.Hacer una estadística descriptiva básica (Media y desviación estándar o Mediana y rango intercuartílico) de las variable MM0, MM3, MM5 y MM0-MM5.

2.Hacer una estadística descriptiva básica de la variable «Número de enfermedades con riesgo vascular que tiene el paciente (Enfermedad vascular central, periférica o diabetes)».

3.Correlacionar el número de enfermedades con riesgo vascular que tiene el paciente con la variable MM0-MM5.

4.Correlacionar la edad con la variable MM0-MM5.

5.Comparar si hay diferencia de medias, estadísticamente significativa, en la variable MM5 entre los pacientes que tienen o no Diabetes.

6.Comparar si hay diferencia de medias, estadísticamente significativa, en la variable MM0-MM5 entre los pacientes que tienen o no Diabetes.

Solución Situación 138

1b: El Intervalo de una OR nunca puede tener valores negativos. En todo caso, el intervalo no contiene al 1, por lo tanto es incompatible con un p-valor superior a 0.05

2d: El Tratamiento no es significativo, el Grupo sanguíneo es significativo es significativo. No hay interacción significativa, porque los valores por cada población son paralelos.

3b: Como una de las dos muestras no se ajusta a la normal debe aplicarse el test de Mann-Withney.

4c: Obsérvese el cálculo de los valores de las dos componentes para los cuatro puntos:

Los puntos c y el d son los que están más a la derecha porque son los que tienen un valor mayor para la componente 1. El c es el que está más arriba, mirando los valores que tienen el c y el d en la componente 2.

5d: Al aumentar el tamaño de muestra el p-valor bajará, al disminuir la desviación estándar el p-valor bajará y al disminuir la diferencia de medias el p-valor subirá. El único perfil que supone: bajada, bajada y subida es el d.

6b: Si la OR no es significativa, porque la p es superior a 0.05, es que no hay relación. Como se trata de una tabla 2×2 el valor de la ji-cuadrado tiene que ser menor que el umbral (3.84), no mayor.

7b: Los dos factores son significativos y hay interacción. En otoño todos los fármacos van igual, cosa que no sucede en otras estaciones. Esto representa que el comportamiento de los fármacos depende de la estación en la que se apliquen: esto es lo que es la interacción.

8c: El valor esperado por grupo es 3 que, como es menor que 5 nos lleva seguro al Test exacto de Fisher.

9b: Obsérvese el cálculo de los valores de las dos componentes para los cuatro puntos:

Los puntos a y el b son los que están más a la izquierda porque son los que tienen un valor menor para la componente 1. El b es el que está más abajo, mirando los valores que tienen el a y el b en la componente 2.

10b. Al aumentar el tamaño de muestra el p-valor bajará, al aumento la desviación estándar el p-valor subirá y al aumentar la diferencia de medias el p-valor bajará. El único perfil que supone: bajada, subida y bajada es el b.

 

Situación 138: Examen (Temas 8-17 y 19)

1.¿En cuál de estas afirmaciones no hay compatibilidad?

a.En un contrate de hipótesis de igualdad de medias una p=0.01 y un IC del 95% de la diferencia de medias entre ambas poblaciones de (0.15, 0.44).

b.En una Odds ratio una p=0.22 y un IC del 95% de (-0.13, 0.56).

c.En una tabla de contingencias 3×2 un valor de ji-cuadrado de 4.3 y un p-valor superior a 0.05.

d. En una ANOVA de un factor una p=0.67 y tener un único grupo homogéneo entre los cinco niveles que estamos comparando.

2.Tenemos los siguientes datos en un estudio donde se aplican dos tratamientos distintos (1 y 2) a un grupo de pacientes que tienen una determinada patología y que se han diferenciado según su grupo sanguíneo.  Con los datos obtenidos se pretende ver la diferencia entre tratamientos, entre grupos sanguíneos y si hay o no interacción. ¿Cuál es la afirmación más razonable respecto a los resultados que podríamos obtener en el ANOVA?:

a.Factor Tratamiento: p<0.05. Factor Grupo sanguíneo: p>0.05. Interacción: p>0.05.

b.Factor Tratamiento: p<0.05. Factor Grupo sanguíneo: p<0.05. Interacción: p<0.05.

c.Factor Tratamiento: p>0.05. Factor Grupo sanguíneo: p<0.05. Interacción: p<0.05.

d.Factor Tratamiento: p>0.05. Factor Grupo sanguíneo: p<0.05. Interacción: p>0.05.

3.En un estudio donde se quiere comparar dos psicoterapias tenemos 100 pacientes que repartimos en dos grupos de igual tamaño. A cada grupo le aplicamos sólo uno de los dos tratamientos a comparar. Evaluamos una variable cuantitativa. El test de Shapiro-Wilk de la primera muestra tiene una p=0.22 y el de la segunda muestra tiene una p=0.03. El test de Fisher-Snedecor nos proporciona una p=0.01. Es cierto lo siguiente:

a.Debemos aplicar el test de la t de Student para varianzas desiguales.

b.Debemos aplicar el test de Mann-Whitney.

c.Debemos aplicar el test de la t de Student para varianzas iguales.

d.Debemos aplicar el test de la t de Student de datos apareados.

4.¿Cuál es el punto 4 en un Análisis de Componentes Principales con las dos siguientes primeras componentes principales:

a.(2, 1, 0, 4, 2, 4)

b.(1, 4, 4, 1, 2, 0)

c.(5, 3, 3, 5, 4, 5)

d.(3, 5, 5, 3, 5, 3)

5.En un estudio de comparación de dos poblaciones partimos de unos datos iniciales concretos y calculamos el p-valor con la técnica adecuada. Seguidamente introducimos nuevos valores de ambas muestras que no teníamos previamente aumentando, pues, el tamaño de ambas muestras y obteniendo la misma media y la misma desviación estándar en ambas muestras y volvemos a calcular el p-valor. Después detectamos que la desviación estándar era más baja de la que habíamos calculado y volvemos a calcular el p-valor. Finalmente, detectamos que la diferencia de medias es más pequeña de la que habíamos calculado previamente y volvemos a calcular el p-valor. ¿Cuál de las siguientes es la secuencia de p-valores que podríamos tener?

a.0.23/0.13/0.21/0.16.

b.0.52/0.14/0.77/0.62.

c.0.12/0.03/0.01/0.001.

d.0.12/0.01/0.001/0.01.

6.¿En cuál de las siguientes afirmaciones no hay compatibilidad?

a.En una diferencia de medias con un IC 95%: (0.85, 5.45) y un p-valor de 0.02.

b.En una OR de 1.34 con p=0.34 y una ji-cuadrado de 4.32.

c.En un ANOVA de dos factores una p=0.23 del primer factor, una p=0.89 del segundo factor y una p=0.00001 de la interacción.

d.Una V de Crámer con un valor de 0 y una ji-cuadrado con una  p=1.

7.Tenemos los siguientes datos en un estudio donde se aplican tres fármacos (A, B, C) en pacientes con la misma patología de las cuatro estaciones del años.  Con los datos obtenidos se pretende ver la diferencia entre fármacos, entre estaciones y ver, finalmente, si hay o no interacción. ¿Cuál es la afirmación más razonable respecto a los resultados que podríamos obtener en el ANOVA?:

a.Factor Fármaco: p<0.05. Factor Estación: p>0.05. Interacción: p<0.05.

b.Factor Fármaco: p<0.05. Factor Estación: p<0.05. Interacción: p<0.05.

c.Factor Fármaco: p<0.05. Factor Estación: p<0.05. Interacción: p>0.05.

d.Factor Fármaco: p>0.05. Factor Estación: p<0.05. Interacción: p>0.05.

8.Hemos de comparar dos formas de rehabilitación psicológica a pacientes que han sufrido un infarto cerebral. La variable analizada es si después de un año el paciente consigue superar un umbral previamente establecido en un test psicotécnico. Se ha trabajado con 100 pacientes. 50 en cada grupo. Cada paciente recibe un único tratamiento. Después del año en un grupo un 7% consigue la rehabilitación psicológica. En el otro grupo un 5% lo consigue. Para ver si esas diferencias son estadísticamente significativas debemos:

a.Aplicar un Test de Wilcoxon.

b.Aplicar un Test de proporciones.

c.Aplicar un Test exacto de Fisher.

d.Aplicar un Test de McNemar.

9.¿Cuál es el punto 2 en un Análisis de Componentes Principales con las dos siguientes primeras componentes principales:

a.(2, 1, 0, 4, 2, 4)

b.(1, 4, 4, 1, 2, 0)

c.(5, 3, 3, 5, 4, 5)

d.(3, 5, 5, 3, 5, 3)

10.En un estudio de comparación de dos poblaciones partimos de unos datos iniciales concretos y calculamos el p-valor con la técnica adecuada. Seguidamente introducimos nuevos valores de ambas muestras que no teníamos previamente aumentando, pues, el tamaño de ambas muestras y obteniendo la misma media y la misma desviación estándar en ambas muestras y volvemos a calcular el p-valor. Después detectamos que la desviación estándar era más alta de la que habíamos calculado y volvemos a calcular el p-valor. Finalmente, detectamos que la diferencia de medias es más grande de la que habíamos calculado previamente y volvemos a calcular el p-valor. ¿Cuál de las siguientes es la secuencia de p-valores que podríamos tener?

a.0.23/0.13/0.21/0.36.

b.0.52/0.14/0.77/0.62.

c.0.12/0.03/0.01/0.001.

d.0.12/0.01/0.001/0.01.

 

Situación 137: Tema 16

Estamos interesados en determinar el tamaño de muestra en un estudio de comparación de dos tratamientos farmacológicos: el tratamiento estándar y una nueva opción creada recientemente. La variable respuesta es curación sin recidiva a los 5 años. El tratamiento estándar tiene un nivel de curación sin recidiva del 35%. Queremos comprobar si con el nuevo preparado conseguimos una mejora de, como mínimo, 10 puntos porcentuales. ¿Cuál es el tamaño de muestra necesario si queremos tener una potencia del 80% y creemos que tendremos una pérdida de seguimiento de un 20%?

El patrón común de los contrastes de hipótesis

Uno de los objetivos fundamentales de la Ciencia es tomar decisiones. Decisiones acerca de cómo debe de ser lo que no vemos (lo poblacional) a partir de la información que extraemos de lo que vemos (la muestra). El contraste de hipótesis estadístico es el principal método mediante el cual se toman esas decisiones en la Ciencia.

En todo contraste de hipótesis el patrón de funcionamiento es siempre el mismo. Es muy importante captar esta idea si se quiere comprender la Estadística y, también, la Ciencia. Karl Pearson decía que la Estadística es la gramática de la Ciencia. Seguramente es en el contraste de hipótesis donde podemos ver mejor los elementos nucleares de esa gramática.

Hay tres elementos básicos en la toma de la decisión:

  1. La diferencia entre el valor muestral y el valor poblacional establecido en la Hipótesis nula. La distancia que hay entre lo que vemos muestralmente y lo que afirmamos sobre la población, en definitiva.
  2. La dispersión que tengamos en la muestra. La variabilidad, lo alejados que estén los valores respecto de la media. La imprevisibilidad, por lo tanto, de los valores que podemos tener.
  3. El tamaño de muestra que tengamos. La cantidad de información que tenemos de la inmensa población sobre la que queremos hablar.

El esquema general en el que relacionamos estos tres factores es siempre el siguiente:

En definitiva, en un contraste de hipótesis, se trata de ver cuán diferente es el cálculo muestral respecto al que se afirma, poblacionalmente, en la Hipótesis nula, que es lo que calculamos en el numerador. Cuanto más próxima a 0 sea esa diferencia más coherente será mantener esa Hipótesis nula. Observemos que el numerador marca la distancia absoluta entre el cálculo muestral y la hipótesis sobre cómo es la población que no tengo.

Sin embargo, este cálculo del numerador que valora la distancia entre lo que veo y lo que afirmo sobre la población quedará matizado por la dispersión y por el tamaño de muestra que tengamos. Observemos bien el cociente: En el denominador tenemos un cociente entre la dispersión y el tamaño de muestra.

Si la dispersión es grande esa diferencia se verá disminuida, si esa dispersión es pequeña esa diferencia entre el valor muestral y el poblacional se verá aumentada.

Lo contrario sucede con el tamaño de muestra: si es grande el tamaño muestral esa diferencia calculada en el numerador se verá aumentada (porque al ser grande el tamaño de muestra el cociente entre la dispersión y el tamaño de muestra se hace pequeña) y si el tamaño de muestra es pequeño esa diferencia se verá disminuida (porque al ser pequeño el tamaño de muestra el cociente entre la dispersión y el tamaño de muestra se hace grande).

Cuanto más próximo a 0 sea este cociente más razonable será mantener la Hipótesis nula y, por el contrario, cuanto más alejado esté de 0 más coherente será rechazarla y pasar a la Hipótesis alternativa.

Veamos estos tres factores cómo influyen para que el cociente sea próximo a 0 ó, por el contrario, sea un valor alejado del cero:

Valores pequeños de diferencia, grandes de dispersión y pequeños de tamaño de muestra hacen que el cociente sea pequeño. Valores grandes de diferencia, pequeños de dispersión y grandes de tamaño de muestra hacen que el cociente se haga grande.

Cada contraste tendrá un umbral para hacer este paso de la Hipótesis nula a la alternativa. El umbral será ese valor que ya hace intolerable la distancia entre lo que vemos y lo que afirmamos en la Hipótesis nula sobre la población.

El p-valor, de hecho, es una forma estandarizada de evaluar este alejamiento del cero. Cuanto menor es el p-valor más alejado estamos del 0 y cuanto más próximo a 1 sea el p-valor más cerca del 0 estamos en este cociente. De hecho, si el valor de la  muestra coincide con el valor poblacional de la Hipótesis nula el p-valor será 1. ¿Hay en esta situación algún argumento coherente para rechazar esa hipótesis?

La frontera del 0.05 en el p-valor es la expresión estandarizada de que estamos justo sobre el umbral de tolerancia del mantenimiento de la Hipótesis nula.

Veamos en los siguientes cinco ejemplos de contrastes de hipótesis: Contraste sobre la correlación de Pearson, Contraste de una proporción, Contraste de comparación de proporciones, Contraste de una media y Contraste de comparación de medias:

Obsérvese que siempre estamos haciendo un cociente como el que hemos escrito antes, conceptualmente, un cociente entre la diferencia entre lo muestral y lo que afirmamos poblacionalmente en la Hipótesis nula y el valor de otro cociente: el que hay entre la dispersión y el tamaño de muestra que tenemos.

A la derecha de cada cociente tenemos la distribución de ese cociente en el caso de que fuera cierta la Hipótesis nula, que es lo que nos permite fijar un umbral o calcular un p-valor como criterio para decidir si mantenemos la Hipótesis nula o, por el contrario, la rechazamos y nos quedamos con la Hipótesis alternativa.

Situación 136: Examen (Temas 1-7)

1.¿Cuál de las siguientes afirmaciones es cierta en una regresión?

a.Una pendiente con un IC 95%: (-0.3, -0.05) es compatible con una correlación con p-valor -0.002.

b.Una pendiente con una p=0.001 es compatible con una correlación con IC 95%: (-0.4, 0.6).

c.Una pendiente con un IC 95%: (-1.5, 0.6) es compatible con una correlación con p-valor igual a 0.2.

d.Una pendiente de -0.3 con p=0.95 es compatible con una correlación con un IC del 95%: (-0.6, -0.2)

2.¿Qué valor refleja un mayor nivel de relación entre dos variables?

a.r= 0.6 (p=0.5)

b.r=-0.7 (IC 95%: (-1, 0.08))

c.r=0.5 (p=0.01)

d.r=0.4 (IC 95%: (0.39, 0.41))

3.Nos dicen que un intervalo de confianza de la media del 95% de la cantidad de un neurotransmisor en unos pacientes es (89, 91). El estudio se ha hecho con una muestra de 400 pacientes. ¿Cuál es el intervalo de confianza del 99.5% descriptivo de esa variable?

a.(30, 150)

b.(50, 130)

c.(60, 120)

d.(80, 100)

4.En una muestra como la siguiente: (4, 5, 5, 55, 55, 56), los resultados más previsibles de la asimetría estandarizada (AE) y de la curtosis estandarizada (CE) son:

a.AE=0 y CE=0

b.AE=5 y CE=5

c.AE=0 y CE=5

d.AE=5 y CE=0

5.Sea la muestra (1, 2, 5, 6, 9, 11). Podemos afirmar:

a.La mediana es 6.

b.El percentil 40 es 5.

c.El percentil 83.3 es 9.

d.El percentil 16.6 es 2.

6.¿Cuál de las siguientes afirmaciones no es cierta en una regresión?

a.Una pendiente con un IC 95%: (-0.3, -0.05) es compatible con una correlación con p-valor 0.02.

b.Una pendiente con una p=0.1 es compatible con una correlación con IC 95%: (-0.4, 0.6).

c.Una pendiente con un IC 95%: (-1.5, 0.6) es compatible con una correlación con p-valor igual a 0.22.

d.Una pendiente de -0.3 con p=0.01 es compatible con una correlación con un IC del 95%: (-0.6, 0.2)

7.¿Qué valor refleja un mayor nivel de relación entre dos variables?

a.r= 0.6 (p=0.01)

b.r=-0.7 (IC 95%: (-1, -0.28))

c.r=0.5 (p=0.01)

d.r=0.4 (IC 95%: (0.39, 0.41))

8.Nos dicen que un intervalo de confianza de la media del 95% de la cantidad de un neurotransmisor en unos pacientes es (88, 92). El estudio se ha hecho con una muestra de 100 pacientes. ¿Cuál es el intervalo de confianza del 68.5% descriptivo de esa variable?

a.(80, 100)

b.(85, 95)

c.(60, 120)

d.(75, 105)

9.En una muestra como la siguiente: (3.3, 4.2, 5, 5.2, 5.5, 5.7, 6.3, 7.2), los resultados más previsibles de la asimetría estandarizada (AE) y la curtosis estandarizada (CE) son:

a.AE=0 y CE=0

b.AE=15 y CE=15

c.AE=0 y CE=15

d.AE=15 y CE=0

  1. Sea la muestra (1, 2, 3, 7, 9, 11, 14). ¿Cuál es la afirmación incorrecta?:

a.La mediana es 7.

b.5 es el percentil 40.

c.9 es el percentil 66.6.

d.2 es el percentil 16.6.

Base de datos de la evolución del MM en pacientes con demencias

Tenemos la siguiente base de datos de pacientes con demencias diagnosticadas:

Variables:

P=Paciente

S=Sexo (h=hombre; m=mujer)

E=Edad

EVC=Enfermedad vascular central (s=sí; n=no)

EVP=Enfermedad vascular periférica (s=sí; n=no)

D=Diabetes (s=sí; n=no)

MM0=Mini Mental en el diagnóstico

MM3=Mini Mental a los 3 años

MM5=Mini Mental a los 5 años

P S E EVC EVP D MM0 MM3 MM5
1 h 60 s n n 21 20 18
2 h 79 n n n 20 19 16
3 h 71 n s s 23 20 17
4 h 66 n s s 22 19 16
5 m 69 n n s 21 19 16
6 m 62 n n s 24 22 19
7 m 60 s n n 21 19 16
8 m 63 s n n 24 22 19
9 m 77 n s n 23 21 18
10 h 63 n s n 20 18 15
11 h 79 n s n 24 22 19
12 h 55 n s s 23 21 18
13 m 72 n n s 21 19 16
14 m 68 n n n 21 21 20
15 h 81 n n s 23 21 18
16 h 71 n n n 20 19 19
17 m 61 n s s 24 23 20
18 m 76 s s s 23 22 19
19 m 72 s s n 22 21 18
20 m 63 n n n 24 23 20
21 m 67 n n n 21 20 17
22 h 69 n n n 23 22 19
23 h 60 n n n 21 20 17
24 m 64 n n s 22 21 18
25 m 73 n n s 21 20 17
26 m 66 s n n 23 21 18
27 m 76 s n n 22 20 17
28 h 75 n n n 23 21 18
29 m 62 n n s 21 19 16
30 m 78 n n n 24 22 19
31 h 57 n s s 23 21 18
32 h 58 n s s 21 19 16
33 m 63 s s n 23 21 18
34 m 65 n s n 24 22 19
35 m 74 s s n 20 17 14
36 m 61 n n n 24 22 19
37 h 71 n n s 23 21 18
38 m 71 n n n 22 21 18
39 m 63 n n s 24 23 20
40 h 67 n n s 21 20 17
41 h 69 n n n 21 20 17
42 m 63 n n n 21 20 17
43 m 75 n s n 22 21 18
44 m 69 n s n 21 20 17
45 m 62 s s n 24 20 17
46 m 66 s s s 24 20 16
47 h 57 n s n 23 22 19
48 h 62 n s s 21 18 16
49 h 59 n n n 21 20 17
50 m 72 n n s 28 27 24
51 m 78 n n s 24 23 20
52 m 73 s n n 24 23 20
53 m 63 n n n 23 24 21
54 h 65 s n n 23 22 19
55 m 67 n s n 23 22 21
56 m 66 n s n 24 23 20
57 h 75 n n s 22 21 18
58 h 62 n n n 21 20 17
59 m 71 n n s 23 22 19
60 m 59 s s n 22 17 16
61 m 66 n n s 24 23 20
62 m 64 n n s 23 22 19
63 m 65 n n n 22 21 18
64 h 71 n n n 24 23 20
65 h 68 n n n 21 20 17
66 h 73 n n n 21 20 17
67 m 64 n n n 21 20 17
68 m 60 s s s 22 18 15
69 m 76 n n n 21 21 18
70 m 64 n n s 23 23 20
71 h 68 n n n 22 19 16
72 m 63 n n s 23 19 16
73 m 68 n n s 21 19 16
74 h 73 n n n 21 22 16
75 h 62 n n n 23 19 16
76 m 65 n n n 24 23 20
77 m 76 n n n 20 19 16
78 m 61 n n n 24 23 20
79 m 67 n n s 22 20 17
80 m 64 n n n 22 21 18
81 h 64 n n s 23 21 18
82 m 69 n s s 20 17 15
83 m 74 n n n 22 21 20
84 m 57 n n n 24 23 20
85 h 67 n n n 23 22 19
86 h 73 n n n 22 21 18
87 m 74 n n s 21 20 17
88 m 72 s s n 23 20 17
89 m 78 n n s 24 23 20
90 m 68 s s s 22 20 18
91 h 73 n n n 21 20 17
92 m 64 n n n 21 20 17
93 h 75 n n n 23 22 19
94 h 63 n n n 23 23 21
95 m 79 n n n 20 19 16
96 m 77 s n s 24 20 16
97 m 76 n n s 23 22 19
98 m 62 n s n 22 21 19
99 h 70 n n s 24 23 21
100 m 73 n n s 20 20 16

A.Técnicas descriptivas:

  1. Calcular la media, desviación estándar, mediana, primer y tercer cuartil, rango y rango intercuartílico de la variable MM0.
  2. Hacer una estadística básica de la variable Edad (Media y desviación estándar o Mediana y rango intercuartílico).
  3. Hacer un Box-Plot de la variable MM5.
  4. Hacer una estadística de la variable Diabetes.

B.Técnicas de relación:

  1. Calcular la correlación entre la Edad y el MM en el diagnóstico (MM0).

2. Crear una función que pronostique el MM5 a partir del MM0. Valorar la capacidad predictiva.

3. Ver si hay relación entre el sexo y el que en cinco años disminuya más de cuatro (o sea, cinco o más) puntos el MM desde el diagnóstico.

4. Calcular la Odds ratio para ver si hay riesgo o protección, cuantificándolo, entre tener algún problema de riesgo vascular (Enfermedad vascular central, periférica o diabetes) y que en cinco años disminuya más de cuatro (o sea, cinco o más) puntos el MM desde el diagnóstico.

C.Técnicas de comparación:

  1. Comparar si hay diferencias estadísticamente significativas en el nivel del MM a los cinco años (MM5) entre hombre y mujeres.
  2. Comparar si hay diferencias estadísticamente significativas en el nivel de diferencia entre MMO y MM5 (o sea, la caída del MM entre el diagnóstico y los 5 años desde el diagnóstico) entre los que tienen o no algún problema vascular.