El cuidado es la esencia de la enfermería.


"La única manera de hacer una gran labor, es amando lo que haces. "


sábado, 4 de junio de 2016

Explotación inferencial de base de datos. (Seminario 4)

Goooo!!

En esta entrada explicaré lo que hicimos en el siguiente seminario. En este nos centramos en plantear correctamente y claramente los objetivos, las variables e introducción sobre nuestro tema a investigar. De hecho planteamos distintas preguntas posibles que podría tener nuestro cuestionario para obtener los resultados de nuestra investigación. También , nuestro profesor nos ayudó a entender las estadísticas inferencial.

De modo que nuestro tema se basaba en: conocer y valorar la formación continuada en enfermería en las parcelas de farmacología y procedimientos clínicos.  
 
Objetivo: Determinar la formación continuada de los enfermeros de los hospitales seleccionados de la provincia de Sevilla, para conocer el grado de conocimiento en las parcelas de farmacología y procedimientos clínicos.  

Método:Diseño analítico observacional transversal. La población de estudio son enfermeros de distintos hospitales de la provincia de Sevilla.   
Para la recogida de datos se repartieron cuestionarios con 10 preguntas sobre conocimientos farmacológicos y 10 sobre procedimientos clínicos entre la población de referencia. Una vez recogido los cuestionarios se analizaron los datos con epi-info, versión 7.1.3.10: se realizaron análisis de frecuencia y chi cuadrado, comparando las variables definidas. 

Resultados: En general la población seleccionada tiene mayor grado de conocimiento de procedimientos clínicos que de farmacología. Además, los jóvenes tienen un índice de aprobado mayor que aquellos que tienen mayor experiencia profesional, aun así, no hay relación entre las variables, formación continuada y grado de conocimiento, pues se acepta la hipótesis nula. 

Conclusiones: los enfermeros jóvenes tienen un mayor conocimiento sobre las preguntas de actualidad que aquellos que llevan más años en el ámbito profesional. Además existe un mayor desconocimiento de farmacología que de clínica, por lo que deberían reforzarse.


CONTINUARÁ...

Explotación descriptiva de base de datos. ( Seminario 3)

Pues bien este blog va llegando a su vez, hoy lo terminaremos con 3 entradas más a parte de esta, puesto que este blog fue creado para la asignatura de ETICS la cual se presenta en primer curso de carrera como ya muchos sabéis. Así pues comencemos mis últimas entradas!!

En esta entrada me voy a centrar en un día en el que me explicaron estadísticas descriptivas la cual la he ido explicando en una entrada y espero que os haya resultado fácil de entender. Además, principalmente teníamos que pensar mi grupo y yo un tema que nos gustases y pudieramos investigar. Para ello como ya sabéis teníamos que tener en cuenta cómo lo íbamos a medir y las variables que íbamos a usar. Así pues empezamos a plantear temas pero la mayoría no se podían y finalmente optamos por el tema: conocer y valorar la formación continuada en los profesionales de enfermería. Por ello comenzamos a plantear nuestras variables y nuestro enfoque.Además nos quisimos centrar en dos parcelas que nos parecían muy interesantes e importantes para los enfermeros: farmacología y práctica clínica. En la siguiente entrada  os explicaré un poco más!


viernes, 3 de junio de 2016

Hipótesis estadísticas. Test de hipótesis. (Tema 10)

BUENAAS!! Vamoos por el último tema!!!
En esta ocasión vamos a controlar los errores aleatorios mediante contrastes de hipótesis, para ello utilizaremos test o contrastes de hipótesis además calcularemos intervalos de confianza.

Primeramente,  tendremos que establecer una hipótesis cerca del valor del parámetro y luego analizaremos la coherencia entre la hipotesis previa (nula) y los datos obtenidos. De modo que necesitamos contrastar la hipótesis nula es decir, la hipótesis que establece igualdad entre los grupos a comparar.
Además, existen dos pruebas para medir la normalidad, estas son: Kolmogorov-Smirrow, la cual se utiliza si el tamaño muestral es superior a 50, y Test  de Shapiro-Wilks, que se usa si el tamaño muestral es inferior a 50.

Seguidamente, tratamos la significación estadística que se basa en rechazar la hipótesis nula para un nivel de un error ,llamado alfa que muestra si se rechaza o acepta la hipótesis nula, máximo del 5 %.
A continuación, plantearemos los siguientes tipos de test de hipótesis: test chi cuadrado, test de t- student, test de anova y regresión lineal.
En primer lugar, el test de chi cuadrado se usa para comparar variables cualitativas como bien vemos en la tercera tabla anterior y nuestro razonamiento para este tipo de test podría ser: suponer la hipótesis cierta y estudiar como es de probable que siendo iguales dos grupos a comparar se obtengan resultados como los obtenidos o haber encontrado diferencias más grandes por grupos.
Adjunto un video en el que os resultará más fácil comprenderlo e incluso se presenta un ejemplo: https://www.youtube.com/watch?v=XvPEeQAjTW8

En segundo lugar, el test de t- student se basa principalmente en :

Además, adjunto un video mas explicativo de este tipo de test: https://www.youtube.com/watch?v=uR8nh8xtU2c

En tercer lugar, nos toca el test de Anova el cual se va a usar principalmente como por ejmplo:
 

Finalmente, trataremos la regresión lineal mediante un video que resulta muy intereante y explicativo:https://www.youtube.com/watch?v=rFLgLOsU1LM

PUES ESTO ES TODO AMIGOS, HA SIDO ESTA ÚLTIMA SEMANA MUY INTENSIVA DE ESTADÍSTICAS PERO PIENSO QUE ES MUY NECESARIO SOBRE TODO A LA HORA DE REALIZAR UN PROYECTO DE FIN DE GRADO.





jueves, 2 de junio de 2016

Estadística inferencial: muestreo y estimación (Tema 9)

Seguimos escribiendo hoy!
A continuación nos centraremos en la inferencia estadística, la cual se utiliza como por ejempo cuando planteamos un estudio en el ámbito sanitario para establecer relaciones entre variables, nuestro interés no suele estar exclusivamente en los pacientes concretos a los que hemos tenido acceso, sino más bien en todos los pacientes similares a estos. Hay que destacar que al inferir siempre hay error aleatorio. Además, presenta las siguientes características:
Ø  Al conjunto de pacientes sobre los que queremos estudiar alguna cuestión (sacar conclusiones) le llamamos población de estudio.
Ø  Al conjunto de individuos concretos que participan en el estudio le denominamos muestra.
Ø  Al número de individuos de la muestra le denominamos tamaño muestral.
Ø  Al conjunto de procedimientos estadísticos que permiten pasar de lo particular, la muestra, a lo general, la población, le denominamos inferencia estadística.

Ø  Al conjunto de procedimientos que permiten elegir muestras de tal forma que éstas reflejen las características de la población le llamamos, esto se hace para evitar sesgos. Técnicas demuestreo.

Ø  Si la muestra se elige por un procedimiento de azar, se puede evaluar ese error. La técnica de muestreo en ese caso se denomina muestreo probabilístico o aleatorio y el error asociado a esa muestra elegida al azar se llama error aleatorio.
Ø  En los muestreos no probabilísticos (Ej: estudios de conveniencia. Utilizar a los pacientes de mi hospital como muestra), no es posible evaluar el error. En los muestreos probabilísticos, el error aleatorio es inevitable pero es evaluable.
Ø  Cuanto mayor sea el tamaño de la muestra, favorezco la reducción del error aleatorio por probabilidad. 

Os adjunto un video explicativo en el que se muestra una introducción de este tipo de estadísticas:https://www.youtube.com/watch?v=RNVSr18Xz7s

Error estándar.

Ø  Es la medida que trata de captar la variabilidad de los valores del estimador (en este caso la media de los días de curación de la úlcera).
Ø  El error estándar de cualquier estimador mide el grado de variabilidad en los valores del estimador en las distintas muestras de un determinado tamaño que pudiésemos tomar de una población.
Ø  Cuanto más pequeño es el error estándar de un estimador, más nos podemos fiar del valor de una muestra concreta.
s=desviación típica
n=tamaño de la muestra
p= proporción estimada en la muestra.



Si en lugar de variar el valor de la media en las muestras entre 52 y 64 días, variara entre 20 y 90 días, sería menos probable que al seleccionar una muestra y calcular su media, ésta estuviera cercana a 57,46, que es el valor de la media en la población.

Cálculo del error estándar

Depende de cada estimador:
-          Error estándar para una media :
-          Error estándar para una proporción (frecuencia relativa):
De ambas fórmulas se deduce que, mientras mayor sea el tamaño de una muestra, menor será el error estándar.

Teorema central del límite:

Para estimadores que pueden ser expresados como suma de valores muestrales, la distribución de sus valores sigue una distribución normal con media de la población y desviación típica igual al error estándar del estimador de que se trate.
Si en vez de una muestra, seleccionara 100 muestras y calculara las medias y las pusiera en un histograma, tendría una distribución normal, en la cual el error estándar coincide con la desviación estándar del histograma, por lo tanto si le sumo y le resto a la media una vez la desviación estándar, es decir, el error estándar, tendré el 68.26% de las observaciones.



Intervalos de confianza:

Ø  Son un medio de conocer el parámetro en una población midiendo el error que tiene que ver con el azar (error aleatorio).
Ø  Se trata de un par de números tales que, con un nivel de confianza determinados, podamos asegurar que el valor del parámetro es mayor o menor que ambos números.
Ø  Se calcula considerando que el estimador muestral sigue una distribución normal, como establece la teoría central del límite.

Procedimiento Muestral. (Tecnica De Muestreo).



-          Un muestreo es un método tal que al escoger un grupo pequeño de una población podamos tener un grado de probabilidad de que ese pequeño grupo posea las características de la población que estamos estudiando.
-          La población general de la queremos obtener conclusiones la vamos a elegir al azar (aleatoriamente), para obtener la muestra y a partir de esta hacer inferencia de la población entera à (confianza (intervalo de confianza) en %).

TIPOS DE MUESTREO.

-          Probabilístico. Todos los sujetos de la población tienen una probabilidad distinta de cero en la selección de la muestra y conocida
1.       Aleatorio simple. P=1/nà por azar (que azar no es ponerme en una esquina y el que pase por aquí)
2.       Aleatorio sistemático.à estas tres son variaciones del muestreo aleatorio simple.
3.       Estratificado.
4.       Conglomerados.
-          No probabilístico o de conveniencia del investigador. Puede haber personas en la población que no tengan probabilidad o que se desconozca,  de ser seleccionado en la muestra.
1.       Accidental. Son aquellos en los que los sujetos de la población no tienen una probabilidad conocida o distinta de 0.
2.       Por cuotas. Me pongo a pasar un cuestionario en una esquina pero el 50% a mujeres y 50% a hombres, despreciando a la mujer 51 que pasa por la esquina.

Muestreo probabilístico.

                Todos y cada uno de los elementos tienen la misma probabilidad de ser elegidos.
                Es el método que consiste en extraer una parte (o muestra) de una población o universo, de tal forma que todas las muestras posibles de tamaño fijo, tengan la misma posibilidad de ser seleccionados.
-          Aleatorio Simple.
1.       Se caracteriza porque cada unidad tiene la probabilidad equitativa de ser incluida en la muestra:
n  De sorteo o rifa: Asignamos un nº a cada miembro de la población, calculamos el tamaño muestral y seleccionamos aleatoriamente ese nº. este tipo de método no es fácil cuando la población es muy grande, pasando a usar el sistema que continua.
n  Tabla de números aleatorios: más económico y requiere menor tiempo. Se hace cuando disponemos de una lista informatizada en una base de datos de la población de estudio.
-          Aleatorio Sistemático.
1.       Similar al aleatorio simple, en donde cada unidad del universo tiene la misma probabilidad de ser seleccionada.
2.       Ejemplo: si N:500 (población) y n:100 (personas que queremos en la muestra N/n=5         
5 será el intervalo para la selección de cada unidad muestral.  Si tengo las personas por número seria así: saco un número aleatorio de la población y a partir de ahí cada 5 elijo al sujeto de estudio. Si saco el 320 a partir de 325, 330, 335... Hasta llegar a 100. Si termino la lista y no he llegado al 100, vuelvo a empezar de nuevo, pero siempre con el intervalo que me ha salido.
-          Estratificado.
1.       Se caracteriza por la subdivisión de la población de estudio en subgrupos o estratos, debido a que las variables principales que deben someterse a estudio presentan cierta variabilidad o distribución conocida que puede afectar a los resultados. Si quiero hacer un estudio sobre cifras de presión arterial, si la población de estudio el 25% son menores de 15 años, el 50% entre 15-65 años y el 25% mayores de 65. Si la muestra que necesito es de 200 personas. Seleccionare aleatoriamente siguiendo el procedimiento anterior 100 personas de entre 15-65 años, 50 menores de 15 años, y 50 mayores de 65.  Se usa principalmente por motivos de edad y sexo.
-          Conglomerado.
1.       Se usa cuando no se dispone de una lista detallada y enumerada de cada una de las unidades que conforman el universo y resulta muy complejo elaborarla. En la selección de la muestra en lugar de escogerse cada unidad se toman los subgrupos o conjuntos de unidades conglomerados. Por ejemplo, quiero hacer un estudio de Andalucía (poblaciones amplias sobre las que se usa este método), calculo el tamaño muestral, pero si hago un muestreo aleatorio me puede salir cada sujeto en un pueblo distinto de la población andaluza, para evitarlo se seleccionan un grupo de municipios y dentro de ese municipio se hacen muestreo aleatorio simple.
2.       En este tipo de muestreo el investigador no conoce la distribución de la variable.
3.       Las inferencias que se hacen en una muestra conglomerada no son tan confiable como las que se obtienen en un estudio hecho por muestreo aleatorio, excluyendo directamente grandes municipios. El municipio se elige por estratificación a su vez.

Muestreo no probabilístico.

-          No se sigue el proceso aleatorio.
-          No puede considerarse que la muestra sea representativa de una población.
-          Se caracteriza porque el investigador selecciona la muestra siguiendo algunos criterios identificados para los fines del estudio que realiza.
-          Por conveniencia o intencional: en el que el investigador decide, según sus objetivos, los elementos que integraran la muestra, considerando las unidades “típicas” de la población que desea conocer.
-          Tipos:
1.       Por cuotas: en el que el investigador selecciona la muestra considerando algunos fenómenos o variables a estudiar, como: Sexo, raza, religión, etc.
2.       Accidental: consiste en utilizar para el estudio las personas disponibles en un momento dado, según lo que interesa estudiar. De las tres es la más deficiente.
3.       Por conveniencia o intencional. En el que el investigado, decide según sus objetivos, loe elementos que integraran la muestra, considerando las unidades “típicas” de la población que se desea conocer.

Tamaño de la muestra.

El tamaño de la muestra a tomar va  a depender del error estándar.
-          De la mínima diferencia entre los grupos de comparación que se considera importante en los valores de la variable a estudiar. Más grande debe ser la muestra para que más pequeño sea el error.
-          De la variabilidad de la variable a estudiar (varianza en la población).
-          El tamaño de la población de estudio.
,
OS ADJUNTO UN VIDEO QUE EXPLICA LOS DISTINTOS TIPOS DE MUESTREO,https://www.youtube.com/watch?v=viyYsnR6FQA

Ejemplo de tamaño muestral proporción:
1-      Un grupo de investigadores quieren conocer la proporción de hipertensión arterial en un municipio de 6550 habitantes, sabiendo que la bibliografía sitúa la prevalencia general de HTA en el 15%, se pide el tamaño de la muestra para estimar la prevalencia de la HTA, considerando un nivel de confianza del 95% y una precisión deseada del 3%.
N=6550
Z=1,93
P=15%, los que tienen HTA
1-p= 1-0,15= 0,85
e=3%=0.03
n = N z2α/2P( 1-P)/ (N-1) e2 + z2α/2 P(1-P)= 6550x(1.96)2x0,15 (1-0,15)/(6550-1)x 0,032 + 1,962 x0,15(1-0,15)= 502,54= 503

Pues hasta mañanaa!! Mañana daremos otro empujón a las estadísticas!!




Medidas de tendencia central, posición y dispersión (Tema 8)

Hoy en el blog haremos un resumen numérico de una serie estadísticas. 

Además de las tablas y gráficos podemos resumir una serie de observaciones mediante “estadísticos”: “Función de los datos observados”.
Hay tres grandes tipos de medidas estadísticas:
-    Medidas de posición: dan idea de la magnitud, tamaño o posición de la observaciones de los datos una vez que están ordenados de menor a mayor.
-   Tendencia central: dan idea del comportamiento central mayoritario.
-  Medidas de dispersión o variabilidad: dan información acerca de la heterogeneidad de nuestras observaciones. 

Por un lado, encontramos las medidas de tendencia central, en las cuales encontramos:


MEDIA ARITMÉTICA O MEDIA (VARIABLES CUANTITATIVAS)
Se calcula para variables cuantitativas y se trata del centro geométrico o de gravedad de nuestros datos. Es la suma de todos los valores de la variable observada entre el total de observaciones. 

               
Cuando los datos están agrupados, para calcular la media utilizamos como valor de referencia de cada intervalo su marca de clase: se calcula una media aritmética estimada que se calcula sumando la marca de clase por la frecuencia absoluta, entre N.
                x= Ʃmcfi/n (multiplicamos la marca de clase por la frecuencia absoluta y vamos sumndo, luego dividimos entre el numero de sujetos)

MEDIANA
Valor de la observación tal que deja a un 50% de los datos  menor y otro 50% de los datos mayor.
-          Si el número de observaciones es impar el valor de la observación será justamente la observación que ocupa la posición (n+1/2) Ejemplo: si son 75, pues 76 entre 2 = 38, la mediana seria la edad que tiene el sujeto 38.
-          Si el número de observaciones es par, el valor de la mediana corresponde a la media entre los dos valores centrales, es decir, la media entre la observación n/2 y la observación (n/2)+1. Ejemplo: cuatro sujetos de edades, 10, 15, 20, 25, cogemos los dos sujetos centrales y hacemos la media aritmética entre ambos.
Propiedad: robustez. Sólo tiene en cuenta la posición de los valores en la muestra y por tanto tiene mucho mejor comportamiento que la media cuando hay observaciones extremas.

MODA (VARIABLES CUALITATIVAS)
Valor con mayor frecuencia (que más veces se repite). Si se repiten dos números, es dimodal o mas números multimodal.
Si hay más de una se dice que la muestra es bimodal (dos modas) o multimodal (más de dos modas).
Se puede calcular para cualquier tipo de variable.
Si los datos están agrupados, se habla de clase modal y corresponde al intervalo en el que el cociente entre la frecuencia relativa y la amplitud es mayor (hi/ci). Donde la frecuencia absoluta sea mayor.






Por otro lado, encontramos las medidas de posición , en las que se presentan:

Cuantiles:

Se calculan para variables cuantitativas y, al igual que la mediana, sólo tienen en cuenta la posición de los valores en la muestra.

Los cuantiles más usuales son los percentiles, los deciles y los cuartiles, según dividan la muestra ordenada en 100, 10 ó 4 partes, respectivamente.

-          Percentiles:
o   Dividen la muestra ordenada en 100 partes.
o   El percentil “i” (Pi), es aquél valor que, ordenadas las observaciones en forma creciente, el i% de ellas son menores que él y el (100-i)% restante son mayores.
o   Para buscar la posición de un percentil en una serie de datos agrupados, buscamos el intervalo en el que la frecuencia relativa acumulada (Hi) sea superior al valor del percentil.
o   El valor del P50 corresponde al valor de la mediana.

-          Deciles:
o   Dividen la muestra ordenada en 10 partes.
o   El decil “i” (Di), es aquél valor que, ordenadas las observaciones en forma creciente, el i/10% de ellas son menores que él y el (100-i)/10% restante son mayores.
o   El valor del D5 corresponde al valor de la mediana y, por tanto, al del P50.
-          Cuartil:
o   Dividen la muestra ordenada en 4 partes.
o   El Q1, primer cuartil indica el valor que ocupa una posición en la serie numérica de forma que el 25% de las observaciones son menores y que el 75% son mayores.
o   El Q2, segundo cuartil indica el valor que ocupa una posición en la serie numérica de forma que el 50% de las observaciones son menores y que el 50% son mayores. Por tanto, el Q2 coincide con el valor del D5, con el valor de la mediana P50.
o   El Q3, tercer cuartil indica el valor que ocupa una posición en la serie numérica de forma que el 75% de las observaciones son menores y que el 25% son mayores.
o   El Q4, cuarto cuartil indica el valor mayor que se alcanza en la serie numérica.

Por consiguiente, trataremos las medidas de dispersión, en la que la información aportada por las medidas de tendencia central es limitada. A raíz de aquí podemos encontrar:

Rango o recorrido: diferencia entre el mayor y el menor valor de la muestra lXn-X1l (valor absoluto).

Desviación media: media aritmética de las distancias de cada observación con respecto a la media de la muestra.

Varianza: expresa la misma información en valores cuadráticos:

Recorrido intercuartílico: diferencia entre el tercer y el primer cuartil = lQ3-Q1l

Coeficiente de variación: es una medida de dispersión relativa (adimensional) ya que todas las demás se expresan en la unidad de medida de la variable. Nos sirve para comparar la heterogeneidad de dos series numéricas con independencia de las unidades de medidas.

Por último, trataremos las distribuciones normales, que en estadísticas se llama distribución de Gauss o distribución gaussiana, a una de las distribuciones de probabilidad de variable continua que con más frecuencia aparece en fenómenos reales. Es Distribución de probabilidad mas frecuente con variables continuas, por ejemplo, altura, peso, niveles de colesterol…

Las distribuciones normales en un histograma aparece una especie de Campana, por eso la campana de Gauss. Y es simétrica respecto de los valores de posición central, es decir que la moda va a coincidir con la media y la mediana.

La gráfica de su función de densidad tiene una forma acampanada y es simétrica respecto de los valores posición central (media, mediana y moda, que coinciden en estas distribuciones). Es simetrica dejando la mitad de los valores por debajo del punto maximo y la mitad de los valores por encima.

Esta curva se conoce como campana de Gauss.Una distribución normal sigue estos principios básicos: si al valor de la media le restamos y le sumamos una desviación típica, si la serie numérica siguiera una distribución normal (como el colesterol). Dice que el 68.25% de las observaciones se va a sumar entre los valores de la suma y la resta de la media a una desviación típica. Estas datos varían si sumamos una, dos o tres desviaciones típicas.
-          S 68,26% de las observaciones.
-           2xS95,45% de las observaciones.
-           3xS 99,73% de las observaciones.

ASIMETRÍAS Y CURTOSIS
La asimetría es al lado contrario al que vemos el pico (la moda), es decir si vemos el pico hacia la derecha la asimetría es a la izquierda, y si la moda esta a la izquierda la asimetría esta hacia la derecha.

Coeficiente de asimetría de una variable:Grado de asimetría de la distribución de sus datos en torno a su media, cuanto mas asimétrica sea, valores mas diferentes encontraremos. Es adimensional 

Asimetrías:

Los resultados pueden ser los siguientes:
-          g1=0 (distribución simétrica; existe la misma concentración de valores a la derecha y a la izquierda de la media).
-          g1>0 (distribución asimétrica positiva; existe mayor concentración de valores  a la derecha de la media que a su izquierda).
-          g1<0 (distribución asimétrica negativa; existe mayor concentración de valores a la izquierda de la media que a su derecha).

Curtosis o apuntamiento de la curva.

No tiene relación con la simetría. Coeficiente de apuntamiento o curtosis de una variable, sirve para medir el grado de concentración de los valores que toma en torno a su media. Los datos se acumulan mucho, mientras mas se acumulen, mas apuntada esta la curva.
Se elige como referencia una variable con distribución normal, de modo que para ella el coeficiente de curtosis es 0.
Los resultados pueden ser los siguientes:
-          g2=0 (distribución mesocúrtica o normal). Presenta un grado de concentración medio alrededor de los valores centrales de la variable (el mismo que presenta una distribución normal). Presentan un grado de concentración medio a los  valores de la media.
-          g2>0 (distribución leptocúrtica). Presenta un elevado grado de concentración alrededor de los valores centrales de la variable.
-          g2<0 (distribución platicúrtica). Presenta un reducido grado de concentración alrededor de los valores centrales de la variable.
Para poder explicarlo de manera mas adecuada os adjunto un enlace explicativo: https://www.youtube.com/watch?v=9-nRaVKs5No



 Espero que estos datos os resulten muy beneficiosos, ya vamos acabando el temario de Estadísticas!!