Guia essencial de funcions R per a anàlisi de dades
Clasificado en Economía
Escrito el en
catalán con un tamaño de 6,54 KB
1. Exploració i gestió de dades
Aquestes funcions s'utilitzen per conèixer el format de les variables, netejar la base de dades i transformar dades:
- class(): Esbrina el format de les variables (numèrica, factor, etc.).
- is.numeric(): Comprova si un objecte és numèric.
- is.character(): Comprova si un objecte és de tipus text.
- as.numeric(): Converteix un objecte en un número.
- as.character(): Converteix un objecte en una cadena de text.
- rename(): Canvia el nom de les columnes o variables.
- mutate(): Crea noves variables o modifica les existents.
- fct_recode(): Reanomena les categories d'un factor (dins de mutate).
- case_when(): Crea variables segons múltiples condicions complexes.
- ifelse(): Aplica una condició simple per crear o modificar dades.
- colSums(is.na(dades)): Compta quants valors perduts (NA) hi ha a cada columna.
- factor() / levels(): Defineix l'ordre de les categories en variables ordinals i mostra les categories existents.
- scale(): S'utilitza per estandarditzar variables.
- cbind(): Uneix diferents vectors o variables per columnes.
- inner_join(), left_join(), right_join(), full_join(): Funcions per unir taules basant-se en una columna comuna (clau).
2. Estadística descriptiva (univariada i bivariada)
Comandaments per calcular freqüències, mesures de tendència central, de posició i de dispersió:
- table(): Crea taules de freqüències absolutes o taules de contingència si s'usen dues variables.
- prop.table(): Converteix les freqüències en proporcions o percentatges.
- addmargins(): Afegeix els totals marginals (files i columnes) a una taula de contingència.
- summary(): Proporciona un resum estadístic ràpid (mínim, quartils, mitjana, màxim).
- mean(): Calcula la mitjana aritmètica. L'argument
na.rm = TRUEserveix per ignorar els valors perduts. - median(): Calcula la mediana.
- round(): Arrodoneix un valor als decimals indicats.
- quantile(): Calcula els quantils o percentils indicats.
- range(): Retorna el valor mínim i el màxim d'un conjunt de dades.
- IQR(): Calcula el rang interquartílic (Q3−Q1).
- var(): Calcula la variància.
- sd(): Calcula la desviació típica o estàndard.
- sum() / cumsum(): Calcula la suma total o la suma acumulada dels valors.
- count(): Calcula freqüències, permetent obtenir absolutes, relatives i acumulades en una sola operació amb tidyverse.
- group_by() + summarize(): Agrupa les dades per categories i calcula estadístics per a cada grup.
3. Visualització gràfica
Funcions per crear representacions visuals de les dades:
- barplot(): Crea diagrames de barres per a variables categòriques.
- pie(): Genera gràfics circulars (de pastís).
- hist(): Crea histogrames per visualitzar la distribució de variables numèriques.
- boxplot(): Crea diagrames de caixa i bigotis. Permet comparar grups usant la sintaxi
variable_numèrica ~ variable_categòrica. - plot(): Genera gràfics de dispersió bàsics per a dues variables numèriques.
- ggplot2 / geom_histogram(): Paquet avançat i funció específica per crear gràfics més complexos i estètics.
4. Tests estadístics i relació
Comandaments per analitzar l'associació i significació estadística entre variables:
- chisq.test(): Realitza el test Chi-quadrat d'independència per a variables categòriques.
- cramer_v() (paquet rstatix): Calcula la força de l'associació per a variables nominals.
- assocstats() (paquet vcd): Calcula múltiples estadístics d'associació (Chi-quadrat, Phi, V de Cramer) d'una sola vegada.
- GKgamma() (paquet vcdExtra): Calcula el coeficient Gamma per a l'associació entre variables ordinals.
- cov(): Calcula la covariància entre dues variables numèriques.
- cor(): Calcula el coeficient de correlació de Pearson. Inclou arguments com
use = "complete.obs"per gestionar els NA. - cor.test(): Realitza un test de correlació per determinar si la relació és significativa.
- t.test(): Compara les mitjanes entre dos grups (Test t de Student o de Welch).
- wilcox.test(): Test no paramètric de Mann-Whitney per comparar grups quan no hi ha normalitat o hi ha outliers.
- var.test(): Compara si les variàncies de dos grups són iguals (Test F).
- leveneTest() (paquet car): Una alternativa robusta per comprovar la igualtat de variàncies abans d'un t-test.
5. Gestió de dades, vectors i transformació
Gestió de dades i vectors
- diff(): Calcula les diferències entre valors consecutius d'un vector.
- max(): Retorna el valor màxim d'un conjunt de dades.
- is.na(): Funció específica per detectar valors perduts (TRUE/FALSE).
- library(): Comandament per carregar paquets com rstatix, vcd, vcdExtra o car.
Transformació de formats (Reshaping)
- pivot_wider(): Converteix dades de format llarg a format ample.
- pivot_longer(): Converteix dades de format ample a format llarg.
Detalls tècnics en càlculs
- na.rm = TRUE: Argument crucial dins de funcions com
mean()per eliminar els NA abans de fer el càlcul. - use = "complete.obs" i use = "pairwise.complete.obs": Arguments per a la funció
cor()que determinen com gestionar els valors perduts en matrius de correlació.