Guia essencial de funcions R per a anàlisi de dades

Clasificado en Economía

Escrito el en catalán con un tamaño de 6,54 KB

1. Exploració i gestió de dades

Aquestes funcions s'utilitzen per conèixer el format de les variables, netejar la base de dades i transformar dades:

  • class(): Esbrina el format de les variables (numèrica, factor, etc.).
  • is.numeric(): Comprova si un objecte és numèric.
  • is.character(): Comprova si un objecte és de tipus text.
  • as.numeric(): Converteix un objecte en un número.
  • as.character(): Converteix un objecte en una cadena de text.
  • rename(): Canvia el nom de les columnes o variables.
  • mutate(): Crea noves variables o modifica les existents.
  • fct_recode(): Reanomena les categories d'un factor (dins de mutate).
  • case_when(): Crea variables segons múltiples condicions complexes.
  • ifelse(): Aplica una condició simple per crear o modificar dades.
  • colSums(is.na(dades)): Compta quants valors perduts (NA) hi ha a cada columna.
  • factor() / levels(): Defineix l'ordre de les categories en variables ordinals i mostra les categories existents.
  • scale(): S'utilitza per estandarditzar variables.
  • cbind(): Uneix diferents vectors o variables per columnes.
  • inner_join(), left_join(), right_join(), full_join(): Funcions per unir taules basant-se en una columna comuna (clau).

2. Estadística descriptiva (univariada i bivariada)

Comandaments per calcular freqüències, mesures de tendència central, de posició i de dispersió:

  • table(): Crea taules de freqüències absolutes o taules de contingència si s'usen dues variables.
  • prop.table(): Converteix les freqüències en proporcions o percentatges.
  • addmargins(): Afegeix els totals marginals (files i columnes) a una taula de contingència.
  • summary(): Proporciona un resum estadístic ràpid (mínim, quartils, mitjana, màxim).
  • mean(): Calcula la mitjana aritmètica. L'argument na.rm = TRUE serveix per ignorar els valors perduts.
  • median(): Calcula la mediana.
  • round(): Arrodoneix un valor als decimals indicats.
  • quantile(): Calcula els quantils o percentils indicats.
  • range(): Retorna el valor mínim i el màxim d'un conjunt de dades.
  • IQR(): Calcula el rang interquartílic (Q3−Q1).
  • var(): Calcula la variància.
  • sd(): Calcula la desviació típica o estàndard.
  • sum() / cumsum(): Calcula la suma total o la suma acumulada dels valors.
  • count(): Calcula freqüències, permetent obtenir absolutes, relatives i acumulades en una sola operació amb tidyverse.
  • group_by() + summarize(): Agrupa les dades per categories i calcula estadístics per a cada grup.

3. Visualització gràfica

Funcions per crear representacions visuals de les dades:

  • barplot(): Crea diagrames de barres per a variables categòriques.
  • pie(): Genera gràfics circulars (de pastís).
  • hist(): Crea histogrames per visualitzar la distribució de variables numèriques.
  • boxplot(): Crea diagrames de caixa i bigotis. Permet comparar grups usant la sintaxi variable_numèrica ~ variable_categòrica.
  • plot(): Genera gràfics de dispersió bàsics per a dues variables numèriques.
  • ggplot2 / geom_histogram(): Paquet avançat i funció específica per crear gràfics més complexos i estètics.

4. Tests estadístics i relació

Comandaments per analitzar l'associació i significació estadística entre variables:

  • chisq.test(): Realitza el test Chi-quadrat d'independència per a variables categòriques.
  • cramer_v() (paquet rstatix): Calcula la força de l'associació per a variables nominals.
  • assocstats() (paquet vcd): Calcula múltiples estadístics d'associació (Chi-quadrat, Phi, V de Cramer) d'una sola vegada.
  • GKgamma() (paquet vcdExtra): Calcula el coeficient Gamma per a l'associació entre variables ordinals.
  • cov(): Calcula la covariància entre dues variables numèriques.
  • cor(): Calcula el coeficient de correlació de Pearson. Inclou arguments com use = "complete.obs" per gestionar els NA.
  • cor.test(): Realitza un test de correlació per determinar si la relació és significativa.
  • t.test(): Compara les mitjanes entre dos grups (Test t de Student o de Welch).
  • wilcox.test(): Test no paramètric de Mann-Whitney per comparar grups quan no hi ha normalitat o hi ha outliers.
  • var.test(): Compara si les variàncies de dos grups són iguals (Test F).
  • leveneTest() (paquet car): Una alternativa robusta per comprovar la igualtat de variàncies abans d'un t-test.

5. Gestió de dades, vectors i transformació

Gestió de dades i vectors

  • diff(): Calcula les diferències entre valors consecutius d'un vector.
  • max(): Retorna el valor màxim d'un conjunt de dades.
  • is.na(): Funció específica per detectar valors perduts (TRUE/FALSE).
  • library(): Comandament per carregar paquets com rstatix, vcd, vcdExtra o car.

Transformació de formats (Reshaping)

  • pivot_wider(): Converteix dades de format llarg a format ample.
  • pivot_longer(): Converteix dades de format ample a format llarg.

Detalls tècnics en càlculs

  • na.rm = TRUE: Argument crucial dins de funcions com mean() per eliminar els NA abans de fer el càlcul.
  • use = "complete.obs" i use = "pairwise.complete.obs": Arguments per a la funció cor() que determinen com gestionar els valors perduts en matrius de correlació.

Entradas relacionadas: