Skip to contents

[Experimental]

Funksjonen beregner antall og andel missing med og uten ukjente verdier. Først beregnes antall og andel missing NA-verdier direkte. I tillegg erstattes ukjente verdier oppgitt i ukjent_datasett med NA før antall og andel missing beregnes på nytt. Resultat for begge beregninger returneres i utdata.

Usage

beregn_kompletthet_datasett_med_ukjent(data, ukjent_datasett)

Arguments

data

Datasett det skal beregnes kompletthet for.

ukjent_datasett

Datasett med oversikt over hvilke verdier og variabler som skal erstattes med NA. Se eksempel for detaljer om struktur på ukjent_datasett.

Value

Tibble med antall observasjoner, antall og andel NA, både med og uten erstatning av ukjente verdier for hver variabel i inndata.

Examples

library(tibble)

# Datasett det skal beregnes kompletthet for
d_eksempel = tibble(
  pas_id = c(1L, 2L, 3L, 4L, 5L, 6L),
  sykehus = c("HUS", "HUS", "SUS", "SUS", "SUS", "OUS"),
  vekt = c(60L, NA_integer_, 100L, NA_integer_, 99L, -1L),
  vekt_2 = c(55L, NA_integer_, 99L, -1L, NA_integer_, 50L),
  hoyde = c(1.52, NA_real_, 1.89, 2.15, NA_real_, 99.9),
  symptom = c("svett", "klam", NA_character_, "trøtt", "vet ikke", "Ukjent"),
  test_logisk = c(TRUE, FALSE, NA, NA, FALSE, TRUE)
)

# Oversikt over hvilke verdier som skal erstattes med NA for hvilke variabler.
ukjent_datasett = tibble(
  variabel = c(
    "pas_id", "sykehus", rep("vekt", 2), rep("vekt_2", 2),
    "hoyde", rep("symptom", 2), "test_logisk"
  ),
  ukjent_verdi_integer = c(
    NA_integer_, NA_integer_, 99, -1, 99, -1,
    NA_integer_, NA_integer_, NA_integer_, NA_integer_
  ),
  ukjent_verdi_real = c(
    NA_real_, NA_real_, NA_real_, NA_real_,
    NA_real_, NA_real_, 99.9, NA_real_, NA_real_, NA_real_
  ),
  ukjent_verdi_tekst = c(
    NA_character_, NA_character_, NA_character_,
    NA_character_, NA_character_, NA_character_, NA_character_,
    "vet ikke", "Ukjent", NA_character_
  )
)

# Beregner kompletthet
beregn_kompletthet_datasett_med_ukjent(
  data = d_eksempel,
  ukjent_datasett = ukjent_datasett
)
#> # A tibble: 7 × 6
#>   variabel    totalt_antall antall_na andel_na antall_na_med_ukjent
#>   <chr>               <int>     <int>    <dbl>                <int>
#> 1 pas_id                  6         0    0                        0
#> 2 sykehus                 6         0    0                        0
#> 3 vekt                    6         2    0.333                    4
#> 4 vekt_2                  6         2    0.333                    4
#> 5 hoyde                   6         2    0.333                    3
#> 6 symptom                 6         1    0.167                    3
#> 7 test_logisk             6         2    0.333                    2
#> # ℹ 1 more variable: andel_na_med_ukjent <dbl>