Pre-analyse van data
7 belangrijke vragen over Pre-analyse van data
Visueel voorbeeld: uitbijters geïllustreerd - 1
- Univariate uitbijters
- De vaste lijn laat het ‘werkelijke’ (populatie) gemiddelde zien
- De stippellijn illustreert waar het gemiddelde ligt dat berekend is op basis van de data, inclusief uitbijters.
- Het gemiddelde dat van de gehele dataset berekend wordt is geen goede weergave van het centrum van de verdeling
- Een onderzoeker die de uitbijters in de data laat, zal met een grove overschatting van het gemiddelde van de verdeling te maken hebben, en loopt het risico verkeerde conclusies te trekken
Transparant in rapportage – negeren en verwijderen van uitbijters
- Of je nu kiest voor verwijderen of ongemoeid laten van uitbijters, het is belangrijk om hierover transparant te zijn in je rapportage
- Voer bijvoorbeeld de analyse tweemaal uit; één keer met, en één keer zonder uitbijters
- Als de uitkomsten niet wezenlijk anders zijn, dan staat het de onderzoeker vrij om de uitbijters te negeren (dus te behouden) of te verwijderen
- Zolang in het verslag beschreven wordt dat er twee analyses gedaan zijn, of er verschillen waren of niet, en welke data gekozen zijn voor verdere analyse, dan is dat vaak een acceptabele oplossing
Univariate uitbijters – identificeren van uitbijters
- De steekproefverdeling is nagenoeg normaal verdeeld
- De steekproefverdeling is scheef verdeeld
- Hogere cijfers + sneller leren
- Niets twee keer studeren
- 100% zeker alles onthouden
Imputatiemethode – omgaan met ontbrekende gegevens
- De imputatiemethode probeert redelijke schattingen voor ontbrekende gegevens te vinden en vervangt de ontbrekende gegevens door deze schattingen
- Dit is vooral handig wanneer het percentage ontbrekende gegevens laag is
- Als het percentage ontbrekende gegevens hoog is, dan wordt het resultaat van imputeren onbetrouwbaar
Missings Not at Random (MNAR) – missing proces
- De categorie MNAR is van toepassing wanneer de ontbrekende gegevens een structuur hebben of we simpelweg niet weten waarom waarden ontbreken.
- Hierbij wordt aangenomen dat de missings niet willekeurig zijn en beïnvloed worden door processen die niet geobserveerd zijn, het missing proces wordt dan nonignorable genoemd.
- Met andere woorden:
- het missing proces is afhankelijk van (nog) niet geobserveerde metingen of onbekende karakteristieken van de respondenten.
- Men moet de ontbrekende gegevens eerst nauwkeurig modelleren om een goede data-analyse te kunnen doen.
- Het simpelweg verwijderen van waarnemingen met ontbrekende gegevens die MNAR zijn, kan resulteren in een model met vertekening.
Verwijderen van ontbrekende waarden – omgaan met ontbrekende gegevens
- Er zijn in principe drie methoden voor het verwijderen van gegevens bij het omgaan met ontbrekende gegevens:
- Lijstgewijs verwijderen (complete case analysis)
- Paarsgewijs verwijderen
- Variabelen volledig verwijderen
Variabelen verwijderen – verwijderen van ontbrekende waarden
- Als voor heel veel respondenten (bijvoorbeeld meer dan 60%, afhankelijk van de grootte van de dataset) de gegevens voor een bepaalde variabele ontbreken, dan kan het verstandig zijn om deze variabelen in zijn geheel te verwijderen, mits deze niet essentieel is voor de analyse
De vragen op deze pagina komen uit de samenvatting van het volgende studiemateriaal:
- Een unieke studie- en oefentool
- Nooit meer iets twee keer studeren
- Haal de cijfers waar je op hoopt
- 100% zeker alles onthouden















