Adatminőség-ellenőrzés · piackutatási adatbázis

Audit-jegyzőkönyv
bp_sulyozott_lak.SAV

Struktúra- és adatminőség-vizsgálat összefoglalója: rekord- és változószám, súlyozás módja, a tartalmi kérdésblokkok bontása, valamint az azonosított adatminőségi kockázatok.

forrás: /mnt/user-data/uploads/bp_sulyozott_lak.SAV  ·  SPSS .sav, n=2000
Dióhéjban
Rekordok száma
2 000
kitöltött kérdőív
Változók (oszlopok) száma
657
~479 tartalmi jelölt · ~178 technikai
Súlyozás
van
suly · nem×kor, kor×végzettség, telep.-régió szerint
Technikai / metaadat mezők
~27%
+ további ~31% felirat nélküli, azonosítatlan oszlop
Tartalmi témakörök bontása

Kattints egy sorra a témakörhöz tartozó változók listájának megnyitásához, majd egy változóra az alapstatisztikák megjelenítéséhez.

Témakör Lefedett terület Kérdések Relatív méret
A „kérdés” önálló kérdésblokkot jelöl — egy többválasztós (multi-select) kérdés minden alopciója egy kérdésnek számít. A legördülő változólista ennek megfelelően oszlop-szinten (finomabb bontásban) sorolja fel a tételeket. A táblázat nem tartalmazza a ~200, felirat nélküli, azonosítatlan oszlopot (l. lentebb az adatminőségi problémák között).

⚠ Azonosított adatminőségi kockázatok

A második vizsgálati kör Python-számításokkal validált eredményei. Kattints egy sorra a részletekért.

Adatminőségi audit
01 / 05 Kritikus

Konstans / majdnem konstans oszlopok

78 tartalmi (de felirat nélküli) oszlopnál — a BNK1, MOB2, TELKO_1, BANK_1 és NETBANK blokkokban — a válaszok 95–99,9%-a egyetlen (0,0) kategóriába esik. Ezeknek önmagukban nincs elemzési hasznuk, és mivel nincs SPSS-felirat, nem dönthető el, hogy ez valódi ritkaság vagy hibás kódolás.

Érintett oszlopok
összesen 78 db
legszélsőségesebb (BNK1_14) 99,9%
02 / 05 Figyelmeztetés

Hiányzó adatok — indokolt vs. problémás

5 db OLDL-oszlop (OLDL71, 75, 77, 79, 84) 100%-ban hiányzik, miközben a blokk többi 92 oszlopánál az átlagos hiányzás csak 8,77% — ez technikai hibára utal. Ezzel szemben a szűrt kérdéseknél (pl. TURIZM6_7, DOHANY2_7) a magas hiányzás indokolt.

Kiugró eset
OLDL blokk átlagos hiányzása 8,77%
5 kiugró OLDL-oszlop 100%
03 / 05 Rendben

Duplikátum-ellenőrzés — ETTEREM6/7/8 „_uj” mezők

A kódból pontosan számolt eredmény szerint ahol mindkét változatban (eredeti és „_uj”) van érvényes érték, ott 100%-ban egyezik az adat. Az „_uj” mező nem eltérő újrakódolás, hanem az eredeti szigorú részhalmaza — több rekordnál egyszerűen hiányzik.

Egyezés érvényes rekordoknál
ETTEREM6_1 (n=1347 közös) 100%
eredetiben van, _uj-ban hiányzik 524 sor
fordítva (_uj-ban van, eredetiben nincs) 0 sor
Pontosítás: a korábbi, kevésbé precíz becslés 73–82%-os egyezést jelzett — ez tévedés volt, mert a hiányzó értékeket eltérésként kezelte. A pontos, kódolt vizsgálat 100%-os adategyezést igazol az érvényes rekordokon.
04 / 05 Figyelmeztetés

Súly-változó (suly) extremitása

A suly terjedelme 0,395–2,497 (átlag=1,000). A felső 1%-ba eső rekordok súlya kiugróan magas, és aránytalanul nagy hatással vannak egy egyszerű (súlyozott) átlagszámítás eredményére.

Kiugró súlyú rekordok hatása
érintett rekordok (felső 1%) 20 db
súlytartomány ezeknél 2,08 – 2,50
életkor-átlag változása kizárásukkal 0,357 év
Kish design effect / hatékonyságvesztés 1,119 / 10,6%
05 / 05 Figyelmeztetés

Skála-konzisztencia — DLS21–DLS29

A DLS21–DLS27 (7 tétel) mindegyike azonos irányítottságú 4-fokú skála, fordított kódolású tétel nincs közöttük. A DLS28 (11 kategóriás gyakorisági skála) és DLS29 (3 kategóriás skála) viszont teljesen más struktúrájú — index- vagy összegképzésnél külön kezelendők.

Skála-összetétel
konzisztens 1–4 Likert-tétel 7 db (DLS21–27)
eltérő struktúrájú tétel 2 db (DLS28, DLS29)