Hvordan kan jeg rent teknisk sikre, at mine datasæt er repræsentative, når visse minoritetsgrupper er underrepræsenterede digitalt?

Når man arbejder med data, opstår der ofte et problem, hvis nogle grupper ikke er aktive på nettet. Det kaldes digital ulighed, og det kan gøre datasættet skævt. For at løse dette teknisk kan man bruge flere forskellige metoder.

En almindelig metode er oversampling. Her vælger man bevidst at inkludere flere eksempler fra de underrepræsenterede grupper, så deres stemme vejer tungere i den samlede analyse. En anden tilgang er vægtning, hvor man giver de eksisterende datapunkter fra minoritetsgrupper en højere statistisk værdi, så de matcher den virkelige befolkningssammensætning bedre.

Man kan også bruge syntetiske data. Det betyder, at man bruger matematiske modeller til at skabe kunstige datapunkter, der minder om de virkelige mennesker i de manglende grupper. Dette kan udfylde de huller, som den manglende digitale tilstedeværelse har efterladt.

Det er vigtigt at huske, at tekniske løsninger aldrig kan fjerne ulighed helt alene. Man skal altid være opmærksom på, at de data, man indsamler, blot er et billede af den digitale verden, som ikke nødvendigvis viser hele virkeligheden.