L'importance d'améliorer la qualité des données à la source | Ordinateur hebdomadaire

featured image

Le Royaume-Uni peut blâmer ses mauvaises données d’immigration sur la Hongrie, l’un des huit pays qui ont rejoint l’Union européenne en 2004. Contrairement à la plupart des pays de l’UE existants, le gouvernement britannique a autorisé ses citoyens à se déplacer et à travailler sans restrictions, s’attendant à ce que 5 000 à 13 000 personnes arrivent. chaque année. Mais il s’agissait d’une sous-estimation massive, provoquant des accusations selon lesquelles l’immigration était hors de contrôle et contribuant sans doute à la sortie de la Grande-Bretagne de l’UE.

Sur la base des résultats du recensement de 2021, le pays qui a envoyé le plus de personnes au Royaume-Uni était la Pologne, suivie de la Roumanie. Mais la Hongrie abrite la compagnie aérienne à bas prix Wizz Air, qui, dans le cadre de la réduction des coûts, a tendance à utiliser des aéroports plus petits tels que Luton, Birmingham et Sheffield Doncaster.

Toujours pour réduire les coûts, l’enquête internationale sur les passagers menée par l’Office for National Statistics (ONS) à l’époque s’est concentrée sur Heathrow, Gatwick et Manchester. En conséquence, il n’a pas remarqué un nombre croissant d’Européens de l’Est utilisant des vols économiques gérés par Wizz Air et d’autres.

Georgina Sturge, statisticienne pour le service de recherche de la Bibliothèque de la Chambre des communes, met en lumière l’épisode dans son nouveau livre, Mauvaises données, comme exemple de la manière dont la collecte de données peut mal tourner. L’enquête auprès des passagers avait été mise en place dans les années 1960, lorsque beaucoup moins de personnes voyageaient à l’étranger, plus quittaient définitivement le Royaume-Uni qu’elles n’y arrivaient, et la plupart des gens avaient besoin de visas.

“Avant, les gens n’avaient pas l’habitude de voyager en masse de Poznań à Doncaster”, explique Sturge. “Malheureusement pour les statisticiens, qui n’avaient même pas posté quelqu’un là-bas pour faire l’enquête à l’époque, c’est exactement ce que les gens ont commencé à faire.”

Sturge affirme que le Royaume-Uni dispose d’excellentes données officielles dans certains domaines, notamment la santé, les statistiques sur les accidents de la circulation et une grande partie de la production de l’ONS. L’Office for Statistics Regulation tient à jour une liste de statistiques nationales approuvées qu’elle décrit comme l’étalon-or.

“Mais en fin de compte, si on nous pose une question ou si nous devons produire du matériel d’information sur quelque chose et qu’il existe des données qui semblent fiables à distance, nous finirons à peu près par les utiliser”, dit-elle à propos de son travail pour les députés. et leur personnel. “De notre point de vue, il s’agit d’expliquer les mises en garde.” Cela signifie qu’il faut réfléchir à l’origine des données, à la manière dont elles sont collectées et dans quel but, en tenant compte des processus humains impliqués plutôt que de la simple question technique de s’en procurer.

Crise de réplication

Les parlementaires ne sont pas les seuls à être avides de données, ni trop pointilleux sur ce qu’ils consomment. Ces dernières années, plusieurs domaines scientifiques ont été menacés par une crise de réplication, où les résultats de recherche publiés dans des revues à comité de lecture ne peuvent pas être reproduits par d’autres répétant le travail, dans certains cas parce que les données contiennent des erreurs ou sont truquées.

Les chercheurs qui s’appuient sur ces données de recherche peuvent constater que leur travail est miné, mais le risque peut être atténué en utilisant des services qui effectuent des contrôles de fiabilité sur les documents. Le journaliste médical et universitaire Ivan Oransky a cofondé Retraction Watch, une base de données d’articles scientifiques qui ont été retirés. Ses données sont utilisées par les éditeurs et les entreprises pour vérifier les références via des logiciels de gestion bibliographique, notamment EndNote, Papers et Zotero, ainsi que le service de bibliothèque numérique Third Iron. « Nous serions ravis de travailler avec d’autres personnes et d’intégrer notre base de données dans les systèmes de gestion des manuscrits utilisés par les éditeurs », déclare-t-il.

Cependant, ajoute-t-il, le plus gros problème réside dans les articles et les données inexacts qui n’ont pas été rétractés, ce qui justifie l’utilisation de services de révision post-publication tels que PubPeer, dont il est directeur bénévole. Plus généralement, il ajoute que les chercheurs sont bien avisés de suivre le proverbe russe, “faire confiance, mais vérifier”, adopté par l’ancien président américain Ronald Reagan lors des pourparlers de désarmement nucléaire avec l’Union soviétique.

Les chercheurs doivent s’efforcer d’obtenir et d’analyser les données originales avant de s’y fier pour un projet ou d’autres recherches. « Cela peut sembler inefficace, mais c’est bien mieux que d’être pris au dépourvu lorsqu’un projet est beaucoup plus avancé », déclare Oransky.

Une autre approche consiste à améliorer la classification des données scientifiques, en particulier celles contenues dans le texte. Neal Dunkinson, vice-président des solutions et des services professionnels pour la société d’analyse sémantique SciBite, affirme que le mot “hérisson” dans un article sur la génétique peut faire référence au gène sonic hedgehog qui aide à contrôler la façon dont les corps se développent à partir d’embryons, nommé d’après le personnage du jeu vidéo, ou il peut faire référence au petit mammifère épineux en général.

SciBite, basé à Cambridge, qui a été racheté par l’éditeur scientifique néerlandais Elsevier en 2020, a développé un service pour automatiser les mentions de marquage de 40 000 gènes à des identités standard, rendant plus précises les recherches d’articles, de diapositives et de cahiers de laboratoire électroniques. Pour ce faire, il a construit des listes d’acronymes, de noms et d’orthographe alternatifs et de fautes d’orthographe courantes. En plus de l’appliquer au matériel existant, il offre une option en temps réel qui invite les chercheurs à ajouter des balises via des listes déroulantes ou l’équivalent d’un correcteur orthographique.

Dunkinson dit que les données de bonne qualité dans les sciences de la vie doivent être « justes » – trouvables, accessibles, interopérables et réutilisables. “Pour le moment, nous ne critiquons pas la qualité des informations écrites – il s’agit de la répétabilité dans le processus expérimental – mais dans quelle mesure ces informations sont-elles utilisables, sont-elles correctement étiquetées, sont-elles stockées correctement, les gens savent-ils où elles se trouvent, sont-elles dans les bons formats », dit-il.

Chaîne de dépendance dans l’audit financier

L’audit financier, comme la plupart des recherches scientifiques, s’appuie sur les données d’autres personnes. Les organisations sont responsables de leurs comptes, mais les auditeurs doivent extraire les données afin de pouvoir vérifier leur exactitude et leur intégrité. Engine B, société de technologie d’audit basée à Londres, a travaillé avec l’Institute of Chartered Accountants d’Angleterre et du Pays de Galles et des cabinets d’audit pour créer un modèle de données commun capable d’extraire des informations à partir de progiciels de planification des ressources d’entreprise communs.

Le responsable de l’audit et de l’éthique de l’entreprise, Franki Hackett, explique que le système utilise la connaissance des logiciels et des pratiques courantes pour présenter ce qu’il pense transformera correctement un fichier afin qu’il puisse être chargé dans ce modèle commun, mais il reste sage d’inclure des vérifications humaines. “Vous pouvez sortir l’humain de la boucle, mais lorsque vous le faites, vous voyez assez souvent des erreurs de fidélité, ou une mauvaise traduction des données ou une transformation et un chargement inappropriés”, dit-elle. “Le maintien d’un bon équilibre entre la machine et l’être humain est un élément essentiel de cette étape de la qualité des données.”

S’il a traité une version précédente, le système du moteur B signale tout changement dans la structure des données, comme les nouveaux champs. Hackett dit que les organisations ont tendance à être faibles dans l’examen des processus de données après leur mise en place, ce qui signifie que de tels changements sont manqués. “Une mentalité de ‘si ce n’est pas cassé, ne le répare pas’ peut passer à côté de cette rupture rampante”, dit-elle.

Les auditeurs qui s’efforcent de décider s’ils peuvent vérifier l’exactitude et l’exhaustivité des registres financiers d’une organisation comparent souvent deux ensembles de données enregistrant les mêmes choses, comme le grand livre général avec les détails de toutes les transactions et la balance générale qui résume les débits et les crédits. Ceux-ci doivent correspondre, mais il est courant de trouver des écarts tels que des dates différentes pour les transactions, ce qui peut indiquer des contrôles médiocres. Hackett dit qu’elle a vu des professionnels de la finance senior coller leurs noms d’utilisateur et mots de passe sur leurs moniteurs pour que d’autres les utilisent, risquant une fraude pure et simple, mais faisant également des erreurs plus probables – et des dates différentes dans les deux ensembles de données peuvent indiquer des tentatives de correction de ces erreurs.

De la même manière, grâce à des recherches universitaires sur la transparence fiscale, Hackett a découvert que les données nationales qu’une directive européenne oblige certaines grandes entreprises à publier ne correspondent souvent pas aux chiffres mondiaux. Les paramètres des données nationales requises sont mal définis, dit-elle : “Ils peuvent produire quelque chose qui est fondamentalement inutilisable, un non-sens qui est souvent un exercice de relations publiques.” Cela démontre la nécessité de savoir exactement à quelles questions la collecte de données tente de répondre.

Waseem Ali, directeur général de l’entreprise de formation en conseil axée sur la diversité Rockborne, a précédemment travaillé en tant que directeur des données pour le marché de l’assurance Lloyds de Londres et responsable de l’analyse pour le fournisseur de soins de santé Virgin Care. Pour les assureurs, de mauvaises données peuvent signifier des primes mal tarifées, mais dans le domaine de la santé, cela peut signifier ne pas fournir de conseils potentiellement vitaux.

“Il y a de fortes chances que j’aie une sorte de maladie cardiaque, en raison de mes antécédents familiaux et de mon appartenance ethnique”, déclare Ali. “Le fait d’avoir les bonnes données de qualité sur moi permet aux prestataires de soins de santé d’intervenir plus tôt, afin qu’ils puissent s’assurer qu’une personne comme Waseem va régulièrement au gymnase et mange correctement.” En plus d’être dans l’intérêt des patients, le travail prédictif basé sur les données pourrait réduire les coûts du système de santé en réduisant le nombre d’interventions majeures ultérieures.

Ali dit que les organisations peuvent chercher à améliorer la qualité des données en comprenant son parcours de bout en bout et en se concentrant sur le matériel le plus critique pour l’entreprise. Des améliorations peuvent être apportées grâce à des changements simples tels que la normalisation de la façon dont les équipes calculent les marges bénéficiaires et l’expérience des clients afin que celles-ci puissent être correctement comparées. « J’ai été dans des organisations où la même statistique est rapportée avec des chiffres différents en raison de la façon dont elle est interprétée », dit-il.

Anthony Scriffignano, scientifique en chef des données chez Dun & Bradstreet, une société basée en Floride qui publie des données sur les entreprises depuis deux siècles, voit quatre types de qualité des données : l’exactitude, l’exhaustivité, l’actualité et la véracité. L’exhaustivité et l’actualité sont relativement faciles à vérifier, bien qu’un champ vide puisse signifier que les données n’existent pas plutôt qu’elles ont été manquées – par exemple parce qu’une entreprise n’a pas de numéro de téléphone – et les données collectées aujourd’hui peuvent avoir été créées ou mises à jour quelque temps auparavant.

La vérification de la précision est plus difficile. Dans certains cas, Dun & Bradstreet peut s’appuyer sur des documents officiels, mais s’il n’y a pas de source faisant autorité, “cela devient un peu un art”, explique Scriffignano. Il peut tenir compte de la fiabilité de l’organisation qui fournit les informations et si les données numériques se situent dans des plages probables, bien que ces dernières doivent l’être. Il peut sembler peu probable qu’un fournisseur de déménagement et d’entreposage ait plus de cinq siècles, mais comme il est indiqué sur ses camions, la Shore Porters Society d’Aberdeen a été fondée en 1498. La clé est d’avoir des processus de vérification rigoureux. « Vous ne pouvez pas vous en tirer comme ça », dit-il.

Le plus difficile des quatre est la véracité. Scriffignano souligne que «la vérité, toute la vérité et rien que la vérité» peut être trois choses différentes, la première brisée par le mensonge, la seconde brisée par omission et la troisième remplie uniquement en étant entièrement véridique.

Il existe des moyens de vérifier qu’un ensemble de données satisfait les trois, comme l’analyse statistique de sa distribution. Si un graphique d’un ensemble de données ressemble normalement à une courbe en cloche avec un point haut au milieu et des côtés effilés, mais n’inclut à la place que le milieu haut, cela indique que certaines données sont exclues – la vérité mais pas toute la vérité . Dun & Bradstreet a vu des données sur les faillites déformées pendant la pandémie de Covid-19, car les plus petites ont été manquées ou non signalées.

Malgré toutes les façons dont les données peuvent être testées, Scriffignano affirme que les plus gros problèmes sont causés par les organisations qui ingèrent involontairement des données qui ont des problèmes inconnus. « En tant que consommateur de données, selon ce que vous en faites, vous devriez probablement réfléchir à l’endroit d’où vous les obtenez et à la façon dont vous savez que vous leur faites confiance », dit-il.

Read more Tech News in French

Source