Uitgegeven op

By

Eerder in deze serie besprak ik vier veelvoorkomende uitdagingen die ik regelmatig tegenkom bij projecten voor geospatiale integratie. Na in het vorige artikel het belang van kennis van je data te hebben behandeld, ga ik nu in op de tweede uitdaging: het creëren van op standaarden gebaseerde metadata.

In een van mijn vorige projecten vroeg ik collega's of ze metadata hadden, en velen antwoordden "ja". Ik ontdekte echter al snel dat deze "metadata" bestonden uit bestanden in ad-hocformaten, die alleen ontdekkingsmetadata bevatten, of door software gegenereerde output met statistieken over het bestand of het onderliggende model.

In het geospatiale domein zijn mensen over het algemeen meer vertrouwd met het concept van op standaarden gebaseerde metadata – metadata die voldoet aan vastgestelde standaarden zoals ISO 19115, INSPIRE, Dublin Core of DCAT – dan in veel andere wetenschappelijke disciplines.

Metadata is een hoeksteen van de FAIR-principes en helpt datasets vindbaar en toegankelijk te maken. Als metadata echter niet aan een standaard voldoet, is deze noch interoperabel, noch herbruikbaar.

Waarom op standaarden gebaseerde metadata belangrijk zijn

Het creëren van op standaarden gebaseerde metadata lijkt echter voor veel mensen nog steeds een lastige opgave. Dit kan te wijten zijn aan een gebrek aan tools die het opstellen van metadata ondersteunen, in combinatie met de perceptie dat metadata op zich ingewikkeld is.

Het helpt ook niet dat veel mensen metadata niet als bijzonder nuttig beschouwen, waardoor ze weinig motivatie hebben om tijd te investeren in het creëren ervan.

Ik denk dat het kiezen van het juiste metadata-schema hier ontzettend belangrijk is. Er is een optimale balans tussen het creëren van iets dat nog steeds nuttig is voor het project, en het voorkomen dat gebruikers overladen worden met te veel in te vullen velden.

In sommige gevallen kan de ontdekkingsmetadata alleen al voldoende zijn, bijvoorbeeld een paar velden zoals in de OGC API – Records atomic unit . In andere gevallen moet het mogelijk zijn om bepaalde informatie automatisch te extraheren, waardoor gebruikers slechts een handvol velden hoeven in te vullen.

Het doel moet zijn om zo min mogelijk handmatige invoer te vragen, terwijl de verstrekte informatie toch nauwkeurig en relevant blijft.

Immers, het enige dat nog erger is dan geen metadata hebben, is metadata van slechte kwaliteit hebben . Wanneer een systeem metadata van slechte kwaliteit verwerkt, levert het geen bruikbare informatie op, wat de perceptie versterkt dat metadata op zich weinig waarde heeft.

Metadata eenvoudiger maken

Helaas is het ecosysteem van tools voor het maken en bekijken van metadata nog niet zo "rijk" als het data-ecosysteem – een lacune die we naar mijn mening moeten aanpakken.

We kunnen gebruikers echter nog steeds helpen om eenvoudig op standaarden gebaseerde metadata te creëren, door workflows te vermijden waarbij ze rechtstreeks XML- of JSON-bestanden moeten aanleveren.

Een praktische aanpak is om een ​​enquêteformulier te verstrekken en gebruikers een klein aantal vragen over de gegevens te stellen, waarbij duidelijk wordt gemaakt dat ze voor elke nieuwe dataset een enquête moeten invullen.

Wanneer gebruikers veel datasets met repetitieve informatie beheren, kan een spreadsheet efficiënter zijn, omdat informatie eenvoudig kan worden gekopieerd en geplakt tussen meerdere records. Een ETL-proces kan deze gegevens vervolgens valideren, omzetten in machineleesbare metadata en uiteindelijk in het systeem importeren.

Werkproces voor het indienen van metadata voor het eMOTIONAL Cities-project

Het eMOTIONAL Cities-project bood gebruikers verschillende manieren om metadata in te dienen bij de Spatial Data Infrastructure (SDI), variërend van gebruiksvriendelijke interfaces, zoals enquêteformulieren, tot machinevriendelijke methoden (bijvoorbeeld POST-verzoeken).

De perceptie van metadata veranderen

Hoewel we het aantal metadataclienten kunnen en moeten vergroten en workflows moeten creëren waarmee gebruikers met bestaande tools metadata kunnen aanmaken, zal de perceptie van metadata als "niet relevant" een obstakel blijven voor de verdere verspreiding ervan.

Zoals we zien bij data zelf, zijn mensen bereid veel tijd en moeite te investeren in het produceren van hoogwaardige resultaten. We moeten dezelfde mentaliteit voor metadata stimuleren, en naar mijn ervaring kan dat alleen door middel van educatie en voorlichting, door de werkelijke waarde ervan aan te tonen.

Laatste blogs