Oproep tot deelname
Samenvatting
In de steeds digitaler wordende wereld van vandaag is het consistent delen en begrijpen van data over organisaties en grenzen heen essentieel geworden. Een fundamentele vereiste voor effectieve datadeling is het gebruik van duidelijke en universeel begrijpelijke terminologie, bekend als "vocabulaires". Momenteel bestaat er geen algemeen geaccepteerde internationale standaard of uniforme aanpak voor het beheren en distribueren van deze vocabulaires via online diensten. Dit gebrek aan standaardisatie leidt tot verwarring, redundantie en inefficiëntie, omdat organisaties moeite hebben met het combineren, beheren en interpreteren van data uit meerdere bronnen. Om een belangrijk punt te benadrukken: hoewel we streven naar een universeel geaccepteerde standaard voor vocabulairediensten (d.w.z. de digitale diensten die toegang bieden tot vocabulaires), streven we expliciet niet naar één universele set vocabulaires. Sterker nog, het doel is juist om diversiteit te ondersteunen en hergebruik te bevorderen, wat uiteindelijk de interoperabiliteit verbetert.
Om deze uitdagingen aan te pakken, stelt het Open Geospatial Consortium (OGC) voor om een nieuwe internationale standaard te ontwikkelen – een "Vocabulary Service Standard" – die de manier waarop vocabulaires worden gedeeld, beheerd en gebruikt in diverse systemen zal vereenvoudigen. Deze standaard stelt consistente methoden vast voor het verkrijgen van toegang tot vocabulaire-informatie, het bijhouden van wijzigingen en het documenteren van bronnen en updates. Door vocabulaire-diensten te standaardiseren, streeft het OGC ernaar de interoperabiliteit te verbeteren, wat betekent dat verschillende systemen en organisaties elkaars data naadloos kunnen begrijpen en gebruiken, terwijl de complexiteit en kosten van data- en terminologiebeheer aanzienlijk worden verminderd.
De voorgestelde Vocabulary Service-standaard zal technische experts, beleidsmakers en organisaties ten goede komen doordat het duidelijkere communicatie mogelijk maakt, het beheer van gegevensbronnen verbetert en meer samenwerking en innovatie over sectoren en internationale grenzen heen stimuleert.
Introductie
Een vocabulairedienst is een digitale dienst die toegang biedt tot gestructureerde termensets – vocabulaires genaamd – die gebruikt worden om data consistent in alle systemen te beschrijven, categoriseren of annoteren. Deze vocabulaires kunnen gecontroleerde vocabulaires, taxonomieën, thesauri, ontologieën en codelijsten omvatten.
Met een woordenschatdienst kunnen gebruikers en systemen doorgaans:
- Ontdek woordenschatten die relevant zijn voor een domein of taak
- Toegang tot woordenschatinhoud in gestandaardiseerde formaten (bijv. SKOS, JSON-LD, RDF)
- Zoek en blader door termen, definities, relaties en metagegevens
- Identificatiegegevens (bijvoorbeeld URI's) voor specifieke termen oplossen om beschrijvingen op te halen die voor mens en machine leesbaar zijn
- Termen hergebruiken en ernaar verwijzen in hun eigen gegevens of metagegevens
- Versie en onderhoud vocabulaires in de loop van de tijd
Een vocabulairedienst streeft ernaar semantische interoperabiliteit te bevorderen – het vermogen van systemen om gegevens uit te wisselen met een eenduidige, gedeelde betekenis – door vocabulaires vindbaar, toegankelijk en bruikbaar te maken in verschillende domeinen en toepassingen. Ondanks dit belang bestaat er momenteel geen moderne standaard voor het delen van vocabulaires via API's, en geen enkele internationale standaardisatieorganisatie heeft een werkgroep die zich bezighoudt met deze lacune. Bestaande community-initiatieven weerspiegelen een gefragmenteerd landschap, met veel verschillende patronen voor hergebruik van vocabulaires. De volgende afbeelding illustreert de situatie. Patroon 1 integreert alle elementen die elders te vinden zijn in een copy-paste-reuse-benadering. Patroon 2 illustreert een hergebruik-via-matching-benadering, waarbij elementen in de ene repository worden gekoppeld aan elementen in een andere. Expliciete filters worden gebruikt in patroon 3, terwijl patroon 4 de klassieke mix laat zien van gedeeltelijk goedgekeurde vocabulaires, gedeeltelijke kopieën van bestaande vocabulaires en uiteindelijk geselecteerde opties die geen verband meer hebben met hun oorspronkelijke bronnen.
De verscheidenheid aan patronen vormt een belangrijk obstakel voor interoperabiliteit. Elke kopie van een vocabulaire brengt het risico met zich mee dat wijzigingen in het origineel niet worden opgemerkt of dat er aanpassingen in de kopieën worden aangebracht die niet te herleiden zijn tot het origineel. Wat nodig is, zijn canonieke vormen van herkomstmetadata en robuuste synchronisatiemechanismen ter ondersteuning van federatie en subsets in gedistribueerde systemen. Een standaard voor gefedereerde vocabulairediensten moet toegang, synchronisatie en subsetidentificatie consistent aanpakken. Bovendien zijn governance- en herkomstkaders essentieel om de integriteit en traceerbaarheid van vocabulaires te waarborgen. Gezien de geografische dimensies van veel vocabulaires wordt federatie bijzonder relevant voor OGC, en het afstemmen van deze diensten op andere OGC-API's zou de interoperabiliteit van het bredere OGC-ecosysteem versterken. Om aan deze behoeften te voldoen, wordt een voorstel gedaan om een OGC Standards Working Group op te richten om modellen voor vocabulairediensten te ontwikkelen en te testen en samen te werken met externe standaardisatiegroepen. Hiermee wordt de compatibiliteit met de RAINBOW-infrastructuur van OGC gewaarborgd en wordt de ontwikkeling van gebundelde, herkomstbewuste woordenschatdiensten ondersteund als onderdeel van een wereldwijd coherente open data-omgeving.
De volgende lijst toont de logica achter de geplande inspanning:
- Het delen van gegevens betekent het delen van het begrip van terminologie
- Woordenschatdiensten bieden toegang tot woordenschatten
- Er is geen geaccepteerde moderne servicestandaard voor het delen van vocabulaires via API
- Er is geen internationale standaardisatieorganisatie met werkgroepen die werken aan een standaard voor woordenschatdiensten
- Er vinden verschillende initiatieven plaats binnen communities of practice
- Het delen van woordenschat vereist vaak het verzamelen van informatie uit meerdere bronnen
- Grote, samengevoegde woordenschatten vereisen vaak de verklaring van ‘relevante subsets’ wanneer ze in meer specifieke contexten worden gebruikt.
- Federatie en subset vereisen canonieke vormen van herkomstmetadata en synchronisatie
- Gefedereerde vocabulaires vereisen standaardisatie van toegang, synchronisatie en identificatie van subsets van grotere vocabulaires.
- Er moeten regelingen voor bestuur en herkomst worden vastgesteld
- Federatie is in veel gevallen intrinsiek een geografische aangelegenheid; daarom heeft OGC een specifiek belang
- Federation Vocabulary-services, compatibel met andere OGC API's, breiden de kracht van OGC-compatibele ecosystemen uit.
- Het voorstel is om een OGC-werkgroep op te richten die ideeën kan testen en verbindingen kan leggen met andere relevante normalisatiegroepen.
Dit voorstel is bedoeld om het internationale bewustzijn van het probleem van gedeelde en hergebruikte woordenschatten te vergroten en een oplossing te creëren in de vorm van een gestandaardiseerde woordenschatdienst.
Achtergrond
In een steeds meer onderling verbonden digitaal ecosysteem speelt het gebruik van gemeenschappelijke terminologie, die op een gestandaardiseerde manier toegankelijk is via vocabulairediensten, een cruciale rol om ervoor te zorgen dat diverse systemen consistent met elkaar kunnen communiceren, informatie kunnen integreren en interpreteren. Naarmate gegevens worden uitgewisseld over organisatorische, nationale en disciplinaire grenzen heen, moet de betekenis van termen helder, nauwkeurig en interoperabel blijven. Vocabulairediensten bieden de mechanismen om gecontroleerde vocabulaires, taxonomieën, ontologieën en codelijsten te beheren, publiceren en onderhouden, die de basis vormen voor semantische interoperabiliteit. Zonder deze diensten zullen pogingen om datasets te harmoniseren, herbruikbare diensten te ontwikkelen of gefedereerde kennisystemen mogelijk te maken, gefragmenteerd, foutgevoelig en niet duurzaam zijn. Elke gebruiker van gegevens ondervindt de last van het vinden en interpreteren van informatie, zonder de middelen om eventuele onduidelijkheden op te lossen. Effectieve vocabulairediensten stellen verschillende actoren in staat om naar gemeenschappelijke concepten te verwijzen, de herkomst en evolutie van termen te volgen en machineleesbare interpretatie van gegevens te ondersteunen. Daarmee vormen ze een fundamenteel element van moderne open data-infrastructuren, FAIR-dataprincipes (Findable, Accessible, Interoperable, Reusable) en semantische webtechnologieën.
De uitdaging is echter dat de huidige stand van zaken op het gebied van woordenschatdiensten gefragmenteerd en ontoereikend is. Er is momenteel geen gestandaardiseerde woordenschatdienst die breed geaccepteerd of in de praktijk geïmplementeerd is. Er bestaan diverse initiatieven die verband houden met specifieke softwareplatforms en die inzicht kunnen bieden in hoe een echt interoperabele oplossing eruit zou kunnen zien.
Bekende vocabulairedatamodellen zijn onder andere SKOS (Simple Knowledge Organization System), OWL (Web Ontology Language) en RDFS (Resource Description Framework Schema), maar deze definiëren alleen de structuur en relaties binnen vocabulaires. Ze definiëren niet hoe een dienst die vocabulaires aanbiedt zich zou moeten gedragen of functioneren.
Een groot probleem is dat het "Web of Data", dat bedoeld was om sterk te vertrouwen op gedeelde vocabulaires, lastig te realiseren is, mede door het ontbreken van een gemeenschappelijk vocabulaire-servicemodel. Hierdoor wordt de interoperabiliteit, een fundamenteel principe, ernstig ondermijnd bij het werken met vocabulaires in verschillende systemen.
Voorwaarden
Bij analyse van de huidige situatie moeten we onderscheid maken tussen standaarden voor vocabulaires en standaarden voor vocabulairediensten. De W3C-standaarden, zoals SKOS, zijn solide en implementeerbaar voor vocabulairestructuren en kunnen als uitgangspunt dienen voor discussies (startpunten omdat ze een aantal essentiële functies missen, met name bij het gebruik van subsets van bestaande vocabulaires). Aan de andere kant bestaan er diverse ISO-standaarden. Deze ISO-richtlijnen zijn nuttig voor het ontwerpen van processen, maar vertalen zich niet naar service-API's of operationeel gedrag.
Het doel is om een servicebenadering te definiëren die onafhankelijk is van een specifiek softwareplatform. Hoewel veel Europese instellingen hetzelfde platform gebruiken, is vertrouwen op één backend-technologie niet de oplossing. In plaats daarvan is een standaard API- en gedragsdefinitie, ongeacht de implementatietechnologie, nodig om echte interoperabiliteit mogelijk te maken.
De functionaliteit van een woordenschatdienst is afhankelijk van verschillende cruciale functies. Een woordenschatdienst moet individuele termen kunnen bedienen en sets en subsets van termen kunnen beheren. De dienst moet verschillende subsets van woordenschatten aanprijzen en beschrijven, en de relaties daartussen uitleggen, inclusief overlappingen en uitbreidingen.
Bovendien moet de dienst consumenten in staat stellen om niet alleen de inhoud op te halen, maar ook de herkomstinformatie, met informatie over de oorsprong en beheergeschiedenis van de vocabulaires en hun subsets. Het huidige gebrek aan dergelijke mogelijkheden dwingt gebruikers om vocabulaires handmatig te kopiëren, waardoor kennis wordt gefragmenteerd en efficiënt hergebruik wordt verhinderd. De ideale vocabulairedienst moet deze complexe relaties, dynamische updates en herkomst ondersteunen en daadwerkelijk gedistribueerd en gefedereerd gebruik van vocabulaires binnen organisaties mogelijk maken.
Andere initiatieven
Ook andere organisaties overwegen het aanbieden van woordenschatten en woordenschatdiensten.
Er is een workshop gepland (inzending nog in behandeling) op SciDataCon 2025 (13-16 oktober 2025) om de federatie van vocabulaires te bespreken (overzicht · Indico ).
Deelnemers dienen de OntoPortal Alliance | OntoPortal te omvatten , een federatie gebaseerd op een specifieke technologie met waarschijnlijk zeer relevante gebruiksscenario's en API's. Een externe standaardisatieorganisatie zal echter nodig zijn om de systemen te hosten.
Concept-API's voor Vocabulary-services zijn in eerdere testbeds besproken. Ze zijn echter nog niet formeel getoetst aan de hier besproken eisen en ook niet serieus overwogen voor adoptie als SWG-product.
Voorstel
Er wordt voorgesteld een OGC Standards Working Group (SWG) op te richten om een Vocabulary Service API te ontwikkelen met twee conformiteitsklassen:
- Woordenschattoegang
- Woordenschatbeheer
Deze SWG moet ook definiëren hoe er naar woordenschatdiensten, met name unies en subsets van woordenschatten, moet worden verwezen in service- en datasetmetadatastandaarden zoals OGC API Records, STAC, ISO 19115, etc.
Deze moeten worden geïmplementeerd als OGC API's, waarbij de Building Block-testmethode wordt gebruikt om ervoor te zorgen dat alle oplossingen worden getest op compatibiliteit met andere OGC API-extensies.
Deze SWG moet worden ondersteund door formeel gefinancierde activiteiten van OGC Research om ervoor te zorgen dat de input en output rekening houden met bestaande onderzoeksresultaten en implementaties zoals OGC RAINBOW. Tegelijkertijd zal dit initiatief de evolutie van OGC RAINBOW naar een compatibele infrastructuur ondersteunen.
Activiteiten dienen zoveel mogelijk actief samenwerking met externe partijen te zoeken. De voorgestelde SWG kan opereren onder auspiciën van bestaande OGC-werkgroepen, zoals "Architecture" of "Geo-Semantics DWG". De SWG kan gezamenlijk worden gepubliceerd via de OGC/W3C Spatial Data on the Web WG en actief worden gepromoot binnen de W3C-gemeenschap als een gezamenlijke activiteit in alle fasen.
Opmerkingen of vragen?
Gelieve e-mail in**@*gc.org met eventuele opmerkingen of vragen over deze oproep tot deelname.
Verzoek om commentaar (RFC)
OGC vraagt om publieke reacties op voorgestelde OGC-dekking...