Appel à participation
Préface
Dans un monde de plus en plus numérique, le partage et la compréhension des données de manière cohérente entre les organisations et au-delà des frontières sont devenus essentiels. L'utilisation de terminologies claires et universellement comprises, appelées « vocabulaires », est une condition fondamentale pour un partage efficace des données. Il n'existe actuellement aucune norme internationale largement acceptée ni approche unifiée pour la gestion et la diffusion de ces vocabulaires via les services en ligne. Ce manque de normalisation est source de confusion, de redondance et d'inefficacité, les organisations peinant à combiner, gérer et interpréter des données provenant de sources multiples. Pour souligner un point essentiel : si notre objectif est de développer une norme universellement acceptée pour les services de vocabulaire (c'est-à-dire les services numériques donnant accès aux vocabulaires), nous ne visons explicitement pas un ensemble unique et universel de vocabulaires ; en réalité, l'objectif est de favoriser la diversité et la réutilisation, ce qui, in fine, améliore l'interopérabilité.
Pour relever ces défis, l'Open Geospatial Consortium (OGC) propose d'élaborer une nouvelle norme internationale, une « norme de service de vocabulaire », qui simplifiera le partage, la gestion et l'utilisation des vocabulaires entre différents systèmes. Cette norme établit des méthodes cohérentes pour accéder aux informations de vocabulaire, suivre les modifications et documenter les sources et les mises à jour. En normalisant les services de vocabulaire, l'OGC cherche à améliorer l'interopérabilité, permettant ainsi aux différents systèmes et organisations de comprendre et d'utiliser leurs données de manière transparente, tout en réduisant considérablement la complexité et le coût de la gestion des données et des terminologies.
La norme proposée pour le service de vocabulaire bénéficiera aux experts techniques, aux décideurs politiques et aux organisations en permettant une communication plus claire, en améliorant la gouvernance des ressources de données et en favorisant une plus grande collaboration et innovation entre les secteurs et les frontières internationales.
Introduction
Un service de vocabulaire est un service numérique donnant accès à des ensembles structurés de termes, appelés vocabulaires, utilisés pour décrire, catégoriser ou annoter des données de manière cohérente entre les systèmes. Ces vocabulaires peuvent inclure des vocabulaires contrôlés, des taxonomies, des thésaurus, des ontologies et des listes de codes.
Un service de vocabulaire permet généralement aux utilisateurs et aux systèmes de :
- Découvrez des vocabulaires pertinents pour un domaine ou une tâche
- Accédez au contenu du vocabulaire dans des formats standardisés (par exemple, SKOS, JSON-LD, RDF)
- Rechercher et parcourir les termes, les définitions, les relations et les métadonnées
- Résoudre les identifiants (par exemple, les URI) pour des termes spécifiques afin de récupérer des descriptions lisibles par l'homme et la machine
- Réutiliser et référencer des termes dans leurs propres données ou métadonnées
- Versionner et maintenir les vocabulaires au fil du temps
Un service de vocabulaire vise à promouvoir l'interopérabilité sémantique (la capacité des systèmes à échanger des données avec un sens commun et sans ambiguïté) en rendant les vocabulaires détectables, accessibles et utilisables dans différents domaines et applications. Malgré cette importance, il n'existe actuellement aucune norme moderne pour le partage de vocabulaires via des API, et aucune organisation internationale de normalisation ne dispose d'un groupe de travail pour combler cette lacune. Les initiatives communautaires existantes reflètent un paysage fragmenté, avec de nombreux modèles de réutilisation de vocabulaire différents. La figure suivante illustre la situation. Le modèle 1 intègre tous les éléments trouvés ailleurs selon une approche copier-coller-réutilisation. Le modèle 2 illustre une approche de réutilisation par correspondance, qui mappe les éléments d'un référentiel à ceux d'un autre. Des filtres explicites sont utilisés dans le modèle 3, tandis que le modèle 4 présente un mélange classique de vocabulaires partiellement approuvés, de copies partielles de vocabulaires existants et, enfin, d'options sélectionnées n'ayant plus aucun lien avec leurs sources d'origine.
La diversité des modèles constitue un obstacle majeur à l'interopérabilité. Chaque copie d'un vocabulaire comporte le risque que des modifications soient omises par rapport à l'original ou que des ajustements soient apportés aux copies sans qu'il soit possible de remonter jusqu'à l'original. Des formes canoniques de métadonnées de provenance et des mécanismes de synchronisation robustes sont nécessaires pour prendre en charge la fédération et la création de sous-ensembles sur les systèmes distribués. Une norme pour les services de vocabulaire fédérés doit traiter l'accès, la synchronisation et l'identification des sous-ensembles de manière cohérente. De plus, des cadres de gouvernance et de provenance sont essentiels pour garantir l'intégrité et la traçabilité des vocabulaires. Compte tenu de la dimension géographique de nombreux vocabulaires, la fédération devient particulièrement pertinente pour l'OGC, et l'alignement de ces services avec d'autres API de l'OGC renforcerait l'interopérabilité de l'écosystème OGC dans son ensemble. Pour répondre à ces besoins, il est proposé de créer un groupe de travail sur les normes de l'OGC chargé de développer et de tester des modèles de services de vocabulaire et de collaborer avec des groupes de normalisation externes. Cela garantirait la compatibilité avec l'infrastructure RAINBOW de l'OGC et soutiendrait l'évolution des services de vocabulaire fédérés et sensibles à la provenance dans le cadre d'un environnement de données ouvertes cohérent à l'échelle mondiale.
La liste suivante montre la logique derrière l’effort prévu :
- Partager des données signifie partager la compréhension de la terminologie
- Les services de vocabulaire donnent accès aux vocabulaires
- Il n’existe pas de norme de service moderne acceptée pour le partage de vocabulaires via l’API
- Il n'existe pas d'organisation internationale de normalisation avec des groupes de travail travaillant sur une norme de service de vocabulaire.
- Plusieurs initiatives se déroulent au sein des communautés de pratique
- Le partage de vocabulaire nécessite souvent l’agrégation de plusieurs sources
- Les vocabulaires volumineux et agrégés nécessitent souvent la déclaration de « sous-ensembles pertinents » lorsqu’ils sont utilisés dans des contextes plus spécifiques.
- La fédération et le sous-ensemble nécessitent des formes canoniques de métadonnées de provenance et de synchronisation
- Les vocabulaires fédérés nécessitent une normalisation de l’accès, de la synchronisation et de l’identification des sous-ensembles de vocabulaires plus vastes.
- Des dispositions de gouvernance et de provenance doivent être établies
- La fédération est intrinsèquement une préoccupation géographique dans de nombreux cas ; par conséquent, l'OGC a un intérêt spécifique
- Les services de vocabulaire de la Fédération, compatibles avec d'autres API OGC, étendent la puissance des écosystèmes compatibles OGC.
- Cette proposition vise à créer un groupe de travail de l'OGC qui pourra tester des idées et rechercher des liaisons avec d'autres groupes de normalisation concernés.
Cette proposition vise à sensibiliser la communauté internationale au problème des vocabulaires partagés et réutilisés et à créer une solution sous la forme d’un service de vocabulaire standardisé.
Présentation
Dans un écosystème numérique de plus en plus interconnecté, l'utilisation d'une terminologie commune, accessible de manière standardisée via des services de vocabulaire, est essentielle pour garantir la cohérence de la communication, de l'intégration et de l'interprétation des informations entre différents systèmes. À mesure que les données s'échangent par-delà les frontières organisationnelles, nationales et disciplinaires, le sens des termes doit rester clair, précis et interopérable. Les services de vocabulaire fournissent les mécanismes nécessaires à la gestion, la publication et la maintenance des vocabulaires contrôlés, des taxonomies, des ontologies et des listes de codes qui sous-tendent l'interopérabilité sémantique. Sans eux, les efforts d'harmonisation des ensembles de données, de développement de services réutilisables ou de mise en place de systèmes fédérés de connaissances seront fragmentés, sujets aux erreurs et non viables. Chaque utilisateur de données devra alors faire face à la recherche et à l'interprétation des données, sans pouvoir lever les ambiguïtés. Des services de vocabulaire efficaces permettent aux différents acteurs de référencer des concepts communs, de suivre la provenance et l'évolution des termes et de faciliter la compréhension des données par les machines, constituant ainsi un élément fondamental des infrastructures de données ouvertes modernes, des principes FAIR (Faciles à trouver, Accessibles, Interopérables et Réutilisables) et des technologies du Web sémantique.
Le défi réside toutefois dans le fait que l'état actuel de l'art des services de vocabulaire est fragmenté et insuffisant. Il n'existe actuellement aucun service de vocabulaire standardisé largement accepté ou mis en œuvre. Plusieurs initiatives liées à des plateformes logicielles spécifiques existent et peuvent donner un aperçu de ce à quoi pourrait ressembler une solution véritablement interopérable.
Bien que les modèles de données de vocabulaire les plus connus incluent SKOS (Simple Knowledge Organization System), OWL (Web Ontology Language) et RDFS (Resource Description Framework Schema), ceux-ci ne définissent que la structure et les relations au sein des vocabulaires. Ils ne définissent pas le comportement ou le fonctionnement d'un service proposant des vocabulaires.
L'un des principaux problèmes réside dans la difficulté de mise en œuvre du « Web de données », initialement conçu pour s'appuyer fortement sur des vocabulaires partagés, en partie en raison de l'absence d'un modèle de service de vocabulaire commun. Par conséquent, l'interopérabilité, principe fondamental, est fortement compromise lors de la gestion de vocabulaires entre différents systèmes.
Exigences
En analysant la situation actuelle, il convient de distinguer les normes relatives aux vocabulaires de celles relatives aux services de vocabulaire. Les normes du W3C, telles que SKOS, sont solides et applicables aux structures de vocabulaire et peuvent servir de point de départ aux discussions (points de départ car elles manquent de fonctionnalités essentielles, notamment pour l'utilisation de sous-ensembles de vocabulaires existants). Par ailleurs, il existe diverses normes ISO. Ces directives ISO sont utiles pour la conception des processus, mais ne se traduisent pas en API de service ni en comportement opérationnel.
L'objectif est de définir une approche de service indépendante de toute plateforme logicielle spécifique. Bien que de nombreuses institutions européennes utilisent la même plateforme, s'appuyer sur une technologie back-end unique n'est pas la solution. Une API et une définition comportementale standardisées, indépendamment de la technologie d'implémentation, sont nécessaires pour permettre une véritable interopérabilité.
Plusieurs fonctionnalités essentielles sont nécessaires au fonctionnement d'un service de vocabulaire. Un service de vocabulaire doit être capable de traiter des termes individuels et de gérer des ensembles et des sous-ensembles de termes. Il doit annoncer et décrire différents sous-ensembles de vocabulaires et expliquer les relations entre eux, y compris les chevauchements et les extensions.
De plus, le service doit permettre aux utilisateurs de récupérer non seulement le contenu, mais aussi les informations de provenance, indiquant l'origine et l'historique de gestion des vocabulaires et de leurs sous-ensembles. L'absence actuelle de telles fonctionnalités oblige les utilisateurs à copier manuellement les vocabulaires, ce qui fragmente les connaissances et empêche une réutilisation efficace. Un service de vocabulaire idéal doit prendre en charge ces relations complexes, les mises à jour dynamiques et la provenance, permettant ainsi une utilisation véritablement distribuée et fédérée des vocabulaires au sein des organisations.
Autres initiatives
D’autres organisations envisagent également de fournir des vocabulaires et des services de vocabulaire.
Un atelier sur la fédération de vocabulaires est prévu (soumission en attente) à SciDataCon 2025 (13-16 octobre 2025) : Aperçu · Indico.
Les participants devraient inclure l' OntoPortal Alliance | OntoPortal , une fédération basée sur une technologie spécifique et proposant des cas d'utilisation et des API probablement très pertinents. Toutefois, un organisme de normalisation externe devra héberger le tout.
Des projets d'API pour les services de vocabulaire ont été discutés lors de bancs d'essai précédents. Cependant, ils n'ont pas encore été formellement évalués au regard des exigences décrites ici, ni sérieusement envisagés pour une adoption en tant que livrable SWG.
Proposition
Il est proposé de créer un groupe de travail sur les normes OGC (SWG) afin de développer une API de service de vocabulaire avec deux classes de conformité :
- Accès au vocabulaire
- Gestion du vocabulaire
Ce SWG devrait également définir comment les services de vocabulaire, en particulier les unions et les sous-ensembles de vocabulaires, doivent être référencés dans les normes de métadonnées de service et d'ensemble de données telles que les enregistrements API OGC, STAC, ISO 19115, etc.
Ces éléments devraient être implémentés sous forme d'API OGC, en utilisant l'approche de test par blocs de construction pour garantir que toutes les solutions sont testées pour être compatibles avec d'autres extensions d'API OGC.
Ce groupe de travail devrait s'appuyer sur des activités financées officiellement par OGC Research afin de garantir que les apports et les résultats tiennent compte des résultats de recherche et des mises en œuvre existants, tels qu'OGC RAINBOW. Parallèlement, cette initiative soutiendra l'évolution d'OGC RAINBOW vers une infrastructure compatible.
Les activités devraient rechercher activement des collaborations avec des activités externes, dans la mesure du possible. Le SWG proposé pourrait fonctionner sous l'égide de groupes de travail existants de l'OGC, tels que « Architecture » ou « Géo-Sémantique DWG ». Il pourrait copublier via le groupe de travail OGC/W3C « Données spatiales sur le Web » et être activement promu par la communauté W3C comme une activité conjointe à toutes les étapes.
Commentaires ou questions?
Contactez nous in**@*gc.org pour tout commentaire ou question concernant cet appel à participation.
Demande de commentaires (RFC)
L'OGC sollicite l'avis du public sur la couverture proposée par l'OGC...