Importer des métadonnées à l'aide d'un pipeline personnalisé

Ce document explique comment importer des métadonnées depuis un système tiers dans Knowledge Catalog (anciennement Dataplex Universal Catalog) à l'aide des méthodes de l'API d'importation de métadonnées et de votre propre pipeline. Les métadonnées Knowledge Catalog se composent d'entrées et de leurs aspects.

Si vous souhaitez plutôt utiliser un pipeline d'orchestration géré par Google Cloudpour extraire et importer des métadonnées, nous vous suggérons d'utiliser un pipeline de connectivité gérée. Avec un pipeline de connectivité gérée, vous apportez votre propre connecteur qui extrait les métadonnées et génère une sortie dans un format pouvant être utilisé comme entrée par les méthodes d'API d'importation de métadonnées (le fichier d'importation de métadonnées). Ensuite, vous utilisez Workflows pour orchestrer les tâches du pipeline.

Vous pouvez exécuter les types de tâches d'importation de métadonnées suivants :

  • Synchronisation complète des entrées avec importation incrémentielle de leurs aspects. Pris en charge pour les entrées personnalisées.
  • Importation incrémentielle des aspects uniquement : compatible avec les aspects appartenant aux entrées personnalisées et système. Pour les entrées personnalisées, vous pouvez modifier les aspects facultatifs et obligatoires. Pour les entrées système, vous pouvez modifier les aspects facultatifs.

Étapes majeures

Pour importer des métadonnées à l'aide de l'API d'importation de métadonnées, procédez comme suit :

  1. Déterminez le champ d'application du job.

    Découvrez également comment Knowledge Catalog applique la logique de comparaison et le mode de synchronisation pour les entrées et les aspects.

  2. Créez un ou plusieurs fichiers d'importation de métadonnées qui définissent les données à importer.

  3. Enregistrez les fichiers d'importation de métadonnées dans un bucket Cloud Storage.

  4. Exécutez un job d'importation de métadonnées.

Les étapes décrites sur cette page supposent que vous êtes familiarisé avec les concepts de métadonnées de Knowledge Catalog, y compris les groupes d'entrées, les types d'entrées et les types d'aspects. Pour en savoir plus, consultez À propos de la gestion des métadonnées dans Knowledge Catalog.

Avant de commencer

Avant d'importer des métadonnées, effectuez les tâches décrites dans cette section.

Rôles requis

Pour vous assurer que le compte de service du catalogue de connaissances dispose des autorisations nécessaires pour accéder au bucket Cloud Storage, demandez à votre administrateur d'accorder au compte de service du catalogue de connaissances le rôle IAM Lecteur des objets de l'espace de stockage (roles/storage.objectViewer) et l'autorisation storage.buckets.get sur le bucket.

Pour obtenir les autorisations nécessaires pour gérer les jobs d'importation de métadonnées, demandez à votre administrateur de vous accorder les rôles IAM suivants :

Pour en savoir plus sur l'attribution de rôles, consultez Gérer l'accès aux projets, aux dossiers et aux organisations.

Vous pouvez également obtenir les autorisations requises avec des rôles personnalisés ou d'autres rôles prédéfinis.

Créer des ressources Google Cloud

Préparez les ressources suivantes : Google Cloud

  1. Créez des groupes d'entrées pour les entrées que vous souhaitez importer.
  2. Créez des types d'aspects pour les aspects que vous souhaitez importer.
  3. Créez des types d'entrées pour les entrées que vous souhaitez importer.
  4. Si vous exécutez un job de métadonnées "aspects uniquement", créez des entrées pour les aspects que vous souhaitez importer.
  5. Créez un bucket Cloud Storage pour stocker vos fichiers d'importation de métadonnées.

Composants d'un job d'importation de métadonnées

Lorsque vous importez des métadonnées, tenez compte des composants suivants d'un job de métadonnées :

  • Champ d'application du job : groupes d'entrées, types d'entrées et types d'aspects à inclure dans le job.
  • Mode de synchronisation : façon dont les entrées et les aspects de la tâche sont mis à jour.
  • Fichier d'importation de métadonnées : fichier qui définit les valeurs à définir pour les entrées et les aspects du job. Vous pouvez fournir plusieurs fichiers d'importation de métadonnées dans le même job de métadonnées. Vous enregistrez les fichiers dans Cloud Storage.
  • Logique de comparaison : comment Knowledge Catalog détermine les entrées et les aspects à modifier.

Champ d'application du job

Le champ d'application du job définit les groupes d'entrées, les types d'entrées et les types d'aspects que vous souhaitez inclure dans un job d'importation de métadonnées. Lorsque vous importez des métadonnées, vous modifiez les entrées et les aspects qui appartiennent aux ressources dans le champ d'application du job.

Pour définir le champ d'application du job, suivez ces consignes :

  • Groupes d'entrées : spécifiez un ou plusieurs groupes d'entrées à inclure dans le job. Le job ne modifie que les entrées et les aspects qui appartiennent à ces groupes d'entrées. Les groupes d'entrées et le job doivent se trouver dans la même région.

  • Types d'entrées : spécifiez un ou plusieurs types d'entrées à inclure dans le job. Le job ne modifie que les entrées et les aspects qui appartiennent à ces types d'entrées. L'emplacement d'un type d'entrée doit correspondre à celui du job, ou le type d'entrée doit être global.

  • Types d'aspect : spécifiez un ou plusieurs types d'aspect à inclure dans le job. Le job ne modifie que les aspects qui appartiennent à ces types d'aspect. L'emplacement d'un type d'aspect doit correspondre à celui du job, ou le type d'aspect doit être global.

Le champ d'application du job doit inclure tous les types d'entrées et d'aspects que vous spécifiez dans le fichier d'importation de métadonnées.

Vous spécifiez le champ d'application du job lorsque vous créez un job de métadonnées.

Mode de synchronisation

Le mode de synchronisation spécifie la manière dont les entrées et les aspects d'un job d'importation de métadonnées sont mis à jour. Vous fournissez un mode de synchronisation pour les entrées et les aspects. Les combinaisons de modes de synchronisation suivantes sont acceptées, selon les ressources que vous souhaitez importer.

Objectif Mode de synchronisation des entrées Mode de synchronisation des proportions Résultats
Importer des entrées et leurs aspects FULL INCREMENTAL

Toutes les entrées du champ d'application du job sont modifiées.

Si une entrée existe dans Knowledge Catalog, mais n'est pas incluse dans le fichier d'importation de métadonnées, elle est supprimée lorsque vous exécutez le job de métadonnées.

Un aspect n'est modifié que si le fichier d'importation des métadonnées inclut une référence à l'aspect dans le champ updateMask et le champ aspectKeys. Consultez Structure d'un élément d'importation.

Importer uniquement les aspects