Importar metadatos mediante una canalización personalizada

En este documento se describe cómo importar metadatos de un sistema de terceros a Universal Catalog de Dataplex mediante los métodos de la API de importación de metadatos y tu propia canalización. Los metadatos de Dataplex Universal Catalog se componen de entradas y sus aspectos.

Si prefieres usar una canalización de orquestación gestionada por Google Cloudpara extraer e importar metadatos, te recomendamos que utilices una canalización de conectividad gestionada. Con una canalización de conectividad gestionada, puedes usar tu propio conector para extraer metadatos y generar resultados en un formato que se pueda usar como entrada en los métodos de la API de importación de metadatos (el archivo de importación de metadatos). Después, usa Workflows para orquestar las tareas de la canalización.

Puede ejecutar los siguientes tipos de trabajos de importación de metadatos:

  • Sincronización completa de las entradas con importación incremental de sus aspectos. Se admiten entradas personalizadas.
  • Importación incremental solo de aspectos. Se admite en aspectos que pertenecen a entradas personalizadas y entradas del sistema. En el caso de las entradas personalizadas, puedes modificar tanto los aspectos opcionales como los obligatorios. En el caso de las entradas del sistema, puedes modificar aspectos opcionales.

Pasos generales

Para importar metadatos mediante la API de importación de metadatos, sigue estos pasos generales:

  1. Determina el ámbito del trabajo.

    También debes saber cómo aplica Dataplex Universal Catalog la lógica de comparación y el modo de sincronización de las entradas y los aspectos.

  2. Crea uno o varios archivos de importación de metadatos que definan los datos que se van a importar.

  3. Guarda los archivos de importación de metadatos en un segmento de Cloud Storage.

  4. Ejecuta una tarea de importación de metadatos.

En los pasos de esta página se da por hecho que conoces los conceptos de metadatos de Dataplex Universal Catalog, como los grupos de entradas, los tipos de entradas y los tipos de aspectos. Para obtener más información, consulta el artículo Acerca de la gestión de metadatos en Dataplex Universal Catalog.

Antes de empezar

Antes de importar metadatos, completa las tareas de esta sección.

Roles obligatorios

Para asegurarte de que la cuenta de servicio de Universal Catalog de Dataplex tenga los permisos necesarios para acceder al bucket de Cloud Storage, pide a tu administrador que le asigne el rol de gestión de identidades y accesos de lector de objetos de almacenamiento (roles/storage.objectViewer) y el permiso storage.buckets.get en el bucket.

Para obtener los permisos que necesitas para gestionar los trabajos de importación de metadatos, pide a tu administrador que te conceda los siguientes roles de gestión de identidades y accesos:

  • Modifica las entradas y sus aspectos en una tarea de metadatos de sincronización de entradas completa:
  • Modifica los aspectos obligatorios de un trabajo de metadatos de solo aspectos:
  • Modifica aspectos opcionales en un trabajo de metadatos solo de aspectos: Usuario del tipo de aspecto de Dataplex (roles/dataplex.aspectTypeUser) en el tipo de aspecto o en el proyecto en el que se define el tipo de aspecto. Ten en cuenta que, al modificar aspectos opcionales en un trabajo de metadatos de solo aspectos, no necesitas permisos para el tipo de entrada asociado.
  • Crea tareas de importación de metadatos: