匯出中繼資料

本文說明如何使用中繼資料匯出作業,從 Knowledge Catalog (原稱 Dataplex Universal Catalog) 匯出中繼資料,以供外部系統使用。您可以匯出中繼資料,並使用 BigQuery 等工具進行分析、以程式輔助處理大量資料,或與自訂應用程式整合。

本指南假設您已熟悉 Knowledge Catalog 中繼資料概念,包括項目群組、項目類型和切面類型。

工作範圍

作業範圍會定義要匯出的中繼資料。您必須為每個中繼資料匯出工作提供下列其中一個工作範圍:

  • 機構:匯出貴機構的中繼資料。
  • 專案:匯出屬於指定專案的中繼資料。
  • 項目群組:匯出屬於指定項目群組的中繼資料。

您可以指定要納入作業的項目類型或層面類型,進一步限制範圍。這項工作只會匯出屬於這些項目類型和切面類型的項目和切面。

VPC Service Controls

Knowledge Catalog 使用 VPC Service Controls,為中繼資料匯出作業提供額外安全性。作業所屬的專案會決定 VPC Service Controls 服務範圍,如下所示:

  • 如果將工作範圍設為機構層級,會發生下列情況:
    • 匯出範圍是工作所屬的機構。
    • 系統只會匯出 VPC Service Controls 範圍內的項目。
    • 凡是位於作業所屬機構內,但不在 VPC Service Controls 範圍內的專案,都會遭到排除。
  • 如果將作業範圍設為專案或項目群組,專案或項目群組必須與作業位於相同的 VPC Service Controls 範圍。如果任何專案或項目群組違反 VPC Service Controls 規則,作業就會失敗。

事前準備

匯出中繼資料前,請先完成本節中的工作。

終端使用者必須具備的角色

如要取得管理中繼資料匯出作業所需的權限,請要求系統管理員授予您下列 IAM 角色:

如要進一步瞭解如何授予角色,請參閱「管理專案、資料夾和組織的存取權」。

這些預先定義的角色具備管理中繼資料匯出工作所需的權限。如要查看確切的必要權限,請展開「Required permissions」(必要權限) 部分:

所需權限

如要管理中繼資料匯出作業,必須具備下列權限:

  • 匯出中繼資料:
    • dataplex.metadataJobs.create
    • dataplex.entryGroups.export
    • dataplex.entryGroups.get
    • resourcemanager.projects.get
    • resourcemanager.projects.list
  • 存取匯出的結果: storage.objects.get

您或許還可透過自訂角色或其他預先定義的角色取得這些權限。

Knowledge Catalog 服務帳戶的必要角色

為確保 Knowledge Catalog 服務帳戶具備存取 Cloud Storage bucket 的必要權限,請要求管理員在 bucket 中授予 Knowledge Catalog 服務帳戶下列權限:storage.buckets.getstorage.objects.getstorage.objects.create

設定 Google Cloud 資源

  1. 安裝 Google Cloud CLI。 完成後,執行下列指令來初始化 Google Cloud CLI:

    gcloud init

    若您採用的是外部識別資訊提供者 (IdP),請先使用聯合身分登入 gcloud CLI

  2. 建立 Cloud Storage bucket,儲存匯出的結果。

    bucket 必須與中繼資料工作位於相同的位置和 VPC Service Controls 範圍。

執行中繼資料匯出工作

以下各節說明如何匯出不同工作範圍的中繼資料。

匯出機構的中繼資料

如要匯出機構的 Metadata,請使用 metadataJobs.create 方法,並將 organizationLevel 布林值設為