Dieses Dokument enthält eine Referenzvorlage zum Erstellen eines benutzerdefinierten Connectors zum Extrahieren von Metadaten aus Drittanbieterquellen wie MySQL, SQL Server und Oracle. Mit diesem Connector können Sie Metadaten über eine Pipeline für verwaltete Verbindungen in Knowledge Catalog (früher Dataplex Universal Catalog) importieren. Ein Beispiel für einen Python-Connector für Oracle Database Express Edition (XE) ist als Ausgangspunkt enthalten. Sie können Connectors auch mit Java, Scala oder R entwickeln.
Funktionsweise von Connectors
Ein Connector extrahiert Metadaten aus einer Drittanbieterdatenquelle, wandelt die Metadaten in das Knowledge Catalog-Format ImportItem um und generiert Metadaten-Importdateien, die von Knowledge Catalog importiert werden können.
Der Connector ist Teil einer Pipeline für verwaltete Verbindungen. Eine Pipeline für verwaltete Verbindungen ist ein orchestrierter Workflow, mit dem Sie Knowledge Catalog-Metadaten importieren. Die Pipeline für verwaltete Verbindungen führt den Connector aus und übernimmt andere Aufgaben im Importworkflow, z. B. das Ausführen eines Metadatenimportjobs und das Erfassen von Logs.
In der verwalteten Verbindungspipeline wird der Connector mit einem Managed Service for Apache Spark-Batchjob ausgeführt. Managed Service for Apache Spark bietet eine serverlose Spark-Ausführungsumgebung. Sie können zwar einen Connector erstellen, der Spark nicht verwendet, wir empfehlen jedoch, Spark zu verwenden, da dies die Leistung Ihres Connectors verbessern kann.
Anschlussstecker-Anforderungen
Für den Connector gelten die folgenden Anforderungen:
- Der Connector muss ein Artifact Registry-Image sein, das in Managed Service for Apache Spark ausgeführt werden kann.
- Der Connector muss Metadatendateien in einem Format generieren, das von einem Knowledge Catalog-Metadatenimportjob (der
metadataJobs.create-API-Methode) importiert werden kann. Ausführliche Anforderungen finden Sie unter Metadaten-Importdatei. Der Connector muss die folgenden Befehlszeilenargumente akzeptieren, um Informationen aus der Pipeline zu empfangen:
Befehlszeilenargument Wert, den die Pipeline bietet target_project_idPROJECT_ID target_location_idREGION