Halaman ini menunjukkan cara menggunakan Dataflow untuk membaca data dari Google Cloud Managed Service for Apache Kafka dan menulis data ke tabel BigQuery. Tutorial ini menggunakan template Apache Kafka ke BigQuery untuk membuat tugas Dataflow.
Ringkasan
Apache Kafka adalah platform open source untuk streaming peristiwa. Kafka umumnya digunakan dalam arsitektur terdistribusi untuk memungkinkan komunikasi antar-komponen yang tidak terikat erat. Anda dapat menggunakan Dataflow untuk membaca peristiwa dari Kafka, memprosesnya, dan menulis hasilnya ke tabel BigQuery untuk analisis lebih lanjut.
Managed Service for Apache Kafka adalah layanan yang membantu Anda menjalankan cluster Kafka yang aman dan skalabel. Google Cloud
Izin yang diperlukan
Akun layanan pekerja Dataflow harus memiliki peran Identity and Access Management (IAM) berikut:
- Klien Kafka Terkelola (
roles/managedkafka.client) - BigQuery Data Editor (
roles/bigquery.dataEditor)
Untuk mengetahui informasi selengkapnya, lihat Keamanan dan izin Dataflow.
Membuat cluster Kafka
Pada langkah ini, Anda akan membuat cluster Managed Service for Apache Kafka. Untuk mengetahui informasi selengkapnya, lihat Membuat cluster Managed Service for Apache Kafka.
Konsol
Buka halaman Managed Service for Apache Kafka > Clusters.
Klik Create.
Di kotak Nama cluster, masukkan nama untuk cluster.
Dalam daftar Region, pilih lokasi untuk cluster.
Klik Create.
gcloud
Gunakan
perintah managed-kafka clusters create.
gcloud managed-kafka clusters create CLUSTER \
--location=REGION \
--cpu=3 \
--memory=3GiB \
--subnets=projects/PROJECT_ID/regions/REGION/subnetworks/SUBNET_NAME
Ganti kode berikut:
CLUSTER: nama untuk clusterREGION: region tempat Anda membuat subnetPROJECT_ID: project ID AndaSUBNET_NAME: subnet tempat Anda ingin men-deploy cluster
Pembuatan cluster biasanya memerlukan waktu 20-30 menit.
Buat topik Kafka
Setelah cluster Managed Service for Apache Kafka dibuat, buat topik.
Konsol
Buka halaman Managed Service for Apache Kafka > Clusters.
Klik nama cluster.
Di halaman detail cluster, klik Create Topic.
Di kotak Nama topik, masukkan nama untuk topik.
Klik Create.
gcloud
Gunakan
perintah managed-kafka topics create.
gcloud managed-kafka topics create TOPIC_NAME \
--cluster=CLUSTER \
--location=REGION \
--partitions=10 \
--replication-factor=3
Ganti kode berikut:
TOPIC_NAME: nama topik yang akan dibuat
Membuat tabel BigQuery
Pada langkah ini, Anda akan membuat tabel BigQuery dengan skema berikut:
| Nama kolom | Jenis data |
|---|---|
name |
STRING |
customer_id |
INTEGER |
Jika Anda belum memiliki set data BigQuery, buat set data terlebih dahulu. Untuk mengetahui informasi selengkapnya, lihat Membuat set data. Kemudian, buat tabel kosong baru:
Konsol
Buka halaman BigQuery.
Di panel Explorer, luaskan project Anda, lalu pilih set data.
Di bagian Dataset info, klik Create table.
Dalam daftar Create table from, pilih Empty table.
Di kotak Table, masukkan nama tabel.
Di bagian Schema, klik Edit sebagai teks.
Tempel definisi skema berikut:
name:STRING, customer_id:INTEGERKlik Create table.
gcloud
Gunakan perintah bq mk.
bq mk --table