Subscrições do BigQuery

Este documento apresenta uma vista geral de uma subscrição do BigQuery, do respetivo fluxo de trabalho e das propriedades associadas.

Uma subscrição do BigQuery é um tipo de subscrição de exportação que escreve mensagens numa tabela do BigQuery existente à medida que são recebidas. Não precisa de configurar um cliente subscritor separado. Use a Google Cloud consola, a CLI Google Cloud, as bibliotecas cliente ou a API Pub/Sub para criar, atualizar, listar, desanexar ou eliminar uma subscrição do BigQuery.

Sem o tipo de subscrição do BigQuery, precisa de uma subscrição de obtenção ou envio e um subscritor (como o Dataflow) que leia as mensagens e as escreva numa tabela do BigQuery. A sobrecarga da execução de uma tarefa do Dataflow não é necessária quando as mensagens não requerem processamento adicional antes de serem armazenadas numa tabela do BigQuery. Em alternativa, pode usar uma subscrição do BigQuery.

No entanto, continua a ser recomendada uma pipeline do Dataflow para sistemas Pub/Sub em que é necessária alguma transformação de dados antes de os dados serem armazenados numa tabela do BigQuery. Para saber como fazer stream de dados do Pub/Sub para o BigQuery com transformação através do Dataflow, consulte o artigo Fazer stream do Pub/Sub para o BigQuery.

O modelo de subscrição do Pub/Sub para o BigQuery do Dataflow aplica a entrega exatamente uma vez por predefinição. Normalmente, isto é conseguido através de mecanismos de remoção de duplicados no pipeline do Dataflow. No entanto, a subscrição do BigQuery só suporta a entrega pelo menos uma vez. Se a eliminação de duplicações exata for fundamental para o seu exemplo de utilização, considere processos posteriores no BigQuery para processar potenciais duplicados.

Antes de começar

Antes de ler este documento, certifique-se de que conhece o seguinte: