El servicio de Dataflow administra por completo los recursos en Google Cloud
por trabajo. Esto incluye activar y desactivar
instancias de Compute Engine (también llamadas
workers o VMs) y acceder a los buckets de
Cloud Storage de tu proyecto para la E/S y la etapa de pruebas de archivos
temporales. Sin embargo, si la canalización interactúa con Google Cloud datos
tecnologías de almacenamiento como BigQuery y
Pub/Sub, debes administrar los recursos y la cuota de esos
servicios.
Dataflow usa una ubicación que proporciona el usuario en Cloud Storage de forma específica para archivos de etapa de pruebas. Esta ubicación está bajo tu control y debes asegurarte de que su vida útil se mantenga siempre que algún trabajo realice operaciones de lectura en ella. Puedes volver a usar la misma ubicación de etapa de pruebas para múltiples ejecuciones de trabajos, ya que el almacenamiento en caché integrado del SDK puede acelerar el tiempo de inicio de tus trabajos.
Trabajos
Puedes ejecutar hasta 25 trabajos de Dataflow simultáneos por Google Cloud proyecto; sin embargo, este límite se puede aumentar si te comunicas con el equipo de Google Cloud asistencia. Para obtener más información, consulta