跳至主要内容
Google Cloud Documentation
技术领域
  • AI 和机器学习
  • 应用开发
  • 应用托管
  • 计算
  • 数据分析和流水线
  • 数据库
  • 分布式云、混合云和多云
  • 生成式 AI
  • 行业解决方案
  • 网络
  • 可观测性和监控
  • 安全
  • Storage
跨产品工具
  • 访问权限和资源管理
  • 费用和用量管理
  • 基础设施即代码
  • 迁移
  • SDK、语言、框架和工具
/
控制台
  • English
  • Deutsch
  • Español
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
  • Cloud Dataflow
免费开始使用吧
概览 指南 Dataflow 机器学习 参考文档 示例 资源
Google Cloud Documentation
  • 技术领域
    • 更多
    • 概览
    • 指南
    • Dataflow 机器学习
    • 参考文档
    • 示例
    • 资源
  • 跨产品工具
    • 更多
  • 控制台
  • Discover
  • 产品概览
  • 用例
  • Apache Beam 的编程模型
  • 开始使用
  • 开始使用 Dataflow
  • 快速入门
    • 使用作业构建器
    • 使用模板
  • 构建流水线
  • 概览
  • 使用 Apache Beam
    • 概览
    • 安装 Apache Beam SDK
    • 创建 Java 流水线
    • 创建 Python 流水线
    • 创建 Go 流水线
  • 使用作业构建器界面
    • 作业构建器界面概览
    • 创建自定义作业
    • 加载和保存作业 YAML 文件
    • 使用作业构建器 YAML 编辑器
    • 软件包和导入转换
  • 使用模板
    • 模板简介
    • 运行示例模板
    • Google 提供的模板
      • 所有提供的模板
      • 为模板创建用户自定义函数
      • 将 SSL 证书与模板搭配使用
      • 加密模板参数
    • Flex 模板
      • 使用 Flex 模板打包流水线
      • 运行 Flex 模板
      • 构建并运行示例 Flex 模板
      • Flex 模板基础映像
    • 经典模板
      • 创建经典模板
      • 运行经典模板
  • 使用笔记本
    • 笔记本使用入门
    • 使用高级笔记本功能
  • Dataflow I/O
    • 托管式 I/O
    • I/O 最佳实践
    • Apache Iceberg
      • 适用于 Apache Iceberg 的托管式 I/O
      • 从 Apache Iceberg 读取数据
      • 将数据写入 Apache Iceberg
      • 使用 BigLake REST 目录向 Apache Iceberg 进行流式写入
      • 使用 BigLake REST 目录从 Apache Iceberg 读取 CDC 数据
    • Apache Kafka
      • 适用于 Apache Kafka 的托管式 I/O
      • 从 Apache Kafka 读取
      • 写入 Apache Kafka
      • 使用适用于 Apache Kafka 的托管式服务
    • BigQuery
      • 适用于 BigQuery 的托管式 I/O
      • 从 BigQuery 中读取
      • 写入 BigQuery
    • Bigtable
      • 从 Bigtable 中读取
      • 写入 Bigtable
    • Cloud Storage
      • 从 Cloud Storage 读取数据
      • 写入 Cloud Storage
    • Pub/Sub
      • 从 Pub/Sub 读取
      • 写入 Pub/Sub
    • 性能基准:Pub/Sub 到 BigQuery
  • 丰富数据
    • 扩充转换
    • 使用 Apache Beam 和 Bigtable 来丰富数据
    • 使用 Apache Beam 和 BigQuery 来丰富数据
    • 使用 Apache Beam 和 Vertex AI Feature Store 来丰富数据
  • 最佳实践
    • Dataflow 最佳实践
    • 大批量流水线最佳实践
    • Pub/Sub 到 BigQuery 最佳实践
  • 运行流水线
  • 部署流水线
  • 使用 Dataflow Runner v2
  • 配置流水线选项
    • 设置流水线选项
    • 流水线选项参考文档
    • Dataflow 服务选项
    • 配置工作器虚拟机
    • 使用 Arm 虚拟机
  • 管理流水线依赖项
  • 设置流水线流处理模式
  • 使用加速器 (GPU/TPU)
    • GPU
      • GPU 概览
      • GPU 的 Dataflow 支持
      • GPU 最佳实践
      • 使用 GPU 运行流水线
      • 使用 NVIDIA L4 GPU
      • 使用 NVIDIA 多处理服务
      • 使用 GPU 处理卫星图像
      • 排查 GPU 问题
    • TPU
      • Dataflow 对 TPU 的支持
      • 使用 TPU 运行流水线
      • 快速入门:在 TPU 上运行 Dataflow
      • 排查 TPU 问题
  • 使用自定义容器
    • 概览
    • 构建自定义容器映像
    • 构建多架构容器映像
    • 在自定义容器中运行 Dataflow 作业
    • 自定义容器问题排查
  • Regions
  • 监控
  • 概览
  • 项目监控信息中心
  • 自定义监控信息中心
  • 监控作业
    • 作业列表
    • 作业图
    • 作业步骤信息
    • 执行详细信息
    • 作业指标
    • 估算的费用
    • 建议
    • 自动扩缩
    • 使用 Cloud Monitoring
    • 使用 Cloud Profiler
  • 日志记录
    • Dataflow 审核日志记录
    • Data Pipelines 审核日志记录
    • 使用流水线日志
    • 控制日志注入
    • 示例流水线数据
  • 查看数据沿袭
  • 优化
  • 使用 Streaming Engine 处理流式作业
  • 用于批量作业的 Dataflow Shuffle
  • 使用自动扩缩和再均衡功能
    • 横向自动扩缩
    • 调整流处理横向自动扩缩
    • 动态线程扩缩
    • 适配
    • 了解动态工作负载再均衡
    • 使用 Dataflow Prime
      • Dataflow Prime 简介
      • 纵向自动扩缩
  • 使用 Dataflow 数据分析
  • 使用灵活资源调度服务
  • 使用 Compute Engine 预留
  • 优化费用
  • 管理
  • 流水线更新
    • 升级指南
    • 更新流式传输流水线
  • 停止正在运行的流水线
  • 请求配额
  • 在项目之间迁移作业
  • 使用 Dataflow 快照
  • 使用数据流水线
  • 使用 Eventarc 管理 Dataflow 作业
  • 控制访问权限
  • Authentication
  • Dataflow 角色和权限
  • 安全与权限
  • 指定网络
  • 配置互联网访问权限和防火墙规则
  • 使用客户管理的加密密钥
  • 使用自定义约束条件
  • Dataflow 开发指南
  • 规划数据流水线
  • 流水线生命周期
  • 开发和测试流水线