Dataflow 机器学习

借助 Dataflow ML,您可以使用 Dataflow 部署和管理完整的机器学习 (ML) 流水线。使用机器学习模型通过批处理和流处理流水线进行本地和远程推断。使用数据处理工具准备数据以用于模型训练并处理模型的结果。
无论您是想实时对图片进行分类、运行远程推理调用,还是构建自定义模型处理程序,都可以找到完整的 Dataflow ML 示例。
使用 MLTransform 类为机器学习 (ML) 工作流预处理数据。通过将多个数据处理转换合并到一个类中,MLTransform 可简化将 Apache Beam ML 数据处理转换应用于工作流的过程。
with pipeline as p:
  predictions = (
      p
      | beam.ReadFromSource('a_source')
      | RunInference(MODEL_HANDLER))
使用 RunInference 就像向流水线添加转换代码一样简单。在此示例中,MODEL_HANDLER 是模型配置对象。
with beam.Pipeline() as p:
  transformed_data = (
    p
    | beam.Create(data)
    | MLTransform(...)
    | beam.Map(print))
如需为训练机器学习模型准备数据,请在流水线中使用 MLTransformMLTransform 将多个数据处理转换封装在一个类中,可让您将一个类用于各种预处理任务。

使用预训练模型进行预测和推理

将预训练模型与 PyTorch 搭配使用。
将预训练模型与 scikit-learn 搭配使用。