Dataflow ML

בעזרת Dataflow ML אפשר להשתמש ב-Dataflow כדי לפרוס ולנהל צינורות עיבוד נתונים מלאים של למידת מכונה (ML). שימוש במודלים של למידת מכונה כדי לבצע היקש מקומי ומרחוק באמצעות צינורות עיבוד נתונים של אצווה וסטרימינג. משתמשים בכלים לעיבוד נתונים כדי להכין את הנתונים לאימון המודל ולעבד את התוצאות של המודלים.
אם אתם רוצים לסווג תמונות בזמן אמת, להפעיל קריאות היקש מרחוק או ליצור מודל מותאם אישית לטיפול, תוכלו למצוא דוגמאות מלאות של Dataflow ML.
להשתמש במחלקה MLTransform כדי לבצע עיבוד מקדים של נתונים לתהליכי עבודה של למידת מכונה (ML). השילוב של כמה טרנספורמציות של עיבוד נתונים במחלקה אחת מאפשר ל-MLTransform לייעל את תהליך ההחלה של טרנספורמציות של עיבוד נתונים של Apache Beam ML על תהליך העבודה.
with pipeline as p:
  predictions = (
      p
      | beam.ReadFromSource('a_source')
      | RunInference(MODEL_HANDLER))
השימוש ב-RunInference פשוט כמו הוספת קוד הטרנספורמציה לצינור עיבוד הנתונים. בדוגמה הזו, MODEL_HANDLER הוא אובייקט ההגדרה של המודל.
with beam.Pipeline() as p:
  transformed_data = (
    p
    | beam.Create(data)
    | MLTransform(...)
    | beam.Map(print))
כדי להכין את הנתונים לאימון מודלים של למידת מכונה, משתמשים ב-MLTransform בצינור הנתונים. ‫MLTransform עוטף כמה טרנספורמציות של עיבוד נתונים במחלקה אחת, ומאפשר להשתמש במחלקה אחת למגוון משימות של עיבוד מקדים.

חיזוי והסקת מסקנות באמצעות מודלים שעברו אימון מראש

שימוש במודל שעבר אימון מראש עם Pytorch.
שימוש במודל שעבר אימון מראש עם scikit-learn.
שימוש במודל שעבר אימון מראש עם TensorFlow.
ל-Apache Beam יש תמיכה מובנית בשליחת בקשות לנקודת קצה (endpoint) של Vertex AI שנפרסה מרחוק. במחברת הזו מוסבר איך להשתמש בטרנספורמציה של Apache Beam‏ RunInference לסיווג תמונות באמצעות Vertex AI.
אפשר להשתמש בטרנספורמציה RunInference עם handler של מודל עם מפתח כדי להשתמש בכמה מודלים באותה טרנספורמציה RunInference.

עיבוד נתונים באמצעות MLTransform

אפשר להשתמש במחלקה MLTransform של Apache Beam עם Vertex AI text-embeddings API כדי ליצור הטמעות טקסט. הטמעות טקסט הן דרך לייצג טקסט כווקטורים מספריים, וזה נחוץ להרבה משימות של עיבוד שפה טבעית (NLP).
אפשר להשתמש במחלקת MLTransform של Apache Beam עם מודלים של Hugging Face Hub כדי ליצור הטמעות טקסט. המסגרת SentenceTransformers של Hugging Face משתמשת ב-Python כדי ליצור הטמעות של משפטים, טקסט ותמונות.
חישוב אוצר מילים ייחודי מתוך מערך נתונים, ואז מיפוי של כל מילה או טוקן לאינדקס נפרד של מספרים שלמים. משתמשים בטרנספורמציה הזו כדי לשנות נתונים טקסטואליים לייצוגים מספריים למשימות של למידת מכונה.