מעקב אחרי מופעים ופעולות

‫Cloud Monitoring אוסף ושומר באופן אוטומטי מידע על מכונת Managed Lustre.

במסמך הזה מפורטת סקירה כללית של המדדים שזמינים לניטור Managed Lustre ב- Google Cloud. המדדים האלה עוזרים לכם להבין את הביצועים, הקיבולת והמצב של מערכות הקבצים של Managed Lustre, כדי שתוכלו לזהות צווארי בקבוק, לפתור בעיות ולבצע אופטימיזציה של ניצול המשאבים.

אפשר להשתמש במדדים האלה ב-Cloud Monitoring כדי ליצור לוחות בקרה בהתאמה אישית, להגדיר התראות ולקבל תובנות מעמיקות יותר לגבי ההתנהגות של מופע Managed Lustre.

‫Cloud Monitoring מופעל באופן אוטומטי עבור Managed Lustre. אין תשלום על איסוף הנתונים או על הצגת המדדים בGoogle Cloud מסוף. יכול להיות שיהיו חיובים על קריאות ל-API. פרטים על התמחור מופיעים במחירון של Cloud Monitoring.

התפקידים שצריך ב-IAM

נדרשים התפקידים הבאים:

  • הצגת נתונים ב-Monitoring (roles/monitoring.viewer) או הרשאות שוות ערך, כדי להציג מדדים ב-Cloud Monitoring.
  • הרשאת עריכה של מעקב (roles/monitoring.editor) או הרשאות שוות ערך, כדי להגדיר התראות.

איך מעניקים תפקיד ב-IAM

הצגת המדדים

מדדים של Cloud Monitoring זמינים משני מקומות במסוףGoogle Cloud :

  • בדף הפרטים של מכונת Managed Lustre מוצגים מדדים זמינים. בנוסף למדדים שמפורטים בדף הזה, המערכת מחשבת את רוחב הפס של הבייטים שהועתקו ואת קצב העתקת האובייקטים.

  • בדף Cloud Monitoring יש כמה אפשרויות של תרשימים והתאמות אישיות.

הצגת מדדים בדף הפרטים של המופע

כדי לראות את המדדים של מופע ספציפי:

  1. נכנסים לדף Instances במסוף Google Cloud .

    כניסה לדף Instances

  2. לוחצים על המופע שרוצים לראות את המדדים שלו. יופיע הדף Instance details.

  3. לוחצים על הכרטיסייה מעקב. לוח הבקרה שמוגדר כברירת מחדל מוצג.

הצגת מדדים ב-Cloud Monitoring

כדי לראות את מדדי Managed Lustre ב-Cloud Monitoring:

  1. נכנסים לדף Metrics Explorer במסוף Google Cloud .

    כניסה ל-Monitoring: Metrics Explorer

  2. פועלים לפי ההוראות במאמר יצירת תרשימים באמצעות Metrics Explorer כדי לבחור את המדדים ולהציג אותם.

הגדרת התראות

אתם יכולים להגדיר מדיניות התראות ב-Cloud Monitoring כדי לקבל התראה כשמערכת הקבצים של Managed Lustre עומדת בתנאים ספציפיים, כמו חריגה מקיבולת האחסון או ממגבלות התפוקה.

דרישות מוקדמות

כדי ליצור מדיניות התראות, צריך להיות לכם תפקיד עריכה ב-Monitoring (roles/monitoring.editor) ב-IAM בפרויקט.

יצירת מדיניות התראות

כדי להגדיר התראה, צריך להגדיר תנאי באמצעות מדד או שאילתת PromQL ולהגדיר ערוצי התראות.

  1. נכנסים לדף Alerting במסוף Google Cloud . Google Cloud

    מעקב: התראות

  2. לוחצים על + יצירת מדיניות.

  3. בוחרים באפשרות Builder ובוחרים את המדד, או בוחרים באפשרות Code editor כדי להזין שאילתה עם PromQL. בבורר המדדים, המדדים של Managed Lustre נמצאים במשאבים Lustre instance ו-Lustre location.

  4. מגדירים את הלוגיקה של הטריגר ומגדירים את ערוצי ההתראות ואת הגדרות ההתראות.

  5. לוחצים על יצירת מדיניות.

מידע נוסף על יצירת טריגרים ואפשרויות אחרות זמין במאמרים הבאים:

דוגמה: יצירת התראה על קיבולת אחסון

בדוגמה הבאה אפשר לראות איך יוצרים התראה שמופעלת כשמופע Managed Lustre חורג מ-80% מהקיבולת שהוקצתה לו.

  1. נכנסים לדף Alerting במסוף Google Cloud . Google Cloud

    מעקב: התראות

  2. לוחצים על + יצירת מדיניות.

  3. בוחרים באפשרות עורך הקוד.

  4. בעורך השאילתות, מדביקים את שאילתת PromQL הבאה:

    (
      sum by (instance_id, location) (lustre_googleapis_com:instance_capacity_bytes)
      -
      sum by (instance_id, location) (lustre_googleapis_com:instance_available_bytes)
    )
    /
    sum by (instance_id, location) (lustre_googleapis_com:instance_capacity_bytes)
    > 0.8
    

    השאילתה הזו מחשבת את יחס השימוש בכל המקרים: (Total - Available) / Total. הערך 0.8 מייצג את סך הבייטים שהגיעו ל-80% שימוש. כדי לקבל התראה כשמגיעים ל-90%, משנים את הערך הזה ל-0.9.

  5. לוחצים על Run Query (הפעלת שאילתה) כדי לאמת את התחביר ולראות תרשים של יחס השימוש הנוכחי.

  6. לוחצים על הבא ומגדירים את הטריגר לAny time series violates (כל חריגה מסדרת זמן).

  7. לוחצים על הבא. בקטע Documentation, מוסיפים פעולות מומלצות לפתרון בעיית הקיבולת. לדוגמה:

    ## Action Required: Lustre Capacity Warning
    The Managed Lustre instance is exceeding 80% capacity usage.
    
    **Metric:** Usage Ratio > 0.8
    **Severity:** Warning
    
    **Recommended Actions:**
    1. Check the instance details in the Google Cloud console.
    2. Verify if this is expected data growth or a runaway process.
    3. If valid, consider expanding the storage capacity of the instance or deleting old data to free up space.
    4. Failure to address this may result in "No Space Left on Device" errors for client applications.
    

יצירת מדיניות התראות באמצעות gcloud

אפשר ליצור מדיניות התראות באמצעות Google Cloud CLI. שימו לב: תצטרכו לערוך את ההתראה במסוף Google Cloud בהמשך כדי להפעיל ערוצי התראה ספציפיים.

בדוגמה הבאה נוצרת התראה על קיבולת של 80% באמצעות gcloud:

gcloud monitoring policies create \
  --policy-from-file=/dev/stdin <<EOF
{
  "displayName": "Lustre High Capacity Usage (>80%)",
  "severity": "WARNING",
  "combiner": "OR",
  "conditions": [
    {
      "displayName": "Capacity Usage Ratio > 0.8",
      "conditionPrometheusQueryLanguage": {
        "query": "(sum by (instance_id, location) (lustre_googleapis_com:instance_capacity_bytes) - sum by (instance_id, location) (lustre_googleapis_com:instance_available_bytes)) / sum by (instance_id, location) (lustre_googleapis_com:instance_capacity_bytes) > 0.8",
        "duration": "300s",
        "evaluationInterval": "60s",
        "alertRule": "AlwaysOn"
      }
    }
  ],
  "documentation": {
    "content": "Action Required: The Managed Lustre instance is exceeding 80% capacity usage. Please verify if storage expansion is required.",
    "mimeType": "text/markdown"
  }
}
EOF

פרטי המדד

מדדים של Managed Lustre מצורפים לסוגי המשאבים המפוקחים הבאים:

  • lustre.googleapis.com/Instance
  • lustre.googleapis.com/Job
  • lustre.googleapis.com/QuotaEntity

הנתונים נדגמים כל 60 שניות. אחרי הדגימה, יכול להיות שיעברו עד 180 שניות עד שהנתונים יוצגו.

מדדים של נפח האחסון

מדדים שקשורים לנפח האחסון שזמין ומוקצה במערכת הקבצים של Lustre.

בתוויות של מדדים, הערך של target הוא בפורמט <fsname>-<TYPE><HEXA>, כאשר <HEXA> הוא האינדקס של היעד בבסיס הקסדצימלי, שמתחיל מאפס. לדוגמה, אם שם מערכת הקבצים הוא filesys, ה-OST ה-43 הוא filesys-OST002a, וה-MDT ה-4 הוא filesys-MDT0003.

מדדי נפח האחסון מצורפים למשאב lustre.googleapis.com/Instance.

מדד תיאור פרטים
available_bytes מספר הבייטים של נפח האחסון של יעד אחסון אובייקטים (OST) או יעד מטא-נתונים (MDT) מסוים שזמין למשתמשים שאינם משתמשי root.