Cloud Monitoring אוסף ושומר באופן אוטומטי מידע על מכונת Managed Lustre.
במסמך הזה מפורטת סקירה כללית של המדדים שזמינים לניטור Managed Lustre ב- Google Cloud. המדדים האלה עוזרים לכם להבין את הביצועים, הקיבולת והמצב של מערכות הקבצים של Managed Lustre, כדי שתוכלו לזהות צווארי בקבוק, לפתור בעיות ולבצע אופטימיזציה של ניצול המשאבים.
אפשר להשתמש במדדים האלה ב-Cloud Monitoring כדי ליצור לוחות בקרה בהתאמה אישית, להגדיר התראות ולקבל תובנות מעמיקות יותר לגבי ההתנהגות של מופע Managed Lustre.
Cloud Monitoring מופעל באופן אוטומטי עבור Managed Lustre. אין תשלום על איסוף הנתונים או על הצגת המדדים בGoogle Cloud מסוף. יכול להיות שיהיו חיובים על קריאות ל-API. פרטים על התמחור מופיעים במחירון של Cloud Monitoring.
התפקידים שצריך ב-IAM
נדרשים התפקידים הבאים:
- הצגת נתונים ב-Monitoring (
roles/monitoring.viewer) או הרשאות שוות ערך, כדי להציג מדדים ב-Cloud Monitoring. - הרשאת עריכה של מעקב (
roles/monitoring.editor) או הרשאות שוות ערך, כדי להגדיר התראות.
הצגת המדדים
מדדים של Cloud Monitoring זמינים משני מקומות במסוףGoogle Cloud :
בדף הפרטים של מכונת Managed Lustre מוצגים מדדים זמינים. בנוסף למדדים שמפורטים בדף הזה, המערכת מחשבת את רוחב הפס של הבייטים שהועתקו ואת קצב העתקת האובייקטים.
בדף Cloud Monitoring יש כמה אפשרויות של תרשימים והתאמות אישיות.
הצגת מדדים בדף הפרטים של המופע
כדי לראות את המדדים של מופע ספציפי:
נכנסים לדף Instances במסוף Google Cloud .
לוחצים על המופע שרוצים לראות את המדדים שלו. יופיע הדף Instance details.
לוחצים על הכרטיסייה מעקב. לוח הבקרה שמוגדר כברירת מחדל מוצג.
הצגת מדדים ב-Cloud Monitoring
כדי לראות את מדדי Managed Lustre ב-Cloud Monitoring:
נכנסים לדף Metrics Explorer במסוף Google Cloud .
פועלים לפי ההוראות במאמר יצירת תרשימים באמצעות Metrics Explorer כדי לבחור את המדדים ולהציג אותם.
הגדרת התראות
אתם יכולים להגדיר מדיניות התראות ב-Cloud Monitoring כדי לקבל התראה כשמערכת הקבצים של Managed Lustre עומדת בתנאים ספציפיים, כמו חריגה מקיבולת האחסון או ממגבלות התפוקה.
דרישות מוקדמות
כדי ליצור מדיניות התראות, צריך להיות לכם תפקיד עריכה ב-Monitoring (roles/monitoring.editor) ב-IAM בפרויקט.
יצירת מדיניות התראות
כדי להגדיר התראה, צריך להגדיר תנאי באמצעות מדד או שאילתת PromQL ולהגדיר ערוצי התראות.
נכנסים לדף Alerting במסוף Google Cloud . Google Cloud
לוחצים על + יצירת מדיניות.
בוחרים באפשרות Builder ובוחרים את המדד, או בוחרים באפשרות Code editor כדי להזין שאילתה עם PromQL. בבורר המדדים, המדדים של Managed Lustre נמצאים במשאבים Lustre instance ו-Lustre location.
מגדירים את הלוגיקה של הטריגר ומגדירים את ערוצי ההתראות ואת הגדרות ההתראות.
לוחצים על יצירת מדיניות.
מידע נוסף על יצירת טריגרים ואפשרויות אחרות זמין במאמרים הבאים:
- יצירת מדיניות התראות על סף מדד
- יצירת מדיניות התראות על היעדר מדדים
- יצירה של מדיניות התראות לגבי ערכי מדדים חזויים
דוגמה: יצירת התראה על קיבולת אחסון
בדוגמה הבאה אפשר לראות איך יוצרים התראה שמופעלת כשמופע Managed Lustre חורג מ-80% מהקיבולת שהוקצתה לו.
נכנסים לדף Alerting במסוף Google Cloud . Google Cloud
לוחצים על + יצירת מדיניות.
בוחרים באפשרות עורך הקוד.
בעורך השאילתות, מדביקים את שאילתת PromQL הבאה:
( sum by (instance_id, location) (lustre_googleapis_com:instance_capacity_bytes) - sum by (instance_id, location) (lustre_googleapis_com:instance_available_bytes) ) / sum by (instance_id, location) (lustre_googleapis_com:instance_capacity_bytes) > 0.8השאילתה הזו מחשבת את יחס השימוש בכל המקרים:
(Total - Available) / Total. הערך0.8מייצג את סך הבייטים שהגיעו ל-80% שימוש. כדי לקבל התראה כשמגיעים ל-90%, משנים את הערך הזה ל-0.9.לוחצים על Run Query (הפעלת שאילתה) כדי לאמת את התחביר ולראות תרשים של יחס השימוש הנוכחי.
לוחצים על הבא ומגדירים את הטריגר לAny time series violates (כל חריגה מסדרת זמן).
לוחצים על הבא. בקטע Documentation, מוסיפים פעולות מומלצות לפתרון בעיית הקיבולת. לדוגמה:
## Action Required: Lustre Capacity Warning The Managed Lustre instance is exceeding 80% capacity usage. **Metric:** Usage Ratio > 0.8 **Severity:** Warning **Recommended Actions:** 1. Check the instance details in the Google Cloud console. 2. Verify if this is expected data growth or a runaway process. 3. If valid, consider expanding the storage capacity of the instance or deleting old data to free up space. 4. Failure to address this may result in "No Space Left on Device" errors for client applications.
יצירת מדיניות התראות באמצעות gcloud
אפשר ליצור מדיניות התראות באמצעות Google Cloud CLI. שימו לב: תצטרכו לערוך את ההתראה במסוף Google Cloud בהמשך כדי להפעיל ערוצי התראה ספציפיים.
בדוגמה הבאה נוצרת התראה על קיבולת של 80% באמצעות gcloud:
gcloud monitoring policies create \
--policy-from-file=/dev/stdin <<EOF
{
"displayName": "Lustre High Capacity Usage (>80%)",
"severity": "WARNING",
"combiner": "OR",
"conditions": [
{
"displayName": "Capacity Usage Ratio > 0.8",
"conditionPrometheusQueryLanguage": {
"query": "(sum by (instance_id, location) (lustre_googleapis_com:instance_capacity_bytes) - sum by (instance_id, location) (lustre_googleapis_com:instance_available_bytes)) / sum by (instance_id, location) (lustre_googleapis_com:instance_capacity_bytes) > 0.8",
"duration": "300s",
"evaluationInterval": "60s",
"alertRule": "AlwaysOn"
}
}
],
"documentation": {
"content": "Action Required: The Managed Lustre instance is exceeding 80% capacity usage. Please verify if storage expansion is required.",
"mimeType": "text/markdown"
}
}
EOF
פרטי המדד
מדדים של Managed Lustre מצורפים לסוגי המשאבים המפוקחים הבאים:
lustre.googleapis.com/Instancelustre.googleapis.com/Joblustre.googleapis.com/QuotaEntity
הנתונים נדגמים כל 60 שניות. אחרי הדגימה, יכול להיות שיעברו עד 180 שניות עד שהנתונים יוצגו.
מדדים של נפח האחסון
מדדים שקשורים לנפח האחסון שזמין ומוקצה במערכת הקבצים של Lustre.
בתוויות של מדדים, הערך של target הוא בפורמט <fsname>-<TYPE><HEXA>, כאשר <HEXA> הוא האינדקס של היעד בבסיס הקסדצימלי, שמתחיל מאפס. לדוגמה, אם שם מערכת הקבצים הוא filesys, ה-OST ה-43 הוא filesys-OST002a, וה-MDT ה-4 הוא filesys-MDT0003.
מדדי נפח האחסון מצורפים למשאב lustre.googleapis.com/Instance.
| מדד | תיאור | פרטים |
|---|---|---|
available_bytes |
מספר הבייטים של נפח האחסון של יעד אחסון אובייקטים (OST) או יעד מטא-נתונים (MDT) מסוים שזמין למשתמשים שאינם משתמשי root. |