יצירת מערך נתונים

כדי לאמן גרסה של מעבד, לשפר את האימון שלה או להעריך אותה, צריך מערך נתונים של מסמכים עם תוויות.

בדף הזה מוסבר איך ליצור מערך נתונים, לייבא מסמכים ולהגדיר סכימה. כדי להוסיף תוויות למסמכים שיובאו, אפשר לעיין במאמר בנושא הוספת תוויות למסמכים.

בדף הזה מניחים שכבר יצרתם מעבד שתומך באימון, באימון מתקדם או בהערכה. אם המעבד שלכם נתמך, הכרטיסייה Train תופיע במסוף Google Cloud .

אפשרויות אחסון של מערכי נתונים

יש שתי אפשרויות לשמירת מערך הנתונים:

  • בניהול Google
  • מיקום מותאם אישית ב-Cloud Storage

אלא אם יש לכם דרישות מיוחדות (למשל, לשמור מסמכים בתיקיות עם הצפנה באמצעות מפתח בניהול הלקוח), אנחנו ממליצים על אפשרות האחסון הפשוטה יותר בניהול Google. אחרי שיוצרים את מערך הנתונים, אי אפשר לשנות את אפשרות האחסון שלו במעבד.

התיקייה או תיקיית המשנה של מיקום מותאם אישית ב-Cloud Storage צריכות להיות ריקות בהתחלה, וצריך להתייחס אליהן כאל תיקיות לקריאה בלבד. שינויים ידניים בתוכן של מערך הנתונים עלולים להפוך אותו ללא שמיש ולגרום לאובדן שלו. הסיכון הזה לא קיים באפשרות האחסון שמנוהלת על ידי Google.

כדי להקצות את מיקום האחסון, פועלים לפי השלבים הבאים.

  1. הצגת אפשרויות מתקדמות במהלך יצירת מעבד חדש.

    create-dataset-1

  2. משאירים את ברירת המחדל של קבוצת הלחצנים Google-managed לאחסון.

    create-dataset-2

  3. לוחצים על יצירה.

    create-dataset-3

  4. מוודאים שערכת הנתונים נוצרה בהצלחה ושהמיקום שלה הוא מיקום בניהול Google.

    create-dataset-4

אפשרות אחסון מותאמת אישית

  1. מפעילים או משביתים את האפשרויות המתקדמות.

    create-dataset-1

  2. בוחרים באפשרות אציין מיקום אחסון משלי.

    create-dataset-5

  3. בוחרים תיקייה ב-Cloud Storage מרכיב הקלט.

    create-dataset-6

  4. לוחצים על יצירה.

    create-dataset-7

פעולות של Dataset API

בדוגמה הזו מוסבר איך להשתמש בשיטה processors.updateDataset כדי ליצור מערך נתונים. משאב של מערך נתונים הוא משאב יחיד במעבד, כלומר אין RPC ליצירת משאב. במקום זאת, אפשר להשתמש ב-updateDataset RPC כדי להגדיר את ההעדפות. ב-Document AI יש אפשרות לאחסן את מסמכי מערך הנתונים בקטגוריה של Cloud Storage שאתם מספקים, או לאפשר ל-Google לנהל אותם באופן אוטומטי.

לפני שמשתמשים בנתוני הבקשה, צריך להחליף את הנתונים הבאים:

LOCATION: Your processor location
PROJECT_ID: Your Google Cloud project ID
PROCESSOR_ID The ID of your custom processor
GCS_URI: Your Cloud Storage URI where dataset documents are stored

הקטגוריה שצוינה

פועלים לפי השלבים הבאים כדי ליצור בקשה לקבוצת נתונים עם קטגוריה של Cloud Storage שסיפקתם.

שיטת HTTP

PATCH https://LOCATION-documentai.googleapis.com/v1beta3/projects/PROJECT_ID/locations/LOCATION/processors/PROCESSOR_ID/dataset