Document AI מאפשר לכם לאמן גרסאות חדשות של מעבדים באמצעות נתוני אימון משלכם, ולהעריך את האיכות של גרסת המעבד בהשוואה לנתוני בדיקה משלכם.
האפשרות הזו שימושית כשרוצים להשתמש במעבד בהתאמה אישית. יש מעבד Document AI לסוג המסמך שלך, אבל אפשר לאמן מחדש גרסה מותאמת אישית שלו כדי שתתאים לצרכים שלך.
בדרך כלל, האימון וההערכה מתבצעים במקביל כדי להגיע לגרסה של מעבד באיכות גבוהה שאפשר להשתמש בה.
Document AI
Document AI מאפשר לכם ליצור כלי חילוץ בהתאמה אישית, שמחלץ ישויות ממסמכים מסוג מסוים, למשל, הפריטים בתפריט או השם והפרטים ליצירת קשר מקורות חיים.
בניגוד למעבדים אחרים, מעבדים בהתאמה אישית לא מגיעים עם גרסאות מעובדות מראש, ולכן הם לא יכולים לעבד מסמכים עד שתאמנו גרסה מאפס.
כדי להתחיל להשתמש ב-Document AI, אפשר לעיין במאמר בנושא יצירת מעבד מותאם אישית משלכם.
עדכון של מעבד
אתם יכולים להמשיך לאמן גרסאות חדשות של מעבדים כדי לשפר את הדיוק של הנתונים, לחלץ שדות מותאמים אישית נוספים מהמסמכים ולהוסיף תמיכה בשפות חדשות.
אימון מתקדם מתבצע באמצעות למידת העברה בגרסאות של מעבדים שאומנו מראש על ידי Google, ובדרך כלל נדרשים פחות נתונים מאשר באימון מאפס.
כדי להתחיל, אפשר לעיין במאמר בנושא המשך אימון של מעבד שאומן מראש.
מעבדים נתמכים
לא כל המעבדים המיוחדים תומכים בהדרכה. אלה המעבדים שתומכים באימון.
שיקולים והמלצות לגבי נתונים
האיכות והכמות של הנתונים קובעות את האיכות של האימון, האימון הנוסף וההערכה.
החלק של קבלת קבוצה של מסמכים מייצגים מהעולם האמיתי ומתן מספיק תוויות באיכות גבוהה הוא בדרך כלל החלק שלוקח הכי הרבה זמן ומשאבים בתהליך.
מספר המסמכים
אם לכל המסמכים יש פורמט דומה (לדוגמה, טופס קבוע עם שונות נמוכה מאוד), נדרשים פחות מסמכים כדי להשיג דיוק. ככל שהשונות גבוהה יותר, כך נדרשים יותר מסמכים.
בתרשימים הבאים מוצגת הערכה גסה של מספר המסמכים שנדרשים כדי שמחלץ מסמכים בהתאמה אישית ישיג ציון איכות מסוים.
| מגוון קטן | שונות גבוהה |
|---|---|
![]() |
![]() |
יצירת תוויות לנתונים
כדאי לעיין באפשרויות לתווית מסמכים ולוודא שיש לכם מספיק משאבים להוספת הערות למסמכים במערך הנתונים.
אימון מודלים
מעבדי חילוץ מותאמים אישית יכולים להשתמש בסוגים שונים של מודלים, בהתאם לתרחיש השימוש הספציפי ולנתוני האימון הזמינים.
- מודל בהתאמה אישית: מודל שמשתמש בנתוני אימון מתויגים.
- מבוססות על תבנית: מסמכים עם פריסה קבועה.
- מבוסס-מודל: מסמכים עם וריאציות מסוימות בפריסה.
- מודל AI גנרטיבי: מבוסס על מודלים בסיסיים שעברו אימון מראש ודורשים אימון נוסף מינימלי.
בטבלה הבאה מוצגים תרחישי שימוש שמתאימים לכל סוג מודל.
| מודל בהתאמה אישית | AI גנרטיבי | ||
|---|---|---|---|
| מבוסס על תבנית | מבוסס על מודל | ||
| גרסת פריסה | ללא | נמוכה עד בינונית | גבוהה |
| כמות הטקסט החופשי (לדוגמה, פסקאות בחוזה) | נמוכה | נמוכה | גבוהה |
| כמות נתוני האימון הנדרשת | נמוכה | גבוהה | נמוכה |
| רמת הדיוק עם נתוני אימון מוגבלים | גבוה יותר | נמוך יותר | גבוה יותר |
איך משפרים את הביצועים של מעבד באמצעות תיאורי נכסים
מתי כדאי להשתמש במעבד אחר
הנה כמה דוגמאות למקרים שבהם כדאי לשקול אפשרויות אחרות מלבד Document AI Workbench, או להתאים את תהליך העבודה:
- פורמטים מסוימים של קלט מבוסס-טקסט (.txt, .html, .docx, .md וכו') לא נתמכים ב-Document AI Workbench. כדאי לשקול שימוש במוצרים אחרים לעיבוד שפה מובנים מראש או בהתאמה אישית ב- Google Cloud, כמו Cloud Natural Language API.
- הסכימה של הכלי המותאם אישית לחילוץ מסמכים תומכת בעד 150 תוויות של ישויות. אם הלוגיקה העסקית שלכם דורשת יותר מ-150 ישויות בהגדרת הסכימה, כדאי לאמן כמה מעבדים, שכל אחד מהם יתמקד בקבוצת משנה של ישויות.
איך מאמנים מעבד
בהנחה שכבר יצרתם מעבד שתומך באימון או באימון מחדש והוספתם תוויות למערך הנתונים, אתם יכולים לאמן גרסה חדשה של מעבד מאפס. אפשר גם להמשיך לאמן גרסה חדשה של מעבד על סמך גרסה קיימת.
גרסת מעבד האימון
ממשק משתמש באינטרנט
במסוף Google Cloud , עוברים לכרטיסייה Train של המעבד.
לוחצים על עריכת סכימה כדי לפתוח את הדף ניהול תוויות. בודקים את התוויות של המעבד.
התוויות שמופעלות בזמן האימון קובעות את הישויות שגרסת המעבד החדשה מחלצת. אם תווית לא פעילה בסכימה, מעבד הגרסה לא מחלץ את התווית הזו, גם אם המסמכים מסומנים בתווית.
בכרטיסייה Train (אימון), לוחצים על View Label Stats (הצגת נתוני התוויות) ומאמתים את קבוצת הבדיקה וקבוצת הנתונים לאימון. מסמכים שתויגו אוטומטית, לא תויגו או לא הוקצו לא נכללים באימון ובהערכה.
לוחצים על אימון גרסה חדשה.
השדה Version Name מגדיר את השדה
nameשלprocessorVersion.
לוחצים על Start training (התחלת האימון) ומחכים עד שהגרסה החדשה של המעבד תאומן ותיבדק.
אפשר לעקוב אחרי התקדמות האימון בכרטיסייה ניהול גרסאות:

לוחצים על הכרטיסייה Evaluate & Test (הערכה ובדיקה) כדי לראות את הביצועים של גרסת המעבד החדשה בקבוצת נתונים לבדיקה. מידע נוסף זמין במאמר בנושא הערכת גרסת המעבד.
Python
למידע נוסף, קראו את מאמרי העזרה של Document AI Python API.
כדי לבצע אימות ב-Document AI, צריך להגדיר את Application Default Credentials. מידע נוסף זמין במאמר הגדרת אימות לסביבת פיתוח מקומית.

