데이터 세트 만들기

프로세서 버전을 학습시키거나 업트레이닝하거나 평가하려면 문서에 라벨이 지정된 데이터 세트가 필요합니다.

이 페이지에서는 데이터 세트를 만들고 문서를 가져오고 스키마를 정의하는 방법을 설명합니다. 가져온 문서에 라벨을 지정하려면 문서에 라벨 지정을 참고하세요.

이 페이지에서는 학습, 업트레이닝 또는 평가를 지원하는 프로세서를 이미 만들었다고 가정합니다. 프로세서가 지원되면 Google Cloud 콘솔에 학습 탭이 표시됩니다.

데이터 세트 스토리지 옵션

데이터 세트를 저장하는 방법은 다음 두 가지 중에서 선택할 수 있습니다.

  • Google 관리
  • 맞춤 위치 Cloud Storage

특수한 요구사항 (예: CMEK 지원 폴더에 문서를 보관)이 없는 경우 더 간단한 Google 관리 스토리지 옵션을 사용하는 것이 좋습니다. 데이터 세트 스토리지 옵션은 생성된 후에는 프로세서에 대해 변경할 수 없습니다.

맞춤 Cloud Storage 위치의 폴더 또는 하위 폴더는 비어 있어야 하며 엄격하게 읽기 전용으로 처리해야 합니다. 콘텐츠를 수동으로 변경하면 데이터 세트를 사용할 수 없게 되어 손실될 위험이 있습니다. Google 관리 스토리지 옵션에는 이러한 위험이 없습니다.

다음 단계에 따라 스토리지 위치를 프로비저닝하세요.

  1. 새 프로세서를 만드는 동안 고급 옵션을 표시합니다.

    create-dataset-1

  2. 기본 라디오 그룹 옵션을 Google 관리 스토리지로 유지합니다.

    create-dataset-2

  3. 만들기를 선택합니다.

    create-dataset-3

  4. 데이터 세트가 성공적으로 생성되었고 데이터 세트 위치가 Google 관리 위치인지 확인합니다.

    create-dataset-4

맞춤 스토리지 옵션

  1. 고급 옵션을 사용 또는 사용 안함으로 설정합니다.

    create-dataset-1

  2. 직접 스토리지 위치 지정을 선택합니다.

    create-dataset-5

  3. 입력 구성요소에서 Cloud Storage 폴더를 선택합니다.

    create-dataset-6

  4. 만들기를 선택합니다.

    create-dataset-7

Dataset API 작업

이 샘플에서는 processors.updateDataset 메서드를 사용하여 데이터 세트를 만드는 방법을 보여줍니다. 데이터 세트 리소스는 프로세서의 싱글톤 리소스이므로 리소스 생성 RPC가 없습니다. 대신 updateDataset RPC를 사용하여 환경설정을 설정할 수 있습니다. Document AI는 사용자가 제공한 Cloud Storage 버킷에 데이터 세트 문서를 저장하거나 Google에서 자동으로 관리하도록 하는 옵션을 제공합니다.

요청 데이터를 사용하기 전에 다음을 바꿉니다.

LOCATION: Your processor location
PROJECT_ID: Your Google Cloud project ID
PROCESSOR_ID The ID of your custom processor
GCS_URI: Your Cloud Storage URI where dataset documents are stored

제공된 버킷

다음 단계에 따라 제공한 Cloud Storage 버킷으로 데이터 세트 요청을 만듭니다.

HTTP 메서드

PATCH https://LOCATION-documentai.googleapis.com/v1beta3/projects/PROJECT_ID/locations/LOCATION/processors/PROCESSOR_ID/dataset

JSON 요청:

  {
      "name":"projects/PROJECT_ID/locations/LOCATION/processors/PROCESSOR_ID/dataset"
      "gcs_managed_config" {
          "gcs_prefix" {
              "gcs_uri_prefix": "GCS_URI"
          }
      }
      "spanner_indexing_config" {}
  }

Google 관리

Google 관리 데이터 세트를 만들려면 다음 정보를 업데이트하세요.

HTTP 메서드

PATCH https://LOCATION-documentai.googleapis.com/v1beta3/projects/PROJECT_ID/locations/LOCATION/processors/PROCESSOR_ID/dataset

JSON 요청:

  {
      "name":"projects/PROJECT_ID/locations/LOCATION/processors/PROCESSOR_ID/dataset"
      "unmanaged_dataset_config": {}
      "spanner_indexing_config": {}
  }

요청을 보내려면 Curl을 사용하면 됩니다.

요청 본문을 request.json 파일에 저장합니다. 다음 명령어를 실행합니다.

CURL

  curl -X PATCH \
  -H "Authorization: Bearer $(gcloud auth print-access-token)" \
  -H "Content-Type: application/json; charset=utf-8" \
  -d @request.json \
  "https://LOCATION-documentai.googleapis.com/v1beta3/projects/PROJECT_ID/locations/LOCATION/processors/PROCESSOR_ID/dataset"

다음과 비슷한 JSON 응답이 표시됩니다.

  {
      "name": "projects/PROJECT_ID/locations/LOCATION/operations/OPERATION_ID"
  }

문서 가져오기

새로 만든 데이터 세트는 비어 있습니다. 문서를 추가하려면 문서 가져오기를 선택하고 데이터 세트에 추가할 문서가 포함된 하나 이상의 Cloud Storage 폴더를 선택합니다.

Cloud Storage가 다른 Google Cloud 프로젝트에 있는 경우 Document AI가 해당 위치에서 파일을 읽을 수 있도록 액세스 권한을 부여해야 합니다. 특히 Document AI의 핵심 서비스 에이전트 service-{project-id}@gcp-sa-prod-dai-core.iam.gserviceaccount.com스토리지 객체 뷰어 역할을 부여해야 합니다. 자세한 내용은 서비스 에이전트를 참고하세요.

create-dataset-8

그런 다음 다음 할당 옵션 중 하나를 선택합니다.

  • 학습: 학습 세트에 할당
  • 테스트: 테스트 세트에 할당
  • 자동 분할: 학습 및 테스트 세트의 문서를 무작위로 셔플합니다.
  • 할당되지 않음: 학습 또는 평가에 사용되지 않습니다. 나중에 수동으로 할당할 수 있습니다.

나중에 언제든지 과제를 수정할 수 있습니다.

가져오기를 선택하면 Document AI에서 지원되는 파일 형식과 JSON Document 파일을 모두 데이터 세트로 가져옵니다. JSON Document 파일의 경우 Document AI가 문서를 가져와 entities을 라벨 인스턴스로 변환합니다.

가져오기가 완료된 후에는 Document AI가 가져오기 폴더를 수정하거나 폴더에서 데이터를 읽지 않습니다.

페이지 상단에서 활동을 선택하여 활동 패널을 엽니다. 이 패널에는 가져오기에 성공한 파일과 가져오기에 실패한 파일이 나열됩니다.

프로세서의 기존 버전이 이미 있는 경우 문서 가져오기 대화상자에서 자동 라벨 지정을 사용하여 가져오기 체크박스를 선택하면 됩니다. 문서를 가져올 때 이전 프로세서를 사용하여 자동으로 라벨이 지정됩니다. 자동 라벨 지정 문서를 라벨 지정됨으로 표시하지 않고 학습 또는 업트레이닝하거나 테스트 세트에서 사용할 수는 없습니다. 자동으로 라벨이 지정된 문서를 가져온 후 자동으로 라벨이 지정된 문서를 수동으로 검토하고 수정합니다. 그런 다음 저장을 선택하여 수정사항을 저장하고 문서를 라벨이 지정된 것으로 표시합니다. 그런 다음 필요에 따라 문서를 할당할 수 있습니다. 자동 라벨 지정을 참고하세요.

문서 가져오기 RPC

이 샘플에서는 dataset.importDocuments 메서드를 사용하여 데이터 세트로 문서를 가져오는 방법을 보여줍니다.

요청 데이터를 사용하기 전에 다음을 바꿉니다.

LOCATION: Your processor location
PROJECT_ID: Your Google Cloud project ID
PROCESSOR_ID: The ID of your custom processor
GCS_URI: Your Cloud Storage URI where dataset documents are stored
DATASET_TYPE: The dataset type to which you want to add documents. The value should be either `DATASET_SPLIT_TRAIN` or `DATASET_SPLIT_TEST`.
TRAINING_SPLIT_RATIO: The ratio of documents which you want to autoassign to the training set.

학습 또는 테스트 데이터 세트

학습 또는 테스트 데이터 세트에 문서를 추가하려면 다음 단계를 따르세요.

HTTP 메서드