Gemini 레이아웃 파서로 문서 처리

Document AI 레이아웃 파서는 복잡한 파일의 비정형 콘텐츠를 고도로 구조화되고 정확하며 머신 리더블 정보로 변환하는 고급 텍스트 파싱 및 문서 이해 서비스입니다. Google의 전문 객체 문자 인식 (OCR) 모델과 Gemini의 생성형 AI 기능을 결합합니다. 전체 문서 구조를 이해하고 테이블, 그림, 목록, 헤더와 같은 요소를 식별하는 동시에 단락이 속한 제목과 같은 요소 간의 컨텍스트 관계를 유지합니다.

검색 및 검색 증강 생성 (RAG)의 중요한 문제를 해결하도록 설계되었습니다. 표준 OCR은 문서를 평면화하여 제목, 표, 목록과 같은 중요한 의미를 더하는 컨텍스트와 구조를 파괴합니다.

주요 사용 사례

작동 방식

Gemini 레이아웃 파서는 시맨틱 의미를 보존하도록 설계된 다단계 파이프라인에서 문서를 처리합니다.

  • 파싱 및 구조화: 문서가 수집됩니다. 모든 요소가 식별되고 트리 형식으로 구성됩니다. 이 DocumentLayout 프로토 필드는 문서의 고유 계층 구조를 보존합니다.
  • 주석 달기 및 구두 설명: 미리보기 Gemini의 생성 기능을 사용하여 복잡한 시각적 요소를 구두로 설명합니다. 그림, 차트, 표에 서식 있는 텍스트 설명이 주석으로 추가됩니다.
  • 청크 처리 및 증강: 파싱된 문서와 주석을 사용하여 시맨틱으로 일관된 청크를 만듭니다. 이러한 청크는 조상 제목과 같은 컨텍스트 정보로 증강되어 청크의 의미가 격리된 상태로 검색되더라도 보존되도록 합니다.

프로세서 버전

다음 모델을 레이아웃 파서에 사용할 수 있습니다. 모델 버전을 변경하려면 프로세서 버전 관리를 참고하세요.

기본 프로세서 할당량에 대한 할당량 증가 요청 (QIR)을 하려면 할당량 관리의 단계를 따르세요.

모델 버전 설명 출시 채널 출시일
pretrained-layout-parser-v1.0-2024-06-03 문서 레이아웃 분석을 위한 정식 버전입니다. 기본 선행 학습된 프로세서 버전입니다. 정식 2024년 6월 3일