Gemini API 최적화 및 추론

Gemini API는 특정 워크로드 요구사항에 따라 속도, 비용, 안정성의 균형을 맞추는 데 도움이 되는 다양한 최적화 메커니즘을 제공합니다. 실시간 대화형 봇을 빌드하든 대규모 오프라인 데이터 처리 파이프라인을 실행하든 올바른 패러다임을 선택하면 비용을 크게 절감하거나 성능을 높일 수 있습니다.

기능 표준 Flex 우선순위 일괄 캐싱
가격 책정 정상가 50% 할인 표준보다 75~100% 더 높음 50% 할인 90% 할인 + 비례 할당 토큰 스토리지
지연 시간 수 초에서 수 분 분 (1~15분 목표) 최대 24시간 첫 번째 토큰까지의 시간 단축
안정성 높음 / 중간-높음 최대한 노력 (삭제 가능) 높음 (삭제 불가) 높음 (처리량) 해당 사항 없음