Gemini API มีกลไกการเพิ่มประสิทธิภาพที่หลากหลายเพื่อช่วยให้คุณรักษาสมดุลระหว่างความเร็ว ต้นทุน และความน่าเชื่อถือตามความต้องการของภาระงานที่เฉพาะเจาะจง ไม่ว่าคุณจะสร้างบ็อตสนทนาแบบเรียลไทม์หรือเรียกใช้ไปป์ไลน์การประมวลผลข้อมูลแบบออฟไลน์ที่มีปริมาณมาก การเลือกกระบวนทัศน์ที่เหมาะสมจะช่วยลดต้นทุนหรือเพิ่มประสิทธิภาพได้อย่างมาก
| ฟีเจอร์ | มาตรฐาน | พับ | ลำดับความสำคัญ | กลุ่ม | กำลังแคช |
|---|---|---|---|---|---|
| การกำหนดราคา | ราคาเต็ม | ส่วนลด 50% | มากกว่ามาตรฐาน 75% ถึง 100% | ส่วนลด 50% | ส่วนลด 90% + พื้นที่เก็บข้อมูลโทเค็นตามสัดส่วน |
| เวลาในการตอบสนอง | วินาทีถึงนาที | นาที (เป้าหมาย 1-15 นาที) | วินาที | สูงสุด 24 ชั่วโมง | เวลาที่ได้รับโทเค็นแรกเร็วขึ้น |
| ความน่าเชื่อถือ | สูง / สูงปานกลาง | ดีที่สุดเท่าที่ทำได้ (ลดภาระได้) | สูง (ไม่หลุดร่วง) | สูง (สำหรับปริมาณงาน) | ไม่มี |
| อินเทอร์เฟซ | พร้อมกัน | พร้อมกัน | พร้อมกัน | อะซิงโครนัส | สถานะที่บันทึกไว้ |
| Use Case ที่ดีที่สุด | เวิร์กโฟลว์การสมัครทั่วไป | เชนแบบลำดับที่ไม่เร่งด่วน | แอปที่พร้อมใช้งานและแอปที่ผู้ใช้มองเห็น | ชุดข้อมูลขนาดใหญ่ การประเมินแบบออฟไลน์ | การค้นหาที่เกิดซ้ำในไฟล์เดียวกัน |
ระดับการให้บริการการอนุมาน (ซิงโครนัส)
คุณสามารถสลับระหว่างการรับส่งข้อมูลแบบซิงโครนัสที่เพิ่มประสิทธิภาพด้านความน่าเชื่อถือและการรับส่งข้อมูลแบบซิงโครนัสที่เพิ่มประสิทธิภาพด้านต้นทุน
ได้โดยส่งพารามิเตอร์ service_tier ในการเรียกการสร้างมาตรฐาน
การอนุมานมาตรฐาน (ค่าเริ่มต้น)
ระดับมาตรฐานเป็นตัวเลือกเริ่มต้นสำหรับการสร้างเนื้อหาตามลำดับ โดยจะให้เวลาในการตอบกลับตามปกติโดยไม่ต้องเสียค่าธรรมเนียมเพิ่มเติมหรือรอคิวนาน
- ความน่าเชื่อถือ: ความสำคัญระดับมาตรฐาน
- ราคา: ราคามาตรฐาน
- เหมาะสำหรับ: แอปพลิเคชันแบบโต้ตอบส่วนใหญ่ที่ใช้ในชีวิตประจำวัน
การอนุมานที่มีลำดับความสำคัญ (เพิ่มประสิทธิภาพเวลาในการตอบสนอง)
ลำดับความสำคัญจะกำหนดเส้นทางการประมวลผลคำขอของคุณไปยังคิวการประมวลผลที่มีความสำคัญสูง การเข้าชมนี้เป็นแบบไม่สามารถลดทอนได้ (ไม่ถูกแทนที่ด้วยระดับอื่นๆ) และมีความน่าเชื่อถือสูงสุด หากคุณเกินขีดจำกัดลำดับความสำคัญแบบไดนามิก ระบบจะลดระดับคำขอเป็นการประมวลผลแบบมาตรฐานอย่างเหมาะสมแทนที่จะล้มเหลวพร้อมข้อผิดพลาด
- ความน่าเชื่อถือ: ความสำคัญสูงสุด
- ราคา: สูงกว่าราคามาตรฐาน 75% ถึง 100%
- เหมาะสำหรับ: แชทบอทสำหรับลูกค้า การตรวจจับการฉ้อโกงแบบเรียลไทม์ และ ผู้ช่วยแบบเรียลไทม์ที่สำคัญต่อธุรกิจ
การอนุมานแบบยืดหยุ่น (เพิ่มประสิทธิภาพด้านต้นทุน)
การอนุมานแบบยืดหยุ่นให้ส่วนลด 50% เมื่อเทียบกับอัตรามาตรฐานโดยใช้ ความสามารถในการประมวลผลแบบออฟพีคตามโอกาส ระบบจะประมวลผลคำขอแบบ ซิงโครนัส ซึ่งหมายความว่าคุณไม่จำเป็นต้องเขียนโค้ดใหม่เพื่อจัดการออบเจ็กต์แบบกลุ่ม เนื่องจากเป็นทราฟิกที่ "ลด" ได้ ระบบจึงอาจหยุดคำขอชั่วคราวหากระบบ พบว่ามีการเพิ่มขึ้นของทราฟิกมาตรฐาน