การแคชบริบท

ในเวิร์กโฟลว์ AI ทั่วไป คุณอาจส่งโทเค็นอินพุตเดียวกันซ้ำๆ ไปยังโมเดล Gemini API มีการแคชแบบไม่เจาะจงเพื่อเพิ่มประสิทธิภาพและลดต้นทุน

การแคชแบบไม่เจาะจง

ระบบจะเปิดใช้การแคชแบบไม่เจาะจงโดยค่าเริ่มต้นสำหรับโมเดล Gemini 2.5 และใหม่กว่าทั้งหมด โดยรองรับทั้งโหมดการสนทนาแบบเก็บสถานะ (ใช้ previous_interaction_id) และแบบไม่เก็บสถานะ เราจะส่งต่อการประหยัดต้นทุนโดยอัตโนมัติหากคำขอของคุณตรงกับแคช คุณไม่จำเป็นต้องดำเนินการใดๆ เพื่อเปิดใช้ฟีเจอร์นี้ จำนวนโทเค็นอินพุตขั้นต่ำสำหรับการแคชบริบทแสดงอยู่ในตารางต่อไปนี้สำหรับแต่ละโมเดล

โมเดล ขีดจำกัดโทเค็นขั้นต่ำ
Gemini 3.8 Flash 4,096
Gemini 3.7 Flash 4,096
Gemini 3.6 Flash 4,096
Gemini 3.5 Flash 4,096
Gemini 3.1 Pro Preview 4,096
Gemini 2.5 Flash 2,048
Gemini 2.5 Pro 2,048

วิธีเพิ่มโอกาสที่จะพบแคชแบบไม่เจาะจง:

  • ลองวางเนื้อหาขนาดใหญ่และเนื้อหาทั่วไปไว้ที่จุดเริ่มต้นของพรอมต์
  • ลองส่งคำขอที่มีคำนำหน้าที่คล้ายกันภายในระยะเวลาสั้นๆ

คุณสามารถดูจำนวนโทเค็นที่ตรงกับแคชได้ในช่อง usage.total_cached_tokens (Python และ JavaScript) ของออบเจ็กต์การตอบกลับ