Context caching

Dalam alur kerja AI yang umum, Anda mungkin akan berulang kali meneruskan token input yang sama ke model. Gemini API menawarkan caching implisit untuk mengoptimalkan performa dan biaya.

Caching implisit

Caching implisit diaktifkan secara default untuk semua model Gemini 2.5 dan yang lebih baru. Caching implisit didukung untuk mode percakapan stateful (menggunakan previous_interaction_id) dan stateless. Kami akan otomatis meneruskan penghematan biaya jika permintaan Anda cocok dengan cache. Anda tidak perlu melakukan apa pun untuk mengaktifkan fitur ini. Jumlah token input minimum untuk caching konteks tercantum dalam tabel berikut untuk setiap model:

Model Batas token minimum
Gemini 3.8 Flash 4.096
Gemini 3.7 Flash 4.096
Gemini 3.6 Flash 4.096
Gemini 3.5 Flash 4.096
Pratinjau Gemini 3.1 Pro 4.096
Gemini 2.5 Flash 2.048
Gemini 2.5 Pro 2.048

Untuk meningkatkan peluang kecocokan cache implisit:

  • Coba tempatkan konten besar dan umum di awal perintah Anda
  • Coba kirim permintaan dengan awalan yang serupa dalam waktu singkat

Anda dapat melihat jumlah token yang cocok dengan cache di kolom usage.total_cached_tokens objek respons (Python dan JavaScript).