Në një rrjedhë pune tipike të inteligjencës artificiale, mund t’i kaloni të njëjtat tokena hyrëse vazhdimisht një modeli. API-ja Gemini ofron ruajtje të memorizuar implicite për të optimizuar performancën dhe kostot.
Ruajtje e memorizuar e nënkuptuar
Ruajtja implicite në memorje aktivizohet si parazgjedhje për të gjitha modelet Gemini 2.5 dhe më të reja. Mbështetet si për modalitetet e bisedës me gjendje statefull (duke përdorur previous_interaction_id ) ashtu edhe për ato pa gjendje state . Ne i kalojmë automatikisht kursimet e kostos nëse kërkesa juaj arrin në memorje. Nuk ka nevojë të bëni asgjë për ta aktivizuar këtë. Numri minimal i tokenëve të hyrjes për ruajtjen e kontekstit në memorje është renditur në tabelën e mëposhtme për secilin model:
| Model | Limiti minimal i tokenëve |
|---|---|
| Binjakët 3.8 Flash | 4,096 |
| Binjakët 3.7 Flash | 4,096 |
| Binjakët 3.6 Flash | 4,096 |
| Binjakët 3.5 Flash | 4,096 |
| Pamje paraprake e Gemini 3.1 Pro | 4,096 |
| Binjakët 2.5 Flash | 2,048 |
| Gemini 2.5 Pro | 2,048 |
Për të rritur mundësinë e një goditjeje implicite në memorjen e përkohshme:
- Mundohu të vendosësh përmbajtje të mëdha dhe të zakonshme në fillim të kërkesës sate.
- Mundohu të dërgosh kërkesa me prefiks të ngjashëm në një kohë të shkurtër
Mund ta shihni numrin e tokenëve që ishin goditje në memorien e përkohshme (cache) në fushën usage.total_cached_tokens (Python dhe JavaScript) të objektit të përgjigjes.