Apa itu Cached Token?
Token masukan berulang yang disimpan di memori cepat server penyedia AI untuk mempercepat respon dan memangkas biaya.
Apa itu cached token?
Cached token (atau prompt caching) adalah mekanisme penyimpanan sementara token masukan pada memori server penyedia model AI (seperti Anthropic, OpenAI, atau Google) agar tidak perlu dihitung ulang dari nol saat digunakan kembali pada panggilan berikutnya.
Fitur ini dirancang khusus untuk skenario percakapan panjang, analisis dokumen tebal, atau penggunaan instruksi sistem (system prompt) kompleks yang dikirimkan berulang-ulang dalam rentang waktu singkat.
Cara kerja prompt caching
- Penulisan cache (cache write): Saat Anda mengirimkan dokumen panjang untuk pertama kali dengan penanda cache, server memproses token dan menyimpannya di memori cache berkecepatan tinggi. Proses awal ini dikenakan tarif standar atau biaya penulisan awal.
- Masa aktif (time-to-live): Data cache disimpan dalam durasi tertentu (umumnya 5 menit hingga beberapa jam, tergantung aktivitas pemanggilan berikutnya).
- Pembacaan cache (cache read / cache hit): Ketika pengguna berikutnya atau pesan baru mengirimkan awalan teks yang identik, server langsung membaca hasil pra-komputasi tanpa mengolah ulang seluruh teks tersebut.
- Pemangkasan latensi: Waktu tunggu respons pertama (Time to First Token) menjadi jauh lebih cepat, sering kali berkurang lebih dari 50 persen.
Contoh pemakaian dan efisiensi biaya
Misalkan pengembang menyematkan buku panduan teknis setebal 50.000 token sebagai konteks referensi untuk bot layanan pelanggan.
- Tanpa caching: Tiap pertanyaan pengguna memaksa server membaca ulang 50.000 token dengan tarif reguler.
- Dengan caching: Panggilan pertama menulis ke cache. Pada pertanyaan kedua dan seterusnya, 50.000 token tersebut dihitung sebagai cached token dengan potongan harga mencapai 75% hingga 90% (misalnya pada Anthropic Prompt Caching dan OpenAI Prompt Caching).
Batasan dan salah paham umum
- Awalan harus sama persis: Caching biasanya bekerja dari awal teks (prefix matching). Jika satu kata di awal sistem prompt diubah, cache tidak dapat digunakan dan harus ditulis ulang.
- Batas minimum token: Fitur cache umumnya mensyaratkan batas minimum tertentu (misalnya minimal 1.024 token di Anthropic atau OpenAI) sebelum sistem mengaktifkan penyimpanan memori.
- Bukan penyimpanan permanen: Cached token bukan database permanen. Jika tidak ada permintaan baru dalam beberapa menit, cache akan kedaluwarsa dan dihapus otomatis dari memori server.
Rujukan resmi
- Anthropic Prompt Caching Guide & Cookbook (Pengecekan: September 2026, sumber: docs.anthropic.com/api/prompt-caching & github.com/anthropics/anthropic-cookbook).
- OpenAI Prompt Caching Documentation (Pengecekan: September 2026, sumber: platform.openai.com/docs/guides/prompt-caching).
Istilah Terkait
Token AIInput TokenSystem PromptContext WindowAPI