Apa itu Output Token?
Token baru yang dihasilkan oleh model AI sebagai respons atau jawaban terhadap instruksi pengguna.
Apa itu output token?
Output token (atau completion token) adalah unit teks baru yang dibuat dan dihasilkan oleh model kecerdasan buatan sebagai jawaban atas pertanyaan atau instruksi pengguna. Setiap kata, tanda baca, kode pemrograman, atau karakter yang diketikkan AI di layar Anda adalah wujud dari output token.
Berbeda dengan input token yang dibaca sekaligus, output token diproduksi satu per satu secara berurutan melalui perhitungan probabilitas matematika.
Cara kerja pembuatan output token
- Prediksi probabilitas: Berdasarkan seluruh input token dan token yang sudah dibuat sebelumnya, model menghitung probabilitas token mana yang paling tepat muncul berikutnya (next-token prediction).
- Pengambilan sampel (sampling): Parameter seperti temperature dan top-p menentukan apakah model memilih token dengan kemungkinan tertinggi atau memberikan sedikit variasi kreatif.
- Penyusunan autoregresif: Setelah satu token terpilih, token tersebut langsung ditambahkan kembali ke konteks masukan untuk memprediksi token berikutnya. Proses berulang sampai model menghasilkan token penanda selesai (stop sequence).
- Pengiriman bertahap (streaming): Token yang baru dibuat dapat langsung dikirim ke antarmuka pengguna baris demi baris tanpa menunggu seluruh paragraf selesai dibuat.
Contoh pemakaian
Saat Anda meminta: "Tuliskan fungsi Python untuk mengecek tahun kabisat".
Kode dan penjelasan sepanjang 150 kata yang diberikan oleh AI akan menghabiskan sekitar 200 output token. Bila instruksi Anda hanya 10 token, total pemakaian tugas tersebut adalah 10 input token + 200 output token.
Batasan dan salah paham umum
- Biaya komputasi lebih tinggi: Output token membutuhkan komputasi lebih intensif karena server harus menjalankan inferensi berulang kali untuk setiap token. Oleh karena itu, tarif per 1 juta output token biasanya 3 hingga 5 kali lipat lebih tinggi daripada input token.
- Batas panjang respons (max output tokens): Setiap model memiliki batas maksimum output per panggilan (misalnya 4.096 atau 8.192 token). Jika jawaban terpotong di tengah kalimat, penyebabnya adalah batasan output token ini tercapai.
- Kecepatan bergantung pada spesifikasi model: Kecepatan keluaran token per detik (tokens per second) dipengaruhi oleh ukuran parameter model dan beban server penyedia.
Rujukan resmi
- OpenAI Platform Text Generation & Completion Models (Pengecekan: September 2026, sumber: platform.openai.com/docs/guides/text-generation).
- Google Gemini API Documentation (Pengecekan: September 2026, sumber: ai.google.dev/gemini-api/docs).
Istilah Terkait