Apa itu Token AI?
Potongan dasar teks yang diproses oleh model kecerdasan buatan, setara dengan beberapa karakter atau sekitar tiga perempat kata.
Apa itu token AI?
Token AI adalah unit data terkecil yang dibaca dan dihasilkan oleh model bahasa besar (LLM) seperti GPT-4o, Claude 3.5 Sonnet, atau Gemini. Model AI tidak membaca kalimat utuh atau huruf satu per satu secara langsung seperti manusia. Sebaliknya, teks dipecah menjadi potongan-potongan kecil yang disebut token.
Satu token umumnya mewakili sekitar 4 karakter dalam bahasa Inggris, atau setara dengan 0,75 kata. Untuk bahasa Indonesia atau teks dengan banyak tanda baca, satu kata bisa terpecah menjadi dua token atau lebih.
Cara kerja tokenisasi
Proses pemecahan teks menjadi token disebut tokenisasi (tokenization). Alat pemecah (tokenizer) memetakan teks ke daftar angka numerik (token ID):
- Pemotongan kata: Kata umum seperti "komputer" bisa menjadi satu token, sedangkan kata yang jarang atau gabungan bisa terpotong menjadi beberapa sub-kata (misalnya "memper" dan "baiki").
- Konversi ke angka: Setiap potongan dicocokkan dengan kamus (vocabulary) bawaan model. Misalnya kata "halo" diubah menjadi ID integer tertentu.
- Pemrosesan vektor: Model AI mengolah deretan angka tersebut ke ruang representasi matematika (embedding) untuk memahami konteks dan memprediksi token berikutnya.
- Detokenisasi: Angka hasil keluaran model diterjemahkan kembali menjadi karakter teks yang terbaca oleh pengguna.
Contoh pemakaian dan estimasi
Jika Anda mengetik kalimat:
"Bagaimana cara restart HP Samsung?"
Tokenizer modern (seperti tiktoken dari OpenAI) membagi kalimat tersebut menjadi sekitar 7 hingga 9 token tergantung pembagian spasi dan imbuhan kata. Jumlah token ini menentukan beban komputasi server dan biaya API yang dikenakan kepada pengembang.
Batasan dan salah paham umum
- Bukan jumlah kata: Banyak orang mengira 1.000 kata sama dengan 1.000 token. Faktanya, 1.000 kata bahasa Indonesia biasanya membutuhkan 1.200 hingga 1.600 token karena struktur morfologi dan imbuhan.
- Konsumsi bahasa non-Inggris lebih banyak: Teks non-Latin atau bahasa dengan kosakata yang kurang dominan di data pelatihan sering kali memerlukan lebih banyak token untuk menyampaikan arti yang sama.
- Batas memori model (context window): Kapasitas memori model dibatasi oleh total token (gabungan masukan dan keluaran), bukan panjang halaman dokumen.
Rujukan resmi
- OpenAI Cookbook & Dokumentasi Tiktoken (Pengecekan: September 2026, sumber: platform.openai.com/docs & github.com/openai/tiktoken).
Istilah Terkait