Ada satu pengalaman yang semakin akrab bagi pengguna AI. Kita sudah menjelaskan aturan, memberi contoh, bahkan mengoreksi kesalahan yang sama beberapa kali. AI mengangguk dalam bentuk jawaban yang meyakinkan, lalu beberapa percakapan kemudian melakukan persis apa yang sudah dilarang.
Rasanya seperti mengajari seseorang yang selalu mengatakan "iya, saya mengerti", tetapi besok mengulangi kesalahan yang sama. Bedanya, AI tidak sedang pura-pura mengerti. Cara AI menggunakan percakapan memang berbeda dari cara manusia menyimpan pengalaman dan menjadikannya kebiasaan.
Di sinilah istilah "lupa" perlu diperlakukan dengan hati-hati. Sebuah model bahasa tidak membaca percakapan seperti manusia membaca buku harian, lalu menyimpan setiap kalimat sebagai ingatan permanen yang bisa dipanggil kapan saja. Yang tersedia bagi model pada saat menghasilkan jawaban adalah konteks tertentu, ditambah mekanisme memori atau instruksi lain yang disediakan oleh sistem yang digunakan.
Penelitian tentang long context menunjukkan bahwa model bahasa dapat mengalami penurunan kemampuan ketika harus menemukan dan menggunakan informasi tertentu di dalam konteks yang panjang. Studi yang dikenal sebagai Lost in the Middle menemukan bahwa model sering lebih baik menggunakan informasi yang berada di awal atau akhir konteks dibanding informasi relevan yang berada di tengah.
Baca Juga: Ketika AI Mulai Terdengar Terlalu Meyakinkan, Padahal, Ia Bisa Salah Tanpa Merasa Bersalah
AI Tidak Selalu Kehilangan Informasi, Ia Bisa Kehilangan Prioritas
Bayangkan sebuah percakapan yang awalnya hanya berisi beberapa instruksi. "Gunakan bahasa Indonesia." "Jangan terlalu formal." "Jangan menggunakan paragraf satu kalimat." Semuanya masih relatif mudah ditemukan dan digunakan karena konteksnya pendek.
Lalu percakapan berkembang menjadi puluhan halaman. Ada pertanyaan baru, revisi, data, contoh, koreksi, perubahan topik, dan instruksi tambahan. Aturan yang sebelumnya terasa sangat penting kini menjadi salah satu bagian dari lautan informasi yang harus diproses untuk menghasilkan satu jawaban berikutnya.
Ini tidak berarti AI benar-benar menghapus instruksi tersebut. Persoalannya adalah apakah informasi itu masih tersedia dalam konteks yang digunakan, seberapa relevan ia terhadap tugas saat itu, dan bagaimana model menentukan bagian mana yang perlu memengaruhi jawabannya.
Fenomena ini menjadi salah satu alasan mengapa context window penting dalam sistem AI. Context window pada dasarnya adalah jumlah informasi yang dapat diproses model dalam satu konteks kerja. Ia bukan sinonim dari memori permanen, dan semakin banyak informasi yang dimasukkan tidak otomatis berarti semakin baik model menggunakan seluruh informasi tersebut.
Bahkan penelitian Liu dan koleganya menunjukkan bahwa kemampuan model dalam mengambil informasi dari konteks panjang dapat berubah tergantung posisi informasi tersebut. Temuan ini penting karena menunjukkan bahwa "AI sudah diberi informasinya" tidak sama dengan "AI akan selalu menggunakan informasi itu secara tepat".
Hal yang sama dapat terjadi pada instruksi. Kita mungkin sudah mengatakan berkali-kali bahwa sebuah gaya penulisan tidak boleh digunakan, tetapi instruksi itu tetap harus bersaing dengan konteks lain yang sedang diproses. Ketika tugas berubah, percakapan bertambah panjang, atau instruksi baru muncul, model dapat menghasilkan jawaban yang tidak lagi sepenuhnya sesuai dengan aturan yang sebelumnya kita anggap sudah terkunci.
Karena itu, mengulang instruksi terkadang membantu, tetapi mengulang bukanlah jaminan. Yang lebih penting adalah bagaimana instruksi tersebut ditempatkan, dirumuskan, dan dipertahankan sebagai bagian dari konteks yang relevan.
Baca Juga: Mengapa Kita Semakin Mudah Percaya pada Jawaban yang Disampaikan AI dengan Meyakinkan?
"Memori" AI Juga Bukan Satu Hal yang Sederhana
Kebingungan menjadi semakin besar karena berbagai produk AI kini memang memiliki fitur yang disebut memory. Pengguna kemudian mudah menyimpulkan bahwa jika AI memiliki memori, semua hal yang pernah dikatakan seharusnya tersimpan dan selalu digunakan.
Padahal, mekanismenya bisa berbeda dari satu produk ke produk lain. Dalam ChatGPT, misalnya, OpenAI membedakan antara memori tersimpan dan referensi terhadap riwayat percakapan. OpenAI juga menjelaskan bahwa ChatGPT tidak mengingat setiap detail dari percakapan sebelumnya, sehingga informasi yang ingin selalu dipertahankan lebih tepat dimasukkan sebagai memori tersimpan atau instruksi yang memang dirancang untuk menjadi panduan.
Artinya, ada perbedaan antara riwayat, konteks, instruksi, dan memori. Keempatnya bisa saling berhubungan, tetapi tidak dapat dianggap sebagai satu lemari arsip yang berisi semua kalimat yang pernah kita ucapkan kepada AI.
Ini juga menjelaskan mengapa pengguna kadang merasa paradoks. AI bisa mengingat sesuatu yang pernah kita ceritakan, tetapi gagal mengikuti aturan yang sudah kita tekankan berkali-kali. Dari sudut pandang manusia, keduanya terlihat seperti tindakan mengingat. Dari sudut pandang sistem, informasi tersebut dapat memiliki status, mekanisme pengambilan, dan tingkat relevansi yang berbeda.
Ada pula persoalan yang lebih mendasar: model bahasa menghasilkan jawaban berdasarkan pola dan konteks yang tersedia, bukan dengan menjalankan daftar aturan seperti program komputer yang selalu memeriksa satu per satu setiap larangan sebelum memberikan keluaran. Karena itu, kemampuan mengikuti instruksi adalah persoalan tersendiri yang terus menjadi objek evaluasi dalam penelitian AI. Studi terbaru tentang instruction following juga menemukan adanya kesenjangan antara kemampuan model mengerjakan tugas umum dan kemampuannya mematuhi instruksi yang sangat spesifik secara konsisten.
Maka, ketika AI mengulangi kesalahan yang sudah kita koreksi, jawabannya tidak selalu "AI lupa". Bisa saja instruksinya tidak lagi berada dalam konteks aktif, informasinya kalah relevan dibanding bagian lain, terjadi konflik dengan instruksi lain, atau model memang gagal mengikuti aturan yang tersedia.
Ini perbedaan kecil dalam istilah, tetapi besar dalam cara kita menggunakan AI. Jika kita menyebut semuanya sebagai "lupa", kita akan mencari solusi yang salah. Kita akan terus mengulang perintah, padahal masalah sebenarnya mungkin terletak pada struktur instruksi atau cara sistem mengelola konteks.
Bagi pengguna, pelajarannya cukup praktis. Instruksi yang benar-benar penting sebaiknya dibuat jelas, konsisten, dan ditempatkan di lokasi yang memang diperlakukan sebagai panduan berkelanjutan oleh sistem yang digunakan. Untuk pekerjaan panjang, aturan utama juga lebih aman diringkas kembali daripada mengandalkan percakapan lama sebagai satu-satunya sumber kebenaran.
Pada saat yang sama, kita perlu berhenti memperlakukan AI seperti manusia yang sedang belajar dari pengalaman. Ketika seseorang dikoreksi lalu besok melakukan kesalahan yang sama, kita bisa mengatakan ia lupa, tidak memperhatikan, atau memang tidak belajar. Pada AI, persoalannya jauh lebih teknis karena "belajar", "mengingat", "menggunakan konteks", dan "mengikuti instruksi" adalah proses yang berbeda.
Mungkin justru di situlah letak salah satu batas penting AI hari ini. Ia dapat memproses percakapan yang sangat panjang dan menghasilkan jawaban yang tampak memahami konteks, tetapi kemampuan itu tidak berarti setiap hal yang pernah kita katakan berubah menjadi aturan permanen.
Jadi, ketika AI kembali melakukan kesalahan yang sudah kita koreksi, pertanyaannya bukan hanya, "Mengapa kamu lupa?" Pertanyaan yang lebih tepat adalah, "Bagian mana dari informasi yang sudah diberikan tidak lagi menjadi bagian yang cukup kuat untuk memengaruhi jawabanmu?"
Pertanyaan itu mengubah cara kita memperlakukan AI. Kita tidak lagi sekadar berharap mesin "mengingat", tetapi mulai memahami bagaimana konteks, instruksi, relevansi, dan memori bekerja. Dan semakin AI menjadi bagian dari pekerjaan sehari-hari, kemampuan memahami mekanisme itu mungkin sama pentingnya dengan kemampuan membuat prompt yang bagus. [][Rudi Tenggarawan/KK]
Penulisan artikel ini dibantu AI dan telah melewati proses kurasi Redaksi.