AI bisa memberikan informasi yang keliru. Namun persoalan yang lebih sulit dikenali justru muncul ketika jawabannya terlihat benar dan kita berhenti memeriksanya.

Kita sudah cukup sering mendengar bahwa AI dapat berhalusinasi. Sistem bisa menyebut data yang tidak ada, mencampurkan fakta, bahkan memberikan referensi yang ternyata tidak pernah diterbitkan. Anehnya, semua itu dapat disampaikan dengan bahasa yang sama lancarnya dengan jawaban yang benar.

Masalah tersebut nyata, tetapi bukan satu-satunya persoalan. NIST dalam Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile bahkan memetakan risiko AI generatif jauh melampaui confabulation, istilah yang digunakannya untuk keluaran keliru atau palsu yang disajikan seolah benar. Risiko lain mencakup bias, privasi, keamanan informasi, integritas informasi, hingga persoalan dalam hubungan manusia dan AI.

Artinya, mengukur AI hanya berdasarkan seberapa sering ia memberikan jawaban benar bisa membuat kita melewatkan persoalan lain yang tidak selalu terlihat sebagai kesalahan. Sebuah keluaran dapat terdengar masuk akal, sesuai tata bahasa, bahkan faktual dalam beberapa bagiannya, tetapi tetap membawa persoalan dalam cara informasi itu dipilih, digeneralisasi, atau digunakan. Di sinilah keandalan AI menjadi pertanyaan yang jauh lebih rumit daripada sekadar benar atau salah.

Baca Juga: Saat AI Bisa Mengerjakan Banyak Hal, Keterampilan Apa yang Justru Menjadi Lebih Berharga?

Jawaban Benar Belum Tentu Berarti Sistemnya Dapat Dipercaya

Salah satu persoalannya adalah bias. AI belajar dari data yang dibuat, dikumpulkan, dan dikategorikan manusia dalam dunia yang memang tidak sepenuhnya netral. Ketimpangan representasi dan pola yang terkandung dalam data dapat ikut terbawa ketika sistem digunakan untuk menghasilkan informasi atau membantu mengambil keputusan.

NIST menempatkan harmful bias and homogenization sebagai salah satu risiko AI generatif. Risiko tersebut tidak hanya berkaitan dengan keluaran yang terang-terangan diskriminatif, tetapi juga kemungkinan model memperkuat pola tertentu, mengurangi keragaman perspektif, atau menghasilkan keluaran yang terlalu homogen. Karena itu, karakter AI yang dapat dipercaya tidak berhenti pada validitas dan reliabilitas, tetapi juga mencakup kemampuan mengelola bias yang merugikan.

Persoalannya menjadi lebih sulit karena bias tidak selalu tampil seperti kesalahan faktual. Jika AI salah menyebut ibu kota sebuah negara, kita relatif mudah memeriksanya. Namun jika sebuah sistem terus menghasilkan rekomendasi yang kurang merepresentasikan kelompok tertentu, persoalannya mungkin baru terlihat setelah pola tersebut diamati berulang kali.

Wendra Wilendra, M.MT., AI Strategist, melihat konteks sebagai salah satu bagian penting dalam kualitas interaksi manusia dengan AI. Ia menekankan bahwa AI membutuhkan tujuan, batas, data, dan contoh yang relevan agar ruang interpretasinya lebih terarah. Namun contoh yang keliru juga dapat membuat sistem menghasilkan jawaban yang konsisten dengan asumsi yang sejak awal sudah bermasalah.

Karena itu, manusia tidak cukup hanya bertanya apakah jawaban AI terdengar logis. Kita juga perlu mengetahui informasi apa yang diberikan kepadanya, asumsi apa yang dibawa ke dalam pertanyaan, dan untuk kepentingan apa hasil tersebut akan digunakan. Semakin besar konsekuensi sebuah keputusan, semakin tidak memadai jika kelancaran bahasa dijadikan ukuran kepercayaan.

Baca Juga: AI Membantu Kita Bekerja, Tapi Apakah Kita Masih Memahami Pekerjaannya?

Persoalan Berikutnya Justru Muncul Ketika AI Semakin Bagus

Ada paradoks menarik di sini. AI yang sering salah akan membuat pengguna berhati-hati, tetapi AI yang semakin sering benar justru berpotensi membuat kewaspadaan menurun. Setelah puluhan jawaban terasa membantu, jawaban berikutnya cenderung diterima dengan pemeriksaan yang lebih sedikit.

NIST menyebut salah satu risiko dalam konfigurasi manusia dan AI sebagai automation bias, yakni kecenderungan memberikan kepercayaan berlebihan kepada sistem otomatis. Lembaga tersebut mengingatkan bahwa meningkatnya reliabilitas AI justru dapat membuat manusia terlalu mengandalkannya atau menganggap konten AI mempunyai kualitas lebih tinggi daripada sumber lain. Ketergantungan semacam itu dapat memperbesar dampak risiko lain, termasuk confabulation dan bias.

Pandangan Wendra mengenai cara AI berbicara menjadi relevan di sini. Menurutnya, pengguna dapat tanpa sadar menghubungkan gaya penyampaian AI dengan tingkat kebenaran informasi, padahal sistem membangun respons yang koheren dan mudah dipahami tanpa memiliki keyakinan terhadap kebenaran seperti manusia. Kelancaran jawaban dan kepastian faktual merupakan dua hal yang berbeda.

Prof. Arvind Narayanan dari Princeton University membawa persoalan keandalan itu lebih jauh. Bersama timnya, ia mengembangkan penelitian mengenai reliabilitas agen AI dan menekankan bahwa kemampuan tinggi tidak identik dengan reliabilitas tinggi. Tim Princeton bahkan mengembangkan evaluasi yang tidak hanya melihat akurasi, tetapi juga konsistensi, prediktabilitas, ketahanan, dan keamanan sistem.

Pembedaan tersebut penting karena manusia biasanya tidak menggunakan AI sebagai soal ujian yang hanya menghasilkan nilai benar atau salah. Kita memakainya untuk meringkas dokumen, membaca data, membantu menulis, membuat rekomendasi, mencari kemungkinan penyelesaian masalah, bahkan semakin sering menggunakannya sebagai bagian dari alur kerja. Dalam situasi seperti itu, kegagalan yang jarang terjadi pun dapat menjadi penting jika pengguna sudah terbiasa menerima hasil tanpa pemeriksaan.

Maka tantangannya bukan membuat manusia selalu mencurigai AI. Jika setiap keluaran harus diperlakukan seolah pasti salah, manfaat teknologi ini juga akan berkurang. Yang dibutuhkan adalah kemampuan mengkalibrasi kepercayaan sesuai konteks, sumber informasi, tingkat risiko, dan konsekuensi apabila hasilnya ternyata keliru.

Untuk mencari gagasan atau menyusun alternatif kalimat, tingkat verifikasi yang dibutuhkan tentu berbeda dengan menggunakan AI untuk membaca kontrak, menyusun rekomendasi bisnis, atau menafsirkan informasi kesehatan. Pada pekerjaan dengan konsekuensi besar, sumber asli, data, konteks, dan penilaian manusia tetap perlu menjadi bagian dari proses. AI dapat mempercepat pekerjaan tanpa harus menjadi pihak terakhir yang menentukan apakah hasilnya benar.

Barangkali itu pula persoalan terbesar AI yang akan semakin sering kita hadapi. Bukan hanya kemungkinan mesin menghasilkan jawaban salah, tetapi kemungkinan manusia menjadi begitu terbiasa dengan jawaban yang benar sehingga lupa bahwa mesin tetap dapat keliru. AI yang semakin baik seharusnya membuat cara kita menggunakannya semakin matang, bukan membuat kebiasaan memeriksa perlahan menghilang. [][Rudi Tenggarawan/KK]

Penulisan artikel ini dibantu AI dan telah melewati proses kurasi Redaksi.