Di sebuah meja makan ilustratif, seorang anak menunjukkan gambar buatan AI.
“Lucu ya. Aku minta kucing jadi astronot.”
Ayahnya melihat gambar itu. “Kok AI bisa tahu bentuk kucing sama baju astronot?”
“Karena pintar?”
“Bisa dibilang begitu. Tapi pintarnya itu belajar dari mana?”
Pertanyaan terakhir membuka satu konsep yang sering terdengar teknis: training data.
Bagi orang tua, istilah ini tidak perlu dipahami sampai level rumus matematika. Namun ada alasan kuat untuk mengenalnya. Training data membantu menjelaskan mengapa AI bisa menghasilkan sesuatu, mengapa AI dapat membawa bias, mengapa ia bisa mengulang pola yang salah, dan mengapa isu privasi serta hak atas data menjadi penting.
Training data bukan “buku jawaban” raksasa
Cara paling mudah menjelaskannya adalah membayangkan proses belajar pola.
Model AI dilatih menggunakan banyak contoh data. Untuk model bahasa, data itu dapat mencakup teks. Untuk model multimodal, pelatihan dapat melibatkan berbagai bentuk informasi seperti teks, gambar, audio, atau video, tergantung sistemnya.
Dari data tersebut, model belajar pola.
Bagaimana kata biasanya berhubungan.
Bagaimana sebuah konsep dijelaskan.
Seperti apa struktur kalimat.
Bagaimana objek visual dapat tampak.
Bagaimana instruksi dan respons berkaitan.
Namun jangan bayangkan training data sebagai satu perpustakaan yang selalu bisa dibuka model saat kita bertanya, lalu AI mengambil halaman tertentu dan membacakannya.
Model mempelajari parameter dan pola dari proses pelatihan. Ketika menjawab, ia menghasilkan respons berdasarkan kemampuan yang terbentuk dari pelatihan, konteks saat ini, dan sistem yang digunakan.
Ini perbedaan penting.
Anak sering bertanya, “Kalau AI pernah dilatih dari artikel tertentu, berarti artikel itu tersimpan di dalam AI?”
Jawabannya tidak sesederhana ya atau tidak.
Model tidak bekerja seperti folder biasa yang menyimpan semua dokumen pelatihan dalam bentuk file yang mudah kita buka satu per satu. Tetapi penelitian dan praktik industri juga mengakui adanya risiko model mengingat atau mereproduksi sebagian data dalam kondisi tertentu, sehingga perlindungan data tetap menjadi isu serius.
Karena itu, orang tua tidak perlu memilih antara dua ekstrem:
“AI menyimpan semua internet.”
atau
“AI sama sekali tidak punya hubungan dengan data yang dipakai melatihnya.”
Yang lebih tepat adalah memahami bahwa training data membentuk kemampuan model, dan cara data dikumpulkan, difilter, dipakai, serta dilindungi punya konsekuensi.
Dari mana training data berasal?
Jawabannya berbeda antarperusahaan dan antarproduk.
Sumber dapat mencakup data yang tersedia untuk publik, data berlisensi, data yang dibuat atau disediakan untuk pelatihan, data sintetis, serta bentuk data lain sesuai kebijakan pengembang.
Beberapa layanan juga memiliki aturan tertentu mengenai apakah interaksi pengguna dapat digunakan untuk meningkatkan model. Aturannya bisa berbeda antara layanan konsumen, akun bisnis, institusi, produk pendidikan, dan pengaturan privasi pengguna.
Inilah alasan orang tua sebaiknya tidak menggunakan satu asumsi untuk semua aplikasi.
Kalau satu aplikasi memiliki pilihan opt-out dari training, belum tentu aplikasi lain sama.
Kalau satu layanan menyatakan data akun tertentu tidak dipakai melatih model secara default, belum tentu layanan lain memiliki kebijakan identik.
Kalau sebuah video di media sosial berkata “semua chat kamu pasti masuk training”, jangan langsung percaya.
Sebaliknya, kalimat “AI tidak pernah menyimpan apa pun” juga tidak boleh diterima tanpa membaca kebijakan.
Untuk keluarga, keterampilan yang lebih penting adalah memeriksa kebijakan produk yang benar-benar digunakan.
“Aku cuma masukin tugas sekolah. Memangnya kenapa?”
Bayangkan anak ingin meminta AI merangkum tugas.
Ia menyalin seluruh dokumen.
Di dalamnya ternyata ada nama lengkap murid, nomor identitas sekolah, alamat email, nomor telepon orang tua, atau informasi lain yang tidak dibutuhkan untuk tugas merangkum.
Masalahnya bukan hanya “apakah data itu nanti dipakai training?”
Ada pertanyaan lebih luas.
Apakah data perlu diunggah sejak awal?
Bagaimana layanan menyimpan dan memprosesnya?
Siapa yang mengelola akun?
Apakah sekolah mengizinkan penggunaan tool itu?
Apakah ada informasi milik orang lain?
Apakah tersedia mode atau pengaturan dengan perlindungan lebih sesuai?
Training data hanyalah satu bagian dari privasi AI.
Orang tua perlu menghindari jebakan yang terlalu sempit: merasa aman hanya karena sebuah perusahaan mengatakan data tidak digunakan untuk melatih model. Data tetap dapat diproses atau disimpan untuk tujuan lain sesuai kebijakan layanan.
Prinsip keluarga yang lebih tahan lama adalah data minimization.
Masukkan hanya data yang memang diperlukan.
Kalau nama bisa dihapus, hapus.
Kalau contoh bisa dianonimkan, anonimkan.
Kalau tugas bisa dijelaskan tanpa mengunggah daftar siswa, jangan unggah daftar siswa.
Ini kebiasaan yang berguna bahkan ketika teknologi berganti.
Training data juga membantu menjelaskan bias
Misalnya model AI sering menggambarkan profesi tertentu dengan stereotip tertentu.
Atau sistem lebih bagus memahami gaya bahasa yang banyak terdapat dalam data dibanding bahasa daerah yang kurang terwakili.
Atau model memberi contoh keluarga dengan pola yang sangat sempit.
Salah satu sumber masalah bisa terkait representasi dalam data, tetapi bias AI tidak hanya berasal dari data. Lembaga standar seperti NIST menekankan bahwa bias dapat muncul dari faktor teknis, manusia, dan sistemik sepanjang siklus hidup AI.
Ini penting agar keluarga tidak menyederhanakan masalah menjadi:
“Kalau datanya banyak, AI pasti adil.”
Jumlah data tidak otomatis menjamin representasi seimbang.
Data besar tetap bisa mencerminkan ketimpangan masyarakat.
Data besar tetap bisa mengandung stereotip.
Data besar tetap bisa lebih kaya untuk bahasa tertentu dan lebih miskin untuk konteks tertentu.
Jadi ketika anak bertanya, “Kenapa AI sering kasih contoh luar negeri?”
Orang tua bisa menjawab, “Mungkin karena pola yang dipelajarinya lebih kuat di konteks itu, atau karena cara sistem dirancang. Kita bisa kasih konteks Indonesia dan tetap cek hasilnya.”
Training data dan hak cipta
Topik lain yang sering muncul adalah karya kreatif.
Anak mungkin bertanya:
“Kalau AI bisa bikin gambar mirip gaya tertentu, berarti dia lihat karya orang?”
Pertanyaan ini masuk ke wilayah yang masih berkembang secara hukum dan kebijakan di banyak negara. Detail hak cipta, lisensi, dan penggunaan data untuk training tidak selalu sederhana, dan dapat berbeda menurut yurisdiksi serta kasus.
Untuk orang tua, tidak perlu memberi jawaban hukum yang terlalu pasti jika memang belum pasti.
Kita bisa mengajarkan dua prinsip.
Pertama, karya kreatif dibuat manusia dan mempunyai hak serta kepentingan yang perlu dihormati.
Kedua, jangan menganggap “bisa dilakukan oleh AI” otomatis berarti “bebas digunakan tanpa aturan”.
Jika anak membuat proyek publik, komersial, atau untuk lomba, periksa ketentuan penggunaan tool dan aturan lombanya. Untuk kebutuhan sekolah, ikuti kebijakan guru dan institusi.
Ini lebih bertanggung jawab daripada memberikan fatwa cepat dari satu posting media sosial.
Apakah data chat keluarga menjadi training data?
Tidak ada jawaban universal.
Kebijakan produk berbeda.
Sebagai contoh, beberapa layanan konsumen menyediakan kontrol agar pengguna dapat memilih apakah konten mereka digunakan untuk meningkatkan model. Produk bisnis atau API dapat memiliki aturan berbeda. Kebijakan bisa diperbarui.
Karena itu, ketika keluarga mulai memakai tool AI baru, ada beberapa hal yang perlu dilihat:
Apakah interaksi digunakan untuk training atau peningkatan model?
Apakah ada pengaturan opt-out?
Berapa lama data disimpan?
Apakah ada akun khusus anak atau pendidikan?
Apa batas usia layanan?
Apakah orang tua atau sekolah perlu memberi persetujuan?
Apakah data dapat dihapus?
Jawaban harus diambil dari kebijakan terbaru layanan tersebut, bukan dari asumsi umum tentang “AI”.
Latihan sederhana: bedakan data publik, pribadi, dan milik orang lain
Orang tua bisa membuat latihan tanpa aplikasi apa pun.
Ambil beberapa contoh:
“Cuaca hari ini.”
“Nama lengkapku.”
“Foto kartu pelajar.”
“Cerita pendek yang aku tulis sendiri.”
“Nomor telepon teman.”
“Foto kelas yang ada 30 wajah.”
“Daftar nilai murid.”
“Artikel berita publik.”
Lalu minta anak mengelompokkan.
Mana informasi publik?
Mana informasi pribadi?
Mana data milik orang lain?
Mana karya yang punya pencipta?
Mana yang tidak perlu dimasukkan ke AI?
Latihan ini jauh lebih berguna daripada sekadar berkata, “Jangan kasih data ke AI,” karena anak belajar alasan dan konteks.
Tidak semua data sensitif dengan tingkat yang sama, tetapi prinsip kehati-hatian tetap penting.
“Kalau AI sudah dilatih, bisa enggak datanya dihapus?”
Ini pertanyaan teknis yang rumit.
Menghapus data dari sebuah database biasa relatif mudah dibayangkan. Tetapi efek data yang sudah ikut membentuk parameter model tidak selalu sama dengan menghapus satu file dari folder.
Bidang machine unlearning mempelajari cara mengurangi atau menghapus pengaruh data tertentu dari model, tetapi implementasinya tidak sederhana dan bergantung pada sistem.
Bagi keluarga, pelajarannya bukan menjadi ahli unlearning.
Pelajarannya adalah berpikir sebelum mengunggah.
Setelah informasi sensitif masuk ke suatu layanan online, pengguna bisa memiliki kontrol yang lebih terbatas daripada sebelum informasi itu dikirim.
Prinsip ini berlaku jauh melampaui AI.
Mengapa orang tua perlu peduli jika anak hanya memakai AI untuk belajar?
Karena AI literacy bukan hanya soal mendapatkan jawaban benar.
Ini juga soal memahami pertukaran yang terjadi.
Saat memakai layanan gratis atau berbayar, ada data yang diproses.
Saat membuat konten, ada pertanyaan tentang sumber pola yang dipelajari model.
Saat model menghasilkan stereotip, ada pertanyaan tentang representasi dan desain.
Saat sekolah mengadopsi AI, ada pertanyaan tentang data siswa.
Saat anak mengunggah foto, ada pertanyaan tentang identitas digital.
Training data menjadi pintu masuk untuk membicarakan semuanya.
Orang tua tidak perlu menakut-nakuti anak dengan kalimat, “Sekali masuk AI, hidupmu tamat.”
Itu tidak akurat dan tidak membantu.
Lebih baik membangun kebiasaan:
Sebelum upload, lihat apa yang sebenarnya diperlukan.
Sebelum percaya, lihat konteks.
Sebelum memakai tool baru, periksa aturan datanya.
Sebelum memasukkan data orang lain, pikirkan apakah kita punya hak untuk melakukannya.
Sebelum menyimpulkan bias, lihat kemungkinan sumbernya secara lebih luas.
Dari “AI pintar” menjadi “AI dilatih”
Kembali ke gambar kucing astronot tadi.
Anak itu mungkin tetap berkata, “AI-nya pintar banget.”
Tidak masalah.
Ayahnya bisa menambahkan satu lapisan:
“Iya, dan kepintaran itu datang dari proses pelatihan dengan data dan teknik tertentu. Makanya kita juga perlu peduli data apa yang dipakai, bagaimana sistem dibuat, dan data apa yang kita masukkan sekarang.”
Satu kalimat itu mengubah posisi anak.
Dari pengguna yang hanya kagum pada hasil menjadi pengguna yang mulai bertanya tentang proses.
Itulah inti AI literacy.
Bukan mematikan rasa penasaran.
Justru memperpanjangnya.
Dari “wow, AI bisa bikin ini” menjadi “AI belajar pola dari mana?”
Dari “aku tinggal upload” menjadi “data ini aman untuk dibagikan?”
Dari “kalau AI bilang begini berarti benar” menjadi “apa yang membentuk jawaban ini?”
Orang tua tidak harus bisa menjelaskan neural network saat makan malam.
Cukup mulai dari pertanyaan yang tepat.
Karena ketika anak memahami bahwa AI tidak muncul dari ruang kosong, mereka juga mulai memahami satu hal penting: teknologi selalu dibentuk oleh data, keputusan manusia, dan aturan yang layak kita periksa.
