Gemini 3.8 Flash Bisa Kloning Suara dari Teks, Ini Kemampuan dan Risikonya

Gemini 3.8 Flash Bisa Kloning Suara dari Teks, Ini Kemampuan dan Risikonya
Ilustrasi: Gemini 3.8 Flash Bisa Kloning Suara (Foto: Wikimedia Commons)

Google merilis model kecerdasan buatan Gemini 3.8 Flash dengan kemampuan pengubah teks menjadi suara sekaligus peniruan suara, kemampuan yang membuka banyak manfaat sekaligus menghadirkan risiko penyalahgunaan. Google merilis pembaruan besar pada model kecerdasan buatannya dengan kemampuan baru mengubah teks menjadi suara dan menirukan karakter suara dari contoh singkat. Pembaruan ini menandai masuknya raksasa mesin pencari itu ke wilayah yang selama ini dikuasai penyedia layanan suara khusus.

Sementara Itu

Kemampuan mengubah teks menjadi suara sudah lama tersedia, tetapi kualitas dan kecepatannya kini jauh berbeda. Model terbaru disebut mampu menghasilkan ucapan yang terdengar alami, lengkap dengan jeda napas dan intonasi, bahkan dalam beberapa bahasa sekaligus dengan aksen yang mendekati penutur asli.

Baca juga: OpenAI Batalkan Peluncuran Model AI Terbaru karena Masalah Keamanan Cara Cek Data Pribadi Bocor di Internet dan Langkah Pencegahannya

Yang paling menarik perhatian adalah fitur peniruan suara. Dengan contoh rekaman pendek, sistem dapat menghasilkan ucapan baru yang menyerupai karakter suara tersebut. Teknologi itu sebelumnya memerlukan perangkat dan waktu latihan jauh lebih besar.

Dari sisi manfaat, teknologi ini membuka banyak peluang. Pembuat konten dapat menambahkan sulih suara pada video tanpa harus menyewa studio. Penyandang disabilitas yang kehilangan kemampuan berbicara dapat memulihkan suara pribadinya. Sementara itu, layanan pelanggan dapat menyediakan bantuan suara dalam banyak bahasa dengan cepat.

Sektor pendidikan juga bisa mengambil manfaat, misalnya menyediakan bahan ajar bersuara untuk siswa yang lebih mudah belajar dengan mendengar. Penerbit buku bisa memproduksi versi audio lebih cepat dan murah, sehingga buku yang biasanya tidak pernah dibuatkan versi audio kini memiliki peluang lebih besar.

Namun risiko penyalahgunaan nyata. Peniruan suara bisa dipakai untuk membuat rekaman palsu yang membingungkan keluarga, misalnya suara anak yang meminta uang dalam keadaan darurat. Pola penipuan semacam itu sudah terdeteksi di beberapa negara dan cenderung meningkat ketika biaya membuat suara palsu turun.

Tanggapan

Risiko lain adalah penyebaran informasi palsu. Rekaman suara pejabat yang dipalsukan bisa menyebar cepat melalui aplikasi pesan sebelum sempat diverifikasi. Karena telinga cenderung mempercayai apa yang didengar, rekaman suara palsu sering lebih meyakinkan daripada tulisan palsu.

Untuk menekan risiko itu, sejumlah penyedia layanan menambahkan tanda air digital pada hasil suara buatan dan membatasi peniruan suara tokoh publik. Pemerintah di beberapa negara juga menyiapkan aturan yang mewajibkan pelabelan konten hasil kecerdasan buatan.

Keamanan siber menjadi isu lain. Model bahasa yang mampu menjelajah laman web, seperti kemampuan memesan tiket atau menghubungi layanan bisnis, juga bisa dipakai untuk memetakan kelemahan sistem. Beberapa pengamat menyoroti bahwa kemampuan ini perlu dibatasi agar tidak disalahgunakan untuk mencari celah.

Bagi pengguna di Indonesia, ketersediaan resmi fitur-fitur seperti ini biasanya mengikuti jadwal peluncuran bertahap. Sebagian fitur muncul lebih dulu di negara asal dan pasar besar, lalu menyebar ke wilayah lain. Karena itu penting memeriksa kanal resmi sebelum mempercayai kabar tentang pembukaan akses.

Ada langkah praktis yang bisa dilakukan siapa pun untuk melindungi diri. Pertama, sepakati kata sandi keluarga untuk keadaan darurat, sehingga permintaan uang lewat telepon dapat diverifikasi. Kedua, jangan mengunggah rekaman suara panjang ke layanan yang tidak jelas kebijakan datanya. Ketiga, perlakukan permintaan mendesak yang tidak biasa dengan sikap skeptis.

Langkah Selanjutnya

Untuk pekerja kreatif, masuknya alat suara buatan mengubah peta kerja sekaligus membuka peluang baru. Pengisi suara kini bisa melisensikan karakter suaranya, tetapi juga menghadapi persaingan dari versi sintetis. Perkembangan aturan hak suara pribadi akan sangat menentukan arah profesi ini beberapa tahun ke depan.

Kalangan industri memperkirakan persaingan model suara akan makin ketat, dengan penekanan pada dua hal: kualitas bahasa daerah dan kecepatan pemrosesan di perangkat. Model yang bisa berjalan tanpa sambungan internet dinilai lebih menarik karena tidak bergantung pada koneksi dan dinilai lebih aman untuk data pribadi.

Kesimpulannya, kemampuan mengubah teks menjadi suara dan menirukan suara membuat alat kecerdasan buatan makin berguna, tetapi sekaligus memperbesar tanggung jawab penggunanya. Yang perlu dipantau berikutnya adalah kebijakan pelabelan konten suara buatan dan langkah penyedia layanan membatasi penyalahgunaan di wilayah yang belum memiliki aturan khusus.

Kualitas bahasa Indonesia pada model suara buatan masih menjadi pekerjaan rumah. Model global umumnya lebih matang pada bahasa Inggris, sedangkan untuk bahasa Indonesia, pelafalan istilah daerah dan penempatan jeda kalimat masih sering terdengar janggal. Penyedia layanan yang mau menambah data pelatihan berbahasa Indonesia berpeluang lebih besar dipakai di dalam negeri, termasuk untuk layanan publik yang membutuhkan suara jelas dan mudah dipahami.

Sumber: Google

Tidak ada komentar

Posting Komentar