Oxford Buka Arsip Perpustakaan Bodleian untuk OpenAI Latih Model, Staf Akademik Resah

Oxford Buka Arsip Bodleian untuk OpenAI

Universitas Oxford mengizinkan OpenAI melatih model kecerdasan artifisialnya memakai teks bersejarah dari Perpustakaan Bodleian. Staf universitas menyuarakan kekhawatiran soal risiko reputasi bermitra dengan perusahaan di balik ChatGPT.

Universitas Oxford mengizinkan perusahaan di balik ChatGPT melatih model kecerdasan artifisialnya memakai teks bersejarah dari Perpustakaan Bodleian. Langkah itu diambil ketika perusahaan teknologi makin gencar mencari data baru dari lembaga akademik.

Materi Bodleian yang didigitalisasi OpenAI telah dipakai untuk mengisi kumpulan data pelatihan perusahaan. Fakta itu tercatat dalam dokumen internal yang diperoleh melalui permintaan keterbukaan informasi.

Oxford mengumumkan kemitraan dengan OpenAI pada Maret 2025 dengan memakai perangkat lunak perusahaan itu untuk mendigitalisasi teks dari perpustakaan yang terkenal di dunia. Universitas menyatakan langkah itu akan membuat konten lebih luas tersedia bagi mahasiswa dan peneliti.

Namun pengumuman itu tidak menyebut bahwa materi tersebut akan dipakai melatih model OpenAI. Model dilatih mengenali pola kata dengan disuapi data dalam jumlah besar sehingga mampu menulis kalimat lengkap dan menjalankan tugas kognitif lain.

Juru bicara OpenAI menyatakan perusahaan bangga memastikan model kecerdasan artifisial masa kini melestarikan pengetahuan sejarah dunia untuk masa depan. Menurutnya, dengan lebih dari satu miliar pengguna, penting bagi teknologi itu mencerminkan berbagai budaya, sejarah, dan perspektif.

Notulen rapat Universitas Oxford mencatat kekhawatiran staf, termasuk anggota komite tata kelola Bodleian, mengenai risiko reputasi bermitra dengan OpenAI. Mereka juga menyoroti dampak komitmen lingkungan universitas karena kemitraan melibatkan teknologi yang boros energi.

Notulen itu juga membahas rencana digitalisasi massal koleksi Bodleian yang berjumlah 23 juta item, sekaligus pembuatan chatbot bernama Ask the Bod. Skala rencana itulah yang membuat sebagian staf menilai keterbukaan soal penggunaan data seharusnya lebih jelas sejak awal.

Pedagang buku bekas melaporkan lonjakan pesanan judul-judul langka, seperti panduan alat pertanian Afrika abad ke-18 atau biografi pembalap mobil era 1950-an. Mereka menduga karena judul-judul itu kecil kemungkinan tersedia dalam bentuk digital, materinya dianggap data baru bagi model generasi berikutnya.

Situs web yang dirayapi kini makin dipenuhi materi hasil kecerdasan artifisial sehingga kurang berguna untuk pelatihan. Karena itu pengembang beralih ke koleksi buku fisik, sering kali koleksi bersejarah dari lembaga besar.

OpenAI sudah menandatangani perjanjian serupa dengan perpustakaan riset Amerika Serikat seperti Boston Public Library, Caltech, MIT, dan University of Michigan dalam proyek bernama NextGenAI. Oxford menjadi satu-satunya anggota dari Inggris dalam proyek itu.

Hingga Juni 2025, sebanyak 125.000 gambar hasil pemindaian disertasi bersejarah telah dibagikan kepada OpenAI dari koleksi Bodleian. Materi itu mencakup disertasi doktoral universitas Eropa dan Amerika yang ditulis pada abad ke-19 dan ke-20.

Teks lain yang dipindai meliputi koleksi langka 10.000 balada berbahasa Inggris abad ke-16 yang memuat lirik lagu dan notasi musik yang dulu beredar di sudut jalan era Tudor.

Staf juga membahas digitalisasi surat-surat kenegaraan Irlandia abad ke-18, surat pribadi novelis Irlandia Maria Edgeworth, dan buku catatan penisilin milik Dorothy Hodgkin.

Juru bicara Oxford menyatakan jumlah teks yang didigitalisasi tergolong sederhana dan hanya mencakup materi yang masa hak ciptanya sudah habis. Menurutnya, Bodleian tetap memegang hak atas hasil pemindaian dan akan menerbitkannya secara terbuka dalam beberapa bulan.

Pihak universitas membantah anggapan bahwa unsur pembelajaran mesin disembunyikan dari publik dan mahasiswa. Mereka menyatakan digitalisasi adalah kepentingan utama universitas, namun staf terbuka bahwa proyek itu turut menyumbang data pelatihan.

Berbeda dengan itu, sejumlah pembelian buku bekas di tempat lain berakhir dihancurkan setelah dipindai. Pesaing dekat OpenAI, Anthropic, dilaporkan menghabiskan puluhan juta dolar membeli buku lalu memotong punggungnya agar isinya bisa dipindai.

Anthropic menyatakan tidak membeli dan merusak buku langka maupun kuno. Namun situs berita teknologi 404 Media pernah menaruh alat pelacak dalam pesanan buku bekas dan melacaknya hingga ke fasilitas Amazon di Amerika Serikat, tempat buku-buku itu juga dibongkar dan dipindai.

Persoalan yang mengemuka bukan lagi soal digitalisasi, melainkan siapa yang memperoleh manfaat dan bagaimana kontrol atas materi bersejarah itu. Bagi sebagian pihak di Oxford, keterbukaan soal penggunaan data seharusnya menjadi syarat sejak awal.

Bagi Oxford, persoalan sebenarnya bukan sekadar digitalisasi. Pertanyaan intinya adalah sejauh mana lembaga akademik boleh menyerahkan materi bersejarah untuk kepentingan komersial pihak lain.

Sumber: The Guardian, 26-27 September 2026.

Tidak ada komentar

Posting Komentar