Jakarta, CNN Indonesia -- Kecerdasan buatan (AI) menjadi teknologi yang sangat populer saat ini. Namun, Bos Twitter Elon Musk mengklaim platform AI membanjiri situs dengan trefik, salah satunya di Twitter.
Sebelumnya, Musk membatasi akses pengguna Twitter, baik yang terverifikasi maupun yang tak terverifikasi alias akun gratisan. Alasannya, ratusan organisasi atau lebih selama ini telah melakukan data scraping atau mengais data di Twitter "dengan sangat agresif".
Data scraping tersebut dilakukan di Twitter untuk melatih model bahasa besar mereka.
ADVERTISEMENT
SCROLL TO CONTINUE WITH CONTENT
Dikutip dari Cloudflare, data scraping mengacu pada teknik di mana program komputer mengekstrak data dari output yang dihasilkan dari program lain.
Data scraping biasanya terwujud dalam web scraping atau proses menggunakan aplikasi untuk mengekstrak informasi berguna dari situs tertentu.
Umumnya perusahaan tidak ingin konten mereka diunduh dan digunakan kembali untuk tujuan yang tidak jelas.
Akibatnya, mereka tidak mengekspos semua data melalui API yang dapat dengan mudah diakses.
Sebaliknya, bot scraper tertarik untuk mendapatkan data situs web dengan mengabaikan upaya pembatasan akses.
Akibatnya, permainan kucing-kucingan biasanya terjadi antara bot web scraper dan berbagai strategi proteksi konten, dengan masing-masing mencoba untuk mengalahkan yang lain.
Dalam sebuah laporan di Vice, pembuat alat pengais gambar internet img2dataset Romain Beaumont mengatakan kepada pemilik situs web untuk secara aktif menolak situs mereka jika tak ingin datanya diambil.
"Sangat menyedihkan bahwa beberapa dari Anda tidak memahami potensi AI dan Open AI dan sebagai konsekuensinya memutuskan untuk melawannya," ujar Beaumont di halaman GitHub.
"Anda akan memiliki banyak kesempatan di tahun-tahun mendatang untuk mendapatkan manfaat dari AI. Saya harap Anda dapat melihatnya lebih cepat daripada nanti. Sebagai pencipta, Anda memiliki lebih banyak kesempatan untuk mendapatkan keuntungan darinya," tambahnya.
Img2dataset adalah alat gratis yang dibagikan Beaumont di GitHub yang memungkinkan pengguna untuk mengunduh secara otomatis, dan mengubah ukuran daftar URL.
Hasilnya adalah sebuah dataset gambar, jenis yang melatih model AI penghasil gambar seperti DALL-E dari OpenAI, model open source Stable Diffusion, dan Imagen dari Google.
Beaumont juga merupakan kontributor open source untuk LAION-5B, salah satu dataset gambar terbesar di dunia yang berisi lebih dari 5 miliar gambar dan digunakan oleh Imagen dan Stable Diffusion.
Img2dataset sendiri akan berusaha mengais gambar dari situs mana pun kecuali pemilik situs menambahkan header https seperti "X-Robots-Tag: noai," dan "X-Robots-Tag: noindex."
Artinya, tanggung jawab ada pada pemilik situs untuk menolak pengambilan data yang dilakukan img2dataset. Sayangnya, mungkin banyak pemilik situs tidak mengetahui adanya img2dataset.
Kasus semacam ini dialami seorang pengguna bernama Terence Eden. Eden mengunggah komentar di halaman Github yang mengatakan alat ini "menghantam" beberapa situsnya dan meminta agar alat ini dibuat menjadi opt-in.
"Saya tidak mengerti mengapa saya dibebankan untuk menambahkan tajuk baru ke situs saya untuk menolak alat ini. Tolong, bisakah Anda mengubah perilaku default sehingga hanya akan bekerja pada situs yang menetapkan X-Robots-Tag: YesAI?" kata Eden.
Merespons komentar tersebut, Beaumont mengatakan "jika Anda tidak ingin orang melihat gambar dari situs web Anda, cara terbaik adalah mematikannya."
Cara Memblokir Data Scraper
Pemilik situs bisa memblok data scraper oleh AI dengan menerapkan beberapa cara. (REUTERS/DADO RUVIC)
Dalam sebuah email kepada Motherboard, Eden mengatakan ia mengetahui img2dataset sedang mengais data situsnya, OpenBenches.
OpenBenches sendiri adalah situs yang mengundang pengguna untuk mengunggah foto dan lokasi memorial bench dari seluruh dunia.
Saat ini, OpenBenches telah memetakan 27.629 bangku, dan menampung 250GB foto.
"Saya menyadarinya karena saya menerima peringatan dari host saya bahwa situs ini sedang diserang," kata Eden.
"Saya harus membayar untuk meningkatkan server saya, membayar ekstra untuk lalu lintas ekspor, dan menghabiskan sebagian waktu akhir pekan saya untuk memblokir penyalahgunaan yang disebabkan oleh bot khusus ini," imbuhnya.
Di sisi lain, Beaumont membela diri dengan membandingkan platformnya dengan cara Google mengindeks semua situs web secara online untuk memberi daya pada mesin pencarinya.
Cara blokir data scraper
Jika Anda tidak ingin bot AI menggunakan konten web Anda, Anda bisa memblokirnya agar tidak mengakses situs Anda dengan menggunakan file robots.txt.
Sayangnya, Anda harus memblokir masing-masing bot dan menentukannya berdasarkan nama.
Sebagai contoh, bot Common Crawl bernama CCBot dan Anda bisa memblokirnya dengan menambahkan kode berikut ini ke file robots.txt Anda:
User-agent: CCBot
Disallow: /
Dikutip dari Makeusof, perintah ini akan memblokir Common Crawl agar tidak mengais data di situs web Anda, tetapi tidak akan menghapus data apa pun yang sudah dikumpulkan dari proses data scraping sebelumnya.