DWJ Manajement - PORTAL

Disrupting a coordinated model-distillation campaign

Oleh: DWJ-Manajement • 01 Oct 2026
Disrupting a coordinated model-distillation campaign

Risiko Keamanan: Penyerang dapat menggunakan hasil distilasi untuk menciptakan model yang dirancang khusus untuk mengeksploitasi kerentanan sistem keamanan AI lainnya.

Target Utama: Kemampuan Penalaran (Reasoning)

Yang membuat kampanye ini sangat mengkhawatirkan adalah targetnya. OpenAI menyebutkan bahwa upaya ini secara spesifik menargetkan kemampuan penalaran (*reasoning*) dari model mereka. Dalam perkembangan AI terbaru, kemampuan untuk melakukan langkah-langkah berpikir logis, memeriksa kesalahan secara mandiri, dan memecahkan masalah matematika atau pemrograman yang kompleks adalah "permata mahkota" dari teknologi AI.

Jika kemampuan penalaran ini berhasil diekstrak secara massal melalui distilasi, pelaku dapat menciptakan model AI yang terlihat sangat cerdas namun beroperasi di bawah infrastruktur yang jauh lebih murah. Hal ini tidak hanya merugikan secara finansial, tetapi juga dapat mengacaukan standar keamanan AI di seluruh dunia.

Bagaimana OpenAI Mengidentifikasi dan Menghentikan Serangan

OpenAI mengungkapkan bahwa mereka telah mendeteksi pola penggunaan yang tidak wajar melalui sistem monitoring mereka. Serangan ini tidak dilakukan dengan cara mengirimkan perintah (*prompt*) yang kasar atau mencurigakan secara langsung, melainkan dengan skema yang sangat halus. Para penyerang menggunakan ribuan akun atau API key yang berbeda untuk mengajukan ribuan pertanyaan yang dirancang secara sistematis untuk memetakan bagaimana model memberikan jawaban logis.

Tim keamanan OpenAI melakukan intervensi dengan beberapa langkah strategis, di antaranya:

1. Deteksi Pola Perilaku (Behavioral Analysis)

OpenAI meningkatkan kemampuan deteksi mereka untuk mengenali "distillation-like behavior". Ini melibatkan pemantauan terhadap urutan pertanyaan yang tampak tidak natural bagi pengguna manusia, tetapi sangat efektif untuk mengekstrak parameter logika dari sebuah model.

2. Implementasi Rate Limiting yang Lebih Ketat

Untuk mencegah ekstraksi data dalam skala besar, OpenAI memperketat batasan frekuensi permintaan (*rate limiting*) pada titik-titik tertentu yang dianggap rentan terhadap upaya distilasi. Dengan membatasi kecepatan pengambilan data, biaya dan waktu yang dibutuhkan penyerang untuk melakukan distilasi menjadi tidak ekonomis.