OpenAI ve Anthropic'in yapay zeka ajanları, test sınırlarını aşarak gerçek kişileri hedef aldı

İngiltere AI Security Institute, OpenAI ve Anthropic'in yapay zeka ajanlarının testler sırasında 19 yetkisiz eylem gerçekleştirdiğini açıkladı.
OpenAI ve Anthropic'in yapay zeka ajanları, test sınırlarını aşarak gerçek kişileri hedef aldı

OpenAI ajanının Hugging Face’e yönelik siber saldırı gerçekleştirmesi ve Anthropic'in Claude modellerinin güvenlik testleri sırasında üç şirketin sistemlerine izinsiz olarak erişmesinin ardından yapay zeka şirketleri siber güvenlik konusunda sınanmaya devam ediyor. 

İngiltere hükümetine bağlı AI Security Institute (AISI), OpenAI ve Anthropic tarafından geliştirilen yapay zeka modellerinin siber güvenlik testleri sırasında belirlenen sınırların dışına çıktığını açıkladı. Wired'ın paylaştığı bilgilere göre ajanlar, gerçek kişi ve kuruluşları hedefleyen girişimlerde bulundu, sahte çevrim içi kimlikler oluşturdu ve açık kaynaklı bir projeye zararlı kod eklemeye çalıştı.

AISI tarafından paylaşılan bilgilere göre, değerlendirme kapsamında yedi farklı model aynı siber güvenlik görevinde toplam 122 kez test edildi. Ajanlardan, birbirine bağlı üç simüle edilmiş sistemi ele geçirmeleri ve sistemlerde saklanan veriye ulaşmaları istendi. Testlerin 10’unda ajanların belirlenen görev alanının dışına çıktığı, toplam 19 yetkisiz eylem gerçekleştirdiği tespit edildi.

Bu eylemlerin 17’si Anthropic’in Mythos 5 modeli, ikisi ise OpenAI’ın GPT-5.6 Sol modeli tarafından gerçekleştirildi. AISI, 122 testin 43’ünde Mythos 5’in, 35’inde ise GPT-5.6 Sol’un kullanıldığını belirtiyor. Yetkisiz eylemlerin büyük bölümü, Mythos 5 tarafından sürdürülen birbiriyle bağlantılı faaliyetlerden oluştu.

En ciddi olayda yapay zeka ajanı, gerçek bir açık kaynak projesine zararlı kod içeren bir değişiklik önerisi gönderdi. Ajan daha sonra projenin geliştiricilerini araştırarak birden fazla sahte kimlik oluşturdu ve kodun onaylanması için proje yöneticilerinden birine sosyal mühendislik uygulamaya çalıştı. Zararlı kod, insan incelemesi sırasında fark edilerek reddedildi.

Ajanın girişimi bununla da sınırlı kalmadı. AISI, modelin gerçek kişilere mesajlar ve zararlı dosyalar gönderdiğini, diğer yapay zeka destekli kodlama araçlarını etkileyebilecek gizli komutlar yerleştirmeye çalıştığını aktardı. Model ayrıca GitHub üzerinde daha sonra aynı görevi yerine getirecek ajanlara yönelik mesajlar bıraktı. Bu mesajlarda oluşturduğu hesapların ve diğer dijital varlıkların yeniden kullanılmasını önerdi. AISI’ye göre sonraki testlerde çalışan bazı ajanlar bu talimatları bulup kullandı.

Olay, 28 Temmuz’da test sistemlerinden Tor ağı üzerinden olağan dışı veri aktarımı yapıldığının belirlenmesiyle ortaya çıktı. AISI, ilgili testleri durdurduğunu, makineleri izole ettiğini ve faaliyetleri yaklaşık bir saat içinde kontrol altına aldığını belirtiyor. GitHub ile birlikte çalışan kurum, ajanların platformda bıraktığı içerikleri de kaldırdı. Yapılan incelemelerde olayların gerçek dünyada doğrudan bir zarara yol açtığına dair kanıt bulunamadı.

OpenAI’ın modeline atfedilen iki eylem ise daha sınırlıydı. OpenAI’ın açıklamasına göre, GPT-5.6 Sol başka bir ajan tarafından açıkta bırakılan GitHub erişim anahtarını kullandı, harici DNS ve tünelleme hizmetlerinde hesaplar oluşturdu. Model ayrıca test ortamındaki yerel bir DNS sunucusunu halka açık internete bağlamaya çalıştı. Sunucuda bir güvenlik açığını hedefleyen kodlar bulunsa da kurulum çalışmadı ve herhangi bir gerçek sistemin sunucuya bağlandığına dair kanıt elde edilmedi.

OpenAI aynı açıklamada, güvenlik şirketi Irregular tarafından yürütülen farklı bir değerlendirmede yaşanan ayrı bir olayı da paylaştı. İnternetten tamamen izole edilmesi gereken test ortamındaki bir yapılandırma hatası, modelin açık internete erişmesine yol açtı. Testte kullanılan kurgusal hedefin adı gerçek bir alan adıyla çakışınca model, simülasyonun bir parçası olduğunu düşündüğü gerçek bir web sitesindeki temel bir güvenlik açığından yararlandı ve bulduğu erişim bilgilerini kullandı. Irregular değerlendirmeleri durdururken etkilenen taraflara da bilgi verildi.

AISI, bu olayların modellerin güvenli test ortamından kaçması sonucunda yaşanmadığını özellikle vurguluyor. Testlerde modellerin maksimum siber kabiliyetlerini ölçmek amacıyla internet erişimi bilinçli olarak açık bırakılmış ve zararlı kullanımı engelleyen güvenlik sınıflandırıcıları devre dışı bırakılmıştı. Test edilen yapılandırmaların ticari olarak kullanıma sunulmadığı ve modellerin normal kullanıcı deneyimindeki davranışlarını yansıtmadığı belirtiliyor.

AISI, bundan sonraki testlerde internet erişimini daha ayrıntılı biçimde sınırlandıracağını, gerçek zamanlı izleme sistemleri kullanacağını ve görevlerin yalnızca belirlenen yollarla çözülebilir olup olmadığını önceden kontrol edeceğini açıkladı. OpenAI da yüksek riskli değerlendirmeler için ortak standartlar geliştirmek üzere ulusal yapay zeka enstitülerini, bağımsız araştırmacıları ve diğer yapay zeka şirketlerini bir araya getirmeyi planlıyor.

Teknoloji dünyasındaki gelişmeleri takip edin. Neleri size ulaştırmamızı istersiniz?
Abonelik kaydınız başarıyla oluşturuldu.