OpenAI'ın henüz kullanıma sunulmayan yeni yapay zeka modeli Astra, gelişmiş siber güvenlik yeteneklerinin yanı sıra kullandığı öne sürülen yeni akıl yürütme yöntemiyle de tartışma yaratıyor. Astra'nın "recurrent depth" olarak adlandırılan ve modelin düşünme sürecinin bir bölümünü gözlemlenmesi daha zor hale getiren bir teknik kullandığı belirtiliyor. Yapay zeka güvenliği araştırmacıları ise "opaque recurrence" olarak da adlanırılan bu yaklaşımın, modellerin davranışlarını denetlemeyi giderek zorlaştırabileceği konusunda uyarıyor.
The Information tarafından paylaşılan bilgilere göre Astra, "recurrent depth" ya da "looped transformer" olarak tanımlanan bir yöntemden yararlanıyor. Geleneksel akıl yürütme modellerinde işlemler büyük ölçüde sıralı biçimde ilerlerken, bu yöntemde bilgiler modelin iç katmanları arasında birden fazla kez dolaştırılabiliyor. Böylece model, aynı problem üzerinde daha fazla hesaplama gerçekleştirebilirken akıl yürütme sürecinin daha büyük bir bölümü doğal dille ifade edilen düşünce zincirinin dışında gerçekleşebiliyor.
Yapay zeka modellerinin düşüncelerini izlemek zorlaşabilir
Konunun merkezinde düşünce zincirinin (chain-of-thought) izlenebilirliği yer alıyor. Günümüzde gelişmiş akıl yürütme modellerinin oluşturduğu ara düşünce adımları, araştırmacıların modelin istenmeyen bir davranış geliştirip geliştirmediğini anlamasında önemli araçlardan biri olarak görülüyor. Örneğin bu kayıtlar, bir modelin güvenlik önlemlerini aşmaya çalışıp çalışmadığını veya kullanıcıdan sakladığı farklı bir strateji geliştirip geliştirmediğini tespit etmek için kullanılabiliyor. OpenAI'ın daha önce gerçekleştirdiği otonom ajan testlerinde de düşünce zincirlerinin modellerin neden belirli davranışlar sergilediğini anlamada önemli rol oynadığı belirtiliyor.
Recurrent depth yaklaşımında ise hesaplamanın daha büyük kısmının modelin kendi iç temsilleri içinde gerçekleşmesi, güvenlik sistemlerinin inceleyebileceği okunabilir düşünce izlerini azaltabilir. Redwood Research baş bilim insanı Ryan Greenblatt, yaklaşımın daha geniş ölçekte kullanılması halinde modellerin akıl yürütmesinin büyük bölümünün görünür kanalların dışına taşınabileceğini düşünüyor. Ayrıca Greenblatt, yapay zeka şirketleri arasındaki performans yarışının geliştiricileri giderek daha az gözlemlenebilir mimariler kullanmaya teşvik edebileceği konusunda uyarıyor.
Redwood Research CEO'su Buck Shlegeris de Astra'da "opaque recurrence" kullanılmasına yönelik endişelerini dile getirdi. Yapay zeka güvenliği alanında çalışmalarıyla bilinen Zvi Mowshowitz ise şirketlerin rekabet nedeniyle daha az izlenebilir sistemlere yönelmesini engellemek için gelecekte düzenlemelerin gerekebileceğini öne sürdü.
OpenAI, Astra'da tekniğin kullanımını sınırlı tutuyor
Bununla birlikte Astra'nın tamamen izlenemez bir model haline geldiğini söylemek için henüz erken. Aktarılan bilgilere göre OpenAI, araştırmacıların modelin düşünce sürecini takip edebilmesini sağlamak amacıyla recurrent depth tekniğinin kullanımını Astra'da sınırlı tutuyor. Modelin düşünce zincirinin önemli bir bölümünün okunabilir olmaya devam edeceği belirtiliyor.
OpenAI baş bilim insanı Jakub Pachocki de şirketin ilk akıl yürütme modellerinden bu yana chain-of-thought izleme yöntemlerini korumaya çalıştığını ve bunun mevcut araştırma programının temel hedeflerinden biri olduğunu ifade etti. Pachocki ayrıca Astra'nın hesaplama derinliğinin GPT-4'ün yaklaşık iki katlık aralığı içinde olduğunu belirterek, ortaya çıkan mimari değişikliğin bazı yorumlarda öne sürüldüğü kadar dramatik olmayabileceğine işaret etti. OpenAI ise Astra'da looped transformer kullanılıp kullanılmadığını doğrulamadı veya reddetmedi.
Şirket, Astra için geliştirdiği güvenlik önlemlerinde düşünce zinciri takibine özellikle ağırlık veriyor. OpenAI, modelin potansiyel olarak amaç dışı veya uyumsuz davranışlarını hızlı biçimde tespit ederek sınırlamak için ek chain-of-thought izleme sistemlerinin devreye alınacağını açıklamıştı.
Modellerin daha fazla hesaplamayı kendi iç temsilleri üzerinden gerçekleştirmesi performansı artırabilir. Ancak aynı özellik, güvenlik araştırmacılarının modelin nasıl karar verdiğini anlamasını zorlaştırabilir. Üstelik Anthropic ve Google DeepMind'da da benzer tekniklerin tartışıldığı belirtiliyor. Bu nedenle recurrent depth tartışması, Astra'dan bağımsız olarak yeni nesil yapay zeka mimarilerinin ne kadar gözlemlenebilir olması gerektiğine yönelik daha geniş bir sektör tartışmasına dönüşebilir.
İlk Yorumu yazmak ister misiniz?
Yorum Yazmak için Giriş Yap