Meta'dan kodlama ve ajan yeteneklerine odaklanan yeni model: Muse Spark 1.3

Meta’nın yeni modeli Muse Spark 1.3; kodlama, uzun süreli ajan görevleri ve çoklu iş akışlarında önemli performans iyileştirmeleriyle dikkat çekiyor.
Meta'dan kodlama ve ajan yeteneklerine odaklanan yeni model: Muse Spark 1.3

Muse Spark 1.2’nin kullanıma sunulmasından yaklaşık bir ay sonra Meta, yapay zeka model ailesinin yeni üyesi Muse Spark 1.3’ü tanıttı. Yeni model, özellikle kodlama, uzun süreli ajan görevleri ve karmaşık iş akışları için geliştirildi. Meta, Muse Spark 1.3’ü şimdiye kadarki en yetenekli modeli olarak tanımlıyor.

Muse Spark 1.3, bugünden itibaren şirketin kodlama aracı Muse Code ve Meta Model API üzerinden kullanılabiliyor. Modelin mevcut muhakeme (reasoning) modları kullanıma açılırken, daha fazla hesaplama gücü kullanan max reasoning seçeneğinin ek güvenlik testlerinin ardından sunulması planlanıyor.

Muse Spark 1.3 uzun süreli ajan görevlerine odaklanıyor

Meta'nın yeni modelde öne çıkardığı en önemli alanlardan biri ajan tabanlı iş akışları. Muse Spark 1.3, tek bir uzun konuşma içerisinde birden fazla görevi takip edebilecek şekilde geliştirildi. Model, açık uçlu bir hedef verildiğinde araçları kullanarak ihtiyaç duyduğu bağlamı oluşturabiliyor, çalışma planındaki eksiklikleri tespit edip düzeltebiliyor ve görev sırasında öğrendiği bilgileri nihai çıktıya taşıyabiliyor.

Model aynı zamanda belirsiz komutlarla karşılaştığında doğrudan varsayımda bulunmak yerine kullanıcıya açıklayıcı sorular yöneltebiliyor. Bir görevi gerçekleştiremediğinde kullanıcıdan yardım istemesi ve geri döndürülemeyecek veya önemli sonuçlar doğurabilecek işlemlerden önce onay alması da Muse Spark 1.3'ün ajan yetenekleri arasında yer alıyor.

Meta, yeni modelin önceki Muse Spark modellerine kıyasla uzun ve karmaşık talimatlardaki kısıtlamaları daha iyi koruduğunu belirtiyor. Bu noktada Muse Spark 1.3'ün yalnızca farklı görevleri paralel şekilde ele alması değil, aynı konuşma içinde eski ve yeni talepler arasındaki ilişkiyi takip edebilmesi de dikkat çekiyor. Modelin kendi yetenekleri konusunda daha iyi kalibre edildiği ve yapamayacağı bir işi gerçekleştirmiş gibi göstermesinin önüne geçilmesinin hedeflendiği ifade ediliyor.

Kodlama görevlerinde daha az araç çağrısı ve token kullanıyor

Muse Spark 1.3'ün bir diğer önemli geliştirme alanı ise kodlama. Meta, modeli önceki sürüme kıyasla daha fazla uzun süreli yazılım geliştirme görevi üzerinde eğitti. Şirketin kendi mühendisleri tarafından gerçekleştirilen karşılaştırmalara göre Muse Spark 1.3, Muse Spark 1.2'ye kıyasla benzer görevleri tamamlarken yaklaşık yüzde 20 daha az araç çağrısı ve yüzde 25 daha az token kullanıyor. Modelin gereksiz konuşma turlarını azaltması, daha az ayrıntılı ancak daha temiz kod üretmesi de yapılan iyileştirmeler arasında.

Meta'nın paylaştığı değerlendirme (benchmark) sonuçlarında Muse Spark 1.3, uzun süreli yazılım geliştirme görevlerini ölçen DeepSWE v1.1'de 75,4 puana ulaştı. Bu sonuç Meta'nın karşılaştırma tablosunda GPT-5.6 Sol ve Claude Opus 5'in üzerinde yer alıyor. Bununla birlikte diğer bazı değerlendirmelerde rakip modeller Muse Spark 1.3'ün önünde kalmaya devam ediyor.

Meta'nın değerlendirme metodolojisinde DeepSWE'nin TypeScript, Go, Python, JavaScript ve Rust dillerindeki 91 farklı kod deposunu kapsayan 113 görevden oluştuğu belirtiliyor. Şirket ayrıca üçüncü taraf modellere yönelik testlerin her model için optimize edilmemiş olabileceğinin ve dolayısıyla modellerin ulaşabileceği en yüksek performansı yansıtmayabileceğinin altını çiziyor.

Meta, OpenAI ve Anthropic ile farkı kapattığını düşünüyor

Meta'nın Baş Yapay Zeka Sorumlusu Alexandr Wang, Muse Spark 1.3'ün şirketin bugüne kadarki en büyük model performansı sıçramasını temsil ettiğini düşünüyor. Wang'a göre model özellikle kodlama alanında OpenAI ve Anthropic'in en güçlü modelleriyle rekabet edebilecek seviyeye ulaştı.

Bağımsız model değerlendirme platformu Artificial Analysis da Muse Spark 1.3'ün max sürümüne Intelligence Index'te 62 puan veriyor. Model böylece platformdaki en yüksek performans gösteren modeller arasına giriyor. Artificial Analysis ayrıca Muse Spark 1.3'ün 1 milyon tokenlık bağlam penceresine sahip olduğunu ve metnin yanı sıra görsel ve video girdilerini desteklediğini belirtiyor.

Yine de model performanslarının kullanılan benchmark, değerlendirme yöntemi ve ajan altyapısına göre önemli ölçüde değişebildiğini hatırlatmakta fayda var. Dolayısıyla Meta'nın OpenAI ve Anthropic ile aradaki farkı kapattığı yönündeki iddiasının farklı gerçek dünya kullanım senaryolarında da doğrulanması gerekecek.

Muse Spark 1.3'ün fiyatı değişmedi

Meta, performans artışına rağmen Muse Spark 1.3'ün API fiyatlarında değişikliğe gitmedi. Modelin standart API fiyatlandırmasında 1 milyon girdi tokenı 1,25 dolar, önbelleğe alınmış girdi tokenları 0,15 dolar, 1 milyon çıktı tokenı ise 4,25 dolar olarak fiyatlandırılıyor.

Ayrıca Meta, modelin ajan ve kodlama yeteneklerine yönelik güvenlik önlemlerini güçlendirdiğini belirtiyor. Muse Spark 1.3'ün prompt injection ve kötü niyetli girdilere karşı daha dayanıklı hale getirildiği, özellikle geri döndürülemeyen işlemlerde daha temkinli davranacak şekilde eğitildiği belirtiliyor.

Şirketin yol haritasında ise Muse Spark ailesinden daha büyük modeller ve model ağırlıklarının paylaşılacağı açık ağırlıklı Muse Spark sürümleri bulunuyor. Meta henüz Muse Spark 1.3'ün ağırlıklarının yayınlanıp yayınlanmayacağını açıklamış değil.

Teknoloji dünyasındaki gelişmeleri takip edin. Neleri size ulaştırmamızı istersiniz?
Abonelik kaydınız başarıyla oluşturuldu.