Çinli GLM-5.3 Siber Güvenlik Testlerinde Anthropic’in Mythos 5 Modeline Yaklaştı
Çin merkezli Z.ai, GLM-5.3 modeliyle yazılım açıklarını bulma testinde Anthropic’in erişimi kısıtlı Mythos 5 modeline yakın sonuç aldığını açıkladı. Şirketin verilerine göre model, CyberGym değerlendirmesinde yüzde 84,5 başarı elde ederken Mythos 5 yüzde 83,8 seviyesinde kaldı ve sonuçlar henüz bağımsız kuruluşlar tarafından doğrulanmadı. Z.ai, GLM-5.3’ü yaklaşık iki hafta içinde açık ağırlıklarla yayınlamayı planlarken siber güvenlik açısından hassas işlevleri doğrulanmış kullanıcılarla sınırlandıracağını bildirdi.
Siber Güvenlik Testleri Modelin İki Farklı Yeteneğini Ortaya Koydu
CyberGym değerlendirmesinde Z.ai tarafından açıklanan yüzde 84,5’lik skor, GLM-5.3’ün kaynak kodunu inceleme, güvenlik açığını ayırt etme, ardından bulgunun gerçek bir zafiyet olduğunu doğrulama görevlerinde güçlü sonuç verdiğini gösteriyor. CyberGym gibi testler yalnızca bir kod parçasında şüpheli satırı işaretlemeyi değil, yapay zekâ aracısının bulduğu problemin gerçekten güvenlik etkisi oluşturup oluşturmadığını incelemesini de ölçüyor. Z.ai’nin açıkladığı sonuçlar Mythos 5’in yüzde 83,8’lik skorunu az farkla geride bıraksa da şirketin kendi değerlendirmesi bağımsız bir denetimden geçmediği için iki model arasında kesin bir üstünlük sıralaması yapmak için erken kalıyor.
ExploitBench tarafındaki sonuçlar ise GLM-5.3’ün açık keşfinden çalışan saldırı koduna geçiş aşamasında rakibinin gerisinde kaldığını gösteriyor. Z.ai, modelin yüzde 54,4 puan aldığını açıklarken Mythos 5 için yüzde 78 seviyesinde bir sonuç bildirdi. ExploitBench’in ölçtüğü yetenek, keşfedilen bir güvenlik açığının gerçek bir istismara dönüştürülmesini değerlendirdiği için savunma ekipleri açısından kritik bir ayrım oluşturuyor; araştırmacılar söz konusu aşamanın düşük seviyeli program mantığı, çalışma zamanı davranışı ile uzun süren görev takibini gerektirdiğini belirtiyor.
İki saatlik saldırı geliştirme değerlendirmesinde Mythos 5, 181 görevi tamamlarken GLM-5.3 aynı sürede 105 görevi tamamladı. Altı saatlik ölçümde Anthropic modeli 247 göreve ulaşırken Çinli model 130 görevde kaldı. Sonuçlar GLM-5.3’ün güvenlik açığı keşfinde üst düzey bir performans sergileyebildiğini fakat uzun süreli saldırı geliştirme zincirlerinde Mythos 5’in gerisinde bulunduğunu ortaya koyuyor.
Anthropic’in Mythos yaklaşımı, güçlü siber güvenlik yeteneklerinin herkese açık bir model olarak sunulmasının doğurabileceği riskler nedeniyle kontrollü erişim üzerine kuruluyor. Şirket, siber güvenlik korumaları kaldırılmış Mythos sürümünü yalnızca incelenmiş kuruluşlara açarken modelin güvenlik açığı keşfi ile istismar üretme kapasitesi saldırı tarafındaki kullanım riskini de artırıyor. ExploitGym araştırması da modern yapay zekâ ajanlarının gerçek yazılım açıklarını çalışan istismarlara dönüştürme kapasitesinin artık ayrı bir değerlendirme alanı olarak ele alınması gerektiğini ortaya koyuyor.
Pekin merkezli Z.ai, GLM-5.3’ü yalnızca güvenlik araştırmacılarına yönelik özel bir ürün olarak değil genel amaçlı kodlama modelinin siber güvenlik yetenekleri genişletilmiş bir sürümü olarak konumlandırıyor. Şirket, GLM-5.2 temel modelini daha uzun görevler ile farklı çalışma ortamlarında eğiterek yeni sürümü geliştirdiğini ve güvenlik becerilerinin genişletilmiş son eğitim aşamasıyla ortaya çıktığını belirtiyor. Yaklaşım, özel olarak güvenlik için tasarlanmış sistemlerden farklı olarak kod yazma, hata ayıklama, yazılım analizi ile güvenlik incelemesini aynı model üzerinde birleştiriyor.
Z.ai’nin planladığı Open Source Shield girişimi, açık kaynak projelerinin güvenlik denetiminde GLM-5.3 kullanımını genişletmeyi hedefliyor. Şirket, seçilmiş projelere savunma amaçlı model erişimi sağlamayı, ZCode ürününe kod denetleme özellikleri eklemeyi planlarken küçük güvenlik ekiplerinin gelişmiş yapay zekâ araçlarına erişimini artırmayı amaçlıyor. Açık kaynak yaklaşımı özellikle bütçesi sınırlı geliştirici ekipleri açısından önem taşıyor çünkü güvenlik açığı taraması, kod incelemesi ile hata düzeltme süreçleri yüksek uzmanlık gerektiren insan kaynağına bağımlı kalabiliyor.
GLM-5.3’ün planlanan dağıtımında Z.ai, riskli istekleri filtreleyen, model davranışını izleyen, kötü niyetli görevleri reddetmek üzere eğitilmiş birden fazla güvenlik katmanı kullanacağını açıkladı. Şirket, sistemin hata düzeltme, siber güvenlik eğitimi ile yetkilendirilmiş test gibi meşru faaliyetleri zararlı taleplerden ayırmasını hedefliyor. Hassas siber güvenlik özellikleri için uygulanacak “trusted access” programı da doğrulanmış kullanıcıları ayrı bir erişim katmanına yerleştirecek.
Açık ağırlıklı modellerin dağıtımı ise üreticinin kontrol alanını genişletmek yerine daraltabiliyor. Model dosyalarını indiren geliştiriciler sistemleri farklı araçlarla birleştirebildiği, davranışlarını değiştirebildiği veya kendi çalışma ortamlarında çalıştırabildiği için üreticinin sunucu tarafında uyguladığı güvenlik filtreleri modelin her kullanımında aynı şekilde devrede kalmayabiliyor. Siber güvenlik alanındaki temel tartışma da tam olarak burada ortaya çıkıyor: savunma ekiplerinin erişimini artıran yetenekler saldırganların teknik bariyerlerini de azaltabiliyor.
Şanghay merkezli 360, haziran ayında yapay zekâ ile güvenlik verilerini otomatik araçlarla birleştiren Tulongfeng sisteminin Mythos seviyesinde yetenek sunduğunu açıklamıştı. Şirketin iddiası da bağımsız olarak doğrulanmazken Z.ai’nin yaklaşımı farklı bir noktada duruyor çünkü GLM-5.3 özel amaçlı bir güvenlik ürünü yerine genel amaçlı bir kodlama modelinden geliştirildi. Çin’deki yapay zekâ laboratuvarlarının siber güvenlik yeteneklerini genel amaçlı modellerin içine taşıması, ABD merkezli kapalı modellerle rekabetin yalnızca metin üretimi veya yazılım geliştirme performansıyla sınırlı kalmadığını gösteriyor.
GLM-5.2’nin son aylarda yabancı geliştiriciler arasında yaygınlaşması da Z.ai’nin yeni sürümü için önemli bir zemin oluşturuyor. Model, kodlama ile ajan tabanlı görevlerde önde gelen ABD modellerine yaklaşan sonuçları daha düşük maliyetle sunması nedeniyle uluslararası geliştiricilerin ilgisini çekmişti. GLM-5.3’ün güvenlik yetenekleriyle birlikte açık ağırlık stratejisini sürdürmesi, Z.ai’nin yalnızca model performansını değil geliştirici ekosistemindeki kullanım alanlarını da büyütmeye çalıştığını gösteriyor.
Açık ağırlıkların yayınlanmasıyla GLM-5.3’ün gerçek performansı farklı donanımlar, araç zincirleri, güvenlik yapılandırmaları ile bağımsız test ortamlarında daha geniş biçimde ölçülecek. Türkiye’de yazılım geliştiren şirketler açısından özellikle güvenlik açığı tarama, kod inceleme, güvenlik testi ile hata düzeltme süreçlerinde açık modellerin kullanılabilirliği maliyet avantajı sağlayabilirken kurumsal ortamlarda modelin hangi verilere eriştiği, ürettiği kodun nasıl denetlendiği, güvenlik sınırlarının nasıl uygulandığı daha belirleyici hale gelecek.
Siber güvenlik ekipleri açısından önümüzdeki dönemin temel ölçütü yalnızca bir yapay zekâ modelinin kaç açık bulduğu olmayacak. Modellerin yanlış pozitifleri azaltması, gerçek zafiyetleri güvenilir biçimde doğrulaması, güvenli düzeltme önermesi, yetkisiz istismar üretimini sınırlandırması gibi ölçütler kurumsal kullanım değerini belirleyecek. GLM-5.3’ün açık dağıtım süreci de Çin ile ABD arasındaki yapay zekâ rekabetinde performans kadar model erişimi ile siber güvenlik kontrolünün nasıl dengeleneceği konusunda yeni bir test alanı oluşturacak.
Tepkiniz Ne?
Beğen
0
Beğenme
0
Sevgi
0
Komik
0
Kızgın
0
Üzgün
0
Vay
0