Yapay Zekâ Şirketleri Eğitim Verisi İçin Şirket E-postalarına Yöneliyor
Yapay zekâ şirketleri, herkese açık internet içeriğinin sınırlarına yaklaşılmasıyla birlikte şirket e-postaları, toplantı kayıtları ve yazılım geliştirme geçmişi gibi kurumsal kaynaklara yönelmeye başladı. Son aylarda özel veri satın alma taleplerinin hızlanması, gerçek iş süreçlerini gösteren içeriklerin yapay zekâ verisi açısından daha değerli görülmeye başladığını ortaya koydu. OpenAI ile Anthropic gibi şirketlerin yer aldığı sektörde yeni talep, insan uzmanlığının gerçek görevler sırasında nasıl ortaya çıktığını gösteren kayıtların ticari değerini artırıyor.
Gerçek İş Akışları Yapay Zekâ Eğitiminde Neden Değerleniyor?
Bir şirketin toplantı kaydı, yalnızca ortaya çıkan sonucu değil çalışanların karar aşamasında hangi seçenekleri değerlendirdiğini de gösterdiği için eğitim açısından sıradan bir internet metninden daha fazla bilgi taşıyabiliyor. E-posta yazışmaları, müşteri görüşmeleri, finansal tartışmalar ve kod değişiklikleri insanların sorunları nasıl tanımladığını, hangi gerekçelerle karar verdiğini ve hataları nasıl düzelttiğini ortaya çıkarıyor. Gerçek görevlerden elde edilen içerikler özellikle bilgisayar kullanan, araştırma yapan veya farklı yazılım araçları arasında işlem gerçekleştiren yapay zekâ sistemlerinin geliştirilmesinde önem kazanıyor.
Veri aracısı Protege’nin CEO’su Bobby Samuels, şirketin işlem hacminin 2025 yılında yaklaşık 30 milyon dolardan 2026 yılında en az 100 milyon dolara yükseldiğini açıkladı. Protege’nin faaliyet alanındaki büyüme, yapay zekâ geliştiricilerinin yalnızca daha fazla içerik değil belirli görevleri gerçekleştirme biçimlerini gösteren nitelikli veri aradığını gösteriyor. Anthropic de Claude Opus 4 ile Claude Sonnet 4 modellerinin eğitiminde herkese açık internet bilgilerinin yanında üçüncü taraflardan alınan kamuya açık olmayan veriler, veri etiketleme hizmetleri, ücretli yükleniciler, izin veren kullanıcılar ile şirket içinde üretilen verilerin kullanıldığını açıklıyor.
HubSpot’un satın aldığı Warmly, kurumsal arşivlerin neden veri alıcılarının ilgisini çektiğini gösteren örneklerden biri oldu. Satın alma anlaşmasının ardından Warmly çalışanlarının toplantı tutanakları ile e-postaları için dört ayrı teklif gelirken tekliflerden birinin 300 bin dolara kadar çıktığı aktarıldı. Warmly yönetimi, çalışan iletişimlerinin veri olarak satılmasına yönelik tekliflerin tamamını reddetti.
Satın alınan veya faaliyetlerini sonlandıran genç teknoloji şirketleri, veri sağlayıcıları açısından yoğun bir bilgi birikimine sahip olmaları nedeniyle ayrı bir konuma geliyor. Bir startup’ın e-posta geçmişi ürün kararlarını, müşteri sorunlarını, satış görüşmelerini ve ekip içi tartışmaları aynı zaman çizelgesinde bir araya getirebiliyor. Kurumsal veri pazarı açısından değer taşıyan nokta, söz konusu kayıtların tek tek belgelerden ziyade gerçek bir iş sürecinin tamamına dair bağlam sunması oluyor.
Bir çalışanın adı e-posta arşivinden çıkarılsa bile mesajların içeriği, tarihleri, görev tanımları veya diğer kayıtlarla bağlantıları kişinin yeniden belirlenmesine yol açabildiği için anonimleştirme süreci kritik önem taşıyor. Şirket arşivlerinde müşteri bilgileri, ticari sırlar, finansal planlar, ürün yol haritaları, kaynak kodları ile çalışanlara ait kişisel bilgiler aynı veri havuzunda bulunabildiğinden veri temizleme işlemi yalnızca isim silmekten ibaret kalmıyor. Kişisel verilerin farklı kayıtlarla birleştirilmesi de veri paylaşımı sırasında ayrıca değerlendirilmesi gereken bir risk oluşturuyor.
OpenAI’nin kurumsal veri politikası, şirketlerin kendi iş verilerini model eğitimine otomatik olarak aktarmadığı bir yapı kullanıyor. OpenAI, ChatGPT Business, ChatGPT Enterprise, ChatGPT Edu ile API platformundaki girdilerin ve çıktıların varsayılan olarak model eğitimi amacıyla kullanılmadığını açıklarken kuruluşların açık şekilde izin vermesi hâlinde belirli verilerin paylaşılabildiğini belirtiyor. Anthropic de ticari ürünlerdeki girdilerin ve çıktıların varsayılan olarak model eğitiminde kullanılmadığını açıklıyor.
Bir yapay zekâ modeli için milyonlarca genel metin aynı konuyu farklı biçimlerde anlatabilirken gerçek bir şirket kaydı karar alma sürecinin nasıl ilerlediğine dair daha az tekrarlanan bilgiler sağlayabiliyor. Yapay zekâ eğitim verisi açısından değerli olan unsur, yalnızca metnin özgünlüğü değil çalışanın bir görevi yerine getirirken kullandığı bağlam, araçlar, geri bildirimler ve karar zinciri oluyor. Anthropic’in eğitim verisi açıklaması da güncel modellerin yalnızca açık internet kaynaklarından oluşmayan karma veri kümeleriyle geliştirildiğini doğruluyor.
Gerçek dünya veri setleri özellikle AI ajanlarının gelişmesiyle daha fazla önem kazanıyor. Bir AI ajanı yalnızca soruya yanıt vermek yerine bir e-posta hazırlayabildiğinde, dosya inceleyebildiğinde, kod üzerinde değişiklik yapabildiğinde veya bir iş sürecini baştan sona yönetebildiğinde eğitim sürecinin gerçek çalışma biçimlerini yansıtması gerekiyor. Şirket içi yazışmalar, toplantılar ve yazılım kayıtları bu nedenle yalnızca dil bilgisini değil görev bağlamını da taşıyan kaynaklara dönüşüyor.
Türkiye’deki şirketler açısından kurumsal veri satışının büyümesi, çalışan e-postaları ile toplantı kayıtlarının yalnızca bilgi güvenliği kapsamında değerlendirilmesini yetersiz bırakabilir. Kişisel Verilerin Korunması Kanunu, ticari sırların korunması, fikrî mülkiyet hakları ve çalışan mahremiyeti gibi başlıklar veri paylaşımı öncesinde birlikte ele alınması gereken konular arasında yer alıyor. Bir şirketin yapay zekâ eğitimi amacıyla veri lisanslamayı değerlendirmesi durumunda hangi kayıtların paylaşılabileceğini, hangi verilerin anonimleştirileceğini ve çalışanlardan hangi izinlerin alınacağını önceden belirlemesi gerekecek.
Yapay zekâ sektöründe veri rekabeti büyüdükçe şirket arşivlerinin ekonomik değeri de yeni bir tartışma alanı oluşturacak. AI veri lisanslama süreçlerinin yaygınlaşması, çalışanların ürettiği içeriklerin kime ait olduğu, şirketlerin hangi kayıtlar üzerinde tasarruf hakkına sahip olduğu ve veri sahiplerinin hangi koşullarda ödeme alacağı gibi soruları daha görünür hâle getirecek. Sektörün sonraki aşamasında model performansını artıran verinin yalnızca internette bulunması değil hukuken kullanılabilir, kaliteli ve gerçek çalışma süreçlerini temsil eden bir yapıya sahip olması belirleyici hâle gelebilir.
Tepkiniz Ne?
Beğen
0
Beğenme
0
Sevgi
0
Komik
0
Kızgın
0
Üzgün
0
Vay
0