AR-GE ÇALIŞMASI
Sentetik veri üretimi
Satılan bir ürün değil, üzerinde çalıştığımız bir konu. Ne yapmaya çalıştığımızı, nasıl çalıştığını ve neyi ölçmeden teslim etmeyeceğimizi yazdık.
Problem
Bir yazılım ekibinin test ortamında gerçek müşteri verisi kullanması yaygın ve yanlış. Test sunucusu üretim kadar sıkı korunmaz, yedeği farklı yerde durur, geliştiricinin dizüstünde bir kopyası kalır. Kişisel veri buradan sızdığında sorumluluk veri sorumlusundadır.
Alternatif genelde iki uçta: ya elle yazılmış birkaç yüz kayıtlık sahte veri kullanılır — gerçek dağılımı taşımadığı için testler yanıltıcı sonuç verir — ya da üretim verisi maskelenerek kopyalanır, ki maskeleme çoğu zaman tersine çevrilebilir kalır.
Aradaki boşluk şu: gerçeğin istatistiksel yapısını taşıyan ama gerçek kişilere geri götürülemeyen veri. Bunun üretilebilir olduğunu biliyoruz; asıl mesele üretilenin gerçekten bu iki şartı birden sağladığını ölçebilmek.
Bir veri setinin yolu
Yedi adım. Sıra rastgele değil: gizlilik bütçesi üretimden önce uygulanıyor, ölçüm ise üretimden sonra geliyor. Bütçeyi sonradan eklemek mümkün değil — model o gürültüyle eğitilmediyse geriye dönülemez.
Kaynak bağlanır
Kaynak ya bir dosya ya da doğrudan bir veri tabanı. Bu adımda henüz veri kopyalanmıyor; hangi tabloların ve hangi sütunların işleneceği seçiliyor. Kapsam dışı bırakılan sütun hiçbir aşamada okunmuyor — veri minimizasyonu bir ayar değil, hattın ilk adımı.
BU ADIMDA
- Kaynak
- Dosya / veri tabanı
- Sütun seçimi
- Zorunlu
- Kapsam dışı sütun
- Okunmaz
Profil çıkarılır
Her sütunun tipi, dağılımı ve sütunlar arasındaki ilişkiler otomatik çıkarılıyor. Tablolar arası yabancı anahtarlar ve iş kuralları — tarih sırası, toplamın satırlarla tutması, geçerli format — bu adımda kayda geçiyor. Üretilen verinin sonra bunlara uyup uymadığı ölçülecek; kural burada yazılmazsa sonra denetlenemez.
BU ADIMDA
- Alan tipi
- Otomatik
- Yabancı anahtar
- Çıkarılır
- İş kuralı
- Kayda geçer
Örüntü öğrenilir
Üretken model verinin dağılımını öğreniyor, satırları ezberlemiyor — aradaki fark bu işin tamamı. Yöntem veriye göre seçiliyor: küçük ve yapılandırılmış tablolarda kopula tabanlı yaklaşım hızlı ve yeterli; kategorik ile sürekli alanların karıştığı büyük tablolarda derin öğrenme tabanlı yöntemler devreye giriyor. Seçim gerekçesiyle birlikte yapılandırmaya yazılıyor.
BU ADIMDA
- Öğrenilen
- Dağılım
- Ezberlenen
- Yok
- Yöntem
- Veriye göre
- Gerekçe
- Yazılır
Gizlilik bütçesi uygulanır
Öğrenme sürecine diferansiyel gizlilik gürültüsü ekleniyor. Bütçe (ε) sonradan ayarlanan bir düğme değil, üretimden önce belirlenen ve raporda açıkça yazılan bir sayı. Sağlık ve finans gibi hassas alanlarda tavan daha aşağıda tutuluyor. Gizlilik ile fayda arasındaki değiş tokuş tam burada yaşanıyor; sıkılaştırmanın faydaya ne kadar mal olduğunu ölçmeden karar vermiyoruz.
BU ADIMDA
- Yöntem
- Diferansiyel gizlilik
- ε
- Önceden belirlenir
- Raporda
- Açık yazılır
- Hassas veride
- Tavan daha düşük
Yeni kayıtlar üretilir
Model sıfırdan kayıt yazıyor. Üretim sabit bir tohumla yapılıyor: aynı kaynak, aynı yapılandırma ve aynı tohum aynı çıktıyı veriyor. Tekrarüretilemeyen bir set denetlenemez — bir bulguyu doğrulamak isteyen taraf aynı seti yeniden üretebilmeli. Setin kendi sürüm numarası oluyor.
BU ADIMDA
- Tohum
- Sabit
- Tekrarüretim
- Aynı çıktı
- Sürümleme
- Set bazında
Üç boyut birlikte ölçülür
Sadakat, fayda ve gizlilik aynı raporda ölçülüyor. Üçü birlikte olmadan bir set hakkında karar verilemez — üstelik yüksek sadakat tek başına iyi haber değil: orijinale fazla yakın bir set gizlilik tarafında kötü haberdir. Alan tipi, değer aralığı ve yabancı anahtar bütünlüğü gibi kurallar ayrıca yüzde yüz geçmek zorunda; tek ihlal seti durdurur.
BU ADIMDA
- Ölçülen
- Üç boyut birden
- Tek boyutla karar
- Yok
- Kural ihlali
- Hattı durdurur
Kalite kartıyla teslim edilir
Set tek başına teslim edilmiyor. Yanında makine-okunur bir kalite kartı gidiyor: kaynağın özeti, kullanılan yöntem ve sürümü, ε değeri, sadakat skorları, fayda ölçümü, saldırı testi sonucu, k ve l değerleri ve tarih. Kart, setin bir yıl sonra elden ele geçtiğinde neyin ölçüldüğünü hâlâ söyleyen tek belge. Kart yoksa teslim yok.
BU ADIMDA
- Kalite kartı
- Zorunlu
- Biçim
- Makine-okunur
- Kalan risk
- Yazılı
Veri nerede işleniyor
İki kurulum modeli var ve aradaki fark teknik bir ayrıntı değil, hukuki bir ayrım. Hangi modelde olduğunuz, verinizin kurumdan çıkıp çıkmadığını belirliyor.
MODEL A
Bulut
Veri Vorte'nin sunucusuna yükleniyor ve orada işleniyor. Bunu yumuşatmıyoruz: bu modelde veri kurumun dışına çıkar. Vorte veri işleyen sıfatını alır; işleme amacı, saklama süresi ve silme yükümlülüğü sözleşmeye yazılır, işlem kaydı tutulur. Test verisi ihtiyacı olan yazılım ekipleri ve araştırma tarafı için hızlı yol budur.
BULUT
- Veri nerede işlenir
- Vorte sunucusu
- Veri dışarı çıkar mı
- Evet
- Vorte'nin sıfatı
- Veri işleyen
- Kurulum
- Gerekmiyor
MODEL B
Yerinde
Yazılım kurumun kendi sunucusuna kuruluyor. Veri kurumun ağından hiç çıkmıyor ve Vorte veriyi görmüyor; bizim işimiz yazılımı kurmak ve güncellemek. Verisini kurum dışına çıkaramayan kuruluşlar için geçerli olan tek yol bu. Karşılığında kurulum ve sürüm yönetimi ağırlaşıyor — bunu da yazıyoruz.
YERİNDE
- Veri nerede işlenir
- Kurumun sunucusu
- Veri dışarı çıkar mı
- Hayır
- Vorte veriyi görür mü
- Hayır
- Kurulum
- Gerekli
Hedeflediğimiz ölçütler
Bir veri seti bu eşikleri geçmeden teslim edilmez.
| BOYUT | ÖLÇÜT | EŞİK |
|---|---|---|
| Sadakat | SDMetrics kalite skoru | ≥ 0,90 |
| Sadakat | KS / Chi-square | Her alanda geçer |
| Fayda | TSTR (sentetikle eğit, gerçekte test et) | Baseline’ın ≥ %95’i |
| Gizlilik | Diferansiyel gizlilik ε | ≤ 5 (hassas veride ≤ 1) |
| Gizlilik | Üyelik çıkarım saldırısı AUC | ≈ 0,50 |
| Klasik | k-anonimlik / l-diversity | k ≥ 5 / l ≥ 3 |
| Klasik | Birebir kopya oranı | %0 |
Bu ölçütler ölçülmeden hiçbir veri seti “anonim” diye sunulmaz. Sentetik veriyi varsayılan olarak anonim değil, takma adlı kişisel veri kabul ediyoruz; ölçülen değerleri ve kalan riski her teslimde yazılı veriyoruz.
Neyi iddia etmiyoruz
Bu alanda pazarlama dili hukukun önüne geçmeye çok müsait. Söylemediğimizi de yazıyoruz.
“Tamamen anonim” demiyoruz
Sentetik veriyi varsayılan olarak anonim değil, takma adlı kişisel veri kabul ediyoruz. Anonimlik ilan edilecek bir sıfat değil, ölçülerek gösterilecek bir sonuçtur; ölçüm yapılmadan hiçbir set anonim diye sunulmaz.
“Sıfır risk” demiyoruz
Her sette kalan bir risk vardır. İşimiz o riski ölçmek ve yazmak; yok saymak değil. Kalan riski göstermeyen bir rapor, riski ortadan kaldırmaz — yalnızca görünmez kılar.
Ölçmediğimizi teslim etmiyoruz
Eşiği geçmeyen set yeniden üretilir. “Yeterince iyi” diye geçilmez, “müşteri fark etmez” diye hiç geçilmez. Atlanan ölçüm, ileride bulunacak bir hatadır.
Bugün satılan bir ürün yok
Bu bir satış sayfası değil. Teslim edilmiş bir set, kurulmuş bir müşteri ve verilmiş bir tarih yok. Olduğunda bu sayfada tarihiyle yazacak.
Ne aşamadayız
DURUM
- Aşama
- Ar-Ge
- Yöntem seçimi
- Devam ediyor
- Ölçüm harness
- Yok
- Teslim edilmiş set
- Yok
- Tarih taahhüdü
- Yok
ÇALIŞMA BAŞLIKLARI
- Tablosal üretim motoru ve otomatik profilleme
- Sadakat, fayda ve gizliliği tek raporda ölçen harness
- Diferansiyel gizlilik katmanı ve üyelik çıkarımı saldırı testleri
- Çok tablolu tutarlılık — yabancı anahtar bütünlüğünün korunması
- Türkçe serbest metin alanlarının gerçekçi ama anonim üretimi
- Paketleme ve kuruma kurulabilir dağıtım
Sıralama çalışma sırası değil; hiçbirine tarih verilmedi.
Sık sorulanlar
Sentetik veri anonim veri midir?
Varsayılan olarak hayır. Sentetik veriyi takma adlı kişisel veri kabul ediyoruz. Anonim sayılabilmesi için gizlilik boyutunun ölçülmesi ve kalan riskin yazılı olarak sunulması gerekir. Bu ölçüm yapılmadan hiçbir set anonim diye sunulmaz — sektörde yaygın olan “sentetik veri anonimdir” kısayolunu kullanmıyoruz.
Gerçek veriyi görüyor musunuz?
Kurulum modeline bağlı. Yerinde kurulumda hayır: yazılım kurumun kendi sunucusunda çalışır, veri ağdan çıkmaz. Bulut modelinde evet: veri bize yüklenir ve bu durumda Vorte veri işleyen sıfatını alır; işleme amacı, saklama süresi ve silme yükümlülüğü sözleşmeye yazılır.
Üretilen veriyle eğitilen model gerçek dünyada çalışır mı?
Ölçtüğümüz şey tam olarak bu. Sentetik veriyle eğitip, üretimden ayrılmış gerçek bir test kümesinde deniyoruz. Hedef, gerçek veriyle eğitilmiş modelin başarısının en az yüzde 95’ini yakalamak. Bu eşiği tutmayan set teslim edilmez.
Hangi veri tipleriyle çalışıyorsunuz?
Odağımız yapısal/tablosal veri: sayısal, kategorik ve tarih alanları ile birbirine yabancı anahtarla bağlı tablolar. Türkçe serbest metin alanları üzerinde çalışıyoruz. Görüntü ve ses kapsamımızda değil.
Ne kadar veri gerekiyor?
Yöntem veri büyüklüğüne göre değişiyor. Küçük ve yapılandırılmış tablolarda kopula tabanlı yöntemler az satırla da çalışıyor; derin öğrenme tabanlı yöntemler daha fazla satır ve daha uzun eğitim istiyor. Peşinen bir alt sınır vermek yerine veriye bakıp söylemeyi tercih ediyoruz.
Bunu bugün satın alabilir miyim?
Hayır. Çalışma Ar-Ge aşamasında; teslim edilmiş bir set ve verilmiş bir tarih yok. Aynı sorunu yaşıyorsanız yine de konuşmak isteriz.
Bu konuda çalışıyorsanız yazın
Test ortamında gerçek veri kullanma sorununu yaşıyorsanız ya da bu alanda araştırma yapıyorsanız konuşalım. Elimizde satacak bir şey yok; öğrenecek çok şey var.
Bize yazın