İçeriğe atla

AR-GE ÇALIŞMASI

Sentetik veri üretimi

Satılan bir ürün değil, üzerinde çalıştığımız bir konu. Ne yapmaya çalıştığımızı, nasıl çalıştığını ve neyi ölçmeden teslim etmeyeceğimizi yazdık.

Problem

Bir yazılım ekibinin test ortamında gerçek müşteri verisi kullanması yaygın ve yanlış. Test sunucusu üretim kadar sıkı korunmaz, yedeği farklı yerde durur, geliştiricinin dizüstünde bir kopyası kalır. Kişisel veri buradan sızdığında sorumluluk veri sorumlusundadır.

Alternatif genelde iki uçta: ya elle yazılmış birkaç yüz kayıtlık sahte veri kullanılır — gerçek dağılımı taşımadığı için testler yanıltıcı sonuç verir — ya da üretim verisi maskelenerek kopyalanır, ki maskeleme çoğu zaman tersine çevrilebilir kalır.

Aradaki boşluk şu: gerçeğin istatistiksel yapısını taşıyan ama gerçek kişilere geri götürülemeyen veri. Bunun üretilebilir olduğunu biliyoruz; asıl mesele üretilenin gerçekten bu iki şartı birden sağladığını ölçebilmek.

Bir veri setinin yolu

Yedi adım. Sıra rastgele değil: gizlilik bütçesi üretimden önce uygulanıyor, ölçüm ise üretimden sonra geliyor. Bütçeyi sonradan eklemek mümkün değil — model o gürültüyle eğitilmediyse geriye dönülemez.

  1. Kaynak bağlanır

    Kaynak ya bir dosya ya da doğrudan bir veri tabanı. Bu adımda henüz veri kopyalanmıyor; hangi tabloların ve hangi sütunların işleneceği seçiliyor. Kapsam dışı bırakılan sütun hiçbir aşamada okunmuyor — veri minimizasyonu bir ayar değil, hattın ilk adımı.

    BU ADIMDA

    Kaynak
    Dosya / veri tabanı
    Sütun seçimi
    Zorunlu
    Kapsam dışı sütun
    Okunmaz
  2. Profil çıkarılır

    Her sütunun tipi, dağılımı ve sütunlar arasındaki ilişkiler otomatik çıkarılıyor. Tablolar arası yabancı anahtarlar ve iş kuralları — tarih sırası, toplamın satırlarla tutması, geçerli format — bu adımda kayda geçiyor. Üretilen verinin sonra bunlara uyup uymadığı ölçülecek; kural burada yazılmazsa sonra denetlenemez.

    BU ADIMDA

    Alan tipi
    Otomatik
    Yabancı anahtar
    Çıkarılır
    İş kuralı
    Kayda geçer
  3. Örüntü öğrenilir

    Üretken model verinin dağılımını öğreniyor, satırları ezberlemiyor — aradaki fark bu işin tamamı. Yöntem veriye göre seçiliyor: küçük ve yapılandırılmış tablolarda kopula tabanlı yaklaşım hızlı ve yeterli; kategorik ile sürekli alanların karıştığı büyük tablolarda derin öğrenme tabanlı yöntemler devreye giriyor. Seçim gerekçesiyle birlikte yapılandırmaya yazılıyor.

    BU ADIMDA

    Öğrenilen
    Dağılım
    Ezberlenen
    Yok
    Yöntem
    Veriye göre
    Gerekçe
    Yazılır
  4. Gizlilik bütçesi uygulanır

    Öğrenme sürecine diferansiyel gizlilik gürültüsü ekleniyor. Bütçe (ε) sonradan ayarlanan bir düğme değil, üretimden önce belirlenen ve raporda açıkça yazılan bir sayı. Sağlık ve finans gibi hassas alanlarda tavan daha aşağıda tutuluyor. Gizlilik ile fayda arasındaki değiş tokuş tam burada yaşanıyor; sıkılaştırmanın faydaya ne kadar mal olduğunu ölçmeden karar vermiyoruz.

    BU ADIMDA

    Yöntem
    Diferansiyel gizlilik
    ε
    Önceden belirlenir
    Raporda
    Açık yazılır
    Hassas veride
    Tavan daha düşük
  5. Yeni kayıtlar üretilir

    Model sıfırdan kayıt yazıyor. Üretim sabit bir tohumla yapılıyor: aynı kaynak, aynı yapılandırma ve aynı tohum aynı çıktıyı veriyor. Tekrarüretilemeyen bir set denetlenemez — bir bulguyu doğrulamak isteyen taraf aynı seti yeniden üretebilmeli. Setin kendi sürüm numarası oluyor.

    BU ADIMDA

    Tohum
    Sabit
    Tekrarüretim
    Aynı çıktı
    Sürümleme
    Set bazında
  6. Üç boyut birlikte ölçülür

    Sadakat, fayda ve gizlilik aynı raporda ölçülüyor. Üçü birlikte olmadan bir set hakkında karar verilemez — üstelik yüksek sadakat tek başına iyi haber değil: orijinale fazla yakın bir set gizlilik tarafında kötü haberdir. Alan tipi, değer aralığı ve yabancı anahtar bütünlüğü gibi kurallar ayrıca yüzde yüz geçmek zorunda; tek ihlal seti durdurur.

    BU ADIMDA

    Ölçülen
    Üç boyut birden
    Tek boyutla karar
    Yok
    Kural ihlali
    Hattı durdurur
  7. Kalite kartıyla teslim edilir

    Set tek başına teslim edilmiyor. Yanında makine-okunur bir kalite kartı gidiyor: kaynağın özeti, kullanılan yöntem ve sürümü, ε değeri, sadakat skorları, fayda ölçümü, saldırı testi sonucu, k ve l değerleri ve tarih. Kart, setin bir yıl sonra elden ele geçtiğinde neyin ölçüldüğünü hâlâ söyleyen tek belge. Kart yoksa teslim yok.

    BU ADIMDA

    Kalite kartı
    Zorunlu
    Biçim
    Makine-okunur
    Kalan risk
    Yazılı

Veri nerede işleniyor

İki kurulum modeli var ve aradaki fark teknik bir ayrıntı değil, hukuki bir ayrım. Hangi modelde olduğunuz, verinizin kurumdan çıkıp çıkmadığını belirliyor.

MODEL A

Bulut

Veri Vorte'nin sunucusuna yükleniyor ve orada işleniyor. Bunu yumuşatmıyoruz: bu modelde veri kurumun dışına çıkar. Vorte veri işleyen sıfatını alır; işleme amacı, saklama süresi ve silme yükümlülüğü sözleşmeye yazılır, işlem kaydı tutulur. Test verisi ihtiyacı olan yazılım ekipleri ve araştırma tarafı için hızlı yol budur.

BULUT

Veri nerede işlenir
Vorte sunucusu
Veri dışarı çıkar mı
Evet
Vorte'nin sıfatı
Veri işleyen
Kurulum
Gerekmiyor

MODEL B

Yerinde

Yazılım kurumun kendi sunucusuna kuruluyor. Veri kurumun ağından hiç çıkmıyor ve Vorte veriyi görmüyor; bizim işimiz yazılımı kurmak ve güncellemek. Verisini kurum dışına çıkaramayan kuruluşlar için geçerli olan tek yol bu. Karşılığında kurulum ve sürüm yönetimi ağırlaşıyor — bunu da yazıyoruz.

YERİNDE

Veri nerede işlenir
Kurumun sunucusu
Veri dışarı çıkar mı
Hayır
Vorte veriyi görür mü
Hayır
Kurulum
Gerekli

Hedeflediğimiz ölçütler

Bir veri seti bu eşikleri geçmeden teslim edilmez.

Sentetik veri setleri için hedeflenen sadakat, fayda ve gizlilik eşikleri
BOYUTÖLÇÜTEŞİK
SadakatSDMetrics kalite skoru≥ 0,90
SadakatKS / Chi-squareHer alanda geçer
FaydaTSTR (sentetikle eğit, gerçekte test et)Baseline’ın ≥ %95’i
GizlilikDiferansiyel gizlilik ε≤ 5 (hassas veride ≤ 1)
GizlilikÜyelik çıkarım saldırısı AUC≈ 0,50
Klasikk-anonimlik / l-diversityk ≥ 5 / l ≥ 3
KlasikBirebir kopya oranı%0

Bu ölçütler ölçülmeden hiçbir veri seti “anonim” diye sunulmaz. Sentetik veriyi varsayılan olarak anonim değil, takma adlı kişisel veri kabul ediyoruz; ölçülen değerleri ve kalan riski her teslimde yazılı veriyoruz.

Neyi iddia etmiyoruz

Bu alanda pazarlama dili hukukun önüne geçmeye çok müsait. Söylemediğimizi de yazıyoruz.

  • “Tamamen anonim” demiyoruz

    Sentetik veriyi varsayılan olarak anonim değil, takma adlı kişisel veri kabul ediyoruz. Anonimlik ilan edilecek bir sıfat değil, ölçülerek gösterilecek bir sonuçtur; ölçüm yapılmadan hiçbir set anonim diye sunulmaz.

  • “Sıfır risk” demiyoruz

    Her sette kalan bir risk vardır. İşimiz o riski ölçmek ve yazmak; yok saymak değil. Kalan riski göstermeyen bir rapor, riski ortadan kaldırmaz — yalnızca görünmez kılar.

  • Ölçmediğimizi teslim etmiyoruz

    Eşiği geçmeyen set yeniden üretilir. “Yeterince iyi” diye geçilmez, “müşteri fark etmez” diye hiç geçilmez. Atlanan ölçüm, ileride bulunacak bir hatadır.

  • Bugün satılan bir ürün yok

    Bu bir satış sayfası değil. Teslim edilmiş bir set, kurulmuş bir müşteri ve verilmiş bir tarih yok. Olduğunda bu sayfada tarihiyle yazacak.

Ne aşamadayız

DURUM

Aşama
Ar-Ge
Yöntem seçimi
Devam ediyor
Ölçüm harness
Yok
Teslim edilmiş set
Yok
Tarih taahhüdü
Yok

ÇALIŞMA BAŞLIKLARI

  • Tablosal üretim motoru ve otomatik profilleme
  • Sadakat, fayda ve gizliliği tek raporda ölçen harness
  • Diferansiyel gizlilik katmanı ve üyelik çıkarımı saldırı testleri
  • Çok tablolu tutarlılık — yabancı anahtar bütünlüğünün korunması
  • Türkçe serbest metin alanlarının gerçekçi ama anonim üretimi
  • Paketleme ve kuruma kurulabilir dağıtım

Sıralama çalışma sırası değil; hiçbirine tarih verilmedi.

Sık sorulanlar

Sentetik veri anonim veri midir?

Varsayılan olarak hayır. Sentetik veriyi takma adlı kişisel veri kabul ediyoruz. Anonim sayılabilmesi için gizlilik boyutunun ölçülmesi ve kalan riskin yazılı olarak sunulması gerekir. Bu ölçüm yapılmadan hiçbir set anonim diye sunulmaz — sektörde yaygın olan “sentetik veri anonimdir” kısayolunu kullanmıyoruz.

Gerçek veriyi görüyor musunuz?

Kurulum modeline bağlı. Yerinde kurulumda hayır: yazılım kurumun kendi sunucusunda çalışır, veri ağdan çıkmaz. Bulut modelinde evet: veri bize yüklenir ve bu durumda Vorte veri işleyen sıfatını alır; işleme amacı, saklama süresi ve silme yükümlülüğü sözleşmeye yazılır.

Üretilen veriyle eğitilen model gerçek dünyada çalışır mı?

Ölçtüğümüz şey tam olarak bu. Sentetik veriyle eğitip, üretimden ayrılmış gerçek bir test kümesinde deniyoruz. Hedef, gerçek veriyle eğitilmiş modelin başarısının en az yüzde 95’ini yakalamak. Bu eşiği tutmayan set teslim edilmez.

Hangi veri tipleriyle çalışıyorsunuz?

Odağımız yapısal/tablosal veri: sayısal, kategorik ve tarih alanları ile birbirine yabancı anahtarla bağlı tablolar. Türkçe serbest metin alanları üzerinde çalışıyoruz. Görüntü ve ses kapsamımızda değil.

Ne kadar veri gerekiyor?

Yöntem veri büyüklüğüne göre değişiyor. Küçük ve yapılandırılmış tablolarda kopula tabanlı yöntemler az satırla da çalışıyor; derin öğrenme tabanlı yöntemler daha fazla satır ve daha uzun eğitim istiyor. Peşinen bir alt sınır vermek yerine veriye bakıp söylemeyi tercih ediyoruz.

Bunu bugün satın alabilir miyim?

Hayır. Çalışma Ar-Ge aşamasında; teslim edilmiş bir set ve verilmiş bir tarih yok. Aynı sorunu yaşıyorsanız yine de konuşmak isteriz.

Bu konuda çalışıyorsanız yazın

Test ortamında gerçek veri kullanma sorununu yaşıyorsanız ya da bu alanda araştırma yapıyorsanız konuşalım. Elimizde satacak bir şey yok; öğrenecek çok şey var.

Bize yazın