logicBombExe/turkish_cyber_security_controls_dataset
Turkish Cyber Security Controls Dataset Veri Kümesi Özeti Bu veri kümesi; siber güvenlik kontrolleri, kontrol seçimi ve güvenli mimari tasarımı hakkında hazırlanmış 800 Türkçe kullanıcı-asistan konuşma çifti içerir. Toplam 1.600 mesajdan oluşan koleksiyon, Türkçe siber güvenlik soru-cevap ve instruction-tuning çalışmalarını desteklemek amacıyla hazırlanmıştır. İçerik geliştirilirken başta NIST SP 800-53 Rev. 5 kontrol kataloğu olmak üzere risk temelli kontrol… See the full description on the dataset page: https://huggingface.co/datasets/logicBombExe/turkish_cyber_security_controls_dataset.
Turkish Cyber Security Controls Dataset
Veri Kümesi Özeti
Bu veri kümesi; siber güvenlik kontrolleri, kontrol seçimi ve güvenli mimari tasarımı hakkında hazırlanmış 800 Türkçe kullanıcı-asistan konuşma çifti içerir. Toplam 1.600 mesajdan oluşan koleksiyon, Türkçe siber güvenlik soru-cevap ve instruction-tuning çalışmalarını desteklemek amacıyla hazırlanmıştır.
İçerik geliştirilirken başta NIST SP 800-53 Rev. 5 kontrol kataloğu olmak üzere risk temelli kontrol uygulama ilkelerinden yararlanılmıştır. Sorular yalnız kontrol tanımlarını değil; kontrollerin gerçek senaryolarda seçilmesini, uygulanmasını, test edilmesini, ölçülmesini ve mimari kararlarla ilişkilendirilmesini de kapsar.
Veri sentetiktir. Gerçek kullanıcı konuşmaları, kişisel veriler, kuruluş sırları veya gerçek olay kayıtları içermez.
Kapsanan Başlıca Konular
- Güvenlik yönetişimi, risk yönetimi, politika ve denetim
- Kimlik ve erişim yönetimi, MFA, PAM ve görevler ayrılığı
- Zero Trust ve katmanlı güvenlik mimarileri
- Bulut, hibrit bulut ve çoklu bulut güvenliği
- Uygulama güvenliği, API güvenliği, DevSecOps ve CI/CD
- Ağ, DNS, e-posta, uç nokta ve sunucu güvenliği
- Loglama, SIEM, SOC, tehdit avcılığı ve olay müdahalesi
- İş sürekliliği, felaket kurtarma, yedekleme ve fidye yazılımı dayanıklılığı
- Fiziksel güvenlik, personel güvenliği ve güvenlik farkındalığı
- Gizlilik mühendisliği, veri minimizasyonu ve kontrollü bilgi paylaşımı
- Tedarik zinciri ve üçüncü taraf güvenliği
- OT/ICS, IoT, konteyner ve Kubernetes güvenliği
- Kontrol etkinliği testi, güvenlik metrikleri ve mimari karar analizi
Veri Yapısı
Yerel dataset.json dosyasının kökünde train alanı bulunur. Bu alan 800 konuşmadan oluşan bir listedir. Her konuşma önce user, ardından assistant mesajını içerir.
{
"train": [
[
{
"content": "Zero Trust mimarisi nasıl tasarlanmalıdır?",
"images": null,
"role": "user",
"thinking": null,
"tool_calls": null
},
{
"content": "Zero Trust tek bir ürün değil; kimlik, cihaz, politika uygulama noktaları, en az ayrıcalık ve sürekli doğrulamayı birlikte ele alan bir mimari yaklaşımdır.",
"images": null,
"role": "assistant",
"thinking": null,
"tool_calls": null
}
]
]
}Alanlar
content: Kullanıcı sorusu veya asistan yanıtı.images: Bu sürümde her zamannull.role:userveyaassistant.thinking: Zincirleme düşünme verisi içermez; her zamannull.tool_calls: Araç çağrısı içermez; her zamannull.
Veri İstatistikleri
Hugging Face ön bilgi bloğundaki boyutlar, dönüştürülmüş veri dosyası için sağlanan metadata değerleridir. Farklı Parquet sıkıştırması veya yeniden oluşturma işlemleri bu değerleri değiştirebilir; yayın sırasında metadata yeniden hesaplanmalıdır.
Kullanım
Yerel JSON dosyasını okuma
import json
from pathlib import Path
data = json.loads(Path("dataset.json").read_text(encoding="utf-8"))
conversations = data["train"]
assert len(conversations) == 800
assert conversations[0][0]["role"] == "user"
assert conversations[0][1]["role"] == "assistant"Bir eğitim aracının messages alanı beklemesi halinde konuşmalar şu şekilde dönüştürülebilir:
records = [{"messages": conversation} for conversation in conversations]Hugging Face üzerinden yükleme
Veri kümesi Hub'a yayımlandıktan sonra depo kimliğini değiştirerek yükleyebilirsiniz:
from datasets import load_dataset
dataset = load_dataset("YOUR_NAMESPACE/YOUR_DATASET", split="turkish")Amaçlanan Kullanımlar
- Türkçe instruction-tuning ve supervised fine-tuning
- Siber güvenlik kontrolü ve mimari tasarım odaklı soru-cevap sistemleri
- Güvenlik eğitim asistanları ve kontrol farkındalığı prototipleri
- Türkçe güvenlik terminolojisi ve yanıt kalitesi değerlendirmeleri
- RAG veya kontrol kataloğu tabanlı sistemler için yardımcı eğitim verisi
Amaçlanmayan Kullanımlar
- Otomatik mevzuat veya standart uyumluluğu belgelendirmesi
- Kuruluşa özel risk değerlendirmesi yapılmadan doğrudan kontrol seçimi
- İnsan uzman onayı olmadan üretim ortamında güvenlik mimarisi kararı verilmesi
- Hukuki, düzenleyici veya sözleşmesel görüş yerine kullanılması
- Güncel tehdit istihbaratı ya da ürün güvenlik duyurusu kaynağı olarak kullanılması
Veri Oluşturma ve Kalite Kontrolü
Veri kümesi, mevcut örneklerin anlatım ve şema yapısı korunarak konu kotalarıyla genişletilmiştir. NIST kontrol kimlikleri yerel NIST SP 800-53 Rev. 5 OSCAL kataloğuna karşı doğrulanmış; yönetişim, bulut, uygulama güvenliği, operasyon, mimari tasarım ve daha az temsil edilen kontrol aileleri dengeli biçimde ele alınmıştır.
İki bağımsız salt-okunur inceleme gerçekleştirilmiştir:
- Teknik/NIST incelemesi: 800 kaydın tamamı programatik, 260 kayıt manuel incelenmiştir. 1.410 açık NIST atfında katalog dışı veya
withdrawnkimlik bulunmamış; manuel örneklemde doğrulanmış kimlik-amaç uyumsuzluğu tespit edilmemiştir. - Veri kalitesi incelemesi: 800 kaydın tamamı ve olası 319.600 soru çifti programatik, 208 kayıt manuel incelenmiştir. Şema ihlali, boş içerik ve tam tekrar bulunmamıştır. İnceleme sonucu, aşağıdaki biçim ve çeşitlilik sınırlamaları nedeniyle
CONDITIONAL PASSolarak değerlendirilmiştir.
Bu denetimler veri kümesinin hatasız veya her bağlam için yeterli olduğunu garanti etmez.
Bilinen Sınırlamalar
- NIST kimliği yazım biçimi: 432 yanıtta toplam 605 atıf
AC-02gibi sıfır dolgulu biçimdedir. Bunlar aktif kontrollere karşılık gelir ancak kanonik kısa gösterim genellikleAC-2biçimindedir. Katı kimlik eşleştirmesi yapan sistemler eğitim öncesinde kimlikleri normalleştirmelidir. - Yanıt şablonlaşması: Yanıtların önemli bir bölümünde “X kontrolü bunu destekler” kalıbı kullanılır. Yeni üretilen örneklerin yanıt uzunlukları da görece dar bir aralıktadır. Bu durum ince ayarlı modelin benzer uzunluk ve cümle kalıplarını gereğinden fazla kullanmasına yol açabilir.
- Yakın soru niyetleri: Tam tekrar bulunmamasına rağmen birkaç soru farklı bağlamlarda benzer kontrol hedeflerini işler. İleri düzey çeşitlilik gerektiren kullanımlarda anlamsal kümeleme yapılması önerilir.
- Sentetik içerik: Veri gerçek uzman görüşmelerinden veya üretim olaylarından türetilmemiştir. Kuruluş, sektör, mevzuat ve tehdit modeli bağlamı ayrıca değerlendirilmelidir.
- Zamansal sınırlılık: Standartlar, tehditler ve iyi uygulamalar zamanla değişebilir. Kontrol açıklamaları kullanılmadan önce güncel ve yetkili kaynaklarla karşılaştırılmalıdır.
- Terminoloji: Bazı örneklerde Türkçe ve İngilizce teknik terimler birlikte kullanılır. Kurumsal kullanım öncesinde bir terminoloji sözlüğüyle normalleştirme yararlı olabilir.
Güvenlik ve Sorumlu Kullanım
Veri kümesi savunma, eğitim ve kontrol tasarımı amaçlıdır. Yanıtlar genel öneriler içerir; bir kontrolün uygulanabilirliği sistem etkisi, tehdit modeli, veri sınıfı, mevzuat ve kalan risk ile birlikte değerlendirilmelidir. Model çıktıları güvenlik uzmanı incelemesi, teknik test ve yetkili dokümantasyonun yerine geçmemelidir.
Kaynak
Temel kontrol referansı:
- National Institute of Standards and Technology, Security and Privacy Controls for Information Systems and Organizations, NIST SP 800-53 Rev. 5. <https://doi.org/10.6028/NIST.SP.800-53r5>
Lisans
Veri kümesi derlemesi MIT License altında sunulmaktadır. Kaynak standart ve yayınların kendi kullanım koşulları ayrıca geçerlidir.
