# Data Discovery Nedir? Hassas Veri Keşfi, PII Tespiti ve Kurumsal Veri Envanteri Nasıl Oluşturulur?

**URL:** https://securesys.com.tr/tr/bilgi-merkezi/veri-guvenligi-siniflandirma/data-discovery-nedir-hassas-veri-kesfi

![Data Discovery Nedir? Hassas Veri Keşfi, PII Tespiti ve Kurumsal Veri Envanteri Nasıl Oluşturulur?](/images/bilgi-merkezi/covers/cover-veriguv-03.webp)

Data Discovery, kurum içerisindeki verilerin nerede bulunduğunu, hangi türde bilgi içerdiğini, kimler tarafından kullanıldığını ve ne kadar hassas olduğunu keşfetmeye yönelik veri güvenliği sürecidir. Türkçede **veri keşfi** veya **hassas veri keşfi** olarak kullanılan bu yaklaşım, modern Data Security Architecture'ın en temel yapı taşlarından biridir.

Bir kurumun veriyi koruyabilmesi için önce o verinin nerede bulunduğunu bilmesi gerekir. Ancak günümüzde kurumsal veri yalnızca veritabanlarında tutulmamaktadır. File server'lar, employee laptops, e-mail sistemleri, SharePoint, OneDrive, Google Drive, SaaS platformları, cloud storage, source code repositories, backup sistemleri ve collaboration tools aynı verinin farklı kopyalarını içerebilir.

Bu nedenle veri güvenliği açısından en temel sorulardan biri şudur:

**“Kurumumuzda hangi hassas veriler var ve bunlar tam olarak nerede bulunuyor?”**

Bu soruya net cevap verilemiyorsa Data Classification, DLP, DSPM, KVKK uyumu, erişim kontrolü ve veri sızıntısı önleme gibi diğer güvenlik katmanlarının etkinliği de sınırlı kalır.

### Data Discovery Nedir?

Data Discovery, kurumun dijital ekosisteminde bulunan structured, semi-structured ve unstructured data kaynaklarının otomatik veya manuel yöntemlerle keşfedilmesi ve analiz edilmesidir.

Amaç yalnızca storage locations listesini çıkarmak değildir. Data Discovery aynı zamanda data content'ini anlamaya çalışır.

Örneğin bir file server üzerinde milyonlarca document olabilir. Bu dosyaların adları:

rapor.xlsx

liste.docx

backup.zip

final_v2.xlsx

gibi olabilir.

Dosya adlarına bakarak sensitive data içerip içermediklerini anlamak mümkün olmayabilir. Ancak content inspection yapıldığında içerisinde:

T.C. kimlik numarası,

telefon numarası,

e-mail adresi,

müşteri bilgileri,

banka hesap bilgileri,

kredi kartı verileri,

sağlık bilgileri,

sözleşme detayları

bulunabilir.

Bu nedenle Data Discovery yalnız metadata değil içeriğin kendisini de analiz eder.

### Hassas Veri Keşfi Nedir?

Hassas veri keşfi, yani **Sensitive Data Discovery**, kurum içerisindeki kritik ve koruma gerektiren veri türlerini otomatik olarak tespit etmeye yönelik süreçtir.

Bu yaklaşım özellikle şu veri türlerinde önemlidir:

Personally Identifiable Information – PII

Personal Data

Special Category Personal Data

Payment Card Data

Financial Data

Health Data

Source Code

Credentials

API Keys

Encryption Keys

Commercial Secrets

Intellectual Property

Hassas veri keşfinin amacı, kurumun nerede risk taşıdığını görünür hale getirmektir.

Bir database'in production ortamında olması onu otomatik olarak kritik yapmaz. İçerisinde hangi data bulunduğu bilinmelidir.

Aynı şekilde sıradan görünen bir Excel dosyası çok daha kritik olabilir.

### Data Discovery Neden Veri Güvenliğinin İlk Adımlarından Biridir?

Security teams çoğu zaman systems'ı korur.

Firewall network'i korur.

EDR endpoint'i korur.

Database security database'i korur.

Ancak data tüm bu systems arasında hareket eder.

Bu nedenle modern Data Security yaklaşımı infrastructure-centric değil data-centric olmalıdır.

Data Discovery sayesinde kurum:

hangi data'ya sahip olduğunu,

nerede bulunduğunu,

kimlerin eriştiğini,

hangi kopyalarının oluştuğunu,

hangi data'nın gereksiz olduğunu

görebilir.

Bu visibility olmadan security policies varsayımlar üzerine kurulabilir.

### Structured Data Nedir?

Structured Data, belirli schema veya tabular format içerisinde tutulan veridir.

Örneğin:

relational databases,

ERP records,

CRM records,

HR systems,

transaction tables

structured data örnekleridir.

Bu data genellikle column ve field bazında analiz edilebilir.

Örneğin customer table içerisinde:

Name

Identity Number

Phone

Email

Credit Card

gibi columns bulunabilir.

Data Discovery tools column names ve values üzerinden sensitive data classification yapabilir.

### Unstructured Data Nedir?

Unstructured Data, sabit bir schema'ya sahip olmayan document ve file içerikleridir.

Örneğin:

Word documents,

PDF files,

PowerPoint presentations,

text files,

images,

e-mails

unstructured data kapsamında değerlendirilebilir.

Kurumsal sensitive information'ın önemli bir bölümü unstructured data içerisinde bulunabilir.

Bu nedenle yalnız database scanning yapmak yeterli değildir.

File systems ve collaboration platforms da discovery kapsamına alınmalıdır.

### Semi-Structured Data Nedir?

Semi-Structured Data tamamen tabular değildir ancak belirli field structure içerir.

Örneğin:

JSON,

XML,

log files,

API responses

bu kategoriye girebilir.

Modern applications büyük miktarda semi-structured data üretir.

Bu nedenle Data Discovery tools bu formats'i de analiz edebilmelidir.

### PII Nedir?

PII, yani Personally Identifiable Information, bir kişiyi doğrudan veya dolaylı olarak tanımlayabilecek bilgi türlerini ifade eder.

Örneğin:

ad soyad,

e-mail adresi,

telefon numarası,

kimlik numarası,

adres,

pasaport bilgisi,

müşteri numarası

PII kapsamında değerlendirilebilir.

Modern Data Discovery solutions, PII patterns'i tespit ederek data inventory oluşturulmasına yardımcı olabilir.

### PII Detection Nasıl Yapılır?

PII Detection farklı yöntemlerle gerçekleştirilebilir.

Pattern matching en temel yöntemlerden biridir.

Örneğin belirli sayı formatları:

identity number,

credit card number,

phone number

olarak detect edilebilir.

Ancak pattern matching tek başına yeterli olmayabilir.

Çünkü 11 haneli her sayı identity number değildir.

Bu nedenle modern PII Detection:

Regex

Validation Algorithms

Context Analysis

Keyword Analysis

Exact Data Match

Machine Learning

kombinasyonunu kullanabilir.

Bu yöntemler false positive oranını azaltmaya yardımcı olur.

### Exact Data Match Data Discovery'de Nasıl Kullanılır?

Exact Data Match, gerçek authoritative dataset içerisindeki values'i referans olarak kullanır.

Örneğin HR sistemindeki employee identity numbers secure şekilde fingerprint edilebilir.

Discovery engine yalnız gerçek employees'a ait data bulunduğunda finding oluşturabilir.

Bu generic pattern detection'a göre daha doğru olabilir.

Özellikle large enterprises için Exact Data Match önemlidir.

### Keyword-Based Discovery

Certain keywords sensitive content'i tespit etmek için kullanılabilir.

Örneğin:

“salary”

“confidential”

“customer list”

“medical record”

“password”

gibi terms sensitive documents için signal olabilir.

Ancak keyword alone kesin classification sağlamaz.

Bu nedenle context ile birlikte kullanılmalıdır.

### AI ve Machine Learning ile Data Discovery

Modern Data Discovery tools yalnız exact patterns aramakla kalmaz.

Machine learning ve AI kullanarak document context'ini analiz edebilir.

Örneğin bir document açıkça “Confidential” yazmasa bile içeriği:

merger plan,

pricing strategy,

legal investigation,

financial forecast

olabilir.

AI semantic analysis bu document'ın sensitive olduğunu tahmin edebilir.

Bu özellikle unstructured data discovery için güçlü bir capability'dir.

### LLM Tabanlı Veri Keşfi

Large Language Models, doğal dil ile yazılmış documents'ın anlamını yorumlayabilir.

Bu sayede traditional regex ile bulunması zor olan confidential content türleri belirlenebilir.

Örneğin LLM:

“Bu document employee performance evaluation içeriyor.”

veya:

“Bu document acquisition strategy ile ilgili.”

gibi semantic classification sağlayabilir.

Ancak confidential content'i external LLM service'e göndermek yeni veri sızıntısı riski oluşturabilir.

Bu nedenle AI-assisted Data Discovery architecture'ı security ve privacy açısından dikkatle tasarlanmalıdır.

### Data Discovery ile Data Classification Arasındaki Fark

Data Discovery:

**“Data nerede ve ne içeriyor?”**

sorusuna cevap verir.

Data Classification:

**“Bu data ne kadar hassas?”**

sorusuna cevap verir.

Örneğin Discovery engine bir Excel file içerisinde 50.000 customer record bulur.

Classification engine bu file'ı Restricted olarak işaretler.

Bu nedenle iki teknoloji birbirini tamamlar.

En sağlıklı süreç:

**Discover → Identify → Classify → Protect**

şeklindedir.

### Data Inventory Nedir?

Data Inventory, kurum içerisindeki data assets'in sistematik listesidir.

Bir Data Inventory yalnız file names listesi değildir.

Her data asset için şu bilgiler tutulabilir:

Data Type

Data Location

Owner

Classification

Sensitivity

Access Rights

Retention

Business Purpose

Legal Basis

Data Source

Data Destination

Bu information data governance ve data security için temel oluşturur.

### Kurumsal Veri Envanteri Neden Önemlidir?

Bir kurum birçok farklı database ve file repository kullanabilir.

Ancak hangi system'ın hangi data'yı tuttuğu documentation olmadan bilinmeyebilir.

Data Inventory bu visibility'yi artırır.

Örneğin bir customer information dataset:

CRM

ERP

Data Warehouse

Backup

Excel Report

SharePoint

gibi farklı locations'da bulunabilir.

Data Inventory bu copies'i ilişkilendirmeye yardımcı olur.

### Data Mapping Nedir?

Data Mapping, verinin systems arasında nasıl hareket ettiğini gösterir.

Örneğin:

Website Form

↓

CRM

↓

ERP

↓

Data Warehouse

↓

Reporting Platform

bu bir data flow olabilir.

Data Mapping sayesinde kurum yalnız data'nın nerede olduğunu değil nereden geldiğini ve nereye gittiğini de anlayabilir.

Bu özellikle privacy ve compliance açısından önemlidir.

### Data Flow Mapping Neden Kritik?

Sensitive data systems arasında hareket ederken yeni copies oluşabilir.

Örneğin customer data CRM'den export edilip Excel'e alınabilir.

Daha sonra e-mail ile üçüncü partiye gönderilebilir.

Bu durumda original CRM security controls artık yeterli değildir.

Data Flow Mapping bu movement'ın visibility'sini artırır.

### Data Lineage Nedir?

Data Lineage, verinin origin'inden current form'una kadar geçirdiği transformation ve movement'ı izleme yaklaşımıdır.

Örneğin:

Raw Customer Data

↓

Cleansed Data

↓

Analytics Dataset

↓

Executive Report

Data Lineage data'nın nasıl dönüştüğünü anlamaya yardımcı olur.

Bu Data Governance, Data Quality ve Data Security açısından değerlidir.

### Data Catalog Nedir?

Data Catalog, kurumun data assets hakkında searchable metadata repository oluşturmasını sağlar.

Users veya analysts:

hangi datasets mevcut,

kim owner,

hangi classification,

hangi business meaning

gibi information'ı görebilir.

Data Catalog daha çok data governance ve analytics use case'lerinde kullanılsa da Data Security için de önemli context sağlar.

### Data Inventory ile Data Catalog Arasındaki Fark

Data Inventory daha çok “hangi data assets var?” sorusuna odaklanır.

Data Catalog ise bu data hakkında daha zengin metadata ve business context sağlar.

Örneğin:

Inventory:

Customer_Transactions_DB

Catalog:

Owner = Finance

Purpose = Payment Reporting

Classification = Confidential

Source = ERP

Retention = 7 Years

şeklinde daha detaylı olabilir.

### Data Discovery Nerelerde Yapılmalıdır?

Modern Data Discovery programı yalnız database'leri değil tüm data landscape'i kapsamalıdır.

Bu kapsamda:

Databases

File Servers

Endpoints

SharePoint

OneDrive

Google Drive

S3 Buckets

Azure Blob Storage

Cloud Databases

SaaS Platforms

E-mail Systems

Source Code Repositories

Backup Systems

Data Lakes

Data Warehouses

scan edilebilir.

Bu geniş kapsam modern Data Security için gereklidir.

### Database Discovery Nasıl Yapılır?

Database discovery sırasında önce environment'taki database instances belirlenir.

Ardından schemas ve tables analiz edilir.

Sensitive columns tespit edilir.

Örneğin:

Customer

Employee

Payment

Health

tables high-risk olabilir.

Discovery engine column-level sensitivity belirleyebilir.

Bu classification, masking ve DAM policies için kullanılabilir.

### File Server Data Discovery

File servers genellikle yıllarca biriken büyük miktarda unstructured data içerir.

Özellikle shared folders üzerinde:

old reports,

employee exports,

customer lists,

contracts,

password files

bulunabilir.

Data Discovery scan bu files'ı content-based analiz ederek sensitive findings oluşturabilir.

### Endpoint Data Discovery

Sensitive data employee laptops üzerinde de bulunabilir.

Örneğin user database'den export ettiği customer file'ı Desktop'a kaydedebilir.

Bu copy centralized security controls dışında kalabilir.

Endpoint Data Discovery bu local copies'i detect etmeye yardımcı olabilir.

Bu özellikle insider threat ve data leakage risklerini azaltmak için önemlidir.

### Cloud Data Discovery

Cloud adoption data discovery'yi daha da karmaşık hale getirmiştir.

Sensitive data:

AWS S3,

Azure Blob Storage,

Google Cloud Storage,

Cloud Databases

üzerinde bulunabilir.

Yanlış configurations veya broad IAM permissions data exposure oluşturabilir.

Cloud Data Discovery data'nın içeriğini ve location'ını görünür hale getirir.

### SaaS Data Discovery

Modern organizations çok sayıda SaaS application kullanır.

CRM,

HR,

ticketing,

collaboration,

productivity platforms

sensitive data barındırabilir.

Bu nedenle SaaS data da inventory kapsamına alınmalıdır.

CASB, API integrations ve DSPM solutions bu visibility'yi sağlayabilir.

### SharePoint ve OneDrive Veri Keşfi

Microsoft 365 environments içerisinde sensitive data büyük ölçüde SharePoint ve OneDrive üzerinde bulunabilir.

Employees kolayca files oluşturup paylaşabilir.

Bu nedenle:

sensitivity labels,

DLP,

data discovery,

access review

birlikte kullanılmalıdır.

Özellikle external sharing ve anonymous links critical risk oluşturabilir.

### Google Drive Veri Keşfi

Google Workspace kullanan organizations için Google Drive aynı data sprawl problemlerini oluşturabilir.

Sensitive files:

shared drives,

personal user drives,

external shared folders

içerisinde bulunabilir.

Data Discovery bu content'i identify etmeye yardımcı olabilir.

### Backup Data Discovery

Backup systems çoğu zaman Data Security programlarında göz ardı edilir.

Ancak backup içerisinde production data'nın tam kopyaları bulunabilir.

Bu nedenle sensitive data backup environment'ta da korunmalıdır.

Backup inventory içerisinde:

classification,

retention,

encryption,

access

bilgileri bulunmalıdır.

### Source Code Repository Data Discovery

Git repositories yalnız source code değil secrets de içerebilir.

Developers yanlışlıkla:

API Keys

Database Passwords

Cloud Credentials

Private Keys

commitleyebilir.

Secret Scanning, Data Discovery'nin DevSecOps tarafındaki önemli use case'lerinden biridir.

Repository history de scan edilmelidir.

Çünkü secret silinse bile Git history içerisinde kalabilir.

### Data Lake ve Data Warehouse Discovery

Modern analytics environments büyük miktarda sensitive data içerir.

Data Lakes raw datasets tutabilir.

Data Warehouses ise customer, financial ve operational data'yı birleştirebilir.

Bu concentration yüksek impact oluşturur.

Bu nedenle discovery ve classification bu environments için kritik olmalıdır.

### Shadow Data Nedir?

Shadow Data, kurumun resmi governance ve security süreçlerinin dışında kalan veri kopyalarıdır.

Örneğin:

database export,

temporary Excel file,

personal cloud copy,

old backup,

unmanaged SharePoint folder

Shadow Data olabilir.

Bu data security açısından tehlikelidir çünkü Data Owner ve Security Team varlığından haberdar olmayabilir.

### Shadow Data Nasıl Oluşur?

Shadow Data çoğunlukla normal business operations sırasında oluşur.

Örneğin employee:

CRM'den customer list indirir.

Excel'e kaydeder.

Dosyayı shared folder'a taşır.

Sonra eski version kalır.

Bir ay sonra başka copy oluşturulur.

Bu süreç sonunda aynı sensitive dataset birçok location'a yayılır.

Bu **Data Sprawl** oluşturur.

### Shadow Data Neden Risklidir?

Original production system güçlü security controls'e sahip olabilir.

Ancak duplicate Excel file için aynı controls bulunmayabilir.

Örneğin:

Database encrypted.

Access limited.

Audit enabled.

Ama Excel file:

unencrypted,

everyone-readable shared folder'da,

external sharing enabled

olabilir.

Attacker için weak copy'ye ulaşmak daha kolaydır.

Bu nedenle Data Security yalnız original data source'u değil copies'i de korumalıdır.

### Dark Data Nedir?

Dark Data, kurum tarafından saklanan ancak business use veya value'su net olmayan eski veya kullanılmayan veridir.

Örneğin:

10 yıllık old exports,

obsolete reports,

old customer files,

unused databases

Dark Data olabilir.

Bu data kullanılmasa bile breach durumunda exposure oluşturur.

Bu nedenle Data Minimization önemlidir.

### Dark Data ile Shadow Data Arasındaki Fark

Shadow Data governance visibility dışında bulunan veri kopyalarıdır.

Dark Data ise varlığı bilinse dahi aktif business value'su olmayan veya kullanılmayan veridir.

Bir data aynı anda hem Shadow hem Dark olabilir.

Örneğin 5 yıl önce employee tarafından oluşturulmuş ve unutulmuş customer Excel file'ı her iki kategoriye de girebilir.

### Stale Data Nedir?

Stale Data, uzun süredir kullanılmayan veya güncellenmeyen data'dır.

Bu data business need açısından reevaluate edilmelidir.

Eğer retention requirement yoksa deletion düşünülebilir.

Stale sensitive data attack surface'i gereksiz yere artırabilir.

### Duplicate Data Neden Güvenlik Problemidir?

Aynı sensitive dataset'in çok sayıda copy'si varsa security perimeter genişler.

Her copy ayrı access control gerektirir.

Örneğin 1 customer database yerine 30 Excel export bulunuyorsa 31 ayrı exposure point oluşur.

Bu nedenle Data Discovery duplicate sensitive data'yı bulmaya yardımcı olabilir.

### Data Minimization Nedir?

Data Minimization, kurumun yalnız gerçekten ihtiyaç duyduğu data'yı toplaması ve gerektiği süre kadar tutması prensibidir.

Gereksiz data hem storage cost hem security risk oluşturur.

Attacker çalabileceği data ne kadar azsa potential impact de azalır.

Bu nedenle Data Discovery yalnız koruma değil deletion decisions için de kullanılabilir.

### Data Discovery ile DSPM Arasındaki İlişki

DSPM, yani Data Security Posture Management, sensitive data'nın nerede bulunduğunu ve hangi security risks altında olduğunu analiz eder.

Data Discovery DSPM'in temel capability'lerinden biridir.

Örneğin DSPM şu finding'i oluşturabilir:

Sensitive Customer Data

Publicly Accessible Storage

No Encryption

Unknown Owner

=

Critical Risk.

Bu data-centric prioritization sağlar.

### Data Discovery ile DLP Arasındaki İlişki

DLP data movement'ı kontrol eder.

Ancak hangi data'nın sensitive olduğunu bilmek gerekir.

Discovery sayesinde sensitive data types belirlenebilir.

DLP policies buna göre oluşturulur.

Örneğin:

Customer PII → External Email = Block.

Bu nedenle Discovery DLP implementation öncesinde önemli foundation sağlar.

### Data Discovery ile DAM

Database Activity Monitoring database üzerinde hangi data'ya nasıl erişildiğini izler.

Discovery ise hangi tables veya columns sensitive olduğunu belirler.

Bu context DAM alert prioritization'ı artırır.

Örneğin:

User accessed table

alert'i tek başına düşük değerli olabilir.

Ancak:

User exported 1 million records from Restricted Customer Table

çok daha critical'dir.

### Data Discovery ile IAM ve IGA

Data Security yalnız data location değildir.

Kimlerin access ettiği de önemlidir.

Discovery findings identity data ile birleştirildiğinde:

Who has access?

Why do they have access?

Is this access still required?

soruları cevaplanabilir.

IGA access reviews burada önemli rol oynar.

### Excessive Data Access Nasıl Keşfedilir?

Data Discovery data'nın sensitivity'sini belirler.

IAM/IGA ise access relationships'ı gösterir.

Bu bilgiler birleştiğinde excessive access tespit edilebilir.

Örneğin:

Restricted HR Dataset

1,500 Users Have Access

risk oluşturabilir.

Bu access review başlatmak için güçlü bir signal'dır.

### Data Ownership Discovery

Bazı data repositories için owner bilinmeyebilir.

Bu özellikle old file servers ve shared folders'da yaygındır.

Unknown Owner security remediation'ı zorlaştırır.

Modern Data Discovery ve DSPM programs owner inference yapmaya çalışabilir.

Örneğin:

folder usage,

creator,

department,

access patterns

üzerinden owner tahmin edilebilir.

### Data Discovery ve KVKK

KVKK kapsamında kişisel verilerin hangi systems'da işlendiğinin bilinmesi önemlidir.

Bu nedenle Data Discovery, kişisel veri envanteri ve data mapping süreçlerini teknik açıdan destekleyebilir.

Örneğin discovery:

hangi database'de identity numbers var,

hangi file server'da employee health data bulunuyor,

hangi SaaS platformda customer contacts tutuluyor

gibi findings sağlayabilir.

Bu information privacy governance için değerlidir.

### Kişisel Veri Envanteri Nedir?

Kişisel veri envanteri, kurumun işlediği personal data categories, processing purposes, legal basis, storage locations, recipients ve retention periods gibi bilgileri içeren yapılandırılmış kayıt yaklaşımıdır.

Technical Data Discovery bu envanterin doğruluğunu artırabilir.

Çünkü yalnız business interviews ile yapılan inventory gerçek environment'taki tüm copies'i bulamayabilir.

### Teknik Discovery ile Hukuki Envanter Neden Birlikte Kullanılmalıdır?

Business units:

“Bu data yalnız CRM'de tutuluyor.”

diyebilir.

Technical scan ise aynı data'nın:

shared folder,

Excel,

backup,

cloud storage

içerisinde bulunduğunu gösterebilir.

Bu nedenle documentation ile actual technical environment karşılaştırılmalıdır.

Bu gap analysis Data Privacy ve Data Security açısından değerlidir.

### Data Discovery ve PCI DSS

Payment card data bulunan environments için cardholder data discovery önemlidir.

Unknown credit card copies compliance scope'u büyütebilir.

Örneğin employee support ticket içerisine card data eklemiş olabilir.

Discovery tools bu unexpected locations'ı tespit edebilir.

Bu scope reduction için de kullanılabilir.

### Data Discovery ve Ransomware

Ransomware actors da data discovery yapar.

Attacker environment'a girdikten sonra high-value data repositories arar.

Bu nedenle defender'ın attacker'dan önce critical data'yı bilmesi gerekir.

Sensitive repositories yüksek monitoring ve access control altında tutulmalıdır.

Bu **Defender Data Discovery** yaklaşımıdır.

### Data Exfiltration Risk Scoring

Discovery ile data sensitivity belirlendiğinde exfiltration alerts daha doğru prioritize edilebilir.

Örneğin:

10 GB Public Data Download

ile:

500 MB Restricted Customer Data Download

aynı risk seviyesinde değildir.

Bu nedenle:

Data Sensitivity

Volume

Identity Risk

Destination

birlikte değerlendirilebilir.

### Data Discovery ve Insider Threat

Insider threat programları sensitive data location context'ine ihtiyaç duyar.

Employee hangi data'ya erişti?

Normalden fazla mı indirdi?

USB'ye mi kopyaladı?

Personal cloud'a mı yükledi?

Bu questions ancak sensitive data visibility ile anlam kazanır.

Data Discovery insider risk analytics'i güçlendirir.

### Cloud Data Discovery Neden Kritik Hale Geldi?

Cloud environments data creation ve replication'ı kolaylaştırmıştır.

Developer birkaç dakika içerisinde new bucket oluşturabilir.

Analyst new dataset copy çıkarabilir.

AI team new vector database oluşturabilir.

Bu velocity traditional inventory processes'i zorlaştırır.

Bu nedenle discovery continuous olmalıdır.

### Continuous Data Discovery Nedir?

Continuous Data Discovery, environment'ı yalnız yılda bir kez scan etmek yerine sürekli veya düzenli aralıklarla izlemeyi ifade eder.

Yeni:

database,

bucket,

file share,

SaaS repository

oluştuğunda discovery kapsamına otomatik alınabilir.

Bu modern cloud environments için daha doğru yaklaşımdır.

### Point-in-Time Discovery Neden Yetersizdir?

Bugün güvenli olan environment yarın değişebilir.

User new sensitive export oluşturabilir.

Developer new cloud bucket açabilir.

AI Agent new dataset generate edebilir.

Bu nedenle annual inventory hızla outdated olabilir.

Continuous Discovery dynamic data estate için gereklidir.

### AI Systems Yeni Veri Kaynakları Oluşturuyor

Generative AI ve RAG systems yeni data stores ortaya çıkarmıştır.

Örneğin:

Vector Databases

Prompt Logs

Embedding Stores

Agent Memory

Conversation Histories

yeni sensitive data repositories olabilir.

Traditional data inventory bunları gözden kaçırabilir.

Bu nedenle modern Data Discovery AI architecture'ı da kapsamalıdır.

### Vector Database Veri Güvenliği

RAG systems documents'ın embeddings'ini vector database içerisinde tutabilir.

Bu repositories sensitive information ile ilişkili olabilir.

Vector database access'i geniş olursa unauthorized retrieval riski oluşabilir.

Bu nedenle vector stores Data Discovery ve Data Classification kapsamına alınmalıdır.

### Prompt Logs Hassas Veri İçerebilir mi?

Evet.

Users AI systems'a:

customer data,

source code,

employee information,

financial data

girebilir.

Bu prompts logs içerisinde saklanabilir.

Bu nedenle prompt logs sensitive data repositories olarak değerlendirilmelidir.

Retention ve access policies uygulanmalıdır.

### Agent Memory Nedir?

AI Agents uzun süreli memory kullanabilir.

Agent geçmiş tasks veya user data'yı saklayabilir.

Bu memory sensitive information içerebilir.

Bu nedenle Agent Memory yeni bir Data Governance ve Data Discovery area haline gelmektedir.

### RAG Corpus Discovery

RAG corpus oluşturulurken hangi documents'ın AI system'a dahil edildiği bilinmelidir.

Örneğin:

Internal Documents

HR Documents

Board Reports

Customer Contracts

aynı corpus içerisinde bulunabilir.

Bu durumda retrieval authorization complexity artar.

Data Discovery RAG corpus içerisindeki sensitivity'yi görünür hale getirmelidir.

### Data Discovery ile AI Governance

AI Governance yalnız model riskini yönetmek değildir.

AI'nın hangi data üzerinde çalıştığı da bilinmelidir.

Bu nedenle AI inventory ile data inventory ilişkilendirilmelidir.

Örneğin:

AI Application A

uses:

Customer Dataset B

ve:

HR Dataset C

gibi mapping yapılabilir.

Bu AI Data Governance'ın temelidir.

### Data Discovery Tool Seçiminde Nelere Bakılmalı?

Tool selection sırasında yalnız file scanning capability değerlendirilmemelidir.

Platform şu capabilities'e sahip olabilir:

Structured Data Discovery

Unstructured Data Discovery

Cloud Discovery

SaaS Discovery

PII Detection

Exact Data Match

Data Classification

Data Lineage

Access Analysis

DSPM Integration

DLP Integration

API Integration

AI/ML Detection

Bu capabilities organization's architecture'ına göre değerlendirilmelidir.

### Data Discovery Projesi Nasıl Başlatılır?

Data Discovery programı tüm environment'ı aynı anda scan ederek başlamak zorunda değildir.

Risk-based approach daha uygulanabilir olabilir.

İlk olarak crown jewel systems belirlenir.

Örneğin:

Customer Database

HR Systems

Finance Systems

File Servers

Cloud Storage

önceliklendirilebilir.

Ardından coverage genişletilir.

Bu phased rollout operational complexity'yi azaltır.

### Discovery Scope Nasıl Belirlenir?

İlk scope oluşturulurken şu questions sorulabilir:

Critical systems hangileri?

Personal data nerelerde olabilir?

Cloud repositories hangileri?

Sensitive file shares hangileri?

High-risk business units hangileri?

Bu questions initial scan priorities belirler.

### False Positive Nasıl Yönetilir?

Data Discovery tools çok fazla false positive üretebilir.

Örneğin normal random numbers identity number olarak işaretlenebilir.

Bu nedenle validation rules gereklidir.

False positive azaltmak için:

Context

Validation Algorithm

Exact Match

Thresholds

kullanılabilir.

Aksi halde Security Team alert fatigue yaşayabilir.

### False Negative Daha mı Tehlikelidir?

False Negative, sensitive data'nın detect edilmemesidir.

Bu risk daha ciddi olabilir çünkü data invisible kalır.

Bu nedenle discovery engine accuracy'si balance edilmelidir.

Amaç sıfır false positive değil yüksek-confidence visibility sağlamaktır.

### Scan Permissions Güvenli Olmalı

Discovery tool data repositories'e erişmek için credentials kullanabilir.

Bu credentials high privilege taşıyabilir.

Bu nedenle scanner accounts:

Least Privilege

Read-Only

Credential Vaulting

Monitoring

ile korunmalıdır.

Data Security tool'un kendisi yeni attack surface oluşturmamalıdır.

### Data Discovery Performance Riski

Large databases veya file servers scanning sırasında performance impact yaşayabilir.

Bu nedenle:

scan schedule,

throttling,

incremental scanning

gibi strategies kullanılabilir.

Production systems için testing yapılmalıdır.

### Incremental Scanning Nedir?

Initial full scan sonrasında yalnız değişen veya new data'nın taranması incremental scanning olarak düşünülebilir.

Bu performance cost'ı azaltabilir.

Continuous discovery için önemli yöntemdir.

### Data Discovery Bulguları Nasıl Önceliklendirilmelidir?

Her sensitive data finding aynı priority değildir.

Örneğin:

Restricted Data + Public Access

critical olabilir.

Restricted Data + Strong Controls

lower risk olabilir.

Bu nedenle risk score şu faktörleri kullanabilir:

Sensitivity

Exposure

Access Count

Encryption

Owner

Location

Age

Activity

Bu DSPM yaklaşımıyla uyumludur.

### Data Discovery Sonrası Ne Yapılmalı?

Discovery yalnız finding üretmek için yapılmamalıdır.

Her finding için action gerekir.

Örneğin:

Classify

Encrypt

Restrict Access

Delete

Move

Mask

Apply DLP

Assign Owner

gibi remediation yapılabilir.

Aksi halde kurum yalnız risk listesini büyütmüş olur.

### Data Discovery Remediation Workflow

Örnek workflow:

#### Discover Sensitive Data

↓

#### Validate Finding

↓

#### Determine Owner

↓

#### Assign Classification

↓

#### Analyze Access

↓

#### Apply Protection

↓

#### Monitor

↓

#### Review

Bu workflow Data Security programını operational hale getirir.

### Data Discovery KPI'ları

Programın başarısı ölçülmelidir.

Örnek KPI'lar:

Total Data Repositories Discovered

Sensitive Data Assets Found

PII Records Detected

Unclassified Sensitive Data Count

Unknown Owner Count

Shadow Data Findings

Dark Data Volume

Stale Data Volume

Publicly Exposed Sensitive Data

Unencrypted Sensitive Data

Duplicate Sensitive Data Count

Discovery Coverage

Mean Time to Remediate Data Risk

gibi metrics olabilir.

### Veri Envanteri Ne Sıklıkla Güncellenmeli?

Dynamic environments için annual update yeterli olmayabilir.

Cloud ve SaaS adoption hızlıysa inventory continuous veya near-real-time olarak güncellenebilir.

En azından critical data repositories regular scanning altında olmalıdır.

Bu Data Inventory'nin living asset olmasını sağlar.

### Data Discovery'de En Sık Yapılan Hatalar

İlk yaygın hata discovery'yi yalnız database scanning olarak görmektir. Sensitive data çoğu zaman file servers, endpoints ve SaaS systems içerisinde bulunur.

İkinci hata yalnız personal data aramaktır. Source code, credentials, trade secrets ve financial data da sensitive olabilir.

Üçüncü hata one-time discovery yapmaktır. Data estate sürekli değiştiği için findings hızla outdated olur.

Dördüncü hata found data'ya owner atamamaktır. Ownership yoksa remediation responsibility belirsiz kalır.

Beşinci hata discovery sonuçlarını DLP, IGA veya DSPM ile entegre etmemektir.

Altıncı hata AI data stores ve vector databases'i kapsam dışı bırakmaktır.

Yedinci hata her finding'i aynı risk seviyesinde değerlendirmektir.

### Data Discovery Kontrol Listesi

- Kurumsal Data Discovery programı var mı?
- Structured data scan ediliyor mu?
- Unstructured data scan ediliyor mu?
- Semi-structured data kapsamda mı?
- Databases discover ediliyor mu?
- File servers scan ediliyor mu?
- Endpoints değerlendiriliyor mu?
- SharePoint ve OneDrive kapsamda mı?
- Google Drive kapsamda mı?
- Cloud object storage scan ediliyor mu?
- SaaS applications kapsamda mı?
- Backup repositories değerlendiriliyor mu?
- Source code repositories secret scanning altında mı?
- Data lakes ve warehouses scan ediliyor mu?
- PII Detection mevcut mu?
- Exact Data Match kullanılıyor mu?
- Sensitive Data Types tanımlı mı?
- Data Owners atanıyor mu?
- Data Inventory güncel mi?
- Data Mapping yapılıyor mu?
- Data Lineage biliniyor mu?
- Shadow Data detect ediliyor mu?
- Dark Data izleniyor mu?
- Stale Data tespit ediliyor mu?
- Duplicate Sensitive Data belirleniyor mu?
- Public exposure kontrol ediliyor mu?
- Encryption status analiz ediliyor mu?
- Access relationships değerlendiriliyor mu?
- Discovery findings classification ile entegre mi?
- DLP integration var mı?
- DSPM integration var mı?
- SIEM/SOC'a high-risk findings aktarılıyor mu?
- Vector databases inventory'de mi?
- Prompt logs kontrol ediliyor mu?
- Agent memory data scope'a dahil mi?
- RAG corpus inventory'de mi?
- Continuous Discovery uygulanıyor mu?
- Data Discovery KPI'ları izleniyor mu?

### Data Discovery Olgunluk Modeli

**Seviye 1 – Bilinmeyen Veri Ortamı:** Kurum verinin nerede olduğunu tam olarak bilmez. Inventory manuel ve eksiktir.

**Seviye 2 – Temel Veri Envanteri:** Critical systems ve data repositories manuel olarak tanımlanır. PII discovery sınırlı olarak uygulanır.

**Seviye 3 – Otomatik Sensitive Data Discovery:** Databases, file servers, cloud ve SaaS environments otomatik scan edilir. Data Classification ve ownership süreçleri ile entegre olunur.

**Seviye 4 – Continuous Data Discovery ve DSPM:** Shadow Data, Dark Data, excessive access ve public exposure sürekli analiz edilir. Risk-based remediation uygulanır.

**Seviye 5 – Adaptive Data Intelligence:** Data Discovery, Identity, DLP, DSPM, AI Governance ve behavioral analytics ile birlikte çalışır. Data location, sensitivity, access ve risk sürekli değerlendirilir.

Bu dönüşüm:

#### Unknown Data

↓

#### Inventoried Data

↓

#### Discovered Sensitive Data

↓

#### Risk-Aware Data

↓

#### Adaptive Data Intelligence

şeklinde ilerler.

### Sık Sorulan Sorular

#### Data Discovery nedir?

Data Discovery, kurum içerisinde verilerin nerede bulunduğunu, hangi içerikleri barındırdığını ve ne kadar hassas olduğunu keşfetme sürecidir.

#### Hassas veri keşfi nedir?

Sensitive Data Discovery, personal data, financial data, credentials, source code ve diğer kritik bilgilerin data repositories içerisinde tespit edilmesidir.

#### PII Detection nedir?

PII Detection, bir kişiyi doğrudan veya dolaylı tanımlayabilecek bilgilerin otomatik yöntemlerle bulunmasıdır.

#### Data Inventory nedir?

Data Inventory, kurumun sahip olduğu data assets, locations, owners, classifications ve access bilgilerinin sistematik kaydıdır.

#### Data Mapping nedir?

Data Mapping, verinin hangi system'dan geldiğini, nerede işlendiğini ve hangi systems'a aktarıldığını gösteren süreçtir.

#### Data Lineage nedir?

Data Lineage, verinin source'tan current state'e kadar geçirdiği movement ve transformation history'sidir.

#### Data Catalog nedir?

Data Catalog, data assets hakkında searchable metadata ve business context sağlayan repository'dir.

#### Shadow Data nedir?

Security ve governance teams'ın tam visibility sahibi olmadığı kontrolsüz data copies'idir.

#### Dark Data nedir?

Toplanmış ancak aktif business use veya value'su sınırlı olan veridir.

#### Stale Data nedir?

Uzun süredir kullanılmayan veya güncellenmeyen data'dır.

#### Structured Data nedir?

Schema ve tabular structure'a sahip database veya application data'sıdır.

#### Unstructured Data nedir?

Word, PDF, e-mail, image ve benzeri sabit schema'ya sahip olmayan data'dır.

#### Data Discovery ile DLP arasındaki fark nedir?

Discovery data'nın nerede olduğunu bulur. DLP data'nın nasıl hareket ettiğini kontrol etmeye çalışır.

#### Data Discovery ile DSPM arasındaki ilişki nedir?

DSPM, Data Discovery findings'ini sensitivity, exposure ve access context ile birleştirerek data security risklerini analiz eder.

#### Data Discovery KVKK için gerekli midir?

Technical Data Discovery, KVKK kapsamında personal data locations ve copies hakkında visibility sağlayarak personal data inventory ve security processes'ini destekleyebilir.

#### Cloud Data Discovery nedir?

AWS, Azure, Google Cloud ve SaaS environments içerisinde sensitive data repositories'in keşfedilmesidir.

#### AI Data Discovery nedir?

AI systems'ın kullandığı datasets, vector databases, prompt logs, RAG corpus ve agent memory gibi yeni data repositories'in keşfedilmesi ve sınıflandırılmasıdır.

### Sonuç: Görmediğiniz Veriyi Koruyamazsınız

Modern Data Security'nin en temel problemlerinden biri kurumların sahip oldukları verinin tamamına görünürlük sağlayamamasıdır.

Bir kurum production database'ini çok güçlü koruyabilir.

Ancak aynı database'den alınmış Excel copy:

employee laptop'ında,

shared folder'da,

cloud storage'da

kontrolsüz şekilde bulunabilir.

Bu durumda saldırgan için en güçlü system'a saldırmak yerine en zayıf copy'yi bulmak daha kolay olabilir.

Bu nedenle modern Data Security yalnız sistemleri değil verinin kendisini takip etmelidir.

Kurumsal Data Discovery şu sorulara sürekli cevap verebilmelidir:

#### Hangi verimiz var?

#### Nerede bulunuyor?

#### Ne kadar hassas?

#### Kim erişebiliyor?

#### Kaç kopyası var?

#### Kim sahibi?

#### Ne kadar süredir kullanılmıyor?

#### Public exposure var mı?

#### AI systems bu veriyi kullanıyor mu?

Bu sorular cevaplandığında Data Classification, DLP, DSPM, DAM, Encryption ve Access Governance gibi diğer security controls çok daha doğru uygulanabilir.

Bu nedenle modern veri güvenliği zincirinin başlangıç noktası:

#### Discover

olmalıdır.

Ardından:

#### Classify

#### Protect

#### Govern

#### Monitor

#### Respond

gelir.

Ve bu bölümün en önemli cümlesi:

**Data Discovery, kurumun yalnız verinin nerede bulunduğunu öğrenmesini değil; hangi hassas verinin hangi sistemde, hangi kullanıcıların erişiminde, hangi kopyalar halinde ve hangi güvenlik riski altında bulunduğunu görünür hale getiren modern Data Security'nin temel keşif katmanıdır.**
