Veri Madenciliği

Veri toplama araçlarındaki olağanüstü gelişmeler ve toplanan veriden karar destek sistemlerinde yararlanma isteği veri madenciliğini ön plana çıkartmıştır.

Özellikle çok değişkenli istatistik analiz ve makine öğrenimi algortimalarına her geçen gün yenileri katılmaktadır.

Fayyad ve diğerleri tarafından ilk kez tanımlanan veri madenciliği süreci, CRISP-DM ve SEMMA yaklaşımları ile standartize edilmeye çalışılmıştır.

Veri tabanı sistemlerinin artan kullanımı ve hacimlerindeki olağanüstü artış, organizasyonları elde toplanan bu verilerden nasıl faydalanılabileceği problemi ile karşı karşıya bırakmıştır.

CRISP-DM (Cross Industry Standard Process for Data Mining), veri madenciliği problemleri çözümünde takip edilmesi önerilen veri madenciliği süreç modelidir.

Veri ön işleme, bu süreç içerisinde en önemli ögedir. Kalitesiz veri, ne kadar iyi algoritmalar kullanılırsa kullanılsın, sonuçların geçersiz olmasına neden olacaktır.

Veri ön işleme, veri entegrasyonu, veri temizleme, veri dönüştürme ve veri indirgeme aşamalarından meydana gelir.

Veri entegrasyonu farklı veri depolarında bulunan verinin tek bir veri deposunda toplanması veya fiziki olarak bir araya getirilmese de, kullanıcıya bütün hâlinde sunulması için gerekli işlemlerin gerçekleştirilmesidir.

Veri temizleme (data cleaning / cleansing), bir veri dizisinde, tablosunda veya herhangi bir veri deposunda bulunan hatalı veya bozuk kayıtların tespit edilmesi, düzeltilmesi veya ortadan kaldırılması işlemidir.

Veri dönüştürme normalleştirme (normalization), kesimlere ayırma (discretization) / birleştirme (aggregation) gibi teknikler kullanılarak verinin modelleme aşamasında kullanılacak veri analizi modelleri / yöntemleri için hazırlanmasıdır.

Veri madenciliği modelleri geleneksel olarak sınıflandırma, kümeleme ve örüntü madenciliği olarak gruplandırılır.

Veri madenciliği içerisinde üç ana gruptan biri olan sınıflandırma, veri dizisinin istatistik ve/veya makine öğrenimi yöntemleri kullanılarak önceden belirlenen sınıflara atanması işlemidir.

İstatistik yöntemler içerisinde lineer ve lineer olmayan başlıca yöntemler lineer regresyon analizi, lojistik regresyon analizi, diskriminanz analizi, Bayes sınıflandırma yöntemleridir. Makine öğrenimi yöntemleri içerisinde ise karar ağaçları, en yakın komşu yöntemi, yapay sinir ağları, destek vektör makineleri başlıca yöntemlerdir. Son dönemlerde fuzzy temelli sınıflandırma yöntemleri önemli bir araştırma alanıdır.

Küme analizi (cluster analysis) veya kümeleme (clustering) en basit tanımı ile veri dizisinde yer alan benzer nesnelerin aynı gruplarda yer alacak şekilde ayrıştırılmasıdır.

Pazar sepeti analizi (market basket analysis) örüntü madenciliğinin (pattern mining) en eski uygulamasıdır. Alışveriş yapan her müşterinin hangi mal veya hizmetleri satın almaya eğilimli olduğu bu müşteriye ilişkin bir satın alma örüntüsünün oluşmasını sağlamaktadır.