Veri Bilimi & Yapay Zeka

Rapid Miner ile K-NN Uygulaması

Rapid Miner ile K-NN Uygulaması Yazan: Şadi Evren ŞEKER Bu yazımızda Rapid Miner yazılımına genel anlamda bir giriş yapacağız. Bu yazının amacı Rapid Miner’ın 7.0 versiyonu esas alınarak hazırlanmıştır ve yazının yazılma tarih itibariyle henüz yeni bir versiyondur. Rapid Miner…

Kemmi Normalleştirme (Quantile Normalization)

Yazan : Şadi Evren ŞEKER Literatürde Quantile Normalization olarak geçen ve çoğu Türkçe kaynakta da kantil normalleştirme olarak çevrilen kavramı (ben kelimenin kökü olan qunatity, yani sayısal veya kemiyet olarak gelen kelimeyi kullanmayı tercih ettim) açıklamaktır. Kemmi normalleştirme basitçe iki…

Genetik Programlama (Genetic Programming)

Yazan : Şadi Evren ŞEKER Genetik programlama, yapay zeka çalışmaları altında kabul edilebilecek ve doğal süreçlerin ve mutasyon gibi genetik fonksiyonların bilgisayar problemlerine uygulanması ile sonuç elde etmeyi hedefleyen yaklaşımın adıdır. Belirli bir hedef fonksiyonun sonuca ulaşması için bilgisayar programlarının…

Eş-Eğitim (Co-Training)

Yazan : Şadi Evren ŞEKER Literatürde İngilizce olarak co-training veya co-learning olarak geçen kavramdır. Türkçede eş-eğitim veya eş-öğrenim şeklinde karşılık bulmak mümkündür. Kavram aslı itibariyle bir makine öğrenmesi (machine learning) algoritmasını ifade eder ve genel olarak metin madenciliği (text mining)…

Metin Madenciliği (Text Mining)

Yazan : Şadi Evren ŞEKER Bu yazının amacı, literatürde metin madenciliği (text mining) veya metin veri madenciliği (text data mining) kavramını açıklamaktır. En basit anlamda, metin madenciliği çalışmaları metni veri kaynağı olarak kabul eden veri madenciliği (data mining) çalışmasıdır diğer…

Jensen Shannon Mesafesi (Jensen-Shannon Divergence)

Yazan : Şadi Evren ŞEKER iki olasılık dağılımı arasındaki mesafeyi ölçmek için kullanılan yöntemlerden birisidir. Literatürde “bilgi çapı” (information radius , kısaca iRad ) veya ortalamaya olan toplam uzaklık (total divergence to average) olarak da geçmektedir. Tanımı itibariyle Kullback Leibler…

Kullback Leibler Uzaklığı (kullback-leibler divergence)

Yazan : Şadi Evren ŞEKER Olasılık teorisi ve bilgi teorisinde (information theory) geçen ve iki olasılık dağılımı arasındaki ilişkiyi (uzaklığı) formüllendiren yöntemin ismidir. Tanımı itibariyle, bilgi kazanımı (information gain) veya entropi kavramlarına yakındır ancak formüllendirmesi uzaklık (mesafe) değerinden sonuç döndürür….

Tversky Indeksi (Tversky Index)

Yazan : Şadi Evren ŞEKER Tversky indeksi, verilen iki küme arasındaki benzerliği gösteren bir indeks değeridir. Hesaplanması sırasında, küme fonksiyonlarından faydalanır. Örnek olarak X ve Y isminde, iki kümemiz olduğunu kabul edersek indeks değeri aşağıdaki şekilde hesaplanacaktır: [latex]S(X, Y) =…

Tanimoto Benzerlik Fonksiyonu (Tanimoto Similarity)

Yazan : Şadi Evren ŞEKER Tanimoto benzerlik fonksiyonu, 1960 yılında iki bitki resmi arasındaki benzerliğin bulunması amacıyla yapılan çalışmalar sırasında çıkmıştır. Resimlerin bitmap olarak tutulduğu bir ortamda, yani resimlerin 1 veya 0 olabilen bitler ile tutulduğu bir ortamda iki resim…

Jaccard Indeksi (Jaccard Index)

Yazan : Şadi Evren ŞEKER Bu yazının amacı, metinler arasındaki ilişkinin ölçülmesi amacıyla geliştirilen ölçülerde (metrics) birisi olan Jaccard indeksini açıklamaktır (jaccard index). Indeks basitçe iki metin üzerinden özellik çıkarımı (feature extraction) yapıldıktan sonra ortak olan özelliklerin sayısının, iki metindeki…