Journals / Eurasian Journal of Educational Research / 2007 / Cilt: 0 - Sayı: 28

Two-Step Clustering Analysis in Researches: A Case Study

Araştırmalarda İki Aşamalı Kümeleme (Two-Step Clustering) Analiz ve Bir Uygulaması

Pages
89–99
DOI
—

Abstract

Problem Statement: It is known that the result of descriptive statistical and the estimations of parameter will be bias for heteregenous data set. After dividing heteregenous data set into homogeneous subpopulations or clusters, the result of statistical analysis will be more robust and unbiased. The aim of this study was to show the applicability of two-step cluster analysis in the educational sciences.Purpose of study : In this study, the two-step cluster analysis has been examined which creates memberships (individual or variable) for different groups according to similarity sides of variables. The advantage and disadvantage of two-step cluster analysis has been determined. It is not an obligation to know the number of clusters firstly. Two-step cluster analysis tries to determine optimal sub-population number. Especially, latent class and cluster analysis techniques have been identified according to log-likelihood distance measurement and this study explains how to consist the groups by using log-likelihood criterion. Also Bayesian information and Akaike’s information criterions have been examined versus log-likelihood. Methods: The sample was consisted of 608 individuals. Some variables which belong to these individuals were examined. Seven variables were used in this sample. The 3 of these variables were scale (oss grade, sport performance, oobp). The rest of these variables (occupation of father, graduation of lise branch, region and gender) were categorical (nominal or ordinal). Two-step cluster analysis were used for this experimental study.Findings and Results: At the end of this study, seven clusters were determined by using Bayesian information criterion (BIC) according to the similarity of the variables. It was recommended to use BIC versus AIC to get optimal cluster number. It was observed that both scale and categorical variables were handled succesfully by using two-step cluster analysis. Also it was observed that two-step cluster analysis was more effective for scale variables.Conclusions and Recommendations: At the end of the study, the article concludes that the two-step cluster analysis seems to be more efficient in analysing the similar data and verdict analysed in this study for experimantal studies in the educational fields. Despite of some unefficent sides of two-step cluster analysis can be used in the educational fields consciously.

Özet

Problem Durumu: Heterojen olan bir veri setinin elde edeceği tanımlayıcı istatistik ve parametre tahminleme denklem değerlerinin sapmalı olacağı bildirilmektedir. Heterojen olan veri setinin homojen olan alt sınıf ya da kümelere bölünmesinden sonra elde edilen istatistiksel çalışmaların daha sağlıklı sonuçlara sahip olduğu literatürde bildirilmektedir. Eğitim bilimleri araştırmaları için veri setindeki birey ya da değişkenlerin çok olması durumunda iki aşamalı kümeleme analizinin uygulanabilirliği çalışmanın temel problemini oluşturmaktadır. Araştırmanın amacı: Bu çalışmada, genel amacı gruplanmamış verileri benzerliklerine göre kümelemek olan iki aşamalı kümeleme analizi ele alınmıştır. Küme sayısı hususunda bir ön bilginin olmadığı durumlarda kullanılabilen iki aşamalı kümeleme analizinin avantaj ve dezavantajları irdelenmiştir. Özellikle gizli sınıf (latent class) ve küme analiz (cluster analysis) ileri istatistik tekniklerinin log-olabilirlik (log-likelihood) uzayında verileri nasıl grupladığı ve yine aynı uzay içerisinde kullanmış olduğu Bayesçi bilgi ve Akaike bilgi ölçütlerinin (BIC, AIC) nasıl bir fonksiyon üstlendikleri açıklanmaya çalışılmıştır. Araştırmanın Yöntemi: Örneklem olarak Doğu Anadolu bölgesindeki büyük bir üniversitede okuyan 608 öğrenciye ait bir veri seti incelenmiştir. Bu veri setine ait 7 adet değişken kullanılmıştır. Bu verilerden üç tanesi sürekli değişken (öss puanı, mekik skoru, oöbp), geriye kalan dört değişken ise kategorik özellik arz etmektedir (baba mesleği, lise mezuniyet kolu, bölge ve cinsiyet) . Bu 7 değişken merkezli 608 birey kümelenmiştir. 608 bireyden oluşan veri setine iki aşamalı kümeleme yöntemi kullanılmıştır. Bulgular ve Sonuçlar: Bu çalışmanın sonucunda, log-olabilirlik temelli Bayesçi bilgi kriteri (BIC)doğrultusunda 608 birey ortak özellikleri bakımından (7 değişken merkezinde) 7 kümeye anlamlı bir şekilde bölünmüştür. İki aşamalı kümeleme analizinin sürekli ve kategorik verileri bir arada kümeleyebildiği gözlemlenmiştir. Yine bu çalışmada iki aşamalı kümeleme analizinin sürekli ve kategorik değişkenleri kümelemede bazen yetersiz kaldığı bulgusuna rastlanmıştır. Bununla birlikte sürekli değişkenleri ideal düzeyde kümeleyebildiği kabul edilmiştir. Öneriler: Eğitim bilimcilerin karışık (sophisticated) istatistik içerikli araştırmalarında bu tür ileri düzey istatistikleri bilinçli bir şekilde kullanmaları önerilmektedir. Bu çalışma ile iki aşamalı küme analiz tekniğinin bilimsel çalışmalara farklı bir ışık tutacağı düşünülmektedir. Sınırlılıkları ile birlikte iki aşamalı kümeleme analizinin homojen olmayan büyük veri setlerine uygulanabilirliği kanısına varılmıştır.