Dergiler / Eğitimde ve Psikolojide Ölçme ve Değerlendirme Dergisi / 2019 / Cilt: 10 - Sayı: 2
The Effect of Item Weighting on Reliability and Validity
- Sayfa
- 149–164
- DOI
- —
Özet
GirişPsikolojik alanda kullanılan testlerden elde edilen puanların geçerliği, psikolojik ölçme alanının en önemli konuları arasında yer almaktadır. Geçerlik, uygulanan testlerden elde edilen puanların bir özelliği olarak düşünülmekte ve şemsiye bir kavram olarak yapı geçerliği altında toplanabilmektedir. Yapı geçerliğine yönelik kanıt toplama sürecinde genellikle açımlayıcı ve doğrulayıcı faktör analizinden yararlanılmaktadır. Açımlayıcı faktör analizi (AFA) kovaryans yapıları üzerine kurulmuş olup gözlenen değişkenler arasındaki kovaryans matrisinden daha az sayıda gizil değişkenler (faktörler) elde etmeye yarayan bir tekniktir. AFA’da amaç, değişkenlerin oluşturduğu kümenin faktör yapısını ortaya çıkarmaktır. DFA’da ise teorik olarak ortaya konulan kuramsal yapının test edilmekte ve analiz öncesinde ölçülen değişkenin yapısal özellikeri bilinmektedir. Bu nedenle DFA’da amaç ölçme aracından elde edilen ölçümlere dayanarak öngörülen faktör yapısının doğrulanmaya çalışılmasıdır. Yapı geçerliğine yönelik kanıt toplama sürecinde her iki analizin de önemi yüksektir. Nunnally (1978), faktör analizi psikolojik yapıların ölçümünün kalbinde yer almaktadır diyerek faktör analizinin önemi vurgulamaktadır. Testten elde edilen puanların geçerliğini artırmak amacıyla farklı önlemler alınabilir. Buna örnek olarak ölçme aracının geliştirilme aşamasında ölçek geliştirme prosedürünü takip etmek, kuramsal alt yapıyı iyi bir şekilde bilmek ve ölçme aracına yansıtabilmek, testlerin uygulanma aşamasında bazı önlemlerin alınması gösterilebilir. Ancak test uygulandıktan sonra elde edilen puanlar üzerinde bazı ağırlıklandırma işlemleri ile de testten elde edilen puanların geçerliğinin artırılabileceği düşünülmüş ve madde ağırlıklıklandırmasına yönelik araştırmalar yürütülmüştür.Madde ağırlıklandırmaya yönelik araştırmalar incelendiğinde çoğunlukla 1900’lü yılların ilk yarısında yer aldığı görülmektedir. Madde ağırlıklandırmayla ilgili olarak önerilen yöntemler arasında çoklu regresyon yoluyla değer atama, kısmı regresyon katsayılarını atama Guilford (1954), madde ayırıcılık indeksleri ile ağırlıklandırma Birnbaum (1968), faktör analizini kullanma (Burt, 1950) gibi yöntemlerin kullanılmasının yanında test varyansını ya da madde varyansını kullanarak madde ağırlıklandırma (Dick, 1965), maddelerin bağlantılı olduğu içerik dikkate alınarak daha önemli konularla ilişkili olan maddeleri ağırlıklandırma (Ghiselli, 1964) tek tek maddeler yerine madde kümelerinin ağırlıklandırma şeklinde yöntemler öneren yazarlarda bulunmaktadır (Gulliksen, 1950). Günümüze daha yakın bir çalışmada ise Rotou, Headrick ve Elmore (2002) çok boyutlu madde tepki kuramı parametreleri kullanarak maddeleri ağırlıklandırmayı ve bireylerin puanlarını hesaplamak için klasik test kuramındaki toplam puan hesaplamasını kullanmaya dayanan bir hibrit ağırlıklandırma yöntemi önermiştir. Türkiye’de ağırlıklandırmaya yönelik araştırmalar yürütülmüş ancak genellikle çoktan seçmeli maddeler için seçenek ağırlıklandırma üzerinde durulmuş (Akkuş & Baykul, 2001; Erdem, Ertuna, & Doğan, 2016; Gözen-Çıtak, 2010; Özdemir, 2004) madde ağırlıklandırma üzerinde yürütülen araştırmaların sınırlı olduğu görülmüştür (Yurdugül, 2010). Yurdugül (2010) tarafından yürütülen araştırmada bireylerin toplam puanları üzerinden değerlendirme yapılmıştır. Mevcut araştırmada ise yapı geçerliğine yönelik araştırmada bulunulmuştur. Yöntemler genel olarak değerlendirildiğinde, Guilford (1954) ve Phillips (1943) madde ağırlıklandırma için harcanan emeğe değmeyeceğini belirtmiştir. Ancak madde ağırlıklandırmayla testten elde edilen sonuçların geçerliği ve güvenirliğinin artırılmasının yanında bireyler arasındaki farkı da maksimize etmesi gerektiğinden (Horst, 1936) bireyleri daha iyi ayırmayı sağlayacaktır. Günümüzde bilgisayar teknolojisinin oldukça gelişmiş olması madde ağırlıklandırma işlemine harcanacak emeği de azaltacağından geçerlik ve güvenirliğe aşırı katkı yapmasa bile kısmi katkıları sebebiyle kullanılması önerilebilir. Madde ağırlıklandırmanın sonuçları genel olarak incelendiğinde, kısa testler için maddelerin farklı ağırlıklandırmanın daha verimli olduğu, madde sayısının 10 ila 20 arasında olduğunda madde ağırlıklandırmanın çok az etkili olduğu (Ghiselli, 1964), uzun testler içinse en iyi ağırlıklandırmanın tüm maddeler için 1 olarak seçilmesi olduğu belirtilmektedir. Maddeler arası korelasyonların ortalaması düşük olduğunda madde ağırlıklandırmanın daha iyi sonuçlar verdiği (Guilford, 1954) ve testteki bileşen sayısı azaldıkça maddeleri farklı puanlamanın eşit ağırlıklandırma yoluyla elde edilen toplam puana (Örneğin, doğru cevap için 1, yanlış cevap için 0 puan vermek ve doğru cevap verilen maddeleri toplamak gibi.) göre bireyleri sıralama üzerinde daha etkili olduğu ifade edilmiştir (Ghiselli, 1964). Madde ağırlıklandırmanın testten elde edilen sonuçların geçerliğini ve güvenirliğini artırıcı etki yapması ve bu nedenle de açıkça önem arz etmesine rağmen çok az sayıda çalışmada kullanılması Burt (1950) tarafından da şaşırtıcı olarak ifade edilmiştir. Günümüzde madde ağırlıklandırmanın etkilerine yönelik olarak yürütülen araştırmaların sınırlı olması nedeniyle bu araştırmada araştırmacılar tarafından geliştirilen madde ağırlıklandırma yöntemi farklı koşullar altında incelenmiştir. Araştırmada “Madde ağırlıklandırmanın testin geçerlik ve güvenirliğine etkisi nasıldır?” sorusuna yanıt aramak amacıyla i) önerilen madde ağırlıklandırma yöntemiyle elde edilen dönüştürülmüş madde puanları matrisi üzerinden yürütülen AFA sonucunda açıklanan varyans oranı nasıl değişmektedir?, ii) önerilen madde ağırlıklandırma yöntemiyle elde edilen dönüştürülmüş madde puanları matrisi üzerinden yürütülen DFA sonucunda CFI, RMSEA ve ki-kare değerleri nasıl değişmektedir?, iii) önerilen madde ağırlıklandırma yöntemiyle elde edilen dönüştürülmüş madde puanları matrisi üzerinden yürütülen güvenirlik analizi sonucunda Cronbach Alfa güvenirlik katsayısı değerleri nasıl değişmektedir? Sorularına yanıt
Abstract
The purpose of this study is to examine the effect of the item weighting method developed by researchers on the construct validity of the test. For this purpose, a Monte Carlo simulation study was carried out. Test length, average factor loadings, and sample size were considered as simulation conditions. Item weighting method was defined as follows: If average score of the individuals (calculated as individual's test score/the number of items) plus item difficulty index is 1 and over then item reliability index added to individual’s item score (1 or 0); if not, then the item score of the individual (1 if 1, 0 if 0) is preserved. As a result of the research, it was observed that the weighting method contributes to the construct validity. According to the results of confirmatory factor analysis, the comparative fit index (CFI) and the root mean square error of approximation (RMSEA) values were improved. According to the research findings, the weighting method used in this research can be recommended.