Regresyon analizi, bir yada birden daha fazla bağımsız değişkenin, bağımlı bir değişkenle arasındaki ilişkiyi matematiksel bir denklem olarak orataya koymak için kullanılır. Burada;
Y : Bağımlı değişken
X: Bağımsız değişken
B: Katsayılar
E: Artıklar
olmak üzere Y=B0+B1+B2X2+…+BkXk+ei şeklinde bir denklem elde edilir. Böylece "şu "X" verisi için "Y" değeri bu olacaktır." şeklinde tahminler yapılabilir. ( Örnekte incelenecek veri setini buradan indirebilirsiniz... )
Burada "y"(Vücut ağırlığı)" değişkeni bağımlı veri, "x"(Vucudun farklı bölümlerinin ölçüleri) değişkenleri ise bağımsız verilerdir.
SPSS' de " Analyze > Regression > Linear "
Bu seçimler yapıldıktan sonra sonuçlar aşağıdaki gibi olacaktır.
Bu tablodaki "Adjusted R Square" değeri oluşturulan denklemin tahmin gücünü göstermektedir. Bu modelin tahmin gücü %99.9' dur.
Bu tabloda "Sig." değer 0.000<0.05 olduğu için oluşturulan modelin anlamlı bir model olduğu yorumu yapılabilir.
Bu tablodan modelin matematiksel hali oluşturulabilir ve katsayıların bağımlı değişken üzerinde anlamlı bir etkiye sahip olup olmadıkları yorumu yapılabilir. Burada "Midarm Circumference" değişkeninin "Sig." değeri 0.170>0.05 olduğu için bu değişkenin bağımlı değişken üzerinde anlamlı bir etkisi yoktur. Böyle bir durumda "Stepwise Regression" yöntemi kullanılır.
Data Set etiketine sahip kayıtlar gösteriliyor. Tüm kayıtları göster
Data Set etiketine sahip kayıtlar gösteriliyor. Tüm kayıtları göster
17 Kasım 2012 Cumartesi
15 Kasım 2012 Perşembe
SPSS:Correlation
Korelasyon katsayısı, iki değişkenin arasındaki lineer ilişkinin yönünü ve miktarını ifade eden bir niceliktir. -1 ile +1 arasında değer alır. "r" korelasyon katsayısı olmak üzere;
Bivariate: İki değişken arasındaki korelasyon katsayısını bulmak için kullanılır.
Partial: İncelenen iki değişkenle ilişkisi olduğu düşünülen bir yada birden fazla değişkenin göz önünde bulundurularak iligili iki değişkenin arasındaki korelasyon katsayısını hesaplamak için kullanılır.
(Örnekte incelenecek veri setini buradan indirebilirsiniz.)
y=Body Fat x1=Triceps skinfold thickness x2=Thigh circumference x3=Midarm circumference
Bu veris setinde "y" değişkeni bağımlı değişken ve x1, x2, x3 değişkenleri ise bağımsız değişkenlerdir. Bunlar kişilere ait vucut ağırlıkları(y) ve bu kişilere ait farklı vucut ölçüleridir(x1,x2,x3). İlk olarak bağımsız değişkenler arasındaki korelasyon katsayılarını inceleyelim.
SPSS' de " Analyze > Correlation > Bivariate "
Bu diyalog kutusunda hangi değişkenlerin aralarındaki korelasyon katsayıları hesaplanmak isteniyorsa o değişkenler "Variables" bölümüne atılır. "Options" seçeneğinden ise isteğe bağlı olarak bazı tanımlayıcı istatistikler hesaplatılabilir. "Correlation Coefficients" bölümü ile ilgili; eğer araştırılmak istenen değişkenler normal dağılım gösteriyorsa "Pearson" seçeneği, normal dağılım göstermiyorsa "Spearman" seçeneği seçilir. (Normallik testi ile ilgili ayrıntılı bilgiyi buradan bulabilirsiniz. )
Bu seçimler yapıldıktan sonra sonuçlar aşağıdakilere benzer şekilde olacaktır.
Tabloda görüldüğü gibi "Triceps skinfold thickness" ve "Midarm circumference" değişkenlerinin arsında pozitif yönlü, orta seviye (neredeyse güçlü) bir korelasyon(r = 0.878) vardır. Diğer ikililer arasındaki korelasyonların zayıf olduğu görülür.
Şimdi "Body Fat" değişkenini göz önünde bulundurarak aynı değişkenler arasındaki korelasyonu(kısmi korelasyon) hesaplayalım.
SPSS' de " Analyze > Correlation > Partial "
Bu seçimler yapıldıktan sonra sonuçlar aşağıdaki gibi olacaktır. (Tabloyu büyütmek için üzerine tıklayınız.)
"Body fat" değişkeni göz önünde bulundurulduğunda "Triceps skinfold thickness" ve "Thigh circumference"değişkenleri arasında negatif yönlü güçlü bir korelasyonun olduğu görülür( r = -0.994). Halbuki ilk tabloda bu iki değişken arasındaki korelasyon zayıf bir korelasyodu.
Bivariate: İki değişken arasındaki korelasyon katsayısını bulmak için kullanılır.
Partial: İncelenen iki değişkenle ilişkisi olduğu düşünülen bir yada birden fazla değişkenin göz önünde bulundurularak iligili iki değişkenin arasındaki korelasyon katsayısını hesaplamak için kullanılır.
(Örnekte incelenecek veri setini buradan indirebilirsiniz.)
y=Body Fat x1=Triceps skinfold thickness x2=Thigh circumference x3=Midarm circumference
Bu veris setinde "y" değişkeni bağımlı değişken ve x1, x2, x3 değişkenleri ise bağımsız değişkenlerdir. Bunlar kişilere ait vucut ağırlıkları(y) ve bu kişilere ait farklı vucut ölçüleridir(x1,x2,x3). İlk olarak bağımsız değişkenler arasındaki korelasyon katsayılarını inceleyelim.
SPSS' de " Analyze > Correlation > Bivariate "
Bu diyalog kutusunda hangi değişkenlerin aralarındaki korelasyon katsayıları hesaplanmak isteniyorsa o değişkenler "Variables" bölümüne atılır. "Options" seçeneğinden ise isteğe bağlı olarak bazı tanımlayıcı istatistikler hesaplatılabilir. "Correlation Coefficients" bölümü ile ilgili; eğer araştırılmak istenen değişkenler normal dağılım gösteriyorsa "Pearson" seçeneği, normal dağılım göstermiyorsa "Spearman" seçeneği seçilir. (Normallik testi ile ilgili ayrıntılı bilgiyi buradan bulabilirsiniz. )
Bu seçimler yapıldıktan sonra sonuçlar aşağıdakilere benzer şekilde olacaktır.
Tabloda görüldüğü gibi "Triceps skinfold thickness" ve "Midarm circumference" değişkenlerinin arsında pozitif yönlü, orta seviye (neredeyse güçlü) bir korelasyon(r = 0.878) vardır. Diğer ikililer arasındaki korelasyonların zayıf olduğu görülür.
Şimdi "Body Fat" değişkenini göz önünde bulundurarak aynı değişkenler arasındaki korelasyonu(kısmi korelasyon) hesaplayalım.
SPSS' de " Analyze > Correlation > Partial "
Bu seçimler yapıldıktan sonra sonuçlar aşağıdaki gibi olacaktır. (Tabloyu büyütmek için üzerine tıklayınız.)
"Body fat" değişkeni göz önünde bulundurulduğunda "Triceps skinfold thickness" ve "Thigh circumference"değişkenleri arasında negatif yönlü güçlü bir korelasyonun olduğu görülür( r = -0.994). Halbuki ilk tabloda bu iki değişken arasındaki korelasyon zayıf bir korelasyodu.
Etiketler:
Bivariate,
Correlation,
Data Analyze,
Data Set,
Kısmi Korelasyon,
Korelasyon,
Partial,
Partial Correlation,
Pearson,
Spearman,
SPSS,
Veri Analizi,
Veri Seti,
Volkan İset
13 Kasım 2012 Salı
SPSS:MANOVA
MANOVA, birden fazla bağımlı değişkenin bulunduğu deneylerde varyans analizi yapmak için kullanılan bir tekniktir. Univariate ANOVA' dan tek farkı, birden fazla bağımlı değişkenin olmasıdır. Ayrıca "Multivariate", yine birden fazla bağımlı değişkenin bulunduğu Çoklu Regresyon Analizinde de kullanılır. Gerekli varsayımlar yine normal dağılım ve homojen varyans varsayımlarıdır. (Hipotezlerin kurulması ve ortalamaların karşılaştırılmasıyla ilgili ayrıntılı bilgiyi Univariate ANOVA bölümünden bulabilirsiniz.)
Bu veri seti bir plastik fabrikasının ürettiği ürünlerle ilgilidir. Burada "Resistance(Dayanıklılık)", "Gloss(Parlaklık)" ve "Opacity(Saydamlık)" değişkenleri bağımlı değişkenlerdir. Faktörler ise "Extrusion_rate" ve "Additive" sütunlarıdır. Burada her faktörün "0" ve "1" olmak üzere iki düzeyi vardır. Dolayısıyla "Post Hoc" testleri uygulanamaz.(Post Hoc testleri için en az üç düzey gerekir.)
SPSS' de " Analyze > General Linear Model > Multivariate "
Burada, eğer fakör düzeyleri rastgele eşleştirilmiş olsaydı ilgili faktör yada faktörler "Random Factor" bölümüne atılırdı.Eğer faktörlerin değişkenleri kantitativ(nicel, sayısal) olsaydı bu sefer ilgili faktör yada faktörler "Covariate" bölümüne atılırdı.
"Model" bölümünde, hangi faktörlerin yada bu faktörlerin etkileşimlerinin, bağımlı değişken üzerinde etkisi olup olmadığı araştırılıyorsa onlar seçilir. "Full factorial" bölümü işaretli olduğu zaman, SPSS tüm faktörleri ve bu faktörlerin olası bütün etkileşimlerini modele koyar. "Custom" bölümünden ise isteğe göre bir model oluşturulabilir. "Sum of squares" bölümünde, eğer kayıp gözlemler varsa "Type IV" , eğer kayıp gözlem yoksa "Type III" seçilir.
"Options" bölümünde, istenilen faktör yada faktör etkileşimlerinin marjinal ortalamaları hesaplatılabilir ve testin güvenilirliği belirlenir. Ayrıca gerekli varsayımlardan birisi olan varyansların homojenliği testi için "Homogeneity tests" bölümü seçilir. Bu seçimler yapıldıktan sonra sonuçlar aşağıdakilere benzer şekilde olacaktır.
Homojenlik testinde bütün bağımlı değişkenlerin "Sig." değerleri 0.05 den büyük olduğu için "%95 güvenle tüm bağımlı değişkenler için varyanslar homojendir." yorumu yapılabilir.
MANOVA tablosu(Multivariate Tests) tablosu incelenciğinde birden fazla test olduğu görülür. Bu testlerden genellikle "Pillai' s Trace" ve "Wilks' Lambda" testleri dikkate alınır. Faktörlerin "Sig." değerleri inceleniğinde, "Extrusion_rate" ve "Additive" faktörlerinin "Sig." değerlerinin 0.05 den küçük oldudğu görülür. Yani " %95 güvenle, "Extrusion_rate" ve "Additive" faktörlerinin bağımlı değişkenler üzerinde istatistiksel olarak anlamlı bir etkisi vardır." yorumu yapılabilir. "Extrusion_rate*Additive" etkileşiminin ise bağımlı değişkenler üzerinde bir etkisi yoktur.("Sig."=0.302>0.05)
Ayrıca SPSS bütün bağımlı değişkenler için ayrı ayrı Univariate ANOVA testini de yapar. Böylece bütün faktör ve faktör etkileşimlerinin, bağımlı değişkenler üzerindeki marjinal etkileri incelenebilir.
Bu veri seti bir plastik fabrikasının ürettiği ürünlerle ilgilidir. Burada "Resistance(Dayanıklılık)", "Gloss(Parlaklık)" ve "Opacity(Saydamlık)" değişkenleri bağımlı değişkenlerdir. Faktörler ise "Extrusion_rate" ve "Additive" sütunlarıdır. Burada her faktörün "0" ve "1" olmak üzere iki düzeyi vardır. Dolayısıyla "Post Hoc" testleri uygulanamaz.(Post Hoc testleri için en az üç düzey gerekir.)
SPSS' de " Analyze > General Linear Model > Multivariate "
Burada, eğer fakör düzeyleri rastgele eşleştirilmiş olsaydı ilgili faktör yada faktörler "Random Factor" bölümüne atılırdı.Eğer faktörlerin değişkenleri kantitativ(nicel, sayısal) olsaydı bu sefer ilgili faktör yada faktörler "Covariate" bölümüne atılırdı.
"Model" bölümünde, hangi faktörlerin yada bu faktörlerin etkileşimlerinin, bağımlı değişken üzerinde etkisi olup olmadığı araştırılıyorsa onlar seçilir. "Full factorial" bölümü işaretli olduğu zaman, SPSS tüm faktörleri ve bu faktörlerin olası bütün etkileşimlerini modele koyar. "Custom" bölümünden ise isteğe göre bir model oluşturulabilir. "Sum of squares" bölümünde, eğer kayıp gözlemler varsa "Type IV" , eğer kayıp gözlem yoksa "Type III" seçilir.
"Options" bölümünde, istenilen faktör yada faktör etkileşimlerinin marjinal ortalamaları hesaplatılabilir ve testin güvenilirliği belirlenir. Ayrıca gerekli varsayımlardan birisi olan varyansların homojenliği testi için "Homogeneity tests" bölümü seçilir. Bu seçimler yapıldıktan sonra sonuçlar aşağıdakilere benzer şekilde olacaktır.
Homojenlik testinde bütün bağımlı değişkenlerin "Sig." değerleri 0.05 den büyük olduğu için "%95 güvenle tüm bağımlı değişkenler için varyanslar homojendir." yorumu yapılabilir.
MANOVA tablosu(Multivariate Tests) tablosu incelenciğinde birden fazla test olduğu görülür. Bu testlerden genellikle "Pillai' s Trace" ve "Wilks' Lambda" testleri dikkate alınır. Faktörlerin "Sig." değerleri inceleniğinde, "Extrusion_rate" ve "Additive" faktörlerinin "Sig." değerlerinin 0.05 den küçük oldudğu görülür. Yani " %95 güvenle, "Extrusion_rate" ve "Additive" faktörlerinin bağımlı değişkenler üzerinde istatistiksel olarak anlamlı bir etkisi vardır." yorumu yapılabilir. "Extrusion_rate*Additive" etkileşiminin ise bağımlı değişkenler üzerinde bir etkisi yoktur.("Sig."=0.302>0.05)
Ayrıca SPSS bütün bağımlı değişkenler için ayrı ayrı Univariate ANOVA testini de yapar. Böylece bütün faktör ve faktör etkileşimlerinin, bağımlı değişkenler üzerindeki marjinal etkileri incelenebilir.
12 Kasım 2012 Pazartesi
SPSS:Univariate ANOVA
Univariate ANOVA, iki yada ikiden daha fazla faktöre ait değişkenlerin ortalamalarını karşılaştırmak için kullanıllır. One-Way ANOVA' dan farkı iki yada ikiden daha fazla faktörün olmasıdır. ANOVA testiyle hangi faktörün bağımlı değişken üzerinde anlamlı bir etkisi olup olmadığı tespit edilir. Post Hoc testleriyle ise eğer faktör düzeyleri arasında bir farklılık var ise bu faklılığın hangi düzeyler arasında olduğu bulunur. Varsamyımlar One-Way ANOVA ile aynıdır. Nomallik ve varyansların homojenliği. (Örnekte incelencek veri setini buradan indirebilirsiniz.)
Burada fakörler "Shelf" ve "Store" sütunları, bağımlı değişken ise "Sales" sütunudur. Bu veri seti, bir süpermarketin iki farklı şubesindeki(Store), üç farklı raftaki(Shelf) ürünlerin satış miktarını(Sales) gösteriyor. Teste başlamadan önce normallik testi yapılmalıdır. Burada veriler normal dağılımlıdır. Ortalamaları karşılaştırmak için öncelikle hipotezler kurulmalıdır.
H0: %95 güvenle, faktör düzeylerinin ortalamaları arasında istatistiksel olarak anlamlı bir farklılk yoktur.
H1: %95 güvenle, faktör düzeylerinin ortalamaları arasında istatistiksel olarak anlamlı bir farklılk vardır
SPSS' de " Analyze > General Linear Models > Univariate " (Resimleri büyütmek için üzerine tıklayın...)
Burada, eğer fakör düzeyleri rastgele eşleştirilmiş olsaydı ilgili faktör yada faktörler "Random Factor" bölümüne atılırdı.Eğer faktörlerin değişkenleri kantitativ(nicel, sayısal) olsaydı bu sefer ilgili faktör yada faktörler "Covariate" bölümüne atılırdı.
"Model" bölümünde, hangi faktörlerin yada bu faktörlerin etkileşimlerinin, bağımlı değişken üzerinde etkisi olup olmadığı araştırılıyorsa onlar seçilir. "Full factorial" bölümü işaretli olduğu zaman, SPSS tüm faktörleri ve bu faktörlerin olası bütün etkileşimlerini modele koyar. "Custom" bölümünden ise isteğe göre bir model oluşturulabilir.
"Post Hoc" bölümünde, faktör düzeyleri arasındaki olası farklılıklara karşın, bu farklılıkların hangi düzeyler arasında olduğunu tespit etmek için ilgili testler seçilir. Varyansların homojen olması durumunda genellikle
"Tukey" testi tercih edilir. Varyansların homojen olmaması durumunda ise genellikle " Tamhane' s T2" testi tercih edilir.
"Sig" değeri 0.315 > 0.05 olduğu için faktörlerin varyansları homojendir.
Bu tabloda "Store" ve "Store*Shelf" faktörlerinin "Sig" değerleri 0.550 > 0.05 ve 0.467 > 0.05 olduğu için bu faktörler için H0 hipotezleri kabul edilir. Yani " %95 güvenle, bu faktör düzeylerinin ortalamaları arasında, istatistiksel olarak anlamlı bir farklılık yoktur." denilebilir. Dolayısıyla bu faktörlerin satışlar üzerinde anlamlı bir etkisi yoktur. Ancak "Shelf" fakörünün "Sig" değeri 0.001 < 0.05 olduğu için H0 hipotezi reddedilir. Yani "%95 güvenle,"Shelf" faktörünün düzeylerinin ortalamaları arasında, istatistiksel olarak anlamlı bir farklılık vardır." denilebilir. Bu farklılıkların hangi düzeyler arasında olduğunu tespit etmek için "Tukey" testinin sonuçları incelenmelidir.
Bu tabloda faktör düzeyleri ve bu faktör düzeylerinin ortalamaları arasındaki farklar sayısal olarak verilmiştir. Tablodaki bu sayısal farklılıkların yanındaki yıldız(*) işereti, bu farklılıkların anlamlı bir farklılık olduğunu göstermektedir. Dolayısıla tablo incelendiğinde 3. faktör düzyeinin ortalamasının diğer iki düzeyin ortalamasından farklı olduğu görülür.
Son olarak "Shelf" faktörünün ortalama tablosu incelendiğinde, 3.düzeyin(3. raf çeşidinin) ortalamasının diğerlerinden daha büyük olduğu görülür. Yani "3. raftaki satışlar diğerlerinden daha fazladır." yorumu yapılabilir.
Etiketler:
ANOVA,
Çok Faktörlü ANOVA,
Data Analyze,
Data Set,
Deney Tasarımı,
Genel Lineer Modeller,
General Linear Models,
SPSS,
Univarite,
Veri Analizi,
Veri Seti,
Volkan İset
Kaydol:
Kayıtlar (Atom)
































