14  Varyans ve İki Kitle için Aralık Tahmini

Ortalama İçin Aralık Tahmini bölümünde bir güven aralığının nasıl kurulduğunu gördük. Yöntem hep aynıdır: içinde yalnız bilinmeyen parametreyi taşıyan ve dağılımı tümüyle bilinen bir büyüklük bulunur, bu büyüklük iki kantilin arasına sıkıştırılır, sonra eşitsizlikler parametre için çözülür. Bu bölümde aynı yöntemi üç yeni soruya uygulayacağız: bir kitlenin yayılımı ne kadardır (\(\sigma^2\)), iki kitleden hangisi daha değişkendir (\(\sigma_1^2/\sigma_2^2\)) ve iki kitlenin ortalamaları ne kadar farklıdır (\(\mu_1 - \mu_2\)). Kullanacağımız ki-kare, \(t\) ve \(F\) dağılımları Örneklem Dağılımları bölümünde tanıtıldı; tablo değerleri Tablolar sayfasından okunur.

14.1 Kitle Varyansı İçin Güven Aralığı

Bir dolum makinesinin şişelere koyduğu ortalama miktar doğru ayarlanmış olabilir; ama miktarlar şişeden şişeye çok dalgalanıyorsa üretim yine kusurludur. Bu yüzden kitle varyansını tahmin etmek, ortalamayı tahmin etmek kadar önemlidir.

\(\sigma^2\)’nin doğal tahmin edicisi örneklem varyansıdır:

\[ S^2 = \frac{1}{n-1}\sum_{i=1}^{n}\left(X_i - \bar X\right)^2 . \]

\(S^2\), \(\sigma^2\)’nin yansız tahmin edicisidir. Aralığı bu yüzden \(S^2\) üzerine kuracağız. Anahtar sonuç, normal bir kitleden alınan \(n\) birimlik rastgele örneklem için

\[ \frac{(n-1)S^2}{\sigma^2} \sim \chi^2_{n-1} \]

olmasıdır (örneklem varyansının dağılımı). Bu büyüklük bilinmeyen parametrelerden yalnız \(\sigma^2\)’yi içerir ve dağılımı ne \(\mu\)’ye ne de \(\sigma^2\)’ye bağlıdır; aradığımız büyüklük tam olarak budur.

Kitap boyunca olduğu gibi \(\chi^2_{\nu,\,p}\), \(\nu\) serbestlik dereceli ki-kare dağılımında solunda \(p\) alan kalan noktadır. Ki-kare dağılımı yalnız pozitif değerler alır ve simetrik değildir. Bu yüzden normal ve \(t\) dağılımlarındaki gibi alt kantil üst kantilin eksi işaretlisi değildir; \(\chi^2_{\nu,\,\alpha/2}\) ile \(\chi^2_{\nu,\,1-\alpha/2}\) \(\chi^2\) tablosundan ayrı ayrı okunur. Örneğin \(\nu = 9\) için \(\chi^2_{9,\,0{,}025} = 2{,}70\) ve \(\chi^2_{9,\,0{,}975} = 19{,}02\)’dir.

Teorem 14.1 (Varyans İçin Güven Aralığı) \(X_1, \ldots, X_n\) (\(n \ge 2\)), ortalaması ve varyansı bilinmeyen \(N(\mu, \sigma^2)\) kitlesinden alınmış bir rastgele örneklem ve \(S^2\) örneklem varyansı olsun. \(0 < \alpha < 1\) için \(\sigma^2\)’nin %\(100(1-\alpha)\) düzeyli güven aralığı

\[ \left[\,\frac{(n-1)S^2}{\chi^2_{n-1,\,1-\alpha/2}}\,,\ \frac{(n-1)S^2}{\chi^2_{n-1,\,\alpha/2}}\,\right] \]

olur. Büyük kantilin alt sınıra, küçük kantilin üst sınıra gittiğine dikkat edin.

İspat

\(Q = \dfrac{(n-1)S^2}{\sigma^2}\) diyelim; \(Q \sim \chi^2_{n-1}\)’dir. Kantillerin tanımından \(Q\)’nun \(\chi^2_{n-1,\,\alpha/2}\)’nin solunda kalma olasılığı \(\alpha/2\), \(\chi^2_{n-1,\,1-\alpha/2}\)’nin solunda kalma olasılığı \(1 - \alpha/2\)’dir. Dağılım sürekli olduğundan uç noktaların olasılığı sıfırdır ve

\[ P\left(\chi^2_{n-1,\,\alpha/2} \le Q \le \chi^2_{n-1,\,1-\alpha/2}\right) = \left(1 - \frac{\alpha}{2}\right) - \frac{\alpha}{2} = 1 - \alpha . \]

Şimdi parantez içindeki olayı \(\sigma^2\) için çözelim. \(n \ge 2\) iken \(S^2 > 0\) olasılığı \(1\)’dir ve iki kantil de pozitiftir; yani eşitsizlikteki bütün terimler pozitiftir. Pozitif sayıların tersini almak eşitsizliklerin yönünü değiştirir:

\[ \frac{1}{\chi^2_{n-1,\,1-\alpha/2}} \le \frac{\sigma^2}{(n-1)S^2} \le \frac{1}{\chi^2_{n-1,\,\alpha/2}} . \]

Her tarafı pozitif \((n-1)S^2\) ile çarpınca

\[ \frac{(n-1)S^2}{\chi^2_{n-1,\,1-\alpha/2}} \le \sigma^2 \le \frac{(n-1)S^2}{\chi^2_{n-1,\,\alpha/2}} \]

bulunur. Bu olay baştaki olayla aynıdır, dolayısıyla olasılığı da \(1 - \alpha\)’dır.

\(\blacksquare\)

Sınırlar \(S^2\)’ye bağlı olduğu için rastgeledir. Örneklem gözlendikten sonra \(S^2\) yerine gözlenen \(s^2\) değeri konur ve sayısal bir aralık elde edilir; bu aralığın yorumu ortalama için kurulan aralıklarınki gibidir. Aralık \(s^2\)’nin iki yanına eşit uzanmaz: ki-kare eğrisi sağa çarpık olduğundan üst sınır \(s^2\)’den çok daha uzaktadır. Bir de uyarı: bu aralık kitlenin normal olmasına çok duyarlıdır. Ortalama için kurulan aralıklar büyük örneklemlerde merkezi limit teoremi sayesinde normallikten sapmaya dayanıklıdır; varyans aralığının böyle bir güvencesi yoktur.

Standart sapma varyansın karekökü olduğundan onun aralığı da kökler alınarak bulunur.

Sonuç 14.1 (Standart Sapma İçin Güven Aralığı) Varyans aralığının (Teorem 14.1) varsayımları altında \(\sigma\)’nın %\(100(1-\alpha)\) düzeyli güven aralığı

\[ \left[\,\sqrt{\frac{(n-1)S^2}{\chi^2_{n-1,\,1-\alpha/2}}}\,,\ \sqrt{\frac{(n-1)S^2}{\chi^2_{n-1,\,\alpha/2}}}\,\right] \]

olur.

İspat

Sınırlara kısaca \(A\) ve \(B\) diyelim (\(0 < A < B\)). \(\sigma > 0\)’dır ve karekök fonksiyonu \([0, \infty)\) üzerinde kesin artandır; bu yüzden

\[ A \le \sigma^2 \le B \iff \sqrt{A} \le \sigma \le \sqrt{B} . \]

İki olay aynı olduğundan olasılıkları da aynıdır ve varyans aralığına (Teorem 14.1) göre bu olasılık \(1 - \alpha\)’dır.

\(\blacksquare\)

Örnek 14.1 (Dolum Makinesinin Varyansı) Bir dolum makinesinden rastgele seçilen \(10\) şişedeki sıvı miktarları ölçülüyor ve örneklem varyansı \(s^2 = 4{,}8\) (mL²) bulunuyor. Miktarların normal dağıldığını varsayarak kitle varyansı \(\sigma^2\) için %95 güven aralığını bulunuz.

Çözüm

\(n = 10\) olduğundan serbestlik derecesi \(\nu = 9\)’dur. \(1 - \alpha = 0{,}95\) için her kuyruğa \(\alpha/2 = 0{,}025\) kalır. \(\chi^2\) tablosundan

\[ \chi^2_{9,\,0{,}025} = 2{,}70, \qquad \chi^2_{9,\,0{,}975} = 19{,}02 \]

okunur. Pay her iki sınırda aynıdır:

\[ (n-1)s^2 = 9 \cdot 4{,}8 = 43{,}2 . \]

Varyans aralığında (Teorem 14.1) alt sınır büyük kantille, üst sınır küçük kantille bölünerek bulunur:

\[ \frac{43{,}2}{19{,}02} \approx 2{,}271, \qquad \frac{43{,}2}{2{,}70} = 16{,}0 . \]

Buna göre %95 güven aralığı

\[ 2{,}271 \le \sigma^2 \le 16{,}0 \]

olur. Nokta tahmini \(s^2 = 4{,}8\) bu aralığın ortasında değil, alt ucuna yakındır; üst sınır \(s^2\)’nin üç katından fazladır. On gözlemle bir varyansı ancak bu kadar kaba tahmin edebiliriz.

0 2 4 6 8 10 12 14 16 18 σ² 2,27 16,0 s² = 4,8 orta nokta ≈ 9,14
σ² için %95 güven aralığı [2,27; 16,0] ve nokta tahmini s² = 4,8. Tahmin aralığın ortasında değil, alt uca yakındır: aralık s²'nin iki yanına eşit uzanmaz, sağa doğru çok daha uzundur.

\(\blacksquare\)

Örnek 14.2 (Dolum Makinesinin Standart Sapması) Aynı dolum makinesinden seçilen \(10\) şişede örneklem varyansı \(s^2 = 4{,}8\) bulunmuştu. Miktarların normal dağıldığını varsayarak kitle standart sapması \(\sigma\) için %95 güven aralığını bulunuz.

Çözüm

Önceki örnekte \(\sigma^2\) için %95 güven aralığı \(2{,}271 \le \sigma^2 \le 16{,}0\) bulundu. Standart sapma aralığına (Sonuç 14.1) göre sınırların karekökünü alırız:

\[ \sqrt{2{,}271} \approx 1{,}507, \qquad \sqrt{16{,}0} = 4{,}0 . \]

Buna göre \(1{,}507 \le \sigma \le 4{,}0\) (mL) olur. Karşılaştırma için nokta tahmini \(s = \sqrt{4{,}8} \approx 2{,}191\)’dir; bu değer de aralığın ortasında değildir.

\(\blacksquare\)

Örnek 14.3 (Ham Veriden Varyans Aralığı) Bir laboratuvarda aynı numune üzerinde yapılan \(8\) bağımsız ölçüm şunlardır:

\[ 12{,}4;\ \ 11{,}8;\ \ 12{,}9;\ \ 12{,}1;\ \ 13{,}0;\ \ 11{,}6;\ \ 12{,}5;\ \ 12{,}1 . \]

Ölçümlerin normal dağıldığını varsayarak ölçüm varyansı \(\sigma^2\) için %90 güven aralığını bulunuz.

Çözüm

Önce örneklem ortalamasını bulalım. Ölçümlerin toplamı \(98{,}4\) olduğundan

\[ \bar x = \frac{98{,}4}{8} = 12{,}3 . \]

Ortalamadan sapmalar sırasıyla

\[ 0{,}1;\ \ -0{,}5;\ \ 0{,}6;\ \ -0{,}2;\ \ 0{,}7;\ \ -0{,}7;\ \ 0{,}2;\ \ -0{,}2 \]

ve bunların kareleri

\[ 0{,}01;\ \ 0{,}25;\ \ 0{,}36;\ \ 0{,}04;\ \ 0{,}49;\ \ 0{,}49;\ \ 0{,}04;\ \ 0{,}04 \]

olur. Karelerin toplamı \(\sum (x_i - \bar x)^2 = 1{,}72\)’dir. Demek ki

\[ (n-1)s^2 = 1{,}72, \qquad s^2 = \frac{1{,}72}{7} \approx 0{,}2457 . \]

Aralığın sınırlarında yalnız \((n-1)s^2\) geçtiğinden \(s^2\)’yi ayrıca yuvarlamaya gerek yoktur. Serbestlik derecesi \(\nu = 7\)’dir. \(1 - \alpha = 0{,}90\) için her kuyruğa \(0{,}05\) kalır ve \(\chi^2\) tablosundan

\[ \chi^2_{7,\,0{,}05} = 2{,}17, \qquad \chi^2_{7,\,0{,}95} = 14{,}07 \]

okunur. Sınırlar

\[ \frac{1{,}72}{14{,}07} \approx 0{,}1222, \qquad \frac{1{,}72}{2{,}17} \approx 0{,}7926 \]

olduğundan %90 güven aralığı \(0{,}1222 \le \sigma^2 \le 0{,}7926\) olur. Karekökler alınırsa ölçümlerin standart sapması için de \(0{,}350 \le \sigma \le 0{,}890\) aralığı elde edilir.

0 4 8 12 16 20 x χ²7; 0,05 = 2,17 χ²7; 0,95 = 14,07 0,05 0,05 0,90 χ²7 yoğunluğu
Serbestlik derecesi 7 olan ki-kare yoğunluğu. 2,17'nin solunda ve 14,07'nin sağında 0,05'er alan kalır; aradaki alan 0,90'dır. Varyans aralığında büyük kantil 14,07 alt sınırın, küçük kantil 2,17 üst sınırın paydasına gider.

\(\blacksquare\)

14.2 İki Varyansın Oranı İçin Güven Aralığı

İki makineden, iki ölçüm yönteminden ya da iki üretim hattından hangisinin daha tutarlı çalıştığını anlamak için varyanslarını karşılaştırırız.

İki kitlenin bilinmeyen varyansları \(\sigma_1^2\) ve \(\sigma_2^2\) ise karşılaştırmayı fark yerine oran üzerinden yaparız: \(\sigma_1^2/\sigma_2^2\) oranı \(1\)’e yakınsa yayılımlar benzerdir, \(1\)’den çok büyükse birinci kitle daha değişkendir. Oranın doğal nokta tahmini \(s_1^2/s_2^2\)’dir. Oranı seçmemizin nedeni, örneklem varyanslarının oranının dağılımının bilinmesi ve bilinmeyen parametrelere bağlı olmamasıdır.

Bu kısım ve bölümün geri kalanı boyunca şu düzeni kullanacağız: \(X_{11}, \ldots, X_{1n_1}\), \(N(\mu_1, \sigma_1^2)\) kitlesinden; \(X_{21}, \ldots, X_{2n_2}\), \(N(\mu_2, \sigma_2^2)\) kitlesinden alınmış rastgele örneklemlerdir ve iki örneklem birbirinden bağımsızdır. \(\bar X_1, \bar X_2\) örneklem ortalamaları, \(S_1^2, S_2^2\) örneklem varyanslarıdır.

Teorem 14.2 (İki Örneklem Varyansının Oranı) Yukarıdaki düzende

\[ F = \frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2} = \frac{\displaystyle\sum_{i=1}^{n_1}\frac{(X_{1i} - \bar X_1)^2}{\sigma_1^2\,(n_1 - 1)}}{\displaystyle\sum_{j=1}^{n_2}\frac{(X_{2j} - \bar X_2)^2}{\sigma_2^2\,(n_2 - 1)}} \sim F_{n_1 - 1,\ n_2 - 1} \]

olur. Bu büyüklüğe payı \(\nu_1 = n_1 - 1\), paydası \(\nu_2 = n_2 - 1\) serbestlik dereceli \(F\) istatistiği denir.

İspat

İkinci eşitlik yalnızca \(S_1^2\) ve \(S_2^2\)’nin tanımının yerine yazılmasıdır. Dağılım için

\[ U = \frac{(n_1 - 1)S_1^2}{\sigma_1^2}, \qquad V = \frac{(n_2 - 1)S_2^2}{\sigma_2^2} \]

diyelim. Her örneklem normal bir kitleden geldiği için \(U \sim \chi^2_{n_1 - 1}\) ve \(V \sim \chi^2_{n_2 - 1}\)’dir (örneklem varyansının dağılımı). \(U\) yalnız birinci örnekleme, \(V\) yalnız ikinci örnekleme bağlıdır; örneklemler bağımsız olduğundan \(U\) ile \(V\) de bağımsızdır. \(F\) dağılımının tanımına göre serbestlik dereceleriyle bölünmüş iki bağımsız ki-kare değişkeninin oranı

\[ \frac{U/(n_1 - 1)}{V/(n_2 - 1)} \sim F_{n_1 - 1,\ n_2 - 1} \]

dağılımına sahiptir. \(U/(n_1 - 1) = S_1^2/\sigma_1^2\) ve \(V/(n_2 - 1) = S_2^2/\sigma_2^2\) olduğundan bu oran tam olarak \(F\)’dir.

\(\blacksquare\)

\(F\) dağılımının kantilleri de sol kuyruk alanıyla gösterilir: \(F_{\nu_1,\nu_2,\,p}\), \(F_{\nu_1,\nu_2}\) dağılımında solunda \(p\) alan kalan noktadır. \(F\) tablosu yalnız \(p = 0{,}95\), \(0{,}975\) ve \(0{,}99\) değerlerini verir; küçük \(p\)’ler için

\[ F_{\nu_1,\nu_2,\,\alpha} = \frac{1}{F_{\nu_2,\nu_1,\,1-\alpha}} \]

eşitliği kullanılır (\(F\) değişkeninin tersi); bu eşitlik, \(F \sim F_{\nu_1,\nu_2}\) ise \(1/F \sim F_{\nu_2,\nu_1}\) olmasından gelir. Serbestlik derecelerinin yer değiştirdiğine dikkat edin.

Teorem 14.3 (Varyans Oranı İçin Güven Aralığı) Yukarıdaki düzende \(\nu_1 = n_1 - 1\), \(\nu_2 = n_2 - 1\) olsun. \(\sigma_1^2/\sigma_2^2\) oranının %\(100(1-\alpha)\) düzeyli güven aralığı

\[ \left[\,\frac{S_1^2}{S_2^2}\cdot\frac{1}{F_{\nu_1,\nu_2,\,1-\alpha/2}}\,,\ \ \frac{S_1^2}{S_2^2}\cdot F_{\nu_2,\nu_1,\,1-\alpha/2}\,\right] \]

olur. Karekökler alınarak \(\sigma_1/\sigma_2\) için de aynı düzeyli bir aralık elde edilir.

0 1 2 3 4 5 x F8, 12; 0,025 ≈ 0,238 F8, 12; 0,975 = 3,51 0,025 0,025 0,95 F8, 12 yoğunluğu
Serbestlik dereceleri 8 ve 12 olan F yoğunluğu. Sağ kuyruğun sınırı olan 0,975 kantili 3,51 tablodan okunur. Sol kuyruğun sınırı olan 0,025 kantili tabloda yoktur; serbestlik dereceleri yer değiştirmiş F dağılımının 0,975 kantilinden 1/4,20 ≈ 0,238 olarak bulunur. Her kuyruğun alanı 0,025, aradaki alan 0,95'tir.
İspat

\(F\) istatistiğinin dağılımına (Teorem 14.2) göre \(F = \dfrac{S_1^2}{S_2^2}\cdot\dfrac{\sigma_2^2}{\sigma_1^2} \sim F_{\nu_1,\nu_2}\)’dir. İki kuyruğa \(\alpha/2\) bırakınca

\[ P\left(F_{\nu_1,\nu_2,\,\alpha/2} \le \frac{S_1^2}{S_2^2}\cdot\frac{\sigma_2^2}{\sigma_1^2} \le F_{\nu_1,\nu_2,\,1-\alpha/2}\right) = 1 - \alpha \]

olur. Terimlerin hepsi pozitiftir. Önce tersleri alalım; eşitsizliklerin yönü değişir:

\[ \frac{1}{F_{\nu_1,\nu_2,\,1-\alpha/2}} \le \frac{S_2^2}{S_1^2}\cdot\frac{\sigma_1^2}{\sigma_2^2} \le \frac{1}{F_{\nu_1,\nu_2,\,\alpha/2}} . \]

Sonra her tarafı pozitif \(S_1^2/S_2^2\) ile çarpalım:

\[ \frac{S_1^2}{S_2^2}\cdot\frac{1}{F_{\nu_1,\nu_2,\,1-\alpha/2}} \le \frac{\sigma_1^2}{\sigma_2^2} \le \frac{S_1^2}{S_2^2}\cdot\frac{1}{F_{\nu_1,\nu_2,\,\alpha/2}} . \]

Son olarak \(1/F_{\nu_1,\nu_2,\,\alpha/2} = F_{\nu_2,\nu_1,\,1-\alpha/2}\) yazılınca üst sınır istenen biçimi alır. Olay değişmediği için olasılık \(1 - \alpha\)’dır. \(\sigma_1/\sigma_2\) için, standart sapma aralığında (Sonuç 14.1) olduğu gibi, karekökün kesin artan olması kullanılır.

\(\blacksquare\)

Aralığın \(1\)’i içerip içermediği önemli bir bilgidir. \(1\)’i içeriyorsa veriler “varyanslar eşittir” varsayımıyla çelişmez; tümüyle \(1\)’in sağında (ya da solunda) kalıyorsa birinci kitlenin varyansı daha büyüktür (ya da daha küçüktür). Bu bilgiyi aşağıda iki ortalamanın farkı için doğru aralığı seçerken kullanacağız.

Örnek 14.4 (İki Dolum Makinesinin Varyansları) İki dolum makinesinin tutarlılığı karşılaştırılıyor. Birinci makineden \(9\), ikinci makineden \(13\) şişe rastgele seçiliyor; doldurulan miktarların örneklem varyansları \(s_1^2 = 3{,}6\) ve \(s_2^2 = 1{,}8\) bulunuyor. Miktarların iki makinede de normal dağıldığını ve örneklemlerin bağımsız olduğunu varsayarak \(\sigma_1^2/\sigma_2^2\) için %95 güven aralığını bulunuz.

Çözüm

Serbestlik dereceleri \(\nu_1 = 9 - 1 = 8\) ve \(\nu_2 = 13 - 1 = 12\)’dir. Nokta tahmini

\[ \frac{s_1^2}{s_2^2} = \frac{3{,}6}{1{,}8} = 2 . \]

\(1 - \alpha = 0{,}95\) için \(1 - \alpha/2 = 0{,}975\)’tir. \(F\) tablosunun \(p = 0{,}975\) kısmından

\[ F_{8,12,\,0{,}975} = 3{,}51, \qquad F_{12,8,\,0{,}975} = 4{,}20 \]

okunur (ilkinde sütun \(8\), satır \(12\); ikincisinde sütun \(12\), satır \(8\)). Varyans oranı aralığına (Teorem 14.3) göre

\[ \frac{2}{3{,}51} \approx 0{,}570, \qquad 2 \cdot 4{,}20 = 8{,}40 , \]

yani %95 güven aralığı \(0{,}570 \le \sigma_1^2/\sigma_2^2 \le 8{,}40\)’dır. Birinci makinenin örneklem varyansı ikincininkinin iki katı olsa da aralık \(1\)’i içerir: bu küçük örneklemlerle iki makinenin kitle varyanslarının farklı olduğu söylenemez.

\(\blacksquare\)

Örnek 14.5 (İki Ölçüm Yönteminin Standart Sapmaları) Aynı büyüklük iki farklı yöntemle ölçülüyor. Birinci yöntemle yapılan \(11\) ölçümün örneklem varyansı \(s_1^2 = 12{,}5\), ikinci yöntemle yapılan \(16\) ölçümünki \(s_2^2 = 2{,}5\)’tir. Ölçümlerin normal dağıldığını ve iki örneklemin bağımsız olduğunu varsayarak standart sapmaların oranı \(\sigma_1/\sigma_2\) için %90 güven aralığını bulunuz.

Çözüm

Serbestlik dereceleri \(\nu_1 = 10\) ve \(\nu_2 = 15\)’tir; nokta tahmini \(s_1^2/s_2^2 = 12{,}5/2{,}5 = 5\)’tir. \(1 - \alpha = 0{,}90\) için \(1 - \alpha/2 = 0{,}95\) olduğundan \(F\) tablosunun \(p = 0{,}95\) kısmına bakarız:

\[ F_{10,15,\,0{,}95} = 2{,}54, \qquad F_{15,10,\,0{,}95} = 2{,}85 . \]

Önce varyansların oranı için aralığı kuralım:

\[ \frac{5}{2{,}54} \approx 1{,}969, \qquad 5 \cdot 2{,}85 = 14{,}25 , \]

yani \(1{,}969 \le \sigma_1^2/\sigma_2^2 \le 14{,}25\). Karekökler alınınca

\[ \sqrt{1{,}969} \approx 1{,}403, \qquad \sqrt{14{,}25} \approx 3{,}775 \]

ve %90 güven aralığı \(1{,}403 \le \sigma_1/\sigma_2 \le 3{,}775\) olur. Aralık tümüyle \(1\)’in sağındadır: birinci yöntemin standart sapması ikincininkinden büyüktür, üstelik en az yaklaşık \(1{,}4\) katıdır.

0,2 0,5 1 2 5 10 20 oran oran = 1 0,570 8,40 iki makine %95 1,97 14,25 iki yöntem %90
Varyans oranı σ₁²/σ₂² için iki güven aralığı, logaritmik eksende (siyah noktalar s₁²/s₂² tahminleridir). Makinelerin aralığı 1'i içerir: varyansların eşit olması verilerle çelişmez. Yöntemlerin aralığı tümüyle 1'in sağındadır: birinci yöntemin varyansı daha büyüktür.

\(\blacksquare\)

14.3 İki Ortalamanın Farkı İçin Güven Aralığı

Deneysel çalışmalarda çoğu zaman iki kitlenin ortalamalarını karşılaştırırız: iki gübrenin verimini, iki öğretim yönteminin başarısını, iki makinenin ortalama dolumunu. Bilinmeyen parametre artık \(\mu_1 - \mu_2\) farkıdır.

Önceki kısımdaki düzeni koruyoruz: iki bağımsız rastgele örneklem, birincisi \(N(\mu_1, \sigma_1^2)\), ikincisi \(N(\mu_2, \sigma_2^2)\) kitlesinden. \(\bar X_1\) ve \(\bar X_2\) sırasıyla \(\mu_1\) ve \(\mu_2\)’nin yansız tahmin edicileri olduğundan

\[ E(\bar X_1 - \bar X_2) = \mu_1 - \mu_2 \]

olur ve \(\bar X_1 - \bar X_2\), \(\mu_1 - \mu_2\)’nin yansız nokta tahmin edicisidir. Aralığın biçimi ise varyanslar hakkında ne bildiğimize bağlıdır. Üç durum vardır:

  1. Kitle varyansları \(\sigma_1^2\) ve \(\sigma_2^2\) biliniyor.
  2. Kitle varyansları bilinmiyor ama eşit kabul ediliyor: \(\sigma_1^2 = \sigma_2^2\).
  3. Kitle varyansları bilinmiyor ve farklı kabul ediliyor: \(\sigma_1^2 \ne \sigma_2^2\).

Üç durumun hepsinde kullanacağımız temel sonuç, örneklem ortalamaları farkının dağılımıdır.

Önerme 14.1 (Örneklem Ortalamalarının Farkı) Yukarıdaki düzende

\[ \bar X_1 - \bar X_2 \sim N\left(\mu_1 - \mu_2,\ \frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}\right) \]

ve dolayısıyla

\[ Z = \frac{(\bar X_1 - \bar X_2) - (\mu_1 - \mu_2)}{\sqrt{\dfrac{\sigma_1^2}{n_1} + \dfrac{\sigma_2^2}{n_2}}} \sim N(0, 1) \]

olur.

İspat

Normal kitlede örneklem ortalamasının dağılımına göre \(\bar X_1 \sim N(\mu_1, \sigma_1^2/n_1)\) ve \(\bar X_2 \sim N(\mu_2, \sigma_2^2/n_2)\)’dir. \(\bar X_1\) yalnız birinci, \(\bar X_2\) yalnız ikinci örnekleme bağlıdır; örneklemler bağımsız olduğundan \(\bar X_1\) ile \(\bar X_2\) de bağımsızdır. Bağımsız normallerin doğrusal birleşimi \(a_1 = 1\), \(a_2 = -1\) katsayılarıyla uygulanırsa

\[ \bar X_1 - \bar X_2 \sim N\left(\mu_1 - \mu_2,\ 1^2\cdot\frac{\sigma_1^2}{n_1} + (-1)^2\cdot\frac{\sigma_2^2}{n_2}\right) \]

bulunur. Varyanslar toplanır, çünkü \(-1\) katsayısının karesi \(1\)’dir: fark almak belirsizliği azaltmaz. Normal bir değişkenden ortalamasını çıkarıp standart sapmasına bölmek standart normal bir değişken verdiğinden \(Z \sim N(0, 1)\)’dir.

\(\blacksquare\)

Varyanslar Biliniyorsa

Varyanslar biliniyorsa \(Z\)’nin içinde bilinmeyen tek şey \(\mu_1 - \mu_2\)’dir ve aralık doğrudan kurulur. \(z_p\), standart normal dağılımın solunda \(p\) alan kalan noktasıdır.

Teorem 14.4 (Varyanslar Bilinirken Ortalama Farkı) \(\sigma_1^2\) ve \(\sigma_2^2\) biliniyorsa \(\mu_1 - \mu_2\)’nin %\(100(1-\alpha)\) düzeyli güven aralığının sınırları

\[ (\bar X_1 - \bar X_2) \mp z_{1-\alpha/2}\sqrt{\frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}} \]

olur; eksi işareti alt sınırı, artı işareti üst sınırı verir.

İspat

Kısalık için \(\sigma_D = \sqrt{\sigma_1^2/n_1 + \sigma_2^2/n_2}\) diyelim. Standart normal dağılım \(0\) etrafında simetrik olduğundan \(z_{\alpha/2} = -z_{1-\alpha/2}\)’dir ve farkın dağılımına (Önerme 14.1) göre

\[ P\left(-z_{1-\alpha/2} \le Z \le z_{1-\alpha/2}\right) = 1 - \alpha \]

olur. Eşitsizliği pozitif \(\sigma_D\) ile çarpalım:

\[ -z_{1-\alpha/2}\,\sigma_D \le (\bar X_1 - \bar X_2) - (\mu_1 - \mu_2) \le z_{1-\alpha/2}\,\sigma_D . \]

Her taraftan \(\bar X_1 - \bar X_2\)’yi çıkarıp \(-1\) ile çarpalım (yönler değişir, sonra iki uç yer değiştirir):

\[ (\bar X_1 - \bar X_2) - z_{1-\alpha/2}\,\sigma_D \le \mu_1 - \mu_2 \le (\bar X_1 - \bar X_2) + z_{1-\alpha/2}\,\sigma_D . \]

Olay değişmediğinden olasılığı \(1 - \alpha\)’dır.

\(\blacksquare\)

Örnek 14.6 (İki Üretim Hattının Ortalamaları) İki üretim hattından çıkan paketlerin ağırlıkları normal dağılıyor ve uzun deneyimden standart sapmaların birinci hatta \(\sigma_1 = 5\) g, ikinci hatta \(\sigma_2 = 6\) g olduğu biliniyor. Birinci hattan \(25\) paketin ortalaması \(\bar x_1 = 80\) g, ikinci hattan \(36\) paketin ortalaması \(\bar x_2 = 75\) g bulunuyor. \(\mu_1 - \mu_2\) için %95 güven aralığını bulunuz.

Çözüm

Farkın standart sapması

\[ \sqrt{\frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}} = \sqrt{\frac{25}{25} + \frac{36}{36}} = \sqrt{2} \approx 1{,}4142 . \]

\(1 - \alpha = 0{,}95\) için \(z_{0{,}975}\) gerekir. Standart normal tablosunda \(0\) ile \(1{,}96\) arasındaki alan \(0{,}4750\)’dir; sağ kuyrukta \(0{,}025\) kalır ve \(z_{0{,}975} = 1{,}96\) olur. Hata payı

\[ 1{,}96 \cdot 1{,}4142 \approx 2{,}772 , \]

nokta tahmini \(\bar x_1 - \bar x_2 = 5\)’tir. Bilinen varyanslı aralığa (Teorem 14.4) göre

\[ 5 - 2{,}772 = 2{,}228, \qquad 5 + 2{,}772 = 7{,}772 , \]

yani %95 güven aralığı \(2{,}228 \le \mu_1 - \mu_2 \le 7{,}772\) (g) olur. Aralık \(0\)’ı içermez ve tümüyle pozitiftir: birinci hattın ortalama ağırlığı daha büyüktür.

\(\blacksquare\)

Varyanslar Bilinmiyor ama Eşitse

Uygulamada kitle varyansları çoğu zaman bilinmez. Önce iki kitlenin aynı varyansa sahip olduğunu, yani \(\sigma_1^2 = \sigma_2^2 = \sigma^2\) olduğunu kabul edelim. O zaman farkın dağılımındaki (Önerme 14.1) büyüklük

\[ Z = \frac{(\bar X_1 - \bar X_2) - (\mu_1 - \mu_2)}{\sigma\sqrt{\dfrac{1}{n_1} + \dfrac{1}{n_2}}} \]

biçimini alır ve içinde bilinmeyen \(\sigma\) vardır. \(S_1^2\) ve \(S_2^2\)’nin ikisi de aynı \(\sigma^2\)’yi tahmin ettiğinden, ikisini birleştirip tek ve daha iyi bir tahmin elde ederiz.

Tanım 14.1 (Ortak Varyans) İki örneklemin ortak (birleştirilmiş) varyansı

\[ S_p^2 = \frac{(n_1 - 1)S_1^2 + (n_2 - 1)S_2^2}{n_1 + n_2 - 2} \]

istatistiğidir; \(S_p = \sqrt{S_p^2}\) yazılır.

Yani \(S_p^2\), iki örneklem varyansının serbestlik dereceleriyle ağırlıklandırılmış ortalamasıdır: büyük örneklemin varyansı daha çok ağırlık alır, \(n_1 = n_2\) ise basit ortalama elde edilir. Pay, her gözlemin kendi örneklem ortalamasından sapmalarının karelerinin toplamıdır. \(E(S_1^2) = E(S_2^2) = \sigma^2\) olduğundan

\[ E(S_p^2) = \frac{(n_1 - 1)\sigma^2 + (n_2 - 1)\sigma^2}{n_1 + n_2 - 2} = \sigma^2 , \]

yani \(S_p^2\) de \(\sigma^2\)’nin yansız tahmin edicisidir.

Teorem 14.5 (Ortak Varyanslı t İstatistiği) Yukarıdaki düzende \(\sigma_1^2 = \sigma_2^2\) ise

\[ T = \frac{(\bar X_1 - \bar X_2) - (\mu_1 - \mu_2)}{S_p\sqrt{\dfrac{1}{n_1} + \dfrac{1}{n_2}}} \sim t_{n_1 + n_2 - 2} \]

olur.

İspat

Ortak varyansa \(\sigma^2\) diyelim ve üç adımda ilerleyelim.

Pay. Farkın dağılımına (Önerme 14.1) göre yukarıdaki \(Z\) standart normaldir.

Payda. Ortak varyansın tanımından

\[ W = \frac{(n_1 + n_2 - 2)S_p^2}{\sigma^2} = \frac{(n_1 - 1)S_1^2}{\sigma^2} + \frac{(n_2 - 1)S_2^2}{\sigma^2} \]

olur. Sağdaki iki terim sırasıyla \(\chi^2_{n_1 - 1}\) ve \(\chi^2_{n_2 - 1}\) dağılımlıdır ve farklı örneklemlere bağlı olduklarından bağımsızdır. Bağımsız ki-kare değişkenlerinin toplamı, serbestlik dereceleri toplanmış bir ki-kare değişkenidir (bağımsız ki-kare değişkenlerinin toplamı); dolayısıyla \(W \sim \chi^2_{n_1 + n_2 - 2}\).

Bağımsızlık. Normal bir örneklemde \(\bar X\) ile \(S^2\) bağımsızdır. Örneklemler de birbirinden bağımsız olduğundan \(\bar X_1, S_1^2, \bar X_2, S_2^2\) dördü birden bağımsızdır. \(Z\) yalnız \(\bar X_1\) ve \(\bar X_2\)’ye, \(W\) yalnız \(S_1^2\) ve \(S_2^2\)’ye bağlı olduğundan \(Z\) ile \(W\) bağımsızdır.

\(t\) dağılımının tanımına göre \(Z \big/ \sqrt{W/(n_1 + n_2 - 2)} \sim t_{n_1 + n_2 - 2}\)’dir. Bu oranı açalım: \(\sqrt{W/(n_1 + n_2 - 2)} = S_p/\sigma\) olduğundan

\[ \frac{Z}{S_p/\sigma} = \frac{(\bar X_1 - \bar X_2) - (\mu_1 - \mu_2)}{\sigma\sqrt{\dfrac{1}{n_1} + \dfrac{1}{n_2}}}\cdot\frac{\sigma}{S_p} = T . \]

Bilinmeyen \(\sigma\) sadeleşip gider; \(T\)’nin dağılımı \(t_{n_1 + n_2 - 2}\)’dir.

\(\blacksquare\)

Teorem 14.6 (Eşit Varyanslarda Ortalama Farkı) \(\sigma_1^2 = \sigma_2^2\) kabul ediliyor ama ortak değer bilinmiyorsa \(\mu_1 - \mu_2\)’nin %\(100(1-\alpha)\) düzeyli güven aralığının sınırları

\[ (\bar X_1 - \bar X_2) \mp t_{n_1 + n_2 - 2,\,1-\alpha/2}\; S_p\sqrt{\frac{1}{n_1} + \frac{1}{n_2}} \]

olur.

İspat

\(t\) dağılımı \(0\) etrafında simetrik olduğundan, \(\nu = n_1 + n_2 - 2\) için ortak varyanslı \(t\) istatistiğine (Teorem 14.5) göre

\[ P\left(-t_{\nu,\,1-\alpha/2} \le T \le t_{\nu,\,1-\alpha/2}\right) = 1 - \alpha \]

olur. Eşitsizliği pozitif \(S_p\sqrt{1/n_1 + 1/n_2}\) ile çarpıp bilinen varyanslı aralığın (Teorem 14.4) ispatındaki gibi \(\mu_1 - \mu_2\) için çözünce istenen sınırlar bulunur; olay değişmediğinden olasılık \(1 - \alpha\)’dır.

\(\blacksquare\)

Örnek 14.7 (İki Öğretim Yöntemi) İki öğretim yöntemi karşılaştırılıyor. Birinci yöntemle çalışan \(10\) öğrencinin sınav puanlarının ortalaması \(\bar x_1 = 85\), örneklem varyansı \(s_1^2 = 16\); ikinci yöntemle çalışan \(12\) öğrencininki \(\bar x_2 = 81\) ve \(s_2^2 = 25\)’tir. Puanların iki grupta da normal dağıldığını, varyansların eşit olduğunu ve grupların bağımsız olduğunu kabul ederek \(\mu_1 - \mu_2\) için %95 güven aralığını bulunuz.

Çözüm

Önce ortak varyansı hesaplayalım:

\[ s_p^2 = \frac{9 \cdot 16 + 11 \cdot 25}{10 + 12 - 2} = \frac{144 + 275}{20} = \frac{419}{20} = 20{,}95 , \]

buradan \(s_p = \sqrt{20{,}95} \approx 4{,}577\). Ayrıca

\[ \sqrt{\frac{1}{10} + \frac{1}{12}} = \sqrt{\frac{11}{60}} \approx 0{,}4282 \]

olduğundan farkın tahmini standart sapması \(4{,}577 \cdot 0{,}4282 \approx 1{,}960\)’tır. Serbestlik derecesi \(\nu = 20\) ve \(t\) tablosundan \(t_{20,\,0{,}975} = 2{,}086\)’dır. Hata payı

\[ 2{,}086 \cdot 1{,}960 \approx 4{,}088 , \]

nokta tahmini \(\bar x_1 - \bar x_2 = 4\)’tür. Eşit varyanslı aralığa (Teorem 14.6) göre

\[ 4 - 4{,}088 = -0{,}088, \qquad 4 + 4{,}088 = 8{,}088 , \]

yani %95 güven aralığı \(-0{,}088 \le \mu_1 - \mu_2 \le 8{,}088\) olur. Aralık \(0\)’ı (kıl payı da olsa) içerir: birinci grubun ortalaması \(4\) puan yüksek çıkmış olsa da bu verilerle %95 güvenle yöntemler arasında fark olduğu söylenemez.

\(\blacksquare\)

İki örneklem de büyükse (kabaca \(n_1 \ge 30\) ve \(n_2 \ge 30\)) işler kolaylaşır. Merkezi limit teoremi sayesinde, kitleler tam normal olmasa bile, Önerme 14.1 içindeki \(Z\) yaklaşık olarak standart normaldir. Büyük örneklemlerde \(S_1^2\) ve \(S_2^2\) de kitle varyanslarına çok yakın değerler alır; \(\sigma_i^2\) yerine \(S_i^2\) yazmanın bu yaklaşımı bozmadığı gösterilebilir (burada ispatlamıyoruz). Yani

\[ \frac{(\bar X_1 - \bar X_2) - (\mu_1 - \mu_2)}{\sqrt{\dfrac{S_1^2}{n_1} + \dfrac{S_2^2}{n_2}}} \]

de yaklaşık olarak standart normal dağılır. Buna göre, varyanslar bilinmese ve eşit kabul edilmese de, \(\mu_1 - \mu_2\) için yaklaşık %\(100(1-\alpha)\) düzeyli güven sınırları

\[ (\bar X_1 - \bar X_2) \mp z_{1-\alpha/2}\sqrt{\frac{S_1^2}{n_1} + \frac{S_2^2}{n_2}} \]

olur. Bu, bilinen varyanslı aralığın (Teorem 14.4) \(\sigma_i^2\) yerine \(S_i^2\) yazılmış hâlidir.

Örnek 14.8 (Büyük Örneklemlerle Ortalama Farkı) İki şehirde hanelerin günlük su tüketimi karşılaştırılıyor. Birinci şehirden \(50\) hanenin ortalaması \(\bar x_1 = 72\) litre, standart sapması \(s_1 = 8\) litre; ikinci şehirden \(40\) hanenin ortalaması \(\bar x_2 = 68\) litre, standart sapması \(s_2 = 6\) litredir. \(\mu_1 - \mu_2\) için yaklaşık %95 güven aralığını bulunuz.

Çözüm

İki örneklem de \(30\)’dan büyük olduğundan \(z\) ile yaklaşık aralık kurabiliriz. Farkın tahmini standart sapması

\[ \sqrt{\frac{8^2}{50} + \frac{6^2}{40}} = \sqrt{1{,}28 + 0{,}90} = \sqrt{2{,}18} \approx 1{,}4765 . \]

Standart normal tablosundan \(z_{0{,}975} = 1{,}96\) olduğundan hata payı \(1{,}96 \cdot 1{,}4765 \approx 2{,}894\)’tür. Nokta tahmini \(72 - 68 = 4\) olduğundan

\[ 4 - 2{,}894 = 1{,}106, \qquad 4 + 2{,}894 = 6{,}894 , \]

yani yaklaşık %95 güven aralığı \(1{,}106 \le \mu_1 - \mu_2 \le 6{,}894\) (litre) olur. Birinci şehirde ortalama tüketim daha yüksektir.

\(\blacksquare\)

Varyanslar Bilinmiyor ve Farklıysa

Varyansların eşit olduğunu kabul edemiyorsak her birini kendi örneklem varyansıyla tahmin ederiz. Farkın dağılımındaki (Önerme 14.1) \(Z\)’de \(\sigma_i^2\) yerine \(S_i^2\) yazılınca

\[ T' = \frac{(\bar X_1 - \bar X_2) - (\mu_1 - \mu_2)}{\sqrt{\dfrac{S_1^2}{n_1} + \dfrac{S_2^2}{n_2}}} \]

bulunur. Küçük örneklemlerde \(T'\) ne standart normaldir ne de tam olarak bir \(t\) dağılımına sahiptir; üstelik gerçek dağılımı bilinmeyen \(\sigma_1^2/\sigma_2^2\) oranına bağlıdır. Bu yüzden \(T'\)’nin dağılımına uygun bir serbestlik dereceli \(t\) dağılımıyla yaklaşılır. Serbestlik derecesini belirlemek için çeşitli yollar vardır; en yaygını aşağıdaki Welch–Satterthwaite (Smith–Satterthwaite olarak da anılır) yaklaşımıdır.

Teorem 14.7 (Welch–Satterthwaite Aralığı) Yukarıdaki düzende \(\sigma_1^2\) ve \(\sigma_2^2\) bilinmiyor ve eşit kabul edilmiyorsa \(T'\) yaklaşık olarak \(t_\nu\) dağılımına sahiptir; burada

\[ \nu = \frac{\left(\dfrac{S_1^2}{n_1} + \dfrac{S_2^2}{n_2}\right)^2}{\dfrac{\left(S_1^2/n_1\right)^2}{n_1 - 1} + \dfrac{\left(S_2^2/n_2\right)^2}{n_2 - 1}} \]

dir. Buna göre \(\mu_1 - \mu_2\) için yaklaşık %\(100(1-\alpha)\) düzeyli güven sınırları

\[ (\bar X_1 - \bar X_2) \mp t_{\nu,\,1-\alpha/2}\sqrt{\frac{S_1^2}{n_1} + \frac{S_2^2}{n_2}} \]

olur. \(\nu\) genellikle tam sayı değildir; tablo kullanılırken bir alt tam sayıya yuvarlanır. Ayrıca her zaman

\[ \min(n_1, n_2) - 1 \le \nu \le n_1 + n_2 - 2 \]

sağlanır.

Serbestlik derecesinin gerekçesi

Kısalık için \(a_i = \sigma_i^2/n_i\) ve \(V = S_1^2/n_1 + S_2^2/n_2\) diyelim; \(\theta = a_1 + a_2\) olsun.

\(V\)’nin beklenen değeri ve varyansı. Normal örneklemde örneklem varyansının momentleri

\[ E(S_i^2) = \sigma_i^2, \qquad \operatorname{Var}(S_i^2) = \frac{2\sigma_i^4}{n_i - 1} \]

olduğundan \(E(V) = \theta\) bulunur. Ayrıca

\[ \operatorname{Var}\left(\frac{S_i^2}{n_i}\right) = \frac{1}{n_i^2}\cdot\frac{2\sigma_i^4}{n_i - 1} = \frac{2a_i^2}{n_i - 1} . \]

\(S_1^2\) ile \(S_2^2\) bağımsız olduğundan

\[ \operatorname{Var}(V) = \frac{2a_1^2}{n_1 - 1} + \frac{2a_2^2}{n_2 - 1} . \]

Yaklaşım. \(Z = \big[(\bar X_1 - \bar X_2) - (\mu_1 - \mu_2)\big]/\sqrt{\theta}\) standart normaldir ve \(T' = Z\big/\sqrt{V/\theta}\) yazılabilir. \(Z\), \(V\)’den bağımsızdır, çünkü normal örneklemlerde örneklem ortalamaları örneklem varyanslarından bağımsızdır. Eğer bir \(\nu\) için \(\nu V/\theta \sim \chi^2_\nu\) olsaydı, \(t\) dağılımının tanımına göre \(T'\) tam olarak \(t_\nu\) dağılımına sahip olurdu. Böyle bir \(V\)’nin beklenen değeri \(\theta\), varyansı

\[ \frac{\theta^2}{\nu^2}\cdot 2\nu = \frac{2\theta^2}{\nu} \]

olurdu. Beklenen değer zaten uyuyor; \(\nu\)’yü varyanslar da eşit olacak biçimde seçelim:

\[ \frac{2\theta^2}{\nu} = \frac{2a_1^2}{n_1 - 1} + \frac{2a_2^2}{n_2 - 1} \iff \nu = \frac{(a_1 + a_2)^2}{\dfrac{a_1^2}{n_1 - 1} + \dfrac{a_2^2}{n_2 - 1}} . \]

Bilinmeyen \(a_i = \sigma_i^2/n_i\) yerine tahminleri \(S_i^2/n_i\) yazılınca teoremdeki \(\nu\) elde edilir. Aralık, eşit varyanslı durumdaki (Teorem 14.6) gibi

\[ P\left(-t_{\nu,\,1-\alpha/2} \le T' \le t_{\nu,\,1-\alpha/2}\right) \approx 1 - \alpha \]

eşitsizliği \(\mu_1 - \mu_2\) için çözülerek bulunur.

\(\nu\)’nün sınırları. \(b_i = S_i^2/n_i\) ve \(k_i = n_i - 1\) yazalım. Cauchy–Schwarz eşitsizliğiyle

\[ (b_1 + b_2)^2 = \left(\frac{b_1}{\sqrt{k_1}}\sqrt{k_1} + \frac{b_2}{\sqrt{k_2}}\sqrt{k_2}\right)^2 \le \left(\frac{b_1^2}{k_1} + \frac{b_2^2}{k_2}\right)(k_1 + k_2), \]

yani \(\nu \le k_1 + k_2 = n_1 + n_2 - 2\); eşitlik \(b_1/k_1 = b_2/k_2\) iken sağlanır. Öte yandan \(k = \min(k_1, k_2)\) için

\[ \frac{b_1^2}{k_1} + \frac{b_2^2}{k_2} \le \frac{b_1^2 + b_2^2}{k} \le \frac{(b_1 + b_2)^2}{k}, \]

yani \(\nu \ge k = \min(n_1, n_2) - 1\). Aşağıdaki şekil \(\nu\)’nün iki örneklemin katkılarının oranına göre bu sınırlar arasında nasıl değiştiğini gösterir.

0,01 0,1 1 10 100 R 5 7 11 15 18 20 ν n₁ + n₂ − 2 = 18 n₁ − 1 = 7 R = 7/11 R = 7,5; ν ≈ 8,89
n₁ = 8, n₂ = 12 için Welch serbestlik derecesi ν, R = (s₁²/n₁)/(s₂²/n₂) oranının fonksiyonu olarak (yatay eksen logaritmik). ν hiçbir zaman 18'i aşmaz ve 7'nin altına inmez; en büyük değer R = 7/11'de alınır. R büyüdükçe ν, birinci örneklemin n₁ − 1 = 7 değerine, R küçüldükçe ikinci örneklemin n₂ − 1 = 11 değerine yaklaşır. Turuncu nokta örnekteki R = 7,5 durumudur.

\(\blacksquare\)

Alt tam sayıya yuvarlamak serbestlik derecesini küçültür, \(t\) kantilini büyütür ve aralığı biraz genişletir; yani güvenli taraftadır. \(\nu\)’nün alt sınırı, en kötü durumda bile küçük örneklemin serbestlik derecesini kullanabileceğimizi söyler.

Örnek 14.9 (Değişkenliği Farklı İki Kitle) İki kitleden bağımsız örneklemler alınıyor. Birinci kitleden \(8\) gözlemin ortalaması \(\bar x_1 = 30\) ve örneklem varyansı \(s_1^2 = 20\); ikinci kitleden \(12\) gözlemin ortalaması \(\bar x_2 = 25\) ve örneklem varyansı \(s_2^2 = 4\)’tür. Kitlelerin normal olduğunu ve varyanslarının farklı olduğunu kabul ederek \(\mu_1 - \mu_2\) için %95 güven aralığını bulunuz.

Çözüm

İki katkıyı ayrı ayrı hesaplayalım:

\[ \frac{s_1^2}{n_1} = \frac{20}{8} = 2{,}5, \qquad \frac{s_2^2}{n_2} = \frac{4}{12} \approx 0{,}3333 . \]

Toplamları \(2{,}8333\) olduğundan farkın tahmini standart sapması \(\sqrt{2{,}8333} \approx 1{,}6833\)’tür. Serbestlik derecesi için pay ve paydayı ayrı hesaplayalım:

\[ \begin{aligned} \text{pay} &= 2{,}8333^2 \approx 8{,}0278,\\[1mm] \text{payda} &= \frac{2{,}5^2}{7} + \frac{0{,}3333^2}{11} \approx 0{,}8929 + 0{,}0101 = 0{,}9030 . \end{aligned} \]

Buna göre \(\nu \approx 8{,}0278/0{,}9030 \approx 8{,}89\)’dur ve bir alt tam sayıya yuvarlayarak \(\nu = 8\) alırız. \(t\) tablosundan \(t_{8,\,0{,}975} = 2{,}306\) okunur. Hata payı

\[ 2{,}306 \cdot 1{,}6833 \approx 3{,}882 , \]

nokta tahmini \(30 - 25 = 5\)’tir. Welch–Satterthwaite aralığına (Teorem 14.7) göre

\[ 5 - 3{,}882 = 1{,}118, \qquad 5 + 3{,}882 = 8{,}882 , \]

yani yaklaşık %95 güven aralığı \(1{,}118 \le \mu_1 - \mu_2 \le 8{,}882\) olur.

\(\nu \approx 8{,}89\) değerinin \(n_1 + n_2 - 2 = 18\)’den çok küçük, alt sınır \(n_1 - 1 = 7\)’ye ise yakın olduğuna dikkat edin. Nedeni, farkın varyansının neredeyse tamamının küçük ve değişken birinci örneklemden gelmesidir (\(2{,}5\)’e karşı \(0{,}33\)); aralığın belirsizliğini asıl bu örneklem belirler.

\(\blacksquare\)

Üç durumu bir arada kullanmak için basit bir reçete verelim.

İpucuÜç adımda doğru aralığı seçmek
  1. Kitle varyansları biliniyorsa \(z\) aralığını (Teorem 14.4) kullanın.
  2. Varyanslar bilinmiyor ama iki örneklem de büyükse (\(n_1, n_2 \ge 30\)) \(\sigma_i^2\) yerine \(s_i^2\) yazılmış \(z\) aralığı yeterlidir.
  3. Varyanslar bilinmiyor ve örneklemler küçükse önce \(\sigma_1^2/\sigma_2^2\) için bir aralık kurun (Teorem 14.3). Aralık \(1\)’i içeriyorsa varyansları eşit kabul edip ortak varyanslı \(t\) aralığını (Teorem 14.6), içermiyorsa Welch aralığını (Teorem 14.7) kullanın. Emin olamadığınızda Welch aralığı güvenli seçimdir: varyanslar eşit olduğunda da iyi çalışır.
1. kitle 2. kitle 4 8 12 16 20 24 x σ₁² = σ₂² 1. kitle 2. kitle 4 8 12 16 20 24 x σ₁² ≠ σ₂²
Ortalamaları 10 ve 16 olan iki normal kitle. Solda iki eğri aynı biçimdedir, yalnız yerleri farklıdır: varyanslar eşittir ve tek bir ortak σ² tahmin edilir. Sağda birinci kitle dar, ikincisi geniştir: varyanslar farklıdır ve her biri ayrı tahmin edilir.

Örnek 14.10 (Aralık Türünü Seçmek) İki ölçüm yöntemi karşılaştırılıyor. Birinci yöntemle yapılan \(11\) ölçümün ortalaması \(\bar x_1 = 40{,}2\) ve örneklem varyansı \(s_1^2 = 12{,}5\); ikinci yöntemle yapılan \(16\) ölçümün ortalaması \(\bar x_2 = 36{,}5\) ve örneklem varyansı \(s_2^2 = 2{,}5\)’tir. Ölçümler normal dağılıyor ve örneklemler bağımsızdır; kitle varyansları bilinmiyor. \(\mu_1 - \mu_2\) için %95 güven aralığını uygun yöntemi seçerek bulunuz.

Çözüm

Yöntemin seçimi. Varyanslar bilinmiyor ve örneklemler küçük, dolayısıyla reçetenin üçüncü adımındayız. Bu veriler için \(\sigma_1^2/\sigma_2^2\)’nin %90 güven aralığını daha önce (Örnek 14.5) \(1{,}969 \le \sigma_1^2/\sigma_2^2 \le 14{,}25\) olarak bulmuştuk. Aralık \(1\)’i içermez; varyansları eşit kabul edemeyiz ve Welch aralığını kullanırız.

Serbestlik derecesi. Katkılar

\[ \frac{s_1^2}{n_1} = \frac{12{,}5}{11} \approx 1{,}1364, \qquad \frac{s_2^2}{n_2} = \frac{2{,}5}{16} = 0{,}15625 \]

ve toplamları \(1{,}2926\)’dır; farkın tahmini standart sapması \(\sqrt{1{,}2926} \approx 1{,}1369\)’dur. Pay ve payda

\[ \begin{aligned} \text{pay} &= 1{,}2926^2 \approx 1{,}6709,\\[1mm] \text{payda} &= \frac{1{,}1364^2}{10} + \frac{0{,}15625^2}{15} \approx 0{,}12913 + 0{,}00163 = 0{,}13076 \end{aligned} \]

olduğundan \(\nu \approx 1{,}6709/0{,}13076 \approx 12{,}78\) bulunur; \(\nu = 12\) alırız.

Aralık. \(t\) tablosundan \(t_{12,\,0{,}975} = 2{,}179\)’dur. Hata payı \(2{,}179 \cdot 1{,}1369 \approx 2{,}477\), nokta tahmini \(40{,}2 - 36{,}5 = 3{,}7\)’dir. Buna göre

\[ 3{,}7 - 2{,}477 = 1{,}223, \qquad 3{,}7 + 2{,}477 = 6{,}177 , \]

yani yaklaşık %95 güven aralığı \(1{,}223 \le \mu_1 - \mu_2 \le 6{,}177\) olur. Birinci yöntem hem daha değişken hem de ortalama olarak daha büyük değerler ölçmektedir.

\(\blacksquare\)

Bu bölümde normal kitlelerin varyansı, iki varyansın oranı ve iki ortalamanın farkı için güven aralıkları kurduk; hepsinde yöntem aynıydı, değişen yalnız kullandığımız dağılımdı (ki-kare, \(F\), normal ya da \(t\)). Sonraki bölüm Oran İçin Aralık Tahmini, aynı fikri binom dağılımının \(p\) parametresine ve iki binom parametresinin farkına uyguluyor.