9  Momentler Yöntemi

Buraya kadar dağılımların parametrelerini biliyormuş gibi davrandık: \(\lambda\) verildiğinde Poisson olasılıklarını, \(\mu\) ile \(\sigma^2\) verildiğinde normal alanları hesapladık. İstatistikte durum tersine döner. Elimizde veri vardır, dağılımın biçimini de çoğu zaman biliriz; bilmediğimiz şey parametrenin kendisidir. Bu kısmın konusu, veriden parametre için tek bir sayısal değer üretmektir. Bu bölümde önce temel kavramları kuracak, sonra ilk ve en eski tahmin yöntemini, momentler yöntemini öğreneceğiz.

9.1 Tahmin Teorisine Giriş

Bir kitleyi incelerken genellikle “bu kitle hangi aileden bir dağılıma uyar?” sorusunun cevabını biliriz; ailenin hangi üyesi olduğu ise bir ya da birkaç sayıya bağlıdır. Bu sayılara bir ad verelim.

Tanım 9.1 (Parametre ve Parametre Kümesi) \(X\) rastgele değişkeninin dağılımı \(f_X(x;\theta)\) olasılık (yoğunluk) fonksiyonu ile verilsin; burada \(\theta \in \Theta\)’dır. \(\theta\)’ya dağılımın parametresi, \(\theta\)’nın alabileceği bütün değerlerin kümesi \(\Theta\)’ya da parametre kümesi denir. Parametre birden çok sayıdan oluşabilir; o zaman \(\theta = (\theta_1, \ldots, \theta_m)\) bir vektör ve \(\Theta \subset \mathbb{R}^m\) olur.

Yani \(f_X(x;\theta)\) tek bir dağılım değil, \(\theta\) değiştikçe değişen bir dağılımlar ailesidir. Parametre kümesi de bu ailenin hangi üyelerinin “izinli” olduğunu söyler: \(f_X(\,\cdot\,;\theta)\)’nın gerçekten bir olasılık (yoğunluk) fonksiyonu olduğu \(\theta\) değerleri.

Örnek 9.1 (Bilinen Dağılımların Parametre Kümeleri) Önceki bölümlerde gördüğümüz dağılımların parametreleri ve parametre kümeleri şunlardır.

  • Bernoulli dağılımı \(\operatorname{Binom}(1,p)\): parametre \(p\), parametre kümesi \(\Theta = (0,1) \subset \mathbb{R}\).
  • Poisson dağılımı \(\operatorname{Poisson}(\lambda)\): parametre \(\lambda\), parametre kümesi \(\Theta = (0,\infty) \subset \mathbb{R}\).
  • Gamma dağılımı (Tanım 4.2) \(\operatorname{Gamma}(r,\alpha)\): parametreler \(r\) ve \(\alpha\), parametre kümesi \(\Theta = (0,\infty) \times (0,\infty) \subset \mathbb{R}^2\).
  • Normal dağılım \(N(\mu,\sigma^2)\): parametreler \(\mu\) ve \(\sigma^2\), parametre kümesi \(\Theta = (-\infty,\infty) \times (0,\infty) \subset \mathbb{R}^2\).

Son örnekte \(\mu\) her reel değeri alabilir, ama varyans pozitif olmak zorundadır; parametre kümesinin ikinci çarpanının \((0,\infty)\) olması bundandır.

9.2 Nokta Tahmini

Parametreyi bilmediğimizde elimizdeki tek bilgi kaynağı kitleden çekilen örneklemdir. Örneklemin bir fonksiyonunu, yani bir istatistiği, parametrenin yerine koymak en doğal fikirdir. Parametre için tek bir sayı önermeye nokta tahmini denir.

Tanım 9.2 (Tahmin Edici ve Tahmin) Bilinmeyen bir \(\theta\) parametresini (ya da \(\theta\)’nın bir \(g(\theta)\) fonksiyonunu) belirlemek amacıyla kullanılan bir örneklem istatistiğine \(\theta\)’nın tahmin edicisi (kestirici, estimatör) denir ve \(\hat\theta = T(X_1, \ldots, X_n)\) ile gösterilir. Tahmin edicinin gözlenen örneklemde aldığı sayısal değere tahmin (kestirim) denir.

Yani tahmin edici bir kuraldır: “gözlemleri topla, \(n\)’ye böl” gibi. Gözlemler rastgele olduğundan tahmin edici de bir rastgele değişkendir ve kendi dağılımı vardır; bu yüzden onu \(\bar X\), \(S^2\), \(T\) gibi büyük harflerle yazarız. Tahmin ise bu kuralın elimizdeki veriye uygulanmasıyla çıkan tek bir sayıdır, örneğin \(\bar x = 3{,}12\). Aynı tahmin edici, başka bir örneklemde başka bir tahmin verir. Gösterimi yüklememek için ikisine de çoğu zaman \(\hat\theta\) denir; hangisinin kastedildiği bağlamdan anlaşılır.

Örnek 9.2 (Bir Paranın Yazı Olasılığı) Yazı gelme olasılığı \(p\) bilinmeyen bir para 10 kez atılıyor. \(i\). atışta yazı gelirse \(X_i = 1\), tura gelirse \(X_i = 0\) olsun; böylece \(X_1, \ldots, X_{10}\) bir \(\operatorname{Binom}(1,p)\) kitlesinden alınmış bir örneklemdir. \(p\) için \(\hat p = \bar X\) tahmin edicisi kullanılıyor ve atışlar \(0, 1, 0, 0, 1, 1, 0, 0, 1, 0\) sonucunu veriyor. Paranın gerçek yazı olasılığı (istatistikçinin bilmediği) \(p = 0{,}3\) olsun. Gözlenen tahmini, \(\hat p\) tahmin edicisinin olasılık fonksiyonu içinde yorumlayınız.

Çözüm

Gözlenen örneklemde 4 yazı vardır. Tahmin edicinin bu örneklemdeki değeri \[ \hat p = \bar x = \frac{0+1+0+0+1+1+0+0+1+0}{10} = \frac{4}{10} = 0{,}4 \] olur. Bu sayı bir tahmindir.

Şimdi \(\hat p = \bar X\)’in kendisine bakalım. \(Y = X_1 + \cdots + X_{10}\) yazı sayısıdır ve \(Y \sim \operatorname{Binom}(10; 0{,}3)\)’tür. \(\hat p = Y/10\) olduğundan tahmin edici yalnız \(0;\ 0{,}1;\ \ldots;\ 1\) değerlerini alır ve \(k = 0, 1, \ldots, 10\) için \[ P\!\left(\hat p = \frac{k}{10}\right) = P(Y = k) = \binom{10}{k}(0{,}3)^k(0{,}7)^{10-k} \] olur. Örneğin \[ \begin{aligned} P(\hat p = 0{,}3) &= \binom{10}{3}(0{,}3)^3(0{,}7)^7 \approx 0{,}2668,\\[1mm] P(\hat p = 0{,}4) &= \binom{10}{4}(0{,}3)^4(0{,}7)^6 \approx 0{,}2001 . \end{aligned} \] Yani tahmin edici gerçek değeri (\(0{,}3\)) en yüksek olasılıkla verir, ama bu olasılık yalnızca yaklaşık \(0{,}27\)’dir; bizim gözlediğimiz \(0{,}4\) gibi komşu değerler de sık sık çıkar. Tahmin edicinin iyiliği tek bir tahmine bakarak değil, bu dağılıma bakarak değerlendirilir.

gerçek p = 0,3 gözlenen tahmin: 0,4 0,0 0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9 1,0 0,1 0,2 0,3 olasılık tahmin edicinin alabileceği değerler k/10
p = 0,3 iken 10 atışlık örneklemden hesaplanan p̂ = X̄ tahmin edicisinin olasılık fonksiyonu. Tahmin edici 0; 0,1; …; 1 değerlerinden birini rastgele alır; bu örneklemde gözlenen değer 0,4'tür.

\(\blacksquare\)

Bir parametre için akla birçok tahmin edici gelebilir. Bunların hangisinin daha iyi olduğunu (yansızlık, etkinlik, tutarlılık gibi ölçütlerle) Tahmin Edicilerin Özellikleri bölümünde tartışacağız. Önce tahmin edicileri sistemli olarak üretmenin yollarına bakalım; bunların ilki momentler yöntemidir.

9.3 Momentler Yöntemi

Yöntemin fikri çok basittir. Kitle momentleri parametrelere bağlıdır; örneklem momentleri ise veriden hesaplanır ve büyük sayılar yasası gereği örneklem büyüdükçe karşılık gelen kitle momentine yaklaşır. O hâlde ikisini eşitleyip parametreyi çözebiliriz.

\(X\)’in olasılık (yoğunluk) fonksiyonu \(f(x;\theta_1, \ldots, \theta_m)\) olsun; yani dağılım \(m\) tane parametreye bağlı. \(X\)’in \(k\). mertebeden momenti kesikli hâlde \[ E(X^k) = \sum_{x \in D_X} x^k f(x;\theta_1, \ldots, \theta_m), \] sürekli hâlde \[ E(X^k) = \int_{D_X} x^k f(x;\theta_1, \ldots, \theta_m)\,dx \] ile verilir; burada \(D_X\), \(X\)’in değer kümesidir. Her iki hâlde de sonuç \(\theta_1, \ldots, \theta_m\) parametrelerinin bir fonksiyonudur. Bu fonksiyona bir ad verelim: \[ E(X^k) = \Psi_k(\theta_1, \ldots, \theta_m), \qquad k = 1, 2, \ldots \] Bu sayılara kitle momentleri de denir. Örneklem tarafındaki karşılıkları, Tanım 7.8 ile tanımladığımız örneklem momentleridir: \[ M_k = \frac{1}{n}\sum_{i=1}^{n} X_i^k, \qquad k = 1, 2, \ldots \] \(M_k\), gözlemlerin \(k\). kuvvetlerinin aritmetik ortalamasıdır; özel olarak \(M_1 = \bar X\)’tir. \(E|X|^k < \infty\) olduğunda \(E(X_i^k) = E(X^k)\) olduğundan beklenen değerin doğrusallığıyla \(E(M_k) = E(X^k)\) bulunur; yani \(M_k\) ortalamada tam olarak kitle momentini verir.

Tanım 9.3 (Momentler Yöntemi) \(X\)’in dağılımı \(\theta_1, \ldots, \theta_m\) parametrelerine bağlı ve \(E(X^k) = \Psi_k(\theta_1, \ldots, \theta_m)\) olsun. İlk \(m\) kitle momentini ilk \(m\) örneklem momentine eşitleyen \[ M_k = \Psi_k(\theta_1, \ldots, \theta_m), \qquad k = 1, 2, \ldots, m \] denklem sisteminin \(\theta_1, \ldots, \theta_m\) için çözümü \(\hat\theta_1, \ldots, \hat\theta_m\)’ye parametrelerin momentler yöntemi tahmin edicileri (moment tahmin edicileri) denir.

Yani bilinmeyen sayısı kadar denklem kurarız: tek parametre için yalnız \(\bar X = E(X)\) denklemi, iki parametre için bunun yanına \(M_2 = E(X^2)\) denklemi yeterlidir. Uygulamada ilk \(m\) moment yerine parametreleri belirleyen başka \(m\) moment denklemi de (örneğin varyans denklemi) kullanılır; bu geniş anlamda aynı parametre için farklı tahmin ediciler çıkabilir. Çözümde bulunan ifade gözlemlerin bir fonksiyonu, yani bir istatistiktir; bu yüzden onu büyük harflerle yazarız.

İki parametreli dağılımlarda ikinci denklemi \(E(X^2)\) yerine varyansla kurmak çoğu zaman hesabı kısaltır. Bunun meşru olduğunu şu özdeşlik gösterir.

Önerme 9.1 (Örneklem Varyansı Özdeşliği) Her \(X_1, \ldots, X_n\) için \[ M_2 - \bar X^2 = \frac{1}{n}\sum_{i=1}^{n}(X_i - \bar X)^2 . \]

İspat

Kareyi açıp toplamı terim terim dağıtalım: \[ \sum_{i=1}^{n}(X_i - \bar X)^2 = \sum_{i=1}^{n} X_i^2 - 2\bar X\sum_{i=1}^{n} X_i + n\bar X^2 . \] \(\sum_{i=1}^{n} X_i = n\bar X\) olduğundan ortadaki terim \(-2n\bar X^2\)’dir; son terimle birleşince \[ \sum_{i=1}^{n}(X_i - \bar X)^2 = \sum_{i=1}^{n} X_i^2 - n\bar X^2 \] kalır. İki yanı \(n\)’ye bölünce sol taraf \(\frac{1}{n}\sum (X_i - \bar X)^2\), sağ taraf \(M_2 - \bar X^2\) olur. \(\blacksquare\)

Kitle tarafında da varyans hesap formülü \(\operatorname{Var}(X) = E(X^2) - \big(E(X)\big)^2\) der. Dolayısıyla \(\bar X = E(X)\) denklemi yanında \(M_2 = E(X^2)\) yazmak ile \[ \frac{1}{n}\sum_{i=1}^{n}(X_i - \bar X)^2 = \operatorname{Var}(X) \] yazmak aynı sonucu verir.

Yöntemle ilgili iki gözlem, örneklere geçmeden önce akılda tutulmalı:

  • Tahmin edilecek parametre sayısı kadar moment kullanılır; daha azı sistemi belirsiz bırakır.
  • Momentler yöntemi bir parametre için tek bir tahmin edici vermek zorunda değildir. Hangi momentlerin eşitlendiğine göre aynı parametre için birbirinden farklı tahmin ediciler çıkabilir. Aşağıdaki Poisson örneği bunu açıkça gösterecek.
İpucuMomentler yöntemi üç adımda
  1. Parametre sayısı \(m\) ise \(E(X), E(X^2), \ldots, E(X^m)\) momentlerini parametreler cinsinden hesaplayın.
  2. Her \(E(X^k)\)’yi karşılık gelen örneklem momenti \(M_k\)’ye eşitleyin (\(M_1 = \bar X\)).
  3. Elde edilen sistemi parametreler için çözün ve sonucu gözlemlerin fonksiyonu olarak yazın.

Örnek 9.3 (Kuvvet Yoğunluğunda Moment Tahmin Edicisi) \(X\)’in olasılık yoğunluk fonksiyonu \[ f(x;\theta) = (1+\theta)\,x^{\theta}, \qquad 0 \le x \le 1,\ \theta > -1 \] olsun. Bu dağılıma sahip bir kitleden \(n\) büyüklüğünde bir rastgele örneklem alındığında \(\theta\) parametresinin tahmin edicisini momentler yöntemiyle bulunuz.

Çözüm

Tek parametre olduğu için yalnız birinci momente ihtiyaç var.

Adım 1. \(\theta > -1\) iken \(\theta + 2 > 0\) olduğundan integral yakınsaktır ve \[ E(X) = \int_0^1 x\,(1+\theta)x^{\theta}\,dx = (1+\theta)\int_0^1 x^{\theta+1}\,dx = (1+\theta)\left[\frac{x^{\theta+2}}{\theta+2}\right]_0^1 = \frac{1+\theta}{\theta+2}. \]

Adım 2. Bunu örneklem ortalamasına eşitleyelim: \[ \bar X = \frac{1+\theta}{\theta+2}. \]

Adım 3. Paydayı karşıya atıp \(\theta\)’lı terimleri bir tarafa toplayalım: \[ \bar X\theta + 2\bar X = 1 + \theta \quad\Longrightarrow\quad \theta(\bar X - 1) = 1 - 2\bar X . \] \(0 \le X_i \le 1\) olduğundan \(\bar X \le 1\)’dir ve sürekli bir dağılımda bütün gözlemlerin tam \(1\) çıkma olasılığı sıfırdır; yani \(\bar X - 1 \neq 0\) ve bölebiliriz: \[ \hat\theta = \frac{1 - 2\bar X}{\bar X - 1} = \frac{2\bar X - 1}{1 - \bar X}. \]

Bulunan tahmin parametre kümesinin içinde mi? \(1 - \bar X > 0\) olduğundan \[ \hat\theta > -1 \iff 2\bar X - 1 > -(1 - \bar X) \iff \bar X > 0 \] olur ve bütün gözlemlerin \(0\) çıkma olasılığı da sıfırdır. Demek ki \(\hat\theta\) her zaman \((-1,\infty)\) içinde kalır.

Aşağıdaki şekil neden \(\bar X\)’in \(\theta\) hakkında bilgi taşıdığını gösteriyor: \(\theta\) büyüdükçe kütle \(1\)’e doğru kayar ve beklenen değer artar.

0,00 0,25 0,50 0,75 1,00 x 1 2 3 4 f(x; θ) θ = −0,5 θ = 0 θ = 1 θ = 3
Kuvvet ailesinden dört yoğunluk. θ büyüdükçe kütle 1'e doğru kayar; eksenin üstündeki üçgenler beklenen değerleri 1/3, 1/2, 2/3 ve 4/5'i gösterir. Bu yüzden X̄ bize θ hakkında bilgi verir.

\(\blacksquare\)

Örnek 9.4 (Kuvvet Yoğunluğunda Sayısal Tahmin) Olasılık yoğunluk fonksiyonu \(f(x;\theta) = (1+\theta)x^{\theta}\) (\(0 \le x \le 1\), \(\theta > -1\)) olan kitleden \(n = 5\) büyüklüğünde bir örneklem çekilmiş ve \(0{,}3;\ 0{,}5;\ 0{,}1;\ 0{,}1;\ 0{,}2\) gözlemleri elde edilmiştir. \(\theta\)’nın momentler yöntemiyle elde edilen tahminini bulunuz.

Çözüm

Tahmin ediciyi Örnek 9.3 içinde \(\hat\theta = \dfrac{2\bar X - 1}{1 - \bar X}\) olarak bulduk. Önce örneklem ortalamasını hesaplayalım: \[ \bar x = \frac{0{,}3 + 0{,}5 + 0{,}1 + 0{,}1 + 0{,}2}{5} = \frac{1{,}2}{5} = 0{,}24 . \] Bunu tahmin edicide yerine koyalım: \[ \hat\theta = \frac{2(0{,}24) - 1}{1 - 0{,}24} = \frac{-0{,}52}{0{,}76} = -\frac{13}{19} \approx -0{,}684 . \] Sağlama: \(\theta = -\tfrac{13}{19}\) için \(\dfrac{1+\theta}{\theta+2} = \dfrac{6/19}{25/19} = \dfrac{6}{25} = 0{,}24\) olur; yani bu değer kitle ortalamasını gerçekten gözlenen ortalamaya eşitler.

Negatif bir \(\theta\), yoğunluğun azalan olduğu, yani kütlenin \(0\) yakınında toplandığı anlamına gelir. Gözlemlerin hepsinin \(0{,}5\)’ten küçük olması bununla uyumludur. Şekilde çözdüğümüz denklemi görüyoruz.

0,24 = 0,24 θ ≈ −0,684 E(X) = (1 + θ)/(θ + 2) −1 0 1 2 3 4 5 6 θ 0,50 0,75 1,00 E(X)
E(X) = (1 + θ)/(θ + 2) eğrisi artandır ve 0 ile 1 arasındaki her değeri bir kez alır. Yatay x̄ = 0,24 çizgisi eğriyi tek bir noktada keser; o noktanın apsisi θ̂ = −13/19 ≈ −0,684 tahminidir.

\(\blacksquare\)

9.4 Bilinen Dağılımlarda Moment Tahmin Edicileri

Şimdi yöntemi önceki bölümlerde tanıdığımız dağılımlara uygulayalım. Her örnekte gereken kitle momentleri ya kardeş kitapta ya da bu kitabın ilk kısmında hesaplanmıştır; biz yalnız eşitleme ve çözme adımlarını yapacağız.

Örnek 9.5 (Üstel Dağılımın Oran Parametresi) \(\operatorname{Üstel}(\lambda)\) dağılımına sahip bir kitleden alınmış \(n\) boyutlu bir örnekleme dayanarak \(\lambda\) parametresinin momentler yöntemine göre tahmin edicisini bulunuz.

Çözüm

Tek parametre vardır. Üstel dağılımın momentlerinden \(E(X) = \dfrac{1}{\lambda}\)’dır. Bunu \(\bar X\)’e eşitleyelim: \[ \bar X = \frac{1}{\lambda} \quad\Longrightarrow\quad \hat\lambda = \frac{1}{\bar X}. \] Gözlemler pozitif olduğundan \(\bar X > 0\)’dır ve bölme her zaman tanımlıdır.

Aynı parametre için ikinci momentten de bir denklem kurulabilir. Varyans hesap formülünden \[ E(X^2) = \operatorname{Var}(X) + \big(E(X)\big)^2 = \frac{1}{\lambda^2} + \frac{1}{\lambda^2} = \frac{2}{\lambda^2} \] olduğundan \(M_2 = \dfrac{2}{\lambda^2}\) denklemi, \(\lambda > 0\) olduğu hesaba katılınca, \[ \tilde\lambda = \sqrt{\frac{2}{M_2}} \] tahmin edicisini verir. Tek parametre için birinci moment yeterli olduğundan olağan seçim \(\hat\lambda = 1/\bar X\)’tir; \(\tilde\lambda\), momentler yönteminin aynı parametreye farklı tahmin ediciler verebileceğinin bir örneğidir. \(\blacksquare\)

Örnek 9.6 (Normal Dağılımın İki Parametresi) \(N(\mu,\sigma^2)\) dağılımına sahip bir kitleden çekilen \(n\) boyutlu bir örnekleme dayanarak \(\mu\) ve \(\sigma^2\) parametrelerinin momentler yöntemiyle tahmin edicilerini bulunuz.

Çözüm

İki parametre olduğu için iki moment gerekir. Normal dağılımın momentlerinden \(E(X) = \mu\) ve \(\operatorname{Var}(X) = \sigma^2\)’dir; buradan \[ E(X^2) = \operatorname{Var}(X) + \big(E(X)\big)^2 = \sigma^2 + \mu^2 \] bulunur. Momentleri eşitleyelim: \[ \bar X = \mu, \qquad M_2 = \sigma^2 + \mu^2 . \] İlk denklem doğrudan \(\hat\mu = \bar X\) verir. Bunu ikincide yerine koyarsak \(\sigma^2 = M_2 - \bar X^2\) olur ve Önerme 9.1 ile \[ \hat\mu = \bar X, \qquad \hat\sigma^2 = M_2 - \bar X^2 = \frac{1}{n}\sum_{i=1}^{n}(X_i - \bar X)^2 \] elde edilir.

Dikkat: \(\hat\sigma^2\)’nin paydası \(n\)’dir; örneklem varyansı \(S^2\)’nin paydası ise \(n-1\)’dir. İkisi arasındaki farkın ne anlama geldiğini, yani \(\hat\sigma^2\)’nin \(\sigma^2\)’yi ortalamada biraz küçük tahmin ettiğini, Tahmin Edicilerin Özellikleri bölümünde göreceğiz. \(\blacksquare\)

Örnek 9.7 (Paket Ağırlıkları İçin Normal Model) Bir makinenin doldurduğu paketlerin ağırlığı (kg) normal dağılımlı kabul ediliyor. Rastgele seçilen 10 paketin ağırlıkları \[ 4{,}8;\ 5{,}2;\ 5{,}0;\ 4{,}6;\ 5{,}4;\ 5{,}1;\ 4{,}9;\ 5{,}3;\ 4{,}7;\ 5{,}0 \] olarak ölçülmüştür. \(\mu\) ve \(\sigma^2\) için momentler yöntemiyle elde edilen tahminleri bulunuz.

Çözüm

Normal kitle örneğinde (Örnek 9.6) bulduğumuz gibi \(\hat\mu = \bar X\) ve \(\hat\sigma^2 = M_2 - \bar X^2\)’dir.

Gözlemlerin toplamı \(50\) olduğundan \(\bar x = 50/10 = 5\)’tir. Gözlemlerin karelerinin toplamı \[ \begin{aligned} \sum x_i^2 &= 23{,}04 + 27{,}04 + 25 + 21{,}16 + 29{,}16\\ &\quad + 26{,}01 + 24{,}01 + 28{,}09 + 22{,}09 + 25 = 250{,}6 \end{aligned} \] olur; buradan \(m_2 = 250{,}6/10 = 25{,}06\) ve \[ \hat\mu = 5, \qquad \hat\sigma^2 = 25{,}06 - 5^2 = 0{,}06 \] bulunur. Sağlama olarak sapmalarla hesaplayalım. \(x_i - \bar x\) değerleri sırasıyla \[ \begin{aligned} &-0{,}2;\ \ 0{,}2;\ \ 0;\ \ -0{,}4;\ \ 0{,}4;\\[1mm] &\ \ \ 0{,}1;\ \ -0{,}1;\ \ 0{,}3;\ \ -0{,}3;\ \ 0 \end{aligned} \] olup kareleri toplamı \[ 0{,}04 + 0{,}04 + 0 + 0{,}16 + 0{,}16 + 0{,}01 + 0{,}01 + 0{,}09 + 0{,}09 + 0 = 0{,}60 \] olur; \(0{,}60/10 = 0{,}06\) aynı sonucu verir. Standart sapmanın tahmini \(\hat\sigma = \sqrt{0{,}06} \approx 0{,}245\) kg’dır. Karşılaştırma için örneklem varyansı \(s^2 = 0{,}60/9 \approx 0{,}0667\)’dir.

Tahmin edilen \(N(5;\ 0{,}06)\) modeli ve gözlemler aşağıda görülüyor.

μ = 5 σ ≈ 0,245 4,2 4,4 4,6 4,8 5,0 5,2 5,4 5,6 5,8 x 0,5 1,0 1,5 f(x) gözlemler
On paketin ağırlıkları (noktalar; 5,0 iki kez gözlendi) ve momentler yöntemiyle kurulan N(5; 0,06) yoğunluğu. Taralı şerit μ̂ ± σ̂ aralığıdır.

\(\blacksquare\)

Örnek 9.8 (Poisson Parametresi İçin İki Tahmin Edici) \(\lambda > 0\) parametreli bir Poisson kitlesinden \(X_1, X_2, \ldots, X_n\) rastgele örneklemi alınsın. \(\lambda\) parametresinin momentler yöntemiyle iki farklı tahmin edicisini elde ediniz.

Çözüm

Poisson dağılımının momentlerine göre (Teorem 3.2) \(E(X) = \lambda\) ve \(\operatorname{Var}(X) = \lambda\)’dır. Ortalama ile varyansın aynı parametreye eşit olması, iki ayrı denklem kurmamıza izin verir.

Birinci yol (birinci moment). \(E(X) = \lambda\)’yı \(\bar X\)’e eşitlersek \[ \hat\lambda_1 = \bar X \] bulunur.

İkinci yol (varyans). Varyans hesap formülünden \(E(X^2) = \operatorname{Var}(X) + \big(E(X)\big)^2\), yani \(E(X^2) = \lambda + \lambda^2\)’dir. Buradan \(\operatorname{Var}(X) = E(X^2) - \big(E(X)\big)^2 = \lambda\) olur. Birinci moment yerine bu varyans denklemini kullanalım: kitle varyansı \(\lambda\)’yı örneklemin (paydası \(n\) olan) varyansına eşitleriz. Önerme 9.1 ile \[ \hat\lambda_2 = M_2 - \bar X^2 = \frac{1}{n}\sum_{i=1}^{n}(X_i - \bar X)^2 \] elde edilir.

İki tahmin edici genellikle farklı değerler verir: \(\hat\lambda_1\) verinin merkezine, \(\hat\lambda_2\) yayılımına bakar. Yalnız ikinci momenti kullanıp \(M_2 = \lambda + \lambda^2\) ikinci derece denklemini \(\lambda > 0\) için çözmek de üçüncü bir tahmin edici verir: \[ \hat\lambda_3 = \frac{\sqrt{1 + 4M_2} - 1}{2}. \] \(\blacksquare\)

Örnek 9.9 (Çağrı Sayıları İçin Poisson Tahminleri) Bir çağrı merkezine gelen çağrı sayısı Poisson dağılımlı kabul ediliyor. Rastgele seçilen 20 dakikada gelen çağrı sayılarının dağılımı aşağıdaki gibidir.

Çağrı sayısı \(k\) 0 1 2 3 4
Dakika sayısı 3 5 6 4 2

\(\lambda\) için \(\hat\lambda_1 = \bar X\) ve \(\hat\lambda_2 = M_2 - \bar X^2\) tahminlerini hesaplayınız.

Çözüm

Toplam gözlem sayısı \(n = 3 + 5 + 6 + 4 + 2 = 20\)’dir. Toplamları frekanslarla ağırlıklandırarak hesaplayalım: \[ \begin{aligned} \sum x_i &= 0 \cdot 3 + 1 \cdot 5 + 2 \cdot 6 + 3 \cdot 4 + 4 \cdot 2 = 37,\\[1mm] \sum x_i^2 &= 0 \cdot 3 + 1 \cdot 5 + 4 \cdot 6 + 9 \cdot 4 + 16 \cdot 2 = 97 . \end{aligned} \] Buradan \(\bar x = 37/20 = 1{,}85\) ve \(m_2 = 97/20 = 4{,}85\) olur. Tahminler \[ \begin{aligned} \hat\lambda_1 &= \bar x = 1{,}85,\\[1mm] \hat\lambda_2 &= m_2 - \bar x^2 = 4{,}85 - 3{,}4225 = 1{,}4275 \end{aligned} \] bulunur. Aynı veri ve aynı yöntem, hangi momentin kullanıldığına göre farklı sayılar vermiştir. (Üçüncü tahmin edici de \(\hat\lambda_3 = \big(\sqrt{1 + 19{,}4} - 1\big)/2 \approx 1{,}758\) verir.)

Şekil iki modelin veriyle nasıl karşılaştığını gösteriyor: \(\hat\lambda_1\) ile kurulan model gözlenen oranlara daha yakın durur. Bu veride varyans ortalamadan küçüktür; Poisson modelinde ise ikisi eşit olmalıydı. Farkın ne kadarının rastlantıdan geldiği sorusu hipotez testlerinin konusudur.

0 1 2 3 4 5 6 k 0,1 0,2 0,3 0,4 oran / olasılık gözlenen oran Poisson(1,85) Poisson(1,4275)
Yirmi dakikada gözlenen çağrı sayılarının oranları ile iki moment tahmininden kurulan Poisson olasılıkları. Ortalamadan gelen λ̂₁ = 1,85 ile varyanstan gelen λ̂₂ = 1,4275 farklı modeller verir.

\(\blacksquare\)

Örnek 9.10 (Gamma Dağılımının İki Parametresi) Olasılık yoğunluk fonksiyonu \[ f(x) = \frac{\alpha}{\Gamma(r)}(\alpha x)^{r-1}e^{-\alpha x}, \qquad x > 0,\ \alpha > 0,\ r > 0 \] olan \(\operatorname{Gamma}(r,\alpha)\) dağılımlı bir kitleden \(n\) büyüklüğünde bir rastgele örneklem alınıyor. \(r\) ve \(\alpha\) parametrelerinin tahmin edicilerini momentler yöntemiyle bulunuz.

Çözüm

İki parametre olduğu için ilk iki moment gerekir. Gamma dağılımının momentlerinden (Teorem 4.2) \[ E(X) = \frac{r}{\alpha}, \qquad \operatorname{Var}(X) = \frac{r}{\alpha^2} \] olduğunu biliyoruz; buradan \[ E(X^2) = \operatorname{Var}(X) + \big(E(X)\big)^2 = \frac{r}{\alpha^2} + \frac{r^2}{\alpha^2} = \frac{r(r+1)}{\alpha^2} \] bulunur.

Eşitleme ve çözüm. Denklemler \[ \bar X = \frac{r}{\alpha}, \qquad M_2 = \frac{r(r+1)}{\alpha^2} = \frac{r^2}{\alpha^2} + \frac{r}{\alpha^2} \] olur. Birinci denklemin karesi \(\bar X^2 = r^2/\alpha^2\) olduğundan ikinciden çıkarınca \[ M_2 - \bar X^2 = \frac{r}{\alpha^2} = \frac{r}{\alpha}\cdot\frac{1}{\alpha} = \frac{\bar X}{\alpha} \] kalır. Buradan önce \(\alpha\), sonra \(r = \alpha\bar X\) bulunur: \[ \hat\alpha = \frac{\bar X}{M_2 - \bar X^2}, \qquad \hat r = \frac{\bar X^2}{M_2 - \bar X^2}. \] Önerme 9.1 gereği payda \(\frac{1}{n}\sum (X_i - \bar X)^2\)’dir; gözlemlerin hepsi eşit olmadıkça pozitiftir, dolayısıyla iki tahmin de pozitif çıkar. \(\blacksquare\)

9.5 Yöntemin Bir Zayıflığı

Momentler yöntemi hesap açısından çok rahattır, ama bulduğu tahmin her zaman veriyle uyumlu olmayabilir. Bunu, değer kümesi parametreye bağlı olan bir dağılımda görelim.

Örnek 9.11 (Üçgen Yoğunluğun Uç Noktası) Olasılık yoğunluk fonksiyonu \[ f(x;\theta) = \frac{2(\theta - x)}{\theta^2}, \qquad 0 < x < \theta \] olan bir kitleden alınmış \(n\) hacimli bir örneklem yardımıyla \(\theta\) parametresinin tahmin edicisini momentler yöntemiyle bulunuz.

Çözüm

Tek parametre vardır; birinci momenti hesaplayalım: \[ \begin{aligned} E(X) &= \int_0^\theta x\,\frac{2(\theta - x)}{\theta^2}\,dx = \frac{2}{\theta^2}\int_0^\theta \left(\theta x - x^2\right)dx\\[1mm] &= \frac{2}{\theta^2}\left(\frac{\theta^3}{2} - \frac{\theta^3}{3}\right) = \frac{2}{\theta^2}\cdot\frac{\theta^3}{6} = \frac{\theta}{3}. \end{aligned} \] Bu sonuç sezgiyle de uyumludur: yoğunluğun grafiği köşeleri \((0,\,2/\theta)\), \((0,0)\) ve \((\theta,0)\) olan bir üçgendir ve bir üçgenin ağırlık merkezinin apsisi köşelerin apsislerinin ortalaması \((0 + 0 + \theta)/3\)’tür.

\(\bar X = \theta/3\) denklemi \[ \hat\theta = 3\bar X \] tahmin edicisini verir. \(\blacksquare\)

Örnek 9.12 (Veriyle Çelişen Bir Moment Tahmini) Üçgen yoğunluklu kitleden (Örnek 9.11) \(n = 6\) gözlem alınmış ve \(0{,}2;\ 0{,}1;\ 0{,}4;\ 0{,}3;\ 0{,}2;\ 1{,}6\) değerleri gözlenmiştir. \(\hat\theta = 3\bar X\) tahminini hesaplayıp veriyle karşılaştırınız.

Çözüm

Gözlemlerin toplamı \(2{,}8\) olduğundan \[ \bar x = \frac{2{,}8}{6} = \frac{7}{15}, \qquad \hat\theta = 3 \cdot \frac{7}{15} = \frac{7}{5} = 1{,}4 \] bulunur. Oysa \(\theta = 1{,}4\) olsaydı yoğunluk \(x \ge 1{,}4\) için sıfır olurdu; yani \(1{,}4\)’ten büyük bir gözlem imkânsız olurdu. Hâlbuki gözlemlerden biri \(1{,}6\)’dır. Başka bir deyişle, momentler yöntemi tam da gözlediğimiz veriyi üretemeyecek bir model önermiştir. Veriyle uyumlu her \(\theta\) en büyük gözlemden büyük, yani \(\theta > 1{,}6\) olmalıdır.

θ = 1,4 gözlem 1,6 f(x) = 2(1,4 − x)/1,96 1,0 1,5 x = 7/15 0,5 1,0 1,5 f(x)
θ̂ = 3x̄ = 1,4 ile kurulan üçgen yoğunluk 1,4'ün sağında sıfırdır; oysa gözlemlerden biri 1,6'dır. Moment tahmini, verinin kendisiyle çelişen bir model üretebilir.

Bunun nedeni, momentler yönteminin veriyi yalnızca \(\bar X\) gibi özetler üzerinden görmesidir; \(\bar X\) en büyük gözlemin parametre hakkında taşıdığı bilgiyi kullanmaz. \(\blacksquare\)

Momentler yöntemi kolaydır ve çoğu zaman makul tahminler verir; ama tahmin edici tek değildir ve son örnekte gördüğümüz gibi veriyle çelişebilir. Bir sonraki bölümde parametreyi “gözlenen veriyi en olası kılan değer” olarak seçen ve bu sorunları büyük ölçüde gideren yöntemi inceleyeceğiz: En Çok Olabilirlik Yöntemi.