10 En Çok Olabilirlik Yöntemi
Momentler yöntemi kitle momentlerini örneklem momentlerine eşitleyerek tahmin edici üretiyordu. Bu bölümde soruyu tersinden soruyoruz: Elimizde belirli gözlemler var; parametrenin hangi değeri tam da bu gözlemleri en olası kılar? Bu sorunun cevabı en çok olabilirlik (maksimum olabilirlik, İng. maximum likelihood) yöntemidir ve istatistikte en yaygın kullanılan tahmin yöntemidir.
10.1 Olabilirlik Fonksiyonu
Yöntemin temel nesnesi, örneklemin ortak olasılık (yoğunluk) fonksiyonunun parametreye bağlı bir fonksiyon olarak okunmasıdır.
Bir kitle üzerinde tanımlı \(X\) rastgele değişkeninin dağılımı \(f(x;\theta)\), \(x \in D_X\), \(\theta \in \Theta\) olasılık (yoğunluk) fonksiyonuyla verilsin; \(\Theta\) parametrenin alabileceği değerlerin kümesidir (parametre uzayı). Bu kitleden alınan \(X_1, X_2, \dots, X_n\) rastgele örneklemi bağımsızdır ve her \(X_i\)’nin olasılık (yoğunluk) fonksiyonu \(f(x_i;\theta)\)’dır. Bağımsızlık yüzünden ortak olasılık (yoğunluk) fonksiyonu bu fonksiyonların çarpımıdır.
Tanım 10.1 (Olabilirlik Fonksiyonu) \(X_1, X_2, \dots, X_n\), \(f(x;\theta)\) (\(\theta \in \Theta\)) dağılımından alınmış bir rastgele örneklem ve \(x_1, x_2, \dots, x_n\) gözlenen değerler olsun. \[ \begin{aligned} L(\theta) = L(x_1, \dots, x_n;\theta) &= f(x_1;\theta)\, f(x_2;\theta) \cdots f(x_n;\theta)\\[1mm] &= \prod_{i=1}^{n} f(x_i;\theta), \qquad \theta \in \Theta \end{aligned} \] fonksiyonuna, gözlemler sabit tutulup \(\theta\)’nın bir fonksiyonu olarak düşünüldüğünde, olabilirlik fonksiyonu denir.
Yani formül örneklemin ortak olasılık (yoğunluk) fonksiyonunun ta kendisidir; değişen yalnız bakış açısıdır. Ortak olasılık fonksiyonunda \(\theta\) sabittir ve \(x\)’ler değişir. Olabilirlikte ise veri elimizdedir, yani \(x\)’ler sabittir, değişen \(\theta\)’dır. Kesikli bir kitlede \(L(\theta)\), “parametre \(\theta\) iken tam da bu gözlemlerin çıkma olasılığı” demektir. Sürekli bir kitlede \(L(\theta)\) bir olasılık değil yoğunluktur, ama yorum aynıdır: \(L(\theta)\) ne kadar büyükse gözlenen veri \(\theta\) altında o kadar “beklenen” bir sonuçtur.
Örnek 10.1 (Aynı Formül, İki Bakış) \(X\), \(\lambda\) parametreli Poisson dağılımına sahip olsun. Tek bir gözlem yapılıyor ve \(x = 2\) bulunuyor. Olabilirlik fonksiyonunu yazınız ve onu en büyük yapan \(\lambda\) değerini bulunuz.
Çözüm
Poisson olasılık fonksiyonu (Olasılık Teorisi’ndeki tanım) \[ f(x;\lambda) = \frac{e^{-\lambda}\lambda^{x}}{x!}, \qquad x = 0, 1, 2, \dots, \quad \lambda \in \Theta = (0, \infty) \] biçimindedir. \(\lambda\) sabitken bu, \(x\)’in bir fonksiyonudur: her \(x\) için \(f(x;\lambda) \ge 0\) ve \(\sum_{x} f(x;\lambda) = 1\). Şimdi ise \(x = 2\) sabit, \(\lambda\) değişken: \[ L(\lambda) = f(2;\lambda) = \frac{\lambda^{2} e^{-\lambda}}{2}, \qquad \lambda > 0 . \] Çarpım kuralıyla türev alalım: \[ L'(\lambda) = \frac{2\lambda e^{-\lambda} - \lambda^2 e^{-\lambda}}{2} = \frac{\lambda(2 - \lambda)\,e^{-\lambda}}{2}. \] \(\lambda > 0\) ve \(e^{-\lambda} > 0\) olduğundan türevin işareti \(2 - \lambda\)’nın işaretidir: \((0, 2)\) aralığında \(L\) artar, \((2, \infty)\) aralığında azalır. O hâlde \(L\) en büyük değerini \(\lambda = 2\)’de alır: \[ L(2) = \frac{4e^{-2}}{2} = 2e^{-2} \approx 0{,}2707 . \] Karşılaştırma için \(L(1) = e^{-1}/2 \approx 0{,}1839\) ve \(L(4) = 8e^{-4} \approx 0{,}1465\). Yani tek gözlem \(2\) iken, bu sonucu en olası kılan parametre değeri \(\lambda = 2\)’dir.
Aşağıdaki şekil aynı formülün iki okunuşunu yan yana koyuyor. Solda \(\lambda = 2\) için \(x\)’e göre olasılıklar, sağda \(x = 2\) için \(\lambda\)’ya göre olabilirlik var; iki grafiğin ortak noktası \(f(2;2) = L(2)\)’dir.
\(\blacksquare\)
Olabilirlik fonksiyonu \(\theta\)’ya göre bir olasılık dağılımı değildir; \(\theta\) üzerinden toplamı ya da integrali \(1\) olmak zorunda değildir. Örneğin Bernoulli dağılımında tek gözlem \(x = 1\) ise \(L(p) = p\) olur ve \(\int_0^1 p\,dp = \tfrac12\) çıkar. Bu yüzden \(L(\theta)\) için “olasılık” değil “olabilirlik” deriz.
10.2 En Çok Olabilirlik Tahmin Edicisi
Olabilirliği en büyük yapan parametre değeri, gözlenen veriyi en iyi açıklayan değerdir. Yöntem bu değeri tahmin olarak seçer.
Tanım 10.2 (En Çok Olabilirlik Tahmin Edicisi) Her gözlem kümesi \((x_1, x_2, \dots, x_n)\) için \(L(\theta)\) olabilirlik fonksiyonunu \(\Theta\) üzerinde en büyük yapan değer \(\hat\theta(x_1, x_2, \dots, x_n)\) olsun: \[ L\big(\hat\theta\big) = \max_{\theta \in \Theta} L(\theta). \] Gözlemlerin yerine rastgele değişkenler konarak elde edilen \(\hat\theta = \hat\theta(X_1, X_2, \dots, X_n)\) istatistiğine \(\theta\) parametresinin en çok olabilirlik tahmin edicisi denir. Gözlenen değerlerden hesaplanan \(\hat\theta(x_1, \dots, x_n)\) sayısına da en çok olabilirlik tahmini denir.
Yani parametrenin alabileceği bütün değerler arasından, elimizdeki veriyi en yüksek olasılıkla (yoğunlukla) üreten değeri seçiyoruz. İngilizce kaynaklarda bu tahmin ediciye maximum likelihood estimator (kısaca MLE) denir. Tahmin edici ile tahmin arasındaki fark, momentler yönteminde gördüğümüzle aynıdır (Tanım 9.2): tahmin edici bir rastgele değişkendir, tahmin ise onun gözlenen bir değeridir.
Olabilirlik Denklemi
\(L\) türevlenebilir ve en büyük değerini \(\Theta\)’nın bir iç noktasında alıyorsa, o noktada türevi sıfırdır. Bu, tahmin ediciyi bulmanın olağan yoludur.
Tanım 10.3 (Olabilirlik Denklemi) \(L(\theta)\) türevlenebilir olsun. \[ \frac{dL(\theta)}{d\theta} = 0 \] denklemine olabilirlik denklemi denir. Bu denklemin bir \(\hat\theta\) çözümü için \[ \frac{d^2 L(\theta)}{d\theta^2}\bigg|_{\theta = \hat\theta} < 0 \] ise \(\hat\theta\), \(L\)’nin bir yerel en büyük noktasıdır; en çok olabilirlik tahmini bu tür çözümler arasında aranır.
Yani birinci türevin sıfır olduğu yer bir tepe adayıdır; ikinci türevin negatif olması eğrinin orada aşağı doğru büküldüğünü, dolayısıyla adayın gerçekten bir tepe olduğunu söyler. Yine de iki noktaya dikkat etmek gerekir. Birincisi, yerel bir tepe her zaman en yüksek tepe değildir; bu yüzden örneklerde bulduğumuz noktanın mutlak en büyük olduğunu da gerekçelendireceğiz. İkincisi, en büyük değer türevin sıfır olmadığı bir yerde de alınabilir (Örnek 10.15).
Olasılık (yoğunluk) fonksiyonları çoğu zaman üstel ifadeler ve çarpımlar içerir. Bu yüzden \(L(\theta)\) yerine \(\ln L(\theta)\)’yı en büyük yapmak çok daha kullanışlıdır: logaritma çarpımı toplama, üssü çarpana çevirir. Aşağıdaki önerme bunun sonucu değiştirmediğini söylüyor.
Önerme 10.1 (Log-Olabilirlik Aynı Noktada En Büyüktür) \(L(\theta) > 0\) olan \(\theta\) değerlerinde \(\ln L(\theta)\) tanımlı olsun. \(L\) ile \(\ln L\) en büyük değerlerini aynı noktalarda alır. Ayrıca \(L\) türevlenebilirse \[ \frac{d}{d\theta}\ln L(\theta) = \frac{L'(\theta)}{L(\theta)}, \] dolayısıyla \(L(\theta) > 0\) olan \(\theta\) değerleri üzerinde olabilirlik denklemi ile \(\dfrac{d}{d\theta}\ln L(\theta) = 0\) denklemi aynı çözümlere sahiptir.
İspat
\(\ln\) fonksiyonu \((0, \infty)\) üzerinde kesin artandır. Bu yüzden \(L(\theta_1), L(\theta_2) > 0\) için \[ L(\theta_1) \le L(\theta_2) \iff \ln L(\theta_1) \le \ln L(\theta_2). \] \(L\)’nin en büyük değeri pozitiftir (gözlenen veri hiçbir \(\theta\) altında imkânsız olsaydı veri gözlenemezdi); \(L(\theta) = 0\) olan noktalar zaten en büyük değer adayı değildir. Şimdi \(\hat\theta\) noktası \(L\)’yi en büyük yapsın. Her \(\theta\) için \(L(\theta) \le L(\hat\theta)\) olduğundan yukarıdaki denklik \(\ln L(\theta) \le \ln L(\hat\theta)\) verir; yani \(\hat\theta\), \(\ln L\)’yi de en büyük yapar. Aynı akıl yürütme ters yönde de işler.
Türev için zincir kuralını uygularız: \((\ln u)' = u'/u\) olduğundan \(\dfrac{d}{d\theta}\ln L(\theta) = L'(\theta)/L(\theta)\). Payda pozitif olduğundan bu kesir ancak \(L'(\theta) = 0\) iken sıfırdır. \(\blacksquare\)
- Olabilirliği yazıp sadeleştirin: \(L(\theta) = \prod_{i=1}^{n} f(x_i;\theta)\).
- Logaritmasını alıp toplam olarak yazın: \(\ln L(\theta) = \sum_{i=1}^{n} \ln f(x_i;\theta)\).
- \(\dfrac{d}{d\theta}\ln L(\theta) = 0\) denklemini \(\theta\) için çözün.
- Bulunan noktanın en büyük değer olduğunu gösterin (ikinci türevin negatifliği ya da birinci türevin işaret değişimi), sonra \(x_i\)’lerin yerine \(X_i\) yazarak tahmin ediciye geçin.
10.3 Tek Parametreli Örnekler
Dört adımı önce en sık karşılaşılan iki kesikli dağılıma uygulayalım.
Örnek 10.2 (Poisson Dağılımında λ) \(\operatorname{Poisson}(\lambda)\) dağılımına sahip bir kitleden alınmış \(n\) birimlik bir rastgele örnekleme dayanarak \(\lambda\) parametresinin en çok olabilirlik tahmin edicisini bulunuz.
Çözüm
Olabilirlik. Poisson olasılık fonksiyonu \[ f(x;\lambda) = \frac{e^{-\lambda}\lambda^{x}}{x!}, \qquad x = 0, 1, 2, \dots, \quad \lambda \in (0, \infty) \] olduğundan \(X_1, \dots, X_n\)’nin ortak olasılık fonksiyonu \[ \begin{aligned} L(\lambda) &= f(x_1;\lambda)\, f(x_2;\lambda) \cdots f(x_n;\lambda)\\[1mm] &= \frac{e^{-\lambda}\lambda^{x_1}}{x_1!} \cdot \frac{e^{-\lambda}\lambda^{x_2}}{x_2!} \cdots \frac{e^{-\lambda}\lambda^{x_n}}{x_n!} = \frac{e^{-n\lambda}\,\lambda^{\sum_{i=1}^{n} x_i}}{x_1!\,x_2! \cdots x_n!} \end{aligned} \] olur: \(n\) tane \(e^{-\lambda}\) çarpanı \(e^{-n\lambda}\) verir, \(\lambda\)’nın üsleri toplanır.
Logaritma. Tek bir çarpanın logaritması \[ \ln \frac{e^{-\lambda}\lambda^{x_i}}{x_i!} = -\lambda + x_i \ln\lambda - \ln(x_i!) \] olduğundan, bunları \(i = 1, \dots, n\) için toplarsak \[ \ln L(\lambda) = -n\lambda + \Big(\sum_{i=1}^{n} x_i\Big)\ln\lambda - \ln\big(x_1!\,x_2! \cdots x_n!\big). \]
Türev. Son terim \(\lambda\)’ya bağlı değildir, türevi sıfırdır: \[ \frac{d}{d\lambda}\ln L(\lambda) = -n + \frac{\sum_{i=1}^{n} x_i}{\lambda} = 0 \quad\Longrightarrow\quad \lambda = \frac{1}{n}\sum_{i=1}^{n} x_i = \bar x . \]
En büyük değer. Gözlemlerden en az biri pozitifse (\(\sum x_i > 0\)) \[ \frac{d^2}{d\lambda^2}\ln L(\lambda) = -\frac{\sum_{i=1}^{n} x_i}{\lambda^2} < 0 \] olur; \(\lambda = \bar x\) noktasında değeri \(-n\bar x/\bar x^{\,2} = -n/\bar x\)’tir. İkinci türev her yerde negatif olduğundan birinci türev azalandır; \(\bar x\)’ten önce pozitif, sonra negatiftir. Yani \(\bar x\) yalnız yerel değil, mutlak en büyük noktadır. (Bütün gözlemler \(0\) ise \(L(\lambda) = e^{-n\lambda}\) azalan olur ve en büyük değerine \(\Theta\) içinde ulaşmaz; formül yine sınır değeri \(\bar x = 0\)’ı verir.)
Gözlemlerin yerine rastgele değişkenleri koyarsak \[ \hat\lambda = \hat\lambda(X_1, X_2, \dots, X_n) = \frac{1}{n}\sum_{i=1}^{n} X_i = \bar X . \] Örneklem ortalaması \(\bar X\), \(\lambda\)’nın en çok olabilirlik tahmin edicisidir. \(E(X) = \lambda\) olduğundan momentler yöntemi de birinci momentten aynı tahmin ediciyi verir (Örnek 9.8). \(\blacksquare\)
Örnek 10.3 (Santrale Gelen Çağrılar) Bir telefon santraline bir dakikada gelen çağrı sayısı \(\operatorname{Poisson}(\lambda)\) dağılımlıdır. Rastgele seçilen altı dakikada sırasıyla \(2, 4, 3, 1, 5, 3\) çağrı gelmiştir. \(\lambda\)’nın en çok olabilirlik tahminini bulunuz.
Çözüm
Genel sonuca göre (Örnek 10.2) tahmin, örneklem ortalamasıdır: \[ \sum_{i=1}^{6} x_i = 2 + 4 + 3 + 1 + 5 + 3 = 18, \qquad \hat\lambda = \bar x = \frac{18}{6} = 3 . \] Sonucu olabilirlik üzerinden de görelim. \[ 2!\,4!\,3!\,1!\,5!\,3! = 2 \cdot 24 \cdot 6 \cdot 1 \cdot 120 \cdot 6 = 207\,360 \] olduğundan \[ \ln L(\lambda) = -6\lambda + 18\ln\lambda - \ln 207\,360 . \] Birkaç değer: \(\ln L(2) \approx -11{,}766\), \(\ln L(3) \approx -10{,}467\), \(\ln L(4) \approx -11{,}289\). İkinci türev \(-18/\lambda^2\), \(\lambda = 3\)’te \(-2\)’dir. Olabilirliğin kendisi çok küçüktür: \(L(3) = e^{-10{,}467} \approx 2{,}85 \cdot 10^{-5}\). Bu, \(\ln L\) ile çalışmanın pratik bir nedenidir; çok sayıda küçük olasılığın çarpımı hızla sıfıra yaklaşır, logaritmaları ise rahatça toplanır.
Yani bu altı dakikaya bakarak santrale dakikada ortalama \(3\) çağrı geldiğini tahmin ederiz. \(\blacksquare\)
Örnek 10.4 (Bernoulli Dağılımında p) \(\operatorname{Bernoulli}(p)\) dağılımına sahip bir kitleden alınmış \(n\) birimlik bir rastgele örnekleme dayanarak \(p\) parametresinin en çok olabilirlik tahmin edicisini bulunuz.
Çözüm
Olabilirlik. Bernoulli olasılık fonksiyonu (Olasılık Teorisi’ndeki tanım) \(f(x;p) = p^{x}(1 - p)^{1 - x}\), \(x \in \{0, 1\}\), \(0 < p < 1\) biçimindedir. Buna göre \[ \begin{aligned} L(p) &= p^{x_1}(1 - p)^{1 - x_1} \cdot p^{x_2}(1 - p)^{1 - x_2} \cdots p^{x_n}(1 - p)^{1 - x_n}\\[1mm] &= p^{\sum_{i=1}^{n} x_i}\,(1 - p)^{\,n - \sum_{i=1}^{n} x_i}. \end{aligned} \] \(\sum x_i\), örneklemdeki başarı (1) sayısıdır; kısaca \(\sum x_i = n\bar x\) yazalım.
Logaritma ve türev. \[ \ln L(p) = n\bar x \ln p + n(1 - \bar x)\ln(1 - p), \] \[ \frac{d}{dp}\ln L(p) = \frac{n\bar x}{p} - \frac{n(1 - \bar x)}{1 - p} = 0 . \] Buradan \(\dfrac{n\bar x}{p} = \dfrac{n(1 - \bar x)}{1 - p}\), yani \(\bar x(1 - p) = p(1 - \bar x)\) bulunur. Parantezleri açınca \(\bar x - \bar x p = p - \bar x p\), dolayısıyla \(p = \bar x\).
En büyük değer. \(0 < \bar x < 1\) iken \[ \frac{d^2}{dp^2}\ln L(p) = -\frac{n\bar x}{p^2} - \frac{n(1 - \bar x)}{(1 - p)^2} < 0 \] her \(p\) için doğrudur. Birinci türev azalan olduğundan \(p = \bar x\) mutlak en büyük noktadır. (Bütün gözlemler \(0\) ya da hepsi \(1\) ise \(L(p) = (1 - p)^n\) ya da \(L(p) = p^n\) tekdüzedir ve en büyük değerine \(\Theta\) içinde ulaşmaz; formül yine sınır değeri \(p = \bar x\)’i verir.)
Sonuç olarak \[ \hat p = \frac{1}{n}\sum_{i=1}^{n} X_i = \bar X , \] yani başarı olasılığının tahmini örneklemdeki başarı oranıdır. \(E(X) = p\) olduğundan momentler yöntemi de aynı tahmin ediciyi verir. \(\blacksquare\)
Örnek 10.5 (Beş Denemede Üç Başarı) Bir \(\operatorname{Bernoulli}(p)\) deneyi beş kez bağımsız olarak tekrarlanıyor ve \((0, 1, 0, 1, 1)\) sonuçları gözleniyor. \(p\)’nin en çok olabilirlik tahminini bulunuz.
Çözüm
Üç başarı olduğundan \(\sum x_i = 3\) ve olabilirlik \[ L(p) = p^{3}(1 - p)^{2}, \qquad 0 < p < 1 . \] Genel sonuca göre (Örnek 10.4) tahmin başarı oranıdır: \(\hat p = \bar x = \dfrac{3}{5} = 0{,}6\). Olabilirliği birkaç noktada hesaplayarak bunu doğrulayalım: \[ L(0{,}2) = 0{,}00512, \quad L(0{,}5) = 0{,}03125, \quad L(0{,}6) = 0{,}03456, \quad L(0{,}8) = 0{,}02048 . \] En büyük değer \(p = 0{,}6\)’dadır.
Yani beş denemenin üçü başarılıysa, bu sonucu en olası kılan başarı olasılığı \(3/5\)’tir. \(\blacksquare\)
10.4 Değişmezlik Özelliği
Çoğu zaman parametrenin kendisi değil, ondan hesaplanan bir büyüklük istenir: \(\sigma^2\) yerine \(\sigma\), \(p\) yerine \(P(X = 0) = 1 - p\) gibi. En çok olabilirlik yönteminde bunun için her şeyi baştan yapmak gerekmez.
Teorem 10.1 (Değişmezlik Özelliği) \(\hat\theta\), \(\theta\) parametresinin en çok olabilirlik tahmin edicisi ve \(g\), \(\Theta\) üzerinde tanımlı bire bir bir fonksiyon olsun. Bu durumda \(g(\hat\theta)\), \(\eta = g(\theta)\) parametre fonksiyonunun en çok olabilirlik tahmin edicisidir.
\(g\) bire bir değilse, \(\eta\)’nın olabilirliği \(L^*(\eta) = \sup\{L(\theta) : g(\theta) = \eta\}\) ile tanımlanır ve sonuç yine geçerlidir.
İspat
Bire bir \(g\). Modeli \(\theta\) yerine \(\eta = g(\theta)\) ile yazalım. \(g\) bire bir olduğundan her \(\eta \in g(\Theta)\) için tek bir \(\theta = g^{-1}(\eta)\) vardır ve olasılık (yoğunluk) fonksiyonu \(f\big(x; g^{-1}(\eta)\big)\) olur. Dolayısıyla \(\eta\)’ya göre olabilirlik \[ L^*(\eta) = L\big(g^{-1}(\eta)\big), \qquad \eta \in g(\Theta). \] \(\hat\theta\), \(L\)’yi en büyük yaptığından her \(\eta\) için \[ L^*(\eta) = L\big(g^{-1}(\eta)\big) \le L(\hat\theta) = L^*\big(g(\hat\theta)\big). \] Yani \(L^*\) en büyük değerini \(\eta = g(\hat\theta)\)’da alır: \(\hat\eta = g(\hat\theta)\).
Genel \(g\). \(L^*\)’ın tanımında \(\theta = \hat\theta\) da \(g(\theta) = g(\hat\theta)\) koşulunu sağladığından \[ L^*\big(g(\hat\theta)\big) \ge L(\hat\theta). \] Öte yandan her \(\eta\) için \(L^*(\eta)\), bazı \(L(\theta)\) değerlerinin supremumudur ve bu değerlerin hepsi \(L(\hat\theta)\)’dan küçük ya da ona eşittir; bu yüzden \(L^*(\eta) \le L(\hat\theta)\). İki eşitsizlik birlikte her \(\eta\) için \(L^*(\eta) \le L^*\big(g(\hat\theta)\big)\) verir, yani \(g(\hat\theta)\), \(L^*\)’ı en büyük yapar. \(\blacksquare\)
Yani en çok olabilirlik tahmini, parametreyi nasıl adlandırdığımıza bağlı değildir. \(\sigma^2\)’nin tahmini \(\hat\sigma^2\) ise \(\sigma\)’nın tahmini \(\sqrt{\hat\sigma^2}\)’dir; \(p\)’nin tahmini \(\hat p\) ise \(1 - p\)’nin tahmini \(1 - \hat p\)’dir. Bu kullanışlı özelliği her tahmin edici taşımaz; sonraki bölümde yansızlığın böyle bir dönüşümle korunmadığını göreceğiz.
Örnek 10.6 (Başarısızlık Olasılığının Tahmini) Bir \(\operatorname{Bernoulli}(p)\) deneyinin beş tekrarında \((0, 1, 0, 1, 1)\) değerleri gözleniyor. \(P(X = 0)\) olasılığının en çok olabilirlik tahminini bulunuz.
Çözüm
Önce \(p\)’yi tahmin edelim. Beş denemede üç başarı örneğinde (Örnek 10.5) bulduğumuz gibi \(\hat p = \bar x = 3/5\).
\(P(X = 0) = 1 - p\)’dir. \(g(p) = 1 - p\) fonksiyonu bire birdir, bu yüzden değişmezlik özelliğine (Teorem 10.1) göre \[ \widehat{P(X = 0)} = g(\hat p) = 1 - \frac{3}{5} = \frac{2}{5} . \] Yani tahmin edilen dağılım \(\operatorname{Bernoulli}(3/5)\)’tir ve bu dağılımda \(0\) gelme olasılığı \(2/5\)’tir. \(\blacksquare\)
10.5 Birden Çok Parametre
Dağılım birden fazla bilinmeyen parametre içerdiğinde olabilirlik çok değişkenli bir fonksiyon olur ve tek türevin yerini kısmi türevler alır.
Tanım 10.4 (Olabilirlik Denklem Sistemi) \(X_1, X_2, \dots, X_n\) rastgele örneklemi \(f(x;\theta_1, \theta_2, \dots, \theta_k)\) gibi \(k\) parametreli bir dağılımdan alınmış olsun ve \[ L(\theta_1, \dots, \theta_k) = \prod_{i=1}^{n} f(x_i;\theta_1, \dots, \theta_k) \] olabilirlik fonksiyonu olsun. \(L\)’yi en büyük yapan \((\hat\theta_1, \dots, \hat\theta_k)\) değerlerine \(\theta_1, \dots, \theta_k\)’nın en çok olabilirlik tahmin edicileri denir. \(L\) türevlenebilir ve en büyük değer iç bir noktada alınıyorsa bu değerler \[ \frac{\partial L}{\partial \theta_1} = 0, \quad \frac{\partial L}{\partial \theta_2} = 0, \quad \dots, \quad \frac{\partial L}{\partial \theta_k} = 0 \] ya da, log-olabilirlik önermesindeki (Önerme 10.1) nedenle eşdeğer olarak, \[ \frac{\partial \ln L}{\partial \theta_1} = 0, \quad \frac{\partial \ln L}{\partial \theta_2} = 0, \quad \dots, \quad \frac{\partial \ln L}{\partial \theta_k} = 0 \] olabilirlik denklem sisteminin çözümleri arasındadır.
Yani her parametreye göre ayrı ayrı türev alınır, diğer parametreler o an sabit sayılır ve \(k\) denklem birlikte çözülür.
Örnek 10.7 (Normal Dağılımda μ ve σ²) \(N(\mu, \sigma^2)\) dağılımından alınmış \(n\) birimlik bir rastgele örnekleme dayanarak \(\mu\) ve \(\sigma^2\) parametrelerinin en çok olabilirlik tahmin edicilerini bulunuz.
Çözüm
Olabilirlik. Normal yoğunluk \[ f(x;\mu, \sigma^2) = \frac{1}{\sqrt{2\pi\sigma^2}}\, e^{-\frac{(x - \mu)^2}{2\sigma^2}}, \qquad x \in \mathbb{R},\ \mu \in \mathbb{R},\ \sigma^2 > 0 . \] \(n\) yoğunluğun çarpımında \(n\) tane \(1/\sqrt{2\pi\sigma^2}\) çarpanı \((2\pi)^{-n/2}(\sigma^2)^{-n/2}\) verir, üsler toplanır: \[ \begin{aligned} L(\mu, \sigma^2) &= \prod_{i=1}^{n} \frac{1}{\sqrt{2\pi\sigma^2}}\, e^{-\frac{(x_i - \mu)^2}{2\sigma^2}}\\[1mm] &= \frac{1}{(2\pi)^{n/2}(\sigma^2)^{n/2}}\, \exp\Big(-\frac{1}{2\sigma^2}\sum_{i=1}^{n}(x_i - \mu)^2\Big). \end{aligned} \]
Logaritma. \[ \ln L(\mu, \sigma^2) = -\frac{n}{2}\ln(2\pi) - \frac{n}{2}\ln\sigma^2 - \frac{1}{2\sigma^2}\sum_{i=1}^{n}(x_i - \mu)^2 . \]
Birinci denklem (\(\mu\)’ye göre). \(\sigma^2\) sabit tutulur; \((x_i - \mu)^2\)’nin \(\mu\)’ye göre türevi \(-2(x_i - \mu)\)’dir: \[ \frac{\partial \ln L}{\partial \mu} = -\frac{1}{2\sigma^2}\sum_{i=1}^{n} 2(x_i - \mu)(-1) = \frac{1}{\sigma^2}\sum_{i=1}^{n}(x_i - \mu) = 0 . \] \(\sigma^2 > 0\) olduğundan \(\sum (x_i - \mu) = 0\), yani \(\sum x_i - n\mu = 0\) ve \(\mu = \bar x\).
İkinci denklem (\(\sigma^2\)’ye göre). Bu kez \(\mu\) sabit tutulur ve \(\sigma^2\) tek bir değişken gibi türetilir: \[ \frac{\partial \ln L}{\partial \sigma^2} = -\frac{n}{2\sigma^2} + \frac{1}{2\sigma^4}\sum_{i=1}^{n}(x_i - \mu)^2 = 0 . \] Her iki tarafı \(2\sigma^4\) ile çarparsak \(-n\sigma^2 + \sum (x_i - \mu)^2 = 0\), yani \(\sigma^2 = \frac{1}{n}\sum (x_i - \mu)^2\). Birinci denklemden gelen \(\mu = \bar x\)’i yerine koyarız.
En büyük değer. Çözümün gerçekten en büyük değer olduğunu iki adımda görelim; bütün gözlemlerin eşit olmadığını varsayıyoruz. Önce her \(\mu\) için \[ \sum_{i=1}^{n}(x_i - \mu)^2 = \sum_{i=1}^{n}(x_i - \bar x)^2 + n(\bar x - \mu)^2 \ \ge\ \sum_{i=1}^{n}(x_i - \bar x)^2 \] olur (sağdaki çapraz terim \(2(\bar x - \mu)\sum (x_i - \bar x) = 0\)’dır). Dolayısıyla her \(\sigma^2\) için \(\ln L(\mu, \sigma^2) \le \ln L(\bar x, \sigma^2)\). Sonra \(A = \sum (x_i - \bar x)^2 > 0\) ve \(v = \sigma^2\) yazıp \[ h(v) = \ln L(\bar x, v) = -\frac{n}{2}\ln(2\pi) - \frac{n}{2}\ln v - \frac{A}{2v} \] fonksiyonuna bakalım. \(h'(v) = -\dfrac{n}{2v} + \dfrac{A}{2v^2} = \dfrac{A - nv}{2v^2}\), \(v < A/n\) iken pozitif, \(v > A/n\) iken negatiftir. Yani \(h\) en büyük değerini \(v = A/n\)’de alır.
Sonuç olarak \[ \hat\mu = \bar X, \qquad \widehat{\sigma^2} = \frac{1}{n}\sum_{i=1}^{n}(X_i - \bar X)^2 . \] Momentler yöntemi de aynı iki tahmin ediciyi verir (Örnek 9.6). Dikkat: \(\widehat{\sigma^2}\)’nin paydası \(n\)’dir; örneklem varyansı \(S^2\)’nin paydası ise \(n - 1\)’dir, yani \(\widehat{\sigma^2} = \frac{n-1}{n}S^2\). Bu farkın ne anlama geldiğini sonraki bölümde yansızlık kavramıyla göreceğiz. \(\blacksquare\)
Örnek 10.8 (Normal Dağılımda σ) \(N(\mu, \sigma^2)\) dağılımından alınmış \(n\) birimlik bir rastgele örnekleme dayanarak standart sapma \(\sigma\)’nın en çok olabilirlik tahmin edicisini bulunuz.
Çözüm
İki parametreli normal örnekte (Örnek 10.7) \(\widehat{\sigma^2} = \frac{1}{n}\sum (X_i - \bar X)^2\). \((0, \infty)\) üzerinde \(g(v) = \sqrt{v}\) bire bir olduğundan değişmezlik özelliğine (Teorem 10.1) göre \[ \hat\sigma = \sqrt{\widehat{\sigma^2}} = \left[\frac{1}{n}\sum_{i=1}^{n}(X_i - \bar X)^2\right]^{1/2}. \] Aynı sonucu, modeli baştan \(\sigma\) ile yazarak da doğrulayabiliriz. \(\ln\sigma^2 = 2\ln\sigma\) olduğundan \[ \ln L(\mu, \sigma) = -\frac{n}{2}\ln(2\pi) - n\ln\sigma - \frac{1}{2\sigma^2}\sum_{i=1}^{n}(x_i - \mu)^2 , \] ve \(\sigma\)’ya göre türev \[ \frac{\partial \ln L}{\partial \sigma} = -\frac{n}{\sigma} + \frac{1}{\sigma^3}\sum_{i=1}^{n}(x_i - \mu)^2 = 0 \quad\Longrightarrow\quad \sigma^2 = \frac{1}{n}\sum_{i=1}^{n}(x_i - \mu)^2 . \] \(\mu = \bar x\) konunca yukarıdaki \(\hat\sigma\) çıkar; değişmezlik özelliğinin söylediği de budur. \(\blacksquare\)
Örnek 10.9 (Beş Ölçümden μ ve σ) Normal dağılımlı bir kitleden alınan beş ölçüm \(3, 5, 6, 7, 9\)’dur. \(\mu\), \(\sigma^2\) ve \(\sigma\)’nın en çok olabilirlik tahminlerini bulunuz.
Çözüm
Normal dağılım için bulduğumuz formülleri (Örnek 10.7, Örnek 10.8) uygulayalım. Ortalama \[ \hat\mu = \bar x = \frac{3 + 5 + 6 + 7 + 9}{5} = \frac{30}{5} = 6 . \] Ortalamadan sapmalar \(-3, -1, 0, 1, 3\); kareleri \(9, 1, 0, 1, 9\) ve toplamları \(20\)’dir. Buna göre \[ \widehat{\sigma^2} = \frac{20}{5} = 4, \qquad \hat\sigma = \sqrt{4} = 2 . \] Karşılaştırma için örneklem varyansı \(s^2 = 20/4 = 5\)’tir.
Tahmin edilen dağılım \(N(6, 4)\)’tür. Olabilirliğin anlamını görmek için onu iki başka adayla karşılaştıralım. \(n = 5\) için \[ \ln L(\mu, \sigma^2) = -\frac{5}{2}\ln(2\pi) - \frac{5}{2}\ln\sigma^2 - \frac{1}{2\sigma^2}\sum_{i=1}^{5}(x_i - \mu)^2 \] formülünden:
| Aday | \(\sum (x_i - \mu)^2\) | \(\ln L\) |
|---|---|---|
| \(N(6, 4)\) | \(20\) | \(\approx -10{,}560\) |
| \(N(6, 9)\) | \(20\) | \(\approx -11{,}199\) |
| \(N(4, 4)\) | \(40\) | \(\approx -13{,}060\) |
En büyük değer tahmin edilen dağılımdadır. Merkezi kaydırmak gözlemleri eğrinin kuyruğuna iter; eğriyi gereğinden fazla yaymak ise bütün yükseklikleri alçaltır.
\(\blacksquare\)
Örnek 10.10 (Ortalaması ile Varyansı Eşit Normal Dağılım) \((X_1, X_2, \dots, X_n)\), \(N(\theta, \theta)\) dağılımından alınmış bir örneklem olsun; yani ortalama da varyans da \(\theta\)’dır. \(\theta\) parametresinin en çok olabilirlik tahmin edicisini bulunuz.
Çözüm
Varyans pozitif olacağından \(\theta > 0\)’dır. Bu kez tek parametre vardır ama hem ortalamada hem varyansta görünür.
Olabilirlik ve logaritma. İki parametreli normal örnekteki (Örnek 10.7) hesapta \(\mu\) ve \(\sigma^2\) yerine \(\theta\) yazarsak \[ L(\theta) = \frac{1}{(2\pi\theta)^{n/2}}\, \exp\Big(-\frac{1}{2\theta}\sum_{i=1}^{n}(x_i - \theta)^2\Big), \] \[ \ln L(\theta) = -\frac{n}{2}\ln(2\pi\theta) - \frac{1}{2}\sum_{i=1}^{n}\frac{(x_i - \theta)^2}{\theta} . \]
Türev. Bölümün türevi kuralıyla \[ \frac{d}{d\theta}\,\frac{(x - \theta)^2}{\theta} = \frac{-2(x - \theta)\theta - (x - \theta)^2}{\theta^2} = -\frac{(x - \theta)(x + \theta)}{\theta^2} = -\frac{x^2 - \theta^2}{\theta^2}, \] çünkü paydaki ortak çarpan \((x - \theta)\) dışarı alınınca \(2\theta + (x - \theta) = x + \theta\) kalır. Ayrıca \(\frac{d}{d\theta}\ln(2\pi\theta) = \frac{1}{\theta}\). Buna göre \[ \frac{d}{d\theta}\ln L(\theta) = -\frac{n}{2\theta} + \frac{1}{2\theta^2}\sum_{i=1}^{n}(x_i^2 - \theta^2) = -\frac{n}{2\theta} + \frac{\sum x_i^2}{2\theta^2} - \frac{n}{2} . \] \(m_2 = \frac{1}{n}\sum x_i^2\) (ikinci örneklem momentinin gözlenen değeri, Tanım 7.8) yazıp ortak paydada toplarsak \[ \frac{d}{d\theta}\ln L(\theta) = \frac{n}{2\theta^2}\left(m_2 - \theta - \theta^2\right). \]
Denklemin çözümü. Türev ancak \(\theta^2 + \theta - m_2 = 0\) iken sıfırdır. Gözlemlerin hepsi \(0\) değilse \(m_2 > 0\)’dır; köklerin çarpımı \(-m_2 < 0\) olduğundan biri pozitif, biri negatiftir; \(\theta > 0\) koşulu pozitif kökü seçer: \[ \theta = \frac{-1 + \sqrt{1 + 4m_2}}{2} . \]
En büyük değer. \(\frac{n}{2\theta^2} > 0\) olduğundan türevin işareti \(m_2 - \theta - \theta^2\)’nin işaretidir. \(\theta + \theta^2\) ifadesi \(\theta > 0\) üzerinde artandır; bu yüzden türev bulunan kökten önce pozitif, sonra negatiftir. Yani kök mutlak en büyük noktadır.
Sonuç olarak \[ \hat\theta = \frac{-1 + \sqrt{1 + 4M_2}}{2}, \qquad M_2 = \frac{1}{n}\sum_{i=1}^{n} X_i^2 . \] Tahmin edici \(\bar X\)’e değil, gözlemlerin karelerinin ortalamasına dayanır; çünkü \(\theta\) hem ortalamayı hem varyansı belirler ve \(E(X^2) = \theta + \theta^2\)’dir. \(\blacksquare\)
Örnek 10.11 (N(θ, θ) Modelinde Bir Örneklem) \(N(\theta, \theta)\) dağılımından alınan dört gözlem \(0, 2, 2, 4\)’tür. \(\theta\)’nın en çok olabilirlik tahminini bulunuz.
Çözüm
Genel formülü (Örnek 10.10) kullanalım. Karelerin ortalaması \[ m_2 = \frac{0^2 + 2^2 + 2^2 + 4^2}{4} = \frac{24}{4} = 6 , \] dolayısıyla \[ \hat\theta = \frac{-1 + \sqrt{1 + 4 \cdot 6}}{2} = \frac{-1 + 5}{2} = 2 . \] Gerçekten \(\theta = 2\) için \(\theta^2 + \theta = 6 = m_2\)’dir. Log-olabilirliğin birkaç değeri de bunu doğrular: \(\ln L(1) \approx -9{,}676\), \(\ln L(2) \approx -7{,}062\), \(\ln L(3) \approx -7{,}873\).
Bu örneklemde ortalama \(\bar x = 2\) ve sapma kareleri ortalaması \[ \frac{1}{4}\sum_{i=1}^{4}(x_i - \bar x)^2 = \frac{4 + 0 + 0 + 4}{4} = 2 \] de \(\hat\theta\) ile aynı çıkıyor; genel olarak bu üç sayı farklıdır. \(\blacksquare\)
10.6 Başka Dağılımlar
Aşağıdaki örneklerde aynı dört adımı başka dağılımlara uyguluyoruz; sonuncusu, olabilirlik denkleminin işe yaramadığı bir durumu gösteriyor.
Örnek 10.12 (Geometrik Dağılımda p) \(\operatorname{Geo}(p)\) dağılımından alınmış \(n\) birimlik bir rastgele örnekleme dayanarak \(p\) parametresinin en çok olabilirlik tahmin edicisini bulunuz.
Çözüm
Geometrik olasılık fonksiyonu (Olasılık Teorisi’ndeki tanım) \(f(x;p) = (1 - p)^{x - 1}p\), \(x = 1, 2, \dots\), \(0 < p < 1\) biçimindedir; \(X\) ilk başarıya kadar yapılan deneme sayısıdır.
Olabilirlik ve logaritma. \[ L(p) = (1 - p)^{x_1 - 1}p \cdot (1 - p)^{x_2 - 1}p \cdots (1 - p)^{x_n - 1}p = p^{n}(1 - p)^{\sum x_i - n}, \] \[ \ln L(p) = n\ln p + \Big(\sum_{i=1}^{n} x_i - n\Big)\ln(1 - p). \]
Türev. \[ \frac{d}{dp}\ln L(p) = \frac{n}{p} - \frac{\sum x_i - n}{1 - p} = 0 . \] Paydaları eşitlersek \(n(1 - p) = p\big(\sum x_i - n\big)\), yani \(n - np = p\sum x_i - np\) ve \(n = p\sum x_i\). Buradan \[ p = \frac{n}{\sum_{i=1}^{n} x_i} = \frac{1}{\bar x} . \]
En büyük değer. Gözlemlerin hepsi \(1\) değilse \(\sum x_i - n > 0\) ve \[ \frac{d^2}{dp^2}\ln L(p) = -\frac{n}{p^2} - \frac{\sum x_i - n}{(1 - p)^2} < 0 , \] yani türev azalandır ve \(1/\bar x\) mutlak en büyük noktadır. (Hepsi \(1\) ise \(L(p) = p^n\) artandır ve en büyük değerine \(\Theta\) içinde ulaşmaz; formül yine sınır değeri \(p = 1/\bar x = 1\)’i verir.)
Sonuç olarak \(\hat p = \dfrac{1}{\bar X}\). Yani ilk başarı ortalama \(\bar x\) denemede geliyorsa, başarı olasılığı \(1/\bar x\) olarak tahmin edilir; bu, \(E(X) = 1/p\) ilişkisiyle de uyumludur. \(\blacksquare\)
Örnek 10.13 (Gamma Dağılımında α (r Bilinirken)) \(r\) bilinen bir sabit olmak üzere \(\operatorname{Gamma}(r, \alpha)\) dağılımından alınmış \(n\) birimlik bir rastgele örnekleme dayanarak \(\alpha\) parametresinin en çok olabilirlik tahmin edicisini bulunuz.
Çözüm
Gamma yoğunluğu (Tanım 4.2), \((\alpha x)^{r-1} = \alpha^{r-1}x^{r-1}\) açılınca \[ f(x;\alpha) = \frac{\alpha}{\Gamma(r)}(\alpha x)^{r - 1} e^{-\alpha x} = \frac{\alpha^{r}}{\Gamma(r)}\, x^{r - 1} e^{-\alpha x}, \qquad x > 0 \] biçimini alır; burada \(\alpha > 0\) bilinmeyen, \(r > 0\) bilinen parametredir.
Olabilirlik ve logaritma. \(n\) yoğunluğun çarpımında sabit çarpanlar \(\alpha^{nr}/\Gamma(r)^n\) verir: \[ L(\alpha) = \frac{\alpha^{nr}}{\Gamma(r)^{n}} \Big(\prod_{i=1}^{n} x_i\Big)^{r - 1} e^{-\alpha\sum x_i}, \] \[ \ln L(\alpha) = nr\ln\alpha + (r - 1)\sum_{i=1}^{n}\ln x_i - \alpha\sum_{i=1}^{n} x_i - n\ln\Gamma(r). \]
Türev. Yalnız birinci ve üçüncü terim \(\alpha\)’ya bağlıdır: \[ \frac{d}{d\alpha}\ln L(\alpha) = \frac{nr}{\alpha} - \sum_{i=1}^{n} x_i = 0 \quad\Longrightarrow\quad \alpha = \frac{nr}{\sum x_i} = \frac{r}{\bar x} . \]
En büyük değer. \(\dfrac{d^2}{d\alpha^2}\ln L(\alpha) = -\dfrac{nr}{\alpha^2} < 0\) her \(\alpha > 0\) için doğrudur; tek kritik nokta mutlak en büyük noktadır.
Sonuç olarak \(\hat\alpha = \dfrac{r}{\bar X}\). \(E(X) = r/\alpha\) olduğundan (Teorem 4.2) bu, ortalamayı \(\bar X\)’e eşitlemekle aynı sonuçtur. \(r = 1\) özel durumunda üstel dağılımın oran parametresi için \(\hat\alpha = 1/\bar X\) bulunur. \(\blacksquare\)
Örnek 10.14 (Üstel Dağılımda Bir Olasılığın Tahmini) \((X_1, X_2, \dots, X_n)\), olasılık yoğunluk fonksiyonu \[ f(x;\theta) = \frac{1}{\theta}\, e^{-x/\theta}, \qquad x > 0,\ \theta > 0 \] olan dağılımdan alınmış bir örneklem olsun. \(P(X \le 2)\) olasılığının en çok olabilirlik tahmin edicisini bulunuz.
Çözüm
Bu, ortalaması \(\theta\) olan üstel dağılımdır (Olasılık Teorisi’ndeki tanımda \(\lambda = 1/\theta\)).
İstenen olasılık \(\theta\) cinsinden. \[ P(X \le 2) = \int_0^2 \frac{1}{\theta}e^{-x/\theta}\,dx = \Big[-e^{-x/\theta}\Big]_0^2 = 1 - e^{-2/\theta} . \]
\(\theta\)’nın tahmini. \(L(\theta) = \theta^{-n}e^{-\sum x_i/\theta}\) ve \[ \ln L(\theta) = -n\ln\theta - \frac{1}{\theta}\sum_{i=1}^{n} x_i , \qquad \frac{d}{d\theta}\ln L(\theta) = -\frac{n}{\theta} + \frac{\sum x_i}{\theta^2} = \frac{n}{\theta^2}\,(\bar x - \theta). \] Türev \(\theta < \bar x\) iken pozitif, \(\theta > \bar x\) iken negatiftir; mutlak en büyük nokta \(\theta = \bar x\)’tir. (İkinci türev bu noktada \(-n/\bar x^{\,2} < 0\)’dır.) Yani \(\hat\theta = \bar X\).
Değişmezlik. \(g(\theta) = 1 - e^{-2/\theta}\) fonksiyonu \(\theta > 0\) üzerinde kesin azalandır (\(g'(\theta) = -\tfrac{2}{\theta^2}e^{-2/\theta} < 0\)), dolayısıyla bire birdir. Değişmezlik özelliğine (Teorem 10.1) göre \[ \widehat{P(X \le 2)} = g(\hat\theta) = 1 - e^{-2/\bar X} . \] Örneğin gözlemlerin ortalaması \(\bar x = 4\) olsaydı tahmin \(1 - e^{-1/2} \approx 0{,}3935\) olurdu. \(\blacksquare\)
Örnek 10.15 (Düzgün Dağılımda θ: Türevin İşe Yaramadığı Durum) \(X_1, X_2, \dots, X_n\), olasılık yoğunluk fonksiyonu \[ f(x;\theta) = \frac{1}{\theta}, \qquad 0 \le x \le \theta,\ \theta > 0 \] olan \(U(0, \theta)\) dağılımından (Olasılık Teorisi’ndeki tanım) alınmış bir rastgele örneklem olsun. \(\theta\)’nın en çok olabilirlik tahmin edicisini bulunuz ve gözlemler \(2, 3, 5\) iken tahmini hesaplayınız.
Çözüm
Olabilirlik. Bir \(x_i\) gözlemi için \(f(x_i;\theta)\), \(x_i \le \theta\) ise \(1/\theta\), \(x_i > \theta\) ise \(0\)’dır. Çarpımın sıfırdan farklı olması için bütün gözlemlerin \(\theta\)’dan küçük ya da eşit olması, yani \(\theta \ge \max_i x_i\) olması gerekir: \[ L(\theta) = \begin{cases} \dfrac{1}{\theta^{n}}, & \theta \ge \max\{x_1, \dots, x_n\},\\[2mm] 0, & \text{diğer durumlarda.} \end{cases} \]
Olabilirlik denklemi çözümsüz. \(\theta \ge \max x_i\) bölgesinde \(\dfrac{d}{d\theta}\theta^{-n} = -n\,\theta^{-n-1} < 0\); türev hiçbir yerde sıfır olmaz. Bu yüzden türeve bakarak değil, fonksiyonun biçimine bakarak düşünürüz.
En büyük değer. \(\theta < \max x_i\) iken \(L(\theta) = 0\)’dır. \(\theta \ge \max x_i\) iken \(L(\theta) = \theta^{-n}\) kesin azalandır; en büyük değerini bu bölgenin sol ucunda alır. O hâlde \[ \hat\theta = \max\{X_1, X_2, \dots, X_n\}. \] Yani \(\theta\) her gözlemden en az onun kadar büyük olmak zorundadır; bu koşulu sağlayan değerler arasında yoğunluk \(1/\theta\)’yı en büyük yapan en küçüğüdür.
Sayısal durum. Gözlemler \(2, 3, 5\) ise \(n = 3\) ve \(\hat\theta = 5\). Olabilirlik \(L(5) = 1/125 = 0{,}008\); buna karşılık \(L(6) = 1/216 \approx 0{,}0046\) ve \(5\)’ten küçük her \(\theta\) için \(L(\theta) = 0\)’dır, çünkü o durumda \(5\) gözlemi imkânsız olurdu.
Karşılaştırma için momentler yöntemi \(E(X) = \theta/2\) eşitliğinden \(2\bar x = 20/3 \approx 6{,}67\) verir; iki yöntem her zaman aynı sonucu vermez. Üstelik \(2\bar X\) bazı örneklemlerde en büyük gözlemden küçük çıkabilir, yani veriyle çelişebilir (benzer bir durum için bkz. Örnek 9.12); \(\max X_i\) ise hiçbir zaman çelişmez. \(\blacksquare\)
Bu bölümde bir örneklemden, onu en olası kılan parametre değerini seçen genel bir tahmin yöntemi kurduk ve onu kesikli, sürekli, tek ve çok parametreli dağılımlara uyguladık. Aynı parametre için artık birden fazla tahmin edicimiz var: örneğin \(\sigma^2\) için \(\widehat{\sigma^2}\) ile \(S^2\), \(U(0, \theta)\) için \(\max X_i\) ile \(2\bar X\). Hangisinin daha iyi olduğunu söyleyebilmek için ölçütlere ihtiyaç var; bunları Tahmin Edicilerin Özellikleri bölümünde ele alacağız.