22  Geometrik, Negatif Binom ve Hipergeometrik Dağılımlar

Poisson Dağılımı bölümünde binom dağılımının, deneme sayısı büyürken ve başarı olasılığı küçülürken Poisson dağılımına yaklaştığını gördük. Bernoulli, binom ve Poisson dağılımlarının ortak yanı, üçünün de başarı sayısını saymasıdır: deneme sayısı (ya da gözlem aralığı) baştan sabittir, kaç başarı geleceği rastgeledir. Bu bölümde soruyu tersine çevireceğiz: başarı sayısını sabitleyip kaç deneme gerektiğini sayacağız. İlk başarıya kadar yapılan deneme sayısı geometrik dağılıma, \(r\)-inci başarıya kadar yapılan deneme sayısı negatif binom dağılımına uyar.

Bölümün üçüncü dağılımı başka bir yönden gelir. Binom dağılımı denemelerin bağımsız olduğunu varsayar; bir torbadan iadeli çekiliş bu varsayımı sağlar. Oysa uygulamada çekilişler çoğu zaman iadesizdir: bir partiden denetlenmek üzere ayrılan ürünler, bir desteden dağıtılan kartlar, bir sınıftan seçilen öğrenciler geri konmaz. İadesiz çekilişte başarı sayısının dağılımı hipergeometrik dağılımdır. Onun binom dağılımından nasıl ayrıldığını, varyansındaki “sonlu kitle düzeltmesi” çarpanının nereden geldiğini ve kitle büyüdükçe iki dağılımın nasıl birleştiğini göreceğiz.

Bölüme en yalın kesikli dağılım olan kesikli düzgün dağılımla başlayacağız; sonunda ise şimdiye kadar tanıdığımız bütün kesikli dağılımları tek bir tabloda toplayıp aralarındaki ilişkileri bir önermede özetleyeceğiz. Ana araçlarımız yine moment üreten fonksiyon (Tanım 17.2), onun momentleri üreten (Teorem 17.4) ve dağılımı tek türlü belirleyen (Teorem 17.5) özellikleri ile toplamın varyansı formülü (Teorem 18.4) olacaktır.

22.1 Kesikli Düzgün Dağılım

Bir Laplace uzayında (Tanım 4.1) bütün sonuçlar eşit olasılıklıdır. Sonuçları \(1, 2, \dots, n\) sayılarıyla etiketlersek “gelen sayı” rastgele değişkeni her değeri aynı olasılıkla alır. Düzgün bir zarın gösterdiği sayı, iyice karıştırılmış \(n\) numaralı karttan çekilen birinin numarası, bir piyango çekilişinde çıkan numara hep bu türdendir.

Tanım 22.1 (Kesikli Düzgün Dağılım) \(n \in \mathbb{N}\) olsun. Değer kümesi \(D_X = \{1, 2, \dots, n\}\) ve olasılık fonksiyonu

\[f_X(x) = \frac{1}{n}, \qquad x = 1, 2, \dots, n\]

olan \(X\) rastgele değişkenine \(\{1, 2, \dots, n\}\) kümesi üzerinde kesikli düzgün dağılıma sahiptir denir.

Olasılık fonksiyonunun toplamı \(n \cdot \frac{1}{n} = 1\) olduğundan \(f_X\) gerçekten bir olasılık fonksiyonudur (Tanım 10.2). Dağılım fonksiyonu (Tanım 9.1), \(\lfloor x \rfloor\) ile \(x\)’in tam kısmını göstermek üzere,

\[F_X(x) = \begin{cases} 0, & x < 1 \\[1mm] \dfrac{\lfloor x \rfloor}{n}, & 1 \le x < n \\[2mm] 1, & x \ge n \end{cases}\]

biçiminde \(\frac{1}{n}\) yüksekliğinde \(n\) basamaktan oluşur. Momentleri, tamsayıların ve karelerinin toplam formüllerinden hemen çıkar.

Önerme 22.1 (Kesikli Düzgün Dağılımın Momentleri) \(X\), \(\{1, 2, \dots, n\}\) üzerinde kesikli düzgün dağılıma sahip olsun. O zaman

\[E(X) = \frac{n+1}{2}, \qquad \operatorname{Var}(X) = \frac{n^2 - 1}{12}.\]

İspat

Beklenen değerin tanımı (Tanım 16.1) ve \(1 + 2 + \cdots + n = \frac{n(n+1)}{2}\) özdeşliğiyle

\[E(X) = \sum_{x=1}^{n} x \cdot \frac{1}{n} = \frac{1}{n} \cdot \frac{n(n+1)}{2} = \frac{n+1}{2}.\]

İkinci moment için \(1^2 + 2^2 + \cdots + n^2 = \frac{n(n+1)(2n+1)}{6}\) özdeşliğini kullanalım:

\[E(X^2) = \sum_{x=1}^{n} x^2 \cdot \frac{1}{n} = \frac{1}{n} \cdot \frac{n(n+1)(2n+1)}{6} = \frac{(n+1)(2n+1)}{6}.\]

Varyans hesap formülü (Önerme 16.3) gereği

\[\operatorname{Var}(X) = E(X^2) - \big(E(X)\big)^2 = \frac{(n+1)(2n+1)}{6} - \frac{(n+1)^2}{4} = \frac{(n+1)\big[2(2n+1) - 3(n+1)\big]}{12} = \frac{(n+1)(n-1)}{12} = \frac{n^2-1}{12}.\]

\(\blacksquare\)

Değer kümesi \(\{a, a+1, \dots, a+n-1\}\) olan düzgün dağılım için ayrı bir formül gerekmez: böyle bir \(Y\) için \(X = Y - a + 1\) değişkeni \(\{1, \dots, n\}\) üzerinde düzgündür ve Teorem 16.2 gereği \(E(Y) = a + \frac{n-1}{2}\), \(\operatorname{Var}(Y) = \operatorname{Var}(X) = \frac{n^2-1}{12}\) olur. Örneğin düzgün bir zar için (\(n = 6\)) \(E(X) = \frac{7}{2}\) ve \(\operatorname{Var}(X) = \frac{35}{12}\)’dir.

22.2 Geometrik Dağılım

Bernoulli deneme dizisine geri dönelim: her denemede başarı olasılığı aynı \(p\) sayısıdır (\(0 < p < 1\)) ve denemeler birbirinden bağımsızdır. Bu bölüm boyunca \(q = 1 - p\) ile başarısızlık olasılığını göstereceğiz. Binom dağılımında (Tanım 20.3) deneme sayısı \(n\) baştan sabittir. Şimdi deneme sayısını sabitlemiyoruz; denemelere ilk başarı gelene kadar devam ediyor ve kaç deneme yapıldığını sayıyoruz. Bir zarı ilk \(6\) gelene kadar atmak, bir hedefe ilk isabete kadar ateş etmek, bir parçayı ilk kusurlu çıkana kadar denetlemek hep bu modeldir.

\(X\), ilk başarının geldiği denemenin sırası olsun. \(X = x\) olayı, ilk \(x-1\) denemenin başarısız ve \(x\)-inci denemenin başarılı olması demektir. Denemeler bağımsız olduğundan (Tanım 7.1) bu olayın olasılığı

\[P(X = x) = \underbrace{q \cdot q \cdots q}_{x-1 \text{ kez}} \cdot p = q^{x-1} p\]

olur. Bu, \(X\)’in olasılık fonksiyonudur.

Tanım 22.2 (Geometrik Dağılım) \(0 < p < 1\) ve \(q = 1 - p\) olsun. Değer kümesi \(D_X = \{1, 2, 3, \dots\}\) ve olasılık fonksiyonu

\[f_X(x) = q^{x-1} p, \qquad x = 1, 2, 3, \dots\]

olan \(X\) rastgele değişkenine \(p\) parametreli geometrik dağılıma sahiptir denir ve kısaca \(X \sim \operatorname{Geo}(p)\) yazılır. \(X\), başarı olasılığı \(p\) olan bağımsız Bernoulli denemelerinde ilk başarıya kadar yapılan deneme sayısıdır.

Geometrik dağılımın literatürde iki parametrizasyonu vardır. İkincisi, ilk başarıdan önceki başarısızlık sayısını sayar: \(Y = X - 1\) için

\[f_Y(y) = q^{y} p, \qquad y = 0, 1, 2, \dots\]

Bu kitapta deneme sayısı \(X\) standart alınır; “geometrik dağılım” dendiğinde \(D_X = \{1, 2, \dots\}\) ve \(f_X(x) = q^{x-1}p\) kastedilir. İki parametrizasyon arasında \(Y = X - 1\) dönüşümüyle geçilir.

Adını, olasılıkların \(p, \, qp, \, q^2 p, \, \dots\) biçiminde ortak çarpanı \(q\) olan bir geometrik dizi oluşturmasından alır. Bu yapı, dağılımla ilgili her hesabı geometrik seri toplamına indirger. Aşağıdaki teorem, geometrik dağılımla çalışırken gereken her şeyi bir arada verir: olasılıkların toplamının \(1\) olduğunu, kuyruk olasılığının kapalı biçimini, moment üreten fonksiyonu ve ilk iki momenti.

Teorem 22.1 (Geometrik Dağılımın Kuyruk Olasılığı, Moment Üreten Fonksiyonu ve Momentleri) \(X \sim \operatorname{Geo}(p)\) ve \(q = 1 - p\) olsun.

(a) \(\displaystyle\sum_{x=1}^{\infty} f_X(x) = 1\)’dir ve her \(k \in \{0, 1, 2, \dots\}\) için \(P(X > k) = q^{k}\)’dır.

(b) Moment üreten fonksiyon \(t < -\ln q\) için tanımlıdır ve

\[M_X(t) = \frac{p e^{t}}{1 - q e^{t}}.\]

(c) \(\displaystyle E(X) = \frac{1}{p}\) ve \(\displaystyle \operatorname{Var}(X) = \frac{q}{p^2} = \frac{1-p}{p^2}\).

İspat

(a) \(0 < q < 1\) olduğundan geometrik seri yakınsar:

\[\sum_{x=1}^{\infty} q^{x-1} p = p \sum_{j=0}^{\infty} q^{j} = p \cdot \frac{1}{1-q} = \frac{p}{p} = 1.\]

Kuyruk olasılığı için

\[P(X > k) = \sum_{x=k+1}^{\infty} q^{x-1} p = p \, q^{k} \sum_{j=0}^{\infty} q^{j} = \frac{p \, q^{k}}{1-q} = q^{k}.\]

Aynı sonuca hesapsız da varılır: \((X > k)\) olayı “ilk \(k\) denemenin hepsi başarısız” olayıdır ve bağımsızlık gereği olasılığı \(q^k\)’dır. Buradan dağılım fonksiyonu da çıkar: \(x \ge 1\) için \(F_X(x) = 1 - q^{\lfloor x \rfloor}\).

(b) Moment üreten fonksiyonun tanımına (Tanım 17.2) göre

\[M_X(t) = E\big(e^{tX}\big) = \sum_{x=1}^{\infty} e^{tx} q^{x-1} p = p e^{t} \sum_{x=1}^{\infty} \big(q e^{t}\big)^{x-1} = p e^{t} \sum_{j=0}^{\infty} \big(q e^{t}\big)^{j}.\]

Bu geometrik seri ancak \(q e^{t} < 1\), yani \(t < -\ln q\) iken yakınsar ve toplamı \(\dfrac{1}{1 - qe^{t}}\)’dir. Öyleyse

\[M_X(t) = \frac{p e^{t}}{1 - q e^{t}}, \qquad t < -\ln q.\]

\(q < 1\) olduğundan \(-\ln q > 0\)’dır; yani \(M_X\), sıfırın bir komşuluğunda tanımlıdır ve Teorem 17.4 uygulanabilir.

(c) \(M_X(t) = p e^{t} \big(1 - q e^{t}\big)^{-1}\) yazıp çarpım ve zincir kurallarıyla türev alalım:

\[M_X'(t) = \frac{p e^{t}}{1 - q e^{t}} + \frac{p e^{t} \cdot q e^{t}}{\big(1 - q e^{t}\big)^{2}} = \frac{p e^{t}\big[(1 - q e^{t}) + q e^{t}\big]}{\big(1 - q e^{t}\big)^{2}} = \frac{p e^{t}}{\big(1 - q e^{t}\big)^{2}}.\]

Bir kez daha türev alırsak

\[M_X''(t) = \frac{p e^{t}}{\big(1 - q e^{t}\big)^{2}} + \frac{2 p e^{t} \cdot q e^{t}}{\big(1 - q e^{t}\big)^{3}} = \frac{p e^{t}\big[(1 - q e^{t}) + 2 q e^{t}\big]}{\big(1 - q e^{t}\big)^{3}} = \frac{p e^{t}\big(1 + q e^{t}\big)}{\big(1 - q e^{t}\big)^{3}}.\]

\(t = 0\) koyup \(1 - q = p\) kullanalım. Teorem 17.4 gereği

\[E(X) = M_X'(0) = \frac{p}{p^{2}} = \frac{1}{p}, \qquad E(X^2) = M_X''(0) = \frac{p(1+q)}{p^{3}} = \frac{1+q}{p^{2}}.\]

Son olarak Önerme 16.3 ile

\[\operatorname{Var}(X) = E(X^2) - \big(E(X)\big)^2 = \frac{1+q}{p^{2}} - \frac{1}{p^{2}} = \frac{q}{p^{2}}.\]

\(\blacksquare\)

\(E(X) = \frac{1}{p}\) sonucu sezgiyle uyuşur: başarı olasılığı \(\frac{1}{6}\) ise ilk başarı için ortalama \(6\) deneme beklenir. Varyans ise \(p\) küçüldükçe hızla büyür: \(p = \frac{1}{6}\) için \(\operatorname{Var}(X) = 30\) ve standart sapma \(\sigma_X \approx 5{,}48\), yani beklenen değere neredeyse eşittir. Geometrik dağılım sağa doğru uzun kuyrukludur.

İpucuBeklenen değeri seriyi türevleyerek de bulabilirsiniz

Moment üreten fonksiyona başvurmadan, \(|q| < 1\) için kuvvet serisinin terim terim türevlenebilmesini kullanarak

\[E(X) = \sum_{x=1}^{\infty} x \, q^{x-1} p = p \sum_{x=1}^{\infty} \frac{d}{dq}\, q^{x} = p \, \frac{d}{dq} \left( \frac{q}{1-q} \right) = p \cdot \frac{1}{(1-q)^{2}} = \frac{1}{p}\]

bulunur. İkinci türevle de ikinci faktöriyel moment çıkar: \(x(x-1) q^{x-2} = \frac{d^{2}}{dq^{2}} q^{x}\) olduğundan (\(x = 1\) terimi sıfırdır)

\[E\big(X(X-1)\big) = \sum_{x=1}^{\infty} x(x-1)\, q^{x-1} p = p q \sum_{x=1}^{\infty} \frac{d^{2}}{dq^{2}}\, q^{x} = p q \, \frac{d^{2}}{dq^{2}} \left( \frac{q}{1-q} \right) = p q \cdot \frac{2}{(1-q)^{3}} = \frac{2q}{p^{2}}\]

ve \(E(X^2) = E\big(X(X-1)\big) + E(X)\) ile \(\operatorname{Var}(X) = \frac{2q}{p^{2}} + \frac{1}{p} - \frac{1}{p^{2}} = \frac{2q + p - 1}{p^{2}} = \frac{q}{p^{2}}\) elde edilir.

Örnek 22.1 (Zarı İlk Altı Gelene Kadar Atmak) Düzgün bir zar, ilk kez \(6\) gelene kadar atılıyor. \(X\) yapılan atış sayısı olsun.

(a) \(X\)’in dağılımını belirleyiniz ve \(P(X = 3)\)’ü hesaplayınız.

(b) Dört atışta hiç \(6\) gelmeme olasılığını, yani \(P(X > 4)\)’ü bulunuz.

(c) İlk \(6\)’nın en geç altıncı atışta gelme olasılığını bulunuz.

(d) \(E(X)\) ve \(\operatorname{Var}(X)\)’i hesaplayınız.

(e) İlk \(6\)’nın gelmesi için en az yüzde \(95\) güvenceyle kaç atış yeterlidir?

(f) \(P(X \ge 18)\) olasılığını Chebyshev eşitsizliğiyle yukarıdan sınırlayıp gerçek değeriyle karşılaştırınız.

Çözüm

(a) Her atışta \(6\) gelme olasılığı \(p = \frac{1}{6}\) ve atışlar bağımsızdır; öyleyse \(X \sim \operatorname{Geo}\!\left(\frac{1}{6}\right)\), \(q = \frac{5}{6}\) ve

\[f_X(x) = \left(\frac{5}{6}\right)^{x-1} \frac{1}{6}, \qquad x = 1, 2, 3, \dots\]

Buradan \(P(X = 3) = \left(\frac{5}{6}\right)^{2} \frac{1}{6} = \frac{25}{216} \approx 0{,}1157\).

(b) Teorem 22.1 (a) gereği \(P(X > 4) = q^{4} = \left(\frac{5}{6}\right)^{4} = \frac{625}{1296} \approx 0{,}4823\). Dört atışın dördünde de \(6\) gelmemesi, neredeyse yazı tura kadar olasıdır.

(c) Tümleyen olay üzerinden hesaplayalım:

\[P(X \le 6) = 1 - P(X > 6) = 1 - \left(\frac{5}{6}\right)^{6} = 1 - \frac{15625}{46656} = \frac{31031}{46656} \approx 0{,}6651.\]

Bu aynı zamanda “altı atışta en az bir \(6\) gelir” olayının olasılığıdır.

(d) Teorem 22.1 (c) ile

\[E(X) = \frac{1}{p} = 6, \qquad \operatorname{Var}(X) = \frac{q}{p^{2}} = \frac{5/6}{1/36} = 30, \qquad \sigma_X = \sqrt{30} \approx 5{,}48.\]

(e) \(P(X \le n) \ge 0{,}95\), yani \(q^{n} \le 0{,}05\) olacak en küçük \(n\) aranıyor. \(\ln q < 0\) olduğundan eşitsizlik yön değiştirir:

\[n \ge \frac{\ln 0{,}05}{\ln (5/6)} \approx \frac{-2{,}9957}{-0{,}1823} \approx 16{,}43.\]

Demek ki \(n = 17\) atış yeterlidir. Gerçekten \(\left(\frac{5}{6}\right)^{16} \approx 0{,}0541 > 0{,}05\) ve \(\left(\frac{5}{6}\right)^{17} \approx 0{,}0451 < 0{,}05\)’tir; \(P(X \le 16) \approx 0{,}9459\), \(P(X \le 17) \approx 0{,}9549\).

(f) \(X \ge 1\) olduğundan \(X - 6 \le -12\) olamaz; dolayısıyla \((X \ge 18) = (|X - 6| \ge 12)\)’dir. Teorem 16.4 ile

\[P(X \ge 18) = P\big(|X - E(X)| \ge 12\big) \le \frac{\operatorname{Var}(X)}{12^{2}} = \frac{30}{144} = \frac{5}{24} \approx 0{,}208.\]

Gerçek değer \(P(X \ge 18) = P(X > 17) = \left(\frac{5}{6}\right)^{17} \approx 0{,}045\)’tir. Chebyshev sınırı doğrudur ama dağılımın biçimini kullanmadığı için gerçek değerin yaklaşık dört buçuk katıdır.

\(\blacksquare\)

Hafızasızlık Özelliği

Zar örneğinde şu soruyu soralım: ilk dört atışta \(6\) gelmediğini biliyoruz; bundan sonraki üç atışta da gelmeme olasılığı nedir? Sezgi, “zarın hafızası yoktur” der: dört başarısız atış, beşinci atışın \(6\) gelme şansını değiştirmez. Aşağıdaki teorem bu sezgiyi kesinleştirir ve daha fazlasını söyler: bu özellik, \(\{1, 2, \dots\}\) üzerindeki ve \(P(X = 1) < 1\) olan kesikli dağılımlar arasında yalnızca geometrik dağılıma aittir. Yani hafızasızlık, geometrik dağılımın tanımlayıcı özelliğidir.

Teorem 22.2 (Geometrik Dağılımın Hafızasızlık Özelliği) (a) \(X \sim \operatorname{Geo}(p)\) ise her \(m, n \in \{0, 1, 2, \dots\}\) için

\[P(X > m + n \mid X > m) = P(X > n).\]

(b) Tersine, \(X\) değerlerini \(\{1, 2, 3, \dots\}\) kümesinde alan ve \(P(X = 1) < 1\) koşulunu sağlayan bir kesikli rastgele değişken olsun. Her \(m, n \in \{0, 1, 2, \dots\}\) için \(P(X > m+n \mid X > m) = P(X > n)\) sağlanıyorsa \(X \sim \operatorname{Geo}(p)\)’dir; burada \(p = P(X = 1)\)’dir.

İspat

(a) \(m + n \ge m\) olduğundan \((X > m+n) \subseteq (X > m)\)’dir; dolayısıyla \((X > m+n) \cap (X > m) = (X > m+n)\). Teorem 22.1 (a) gereği \(P(X > m) = q^{m} > 0\) olduğundan koşullu olasılık tanımlıdır ve

\[P(X > m + n \mid X > m) = \frac{P(X > m+n)}{P(X > m)} = \frac{q^{m+n}}{q^{m}} = q^{n} = P(X > n).\]

1 2 3 4 5 6 7 8 9 10 0,1 0,2 0,3 x f(x) Geo(p), p = 0,3, q = 0,7 taralı kuyruk: P(X > 3) = q3 = 0,343 4 5 6 7 8 9 10 11 12 13 0,1 0,2 0,3 x f(x | X > 3) X > 3 verildiğinde kuyruk, P(X > 3)'e bölündü: x = 3 + n çubuğu, soldaki x = n ile aynı P(X > 3 + n | X > 3) = P(X > n)
Geometrik dağılımın hafızasızlığı (p = 0,3). Solda X > 3 kuyruğu taralıdır ve toplam olasılığı q3 = 0,343'tür. Sağda bu kuyruk P(X > 3)'e bölünerek koşullu dağılıma dönüştürülmüştür: x = 4, 5, 6, … çubukları soldaki x = 1, 2, 3, … çubuklarıyla tam aynı yüksekliktedir. Üç başarısızlıktan sonra kalan bekleme süresi, en baştaki bekleme süresiyle aynı dağılıma sahiptir; kesikli oklar bu eşlemeyi gösterir.

(b) \(G(k) = P(X > k)\) yazalım; \(X \ge 1\) olduğundan \(G(0) = 1\)’dir. Varsayım, \(G(m) > 0\) olan her \(m\) için

\[\frac{G(m+n)}{G(m)} = G(n), \qquad \text{yani} \qquad G(m+n) = G(m)\, G(n)\]

demektir. (\(G(m) = 0\) ise \(G(m+n) \le G(m) = 0\) olduğundan bu eşitlik zaten sağlanır; öyleyse eşitlik her \(m, n\) için geçerlidir.) \(q = G(1) = P(X > 1) = 1 - P(X = 1)\) diyelim. \(P(X = 1) < 1\) olduğundan \(q > 0\)’dır. Tümevarımla \(G(n) = q^{n}\) olduğunu gösterelim: \(n = 0\) ve \(n = 1\) için doğrudur; \(G(n) = q^{n}\) ise \(G(n+1) = G(n) \, G(1) = q^{n} \cdot q = q^{n+1}\)’dir.

Şimdi \(q < 1\) olduğunu görelim. \(q = 1\) olsaydı her \(n\) için \(P(X > n) = 1\) olurdu. Ama \(X\) gerçel değerli olduğundan \((X > n)\) olayları azalarak \(\bigcap_{n} (X > n) = \varnothing\) kümesine iner; olasılığın azalan dizilerdeki sürekliliği (Teorem 3.5) gereği \(P(X > n) \to P(\varnothing) = 0\) olmalıdır. Bu çelişki \(q < 1\) verir. Öyleyse \(p = 1 - q = P(X = 1) \in (0, 1)\)’dir ve her \(x \ge 1\) için

\[P(X = x) = P(X > x - 1) - P(X > x) = q^{x-1} - q^{x} = q^{x-1}(1 - q) = q^{x-1} p,\]

yani \(X \sim \operatorname{Geo}(p)\).

1 3 5 7 9 11 13 0,1 0,2 0,3 x f(x) f(x) = (1 − p)x−1 p, p = 0,3 P(X > 5) = (1 − p)5 ≈ 0,168 kuyruk, başlangıçla aynı biçimde
İlk başarıya kadar yapılan deneme sayısının (geometrik dağılım, p = 0,3) olasılık fonksiyonu. Çubuklar sabit oranla (1 − p) küçülür; bu yüzden 5. denemeden sonraki kuyruk (turuncu), baştan başlayan dağılımın küçültülmüş kopyasıdır. Hafızasızlık özelliği tam olarak budur: ilk beş deneme başarısızsa, kalan bekleme yine geometriktir.

\(\blacksquare\)

Teoremin (a) kısmı \(m = 4\), \(n = 3\) ile zar sorusunu yanıtlar: \(P(X > 7 \mid X > 4) = P(X > 3) = \left(\frac{5}{6}\right)^{3} \approx 0{,}5787\). Dört başarısız atıştan sonra bile ilk \(6\)’ya “yaklaşmış” olmayız; kalan bekleme süresinin dağılımı en baştaki dağılımın aynısıdır. (b) kısmı ise sürekli dağılımlar için de bir habercidir: bir sonraki bölümde, \((0, \infty)\) üzerindeki sürekli dağılımlar arasında hafızasız olan tek dağılımın üstel dağılım olduğunu göreceğiz.

UyarıKumarbaz yanılgısı

Hafızasızlık, gündelik sezginin sık yanıldığı bir noktadır. Bir rulet çarkında art arda on kez kırmızı geldiğinde “artık siyahın gelme vakti” düşüncesi, geçmiş sonuçların gelecekteki bağımsız denemeyi etkilediğini varsayar; oysa denemeler bağımsızsa on birinci dönüşte siyahın olasılığı ilk dönüştekiyle aynıdır. Geometrik dağılım bu gerçeği tam olarak ifade eder: \(m\) başarısızlıktan sonra ilk başarıya kalan bekleme süresi, başlangıçtaki bekleme süresiyle aynı dağılıma sahiptir. “Uzun süredir gelmeyen” bir başarı, gecikmiş bir borç gibi birikmez.

22.3 Negatif Binom Dağılımı

Geometrik dağılım ilk başarıyı bekler. Şimdi \(r\)-inci başarıyı bekleyelim: bir hedefe üçüncü isabet gelene kadar kaç atış yapılır, bir denetimde ikinci kusurlu parçaya kaç parçada rastlanır? \(r \in \mathbb{N}\) sabit olmak üzere \(X\), \(r\)-inci başarının geldiği denemenin sırası olsun. \(X\)’in alabileceği en küçük değer \(r\)’dir (ilk \(r\) denemenin hepsi başarılı olursa).

\(X = x\) olayını sayarak olasılık fonksiyonunu türetelim. \(r\)-inci başarının tam \(x\)-inci denemede gelmesi iki koşulun birlikte sağlanması demektir: \(x\)-inci deneme başarılıdır ve ilk \(x - 1\) denemede tam \(r - 1\) başarı vardır. İlk \(x-1\) denemede \(r-1\) başarının hangi konumlara düşeceği \(\binom{x-1}{r-1}\) biçimde seçilir (Teorem 5.2). Bu seçimlerin her biri, sabit bir sonuç dizisine karşılık gelir: dizide toplam \(r\) başarı ve \(x - r\) başarısızlık vardır ve bağımsızlık gereği dizinin olasılığı \(p^{r} q^{x-r}\)’dir. Diziler ayrık olaylar olduğundan olasılıklar toplanır:

\[P(X = x) = \binom{x-1}{r-1} p^{r} q^{x-r}, \qquad x = r, r+1, r+2, \dots\]

Tanım 22.3 (Negatif Binom Dağılımı) \(r \in \mathbb{N}\), \(0 < p < 1\) ve \(q = 1 - p\) olsun. Değer kümesi \(D_X = \{r, r+1, r+2, \dots\}\) ve olasılık fonksiyonu

\[f_X(x) = \binom{x-1}{r-1} p^{r} q^{x-r}, \qquad x = r, r+1, r+2, \dots\]

olan \(X\) rastgele değişkenine \(r\) ve \(p\) parametreli negatif binom dağılımına sahiptir denir ve \(X \sim \operatorname{NB}(r, p)\) yazılır. \(X\), başarı olasılığı \(p\) olan bağımsız Bernoulli denemelerinde \(r\)-inci başarıya kadar yapılan deneme sayısıdır. \(r = 1\) için \(\binom{x-1}{0} = 1\) olduğundan \(\operatorname{NB}(1, p) = \operatorname{Geo}(p)\)’dir.

Geometrik dağılımda olduğu gibi burada da ikinci bir parametrizasyon vardır: \(r\)-inci başarıdan önceki başarısızlık sayısı \(Y = X - r\) için

\[f_Y(y) = \binom{y + r - 1}{r - 1} p^{r} q^{y}, \qquad y = 0, 1, 2, \dots\]

Bu kitapta deneme sayısı \(X\) standart alınır.

Dağılımın adı ikinci parametrizasyondan gelir: \(\binom{y+r-1}{r-1} = \binom{y+r-1}{y}\) ve genelleştirilmiş binom katsayısı için \(\binom{y+r-1}{y} = (-1)^{y} \binom{-r}{y}\) özdeşliği sayesinde \(f_Y(y) = \binom{-r}{y} p^{r} (-q)^{y}\) yazılabilir; yani olasılıklar, üssü negatif olan \((1 - q)^{-r}\) binom açılımının terimleridir. Bu gözlemi kanıtlamak için aşağıdaki yardımcı sonuca ihtiyacımız var: geometrik serinin art arda türevleri, negatif binom olasılıklarının toplamını verir.

Lemma 22.1 (Geometrik Serinin Türevleri) \(r \in \mathbb{N}\) ve \(|s| < 1\) için

\[\sum_{k=0}^{\infty} \binom{k + r - 1}{r - 1} s^{k} = \frac{1}{(1-s)^{r}}.\]

İspat

\(r = 1\) için ifade \(\sum_{k \ge 0} s^{k} = \frac{1}{1-s}\) geometrik serisidir. \(r \ge 2\) olsun. \(|s| < 1\) üzerinde kuvvet serisi terim terim türevlenebilir; geometrik seriyi \(r - 1\) kez türevleyelim. Sol tarafta \(s^{k}\) teriminin \((r-1)\)-inci türevi \(k \ge r - 1\) için \(k(k-1)\cdots(k-r+2)\, s^{k-r+1}\), \(k < r-1\) için sıfırdır. \(j = k - r + 1\) dersek

\[\frac{d^{\,r-1}}{ds^{\,r-1}} \sum_{k=0}^{\infty} s^{k} = \sum_{j=0}^{\infty} (j+r-1)(j+r-2)\cdots(j+1)\, s^{j} = \sum_{j=0}^{\infty} \frac{(j+r-1)!}{j!}\, s^{j}.\]

Sağ tarafta \(\frac{d}{ds}(1-s)^{-m} = m (1-s)^{-m-1}\) olduğundan \(r - 1\) türev sonunda

\[\frac{d^{\,r-1}}{ds^{\,r-1}} \frac{1}{1-s} = 1 \cdot 2 \cdots (r-1) \cdot (1-s)^{-r} = \frac{(r-1)!}{(1-s)^{r}}\]

bulunur. İki tarafı \((r-1)!\)’e bölersek

\[\sum_{j=0}^{\infty} \frac{(j+r-1)!}{j!\,(r-1)!}\, s^{j} = \sum_{j=0}^{\infty} \binom{j+r-1}{r-1} s^{j} = \frac{1}{(1-s)^{r}}.\]

\(\blacksquare\)

Lemma elimizdeyken negatif binom dağılımının temel nicelikleri geometrik dağılımdakiyle aynı yoldan çıkar. Momentleri doğrudan seriden hesaplamak yerine, moment üreten fonksiyonun geometrik dağılımınkinin \(r\)-inci kuvveti olduğunu görüp geometrik dağılım için yaptığımız türev hesaplarını yeniden kullanacağız.

Teorem 22.3 (Negatif Binom Dağılımının Moment Üreten Fonksiyonu ve Momentleri) \(X \sim \operatorname{NB}(r, p)\) ve \(q = 1 - p\) olsun.

(a) \(\displaystyle\sum_{x=r}^{\infty} f_X(x) = 1\).

(b) Moment üreten fonksiyon \(t < -\ln q\) için tanımlıdır ve

\[M_X(t) = \left( \frac{p e^{t}}{1 - q e^{t}} \right)^{r}.\]

(c) \(\displaystyle E(X) = \frac{r}{p}\) ve \(\displaystyle \operatorname{Var}(X) = \frac{r q}{p^{2}} = \frac{r(1-p)}{p^{2}}\).

İspat

(a) \(k = x - r\) dönüşümüyle ve Lemma 22.1’nde \(s = q\) alarak

\[\sum_{x=r}^{\infty} \binom{x-1}{r-1} p^{r} q^{x-r} = p^{r} \sum_{k=0}^{\infty} \binom{k+r-1}{r-1} q^{k} = p^{r} \cdot \frac{1}{(1-q)^{r}} = \frac{p^{r}}{p^{r}} = 1.\]

(b) Aynı dönüşümle

\[M_X(t) = \sum_{x=r}^{\infty} e^{tx} \binom{x-1}{r-1} p^{r} q^{x-r} = p^{r} e^{rt} \sum_{k=0}^{\infty} \binom{k+r-1}{r-1} \big(q e^{t}\big)^{k}.\]

\(q e^{t} < 1\), yani \(t < -\ln q\) iken lemmayı \(s = q e^{t}\) ile uygulayabiliriz:

\[M_X(t) = p^{r} e^{rt} \cdot \frac{1}{\big(1 - q e^{t}\big)^{r}} = \left( \frac{p e^{t}}{1 - q e^{t}} \right)^{r}.\]

(c) \(g(t) = \dfrac{p e^{t}}{1 - q e^{t}}\), geometrik dağılımın moment üreten fonksiyonu olsun; \(M_X = g^{r}\)’dir. Teorem 22.1’nin ispatında \(g(0) = 1\), \(g'(0) = \frac{1}{p}\) ve \(g''(0) = \frac{1+q}{p^{2}}\) hesaplanmıştı. Zincir ve çarpım kurallarıyla

\[M_X'(t) = r\, g(t)^{r-1} g'(t), \qquad M_X''(t) = r(r-1)\, g(t)^{r-2} \big(g'(t)\big)^{2} + r\, g(t)^{r-1} g''(t).\]

\(t = 0\) koyarsak (Teorem 17.4)

\[E(X) = M_X'(0) = r \cdot \frac{1}{p} = \frac{r}{p}, \qquad E(X^{2}) = M_X''(0) = \frac{r(r-1)}{p^{2}} + \frac{r(1+q)}{p^{2}}.\]

Buradan

\[\operatorname{Var}(X) = \frac{r(r-1) + r(1+q)}{p^{2}} - \frac{r^{2}}{p^{2}} = \frac{r^{2} - r + r + rq - r^{2}}{p^{2}} = \frac{rq}{p^{2}}.\]

\(\blacksquare\)

Moment üreten fonksiyonun geometrik dağılımınkinin \(r\)-inci kuvveti çıkması rastlantı değildir. \(r\)-inci başarıyı beklemek, ilk başarıyı beklemek, sonra ikinciyi beklemek, … diye \(r\) bağımsız beklemeye ayrılır. Aşağıdaki önerme bunu moment üreten fonksiyonun teklik özelliğiyle kesinleştirir; aynı zamanda \(E(X) = \frac{r}{p}\) ve \(\operatorname{Var}(X) = \frac{rq}{p^{2}}\) formüllerinin neden geometrik dağılımınkilerin \(r\) katı olduğunu açıklar.

Önerme 22.2 (Bağımsız Geometrik Değişkenlerin Toplamı Negatif Binomdur) \(T_1, T_2, \dots, T_r\) bağımsız rastgele değişkenler ve her biri \(\operatorname{Geo}(p)\) dağılımına sahip olsun. O zaman

\[X = T_1 + T_2 + \cdots + T_r \sim \operatorname{NB}(r, p).\]

İspat

\(t < -\ln q\) olsun. \(T_1, \dots, T_r\) bağımsız olduğundan (Tanım 14.1) \(e^{tT_1}, \dots, e^{tT_r}\) de bağımsızdır ve bağımsız değişkenlerin çarpımının beklenen değeri beklenen değerlerin çarpımıdır (Teorem 18.1; \(r\) çarpan için, \(e^{t(T_1 + \cdots + T_{r-1})}\) ile \(e^{tT_r}\) bağımsız olduğundan tümevarımla). Öyleyse

\[M_X(t) = E\big(e^{t(T_1 + \cdots + T_r)}\big) = E\big(e^{tT_1} e^{tT_2} \cdots e^{tT_r}\big) = \prod_{i=1}^{r} E\big(e^{tT_i}\big) = \prod_{i=1}^{r} M_{T_i}(t) = \left( \frac{p e^{t}}{1 - q e^{t}} \right)^{r}.\]

Son adımda Teorem 22.1 (b) kullanıldı. Bulunan fonksiyon, Teorem 22.3 (b) gereği \(\operatorname{NB}(r, p)\) dağılımının moment üreten fonksiyonudur ve sıfırın bir komşuluğunda tanımlıdır. Moment üreten fonksiyonun teklik özelliği (Teorem 17.5) gereği \(X \sim \operatorname{NB}(r, p)\)’dir.

\(\blacksquare\)

Önermenin olasılıksal yorumu şudur: \(T_1\) ilk başarıya kadar geçen deneme sayısı, \(T_2\) ilk başarıdan ikinci başarıya kadar geçen deneme sayısı, …, \(T_r\) ise \((r-1)\)-inci başarıdan \(r\)-inci başarıya kadar geçen deneme sayısıdır. Denemeler bağımsız ve aynı dağılımlı olduğundan bu bekleme süreleri de bağımsız ve her biri \(\operatorname{Geo}(p)\) dağılımlıdır; toplamları \(r\)-inci başarının sırasıdır. Bu ayrıştırma, momentleri ikinci bir yoldan verir: beklenen değerin toplamsallığı (Önerme 18.2, tümevarımla \(r\) toplanana genişletilerek) ile \(E(X) = r \cdot \frac{1}{p}\), bağımsız toplamın varyansı (Sonuç 18.2, tümevarımla \(r\) toplanana genişletilerek) ile \(\operatorname{Var}(X) = r \cdot \frac{q}{p^{2}}\).

Örnek 22.2 (Üçüncü Tura ve İkinci Kusurlu Parça) (a) Düzgün bir madeni para atılıyor. Üçüncü turanın tam beşinci atışta gelme olasılığını ve üçüncü turanın en geç beşinci atışta gelme olasılığını bulunuz. Üçüncü turaya kadar yapılan atış sayısının beklenen değerini ve varyansını hesaplayınız.

(b) Bir makinenin ürettiği parçaların yüzde \(10\)’u kusurludur ve parçalar birbirinden bağımsız olarak kusurlu çıkmaktadır. Parçalar tek tek denetleniyor ve ikinci kusurlu parça bulununca denetim durduruluyor. Tam \(10\) parça denetlenme olasılığını, denetlenen parça sayısının beklenen değerini ve standart sapmasını bulunuz.

Çözüm

(a) \(X\), üçüncü turanın geldiği atışın sırası olsun; \(X \sim \operatorname{NB}\!\left(3, \frac{1}{2}\right)\) ve

\[f_X(x) = \binom{x-1}{2} \left(\frac{1}{2}\right)^{3} \left(\frac{1}{2}\right)^{x-3} = \binom{x-1}{2} \frac{1}{2^{x}}, \qquad x = 3, 4, 5, \dots\]

Buradan \(P(X = 5) = \binom{4}{2} \frac{1}{2^{5}} = \frac{6}{32} = \frac{3}{16}\). En geç beşinci atış için

\[P(X \le 5) = f_X(3) + f_X(4) + f_X(5) = \binom{2}{2}\frac{1}{8} + \binom{3}{2}\frac{1}{16} + \binom{4}{2}\frac{1}{32} = \frac{1}{8} + \frac{3}{16} + \frac{3}{16} = \frac{1}{2}.\]

Sonucun \(\frac{1}{2}\) çıkması bir sağlama sunar: “üçüncü tura en geç beşinci atışta gelir” olayı, “beş atışta en az üç tura gelir” olayıyla aynıdır ve düzgün parada beş atışta en az üç tura ile en çok iki tura bakışımlı olduğundan bu olasılık \(\frac{1}{2}\)’dir. Momentler Teorem 22.3 (c) ile

\[E(X) = \frac{r}{p} = \frac{3}{1/2} = 6, \qquad \operatorname{Var}(X) = \frac{rq}{p^{2}} = \frac{3 \cdot \frac{1}{2}}{\frac{1}{4}} = 6.\]

(b) Her parça için “kusurlu” olayını başarı sayalım: \(p = 0{,}1\), \(q = 0{,}9\), \(r = 2\). Denetlenen parça sayısı \(X \sim \operatorname{NB}(2;\ 0{,}1)\) ve

\[P(X = 10) = \binom{9}{1} (0{,}1)^{2} (0{,}9)^{8} = 9 \cdot 0{,}01 \cdot 0{,}43046721 \approx 0{,}0387.\]

Beklenen değer ve varyans

\[E(X) = \frac{2}{0{,}1} = 20, \qquad \operatorname{Var}(X) = \frac{2 \cdot 0{,}9}{(0{,}1)^{2}} = 180, \qquad \sigma_X = \sqrt{180} \approx 13{,}42.\]

Ortalama \(20\) parça denetlenir; ama standart sapma \(13\)’ün üzerindedir, yani denetimin çok kısa ya da çok uzun sürmesi olağandır. Karşılaştırma için, ikinci kusurlunun en geç onuncu parçada bulunma olasılığı \(P(X \le 10) = \sum_{x=2}^{10} (x-1)(0{,}1)^{2}(0{,}9)^{x-2} \approx 0{,}2639\)’dur.

\(\blacksquare\)

22.4 Hipergeometrik Dağılım

Buraya kadarki bütün dağılımlar bağımsız denemelere dayanıyordu. Şimdi bağımsızlığın bozulduğu en temel duruma bakalım: iadesiz çekiliş. \(N\) nesneden oluşan bir topluluğun \(M\) tanesi “başarılı” (kusurlu parça, as kart, kırmızı bilye), \(N - M\) tanesi “başarısız” olsun. Topluluktan rastgele ve iadesiz olarak \(n\) nesne çekiliyor (\(1 \le n \le N\)) ve \(X\), çekilenler arasındaki başarılı nesne sayısını gösteriyor. Çekilişler iadeli olsaydı her çekilişte başarı olasılığı \(\frac{M}{N}\) olur ve \(X\) binom dağılımına uyardı. İadesiz çekilişte ise ikinci çekilişteki başarı olasılığı ilkinin sonucuna bağlıdır; binom modeli geçerli değildir.

Olasılık fonksiyonunu doğrudan sayarak bulalım. Çekilen \(n\) nesnenin sırası önemli olmadığından sonuç, \(N\) nesneden seçilmiş \(n\) elemanlı bir alt kümedir; “rastgele çekiliş” bu \(\binom{N}{n}\) alt kümenin eşit olasılıklı olması demektir (Tanım 4.1, Teorem 5.2). \(X = x\) olan alt kümeler, \(M\) başarılıdan \(x\) tanesi ve \(N - M\) başarısızdan \(n - x\) tanesi seçilerek oluşur; sayıları çarpım kuralıyla \(\binom{M}{x}\binom{N-M}{n-x}\)’dir. Öyleyse

\[P(X = x) = \frac{\binom{M}{x}\binom{N-M}{n-x}}{\binom{N}{n}}.\]

Bu ifadenin anlamlı olması için \(0 \le x \le M\) ve \(0 \le n - x \le N - M\) gerekir; yani \(x\), \(\max\{0, n - (N-M)\}\) ile \(\min\{n, M\}\) arasında değişir.

Tanım 22.4 (Hipergeometrik Dağılım) \(N \in \mathbb{N}\), \(M \in \{0, 1, \dots, N\}\) ve \(n \in \{1, 2, \dots, N\}\) olsun. Değer kümesi

\[D_X = \big\{ x \in \mathbb{Z} : \max\{0, n - N + M\} \le x \le \min\{n, M\} \big\}\]

ve olasılık fonksiyonu

\[f_X(x) = \frac{\binom{M}{x}\binom{N-M}{n-x}}{\binom{N}{n}}, \qquad x \in D_X\]

olan \(X\) rastgele değişkenine \(N, M, n\) parametreli hipergeometrik dağılıma sahiptir denir ve \(X \sim \operatorname{HG}(N, M, n)\) yazılır. \(X\), \(M\) tanesi başarılı olan \(N\) nesneden iadesiz çekilen \(n\) nesne arasındaki başarılı nesne sayısıdır.

\(b > a\) ya da \(b < 0\) iken \(\binom{a}{b} = 0\) uzlaşımı benimsenirse formül \(x = 0, 1, \dots, n\) için yazılabilir; \(D_X\) dışındaki değerlerde pay kendiliğinden sıfırlanır.

Hipergeometrik dağılımın momentlerini binom dağılımındaki gibi moment üreten fonksiyondan çıkaramayız; \(M_X(t)\)’nin kullanışlı bir kapalı biçimi yoktur. Bunun yerine binom dağılımı için de işe yarayan ikinci yolu izleyeceğiz: \(X\)’i gösterge değişkenlerinin toplamı olarak yazmak. Fark şudur: burada göstergeler bağımsız değildir, bu yüzden varyans hesabında kovaryans terimleri ortaya çıkar ve sonucu binom varyansından ayıran çarpan tam olarak bu terimlerden gelir.

Teorem 22.4 (Hipergeometrik Dağılımın Momentleri) \(X \sim \operatorname{HG}(N, M, n)\) olsun ve \(p = \dfrac{M}{N}\) yazalım.

(a) \(\displaystyle\sum_{x \in D_X} f_X(x) = 1\).

(b) \(\displaystyle E(X) = n \, \frac{M}{N} = np\).

(c) \(N \ge 2\) için \(\displaystyle \operatorname{Var}(X) = n \, \frac{M}{N} \left( 1 - \frac{M}{N} \right) \frac{N - n}{N - 1} = n p (1-p) \, \frac{N-n}{N-1}\).

İspat

(a) Binom teoremi (Teorem 5.4) ile \((1+t)^{M}(1+t)^{N-M} = (1+t)^{N}\) özdeşliğinin iki yanında \(t^{n}\)’nin katsayısını karşılaştıralım. Sol tarafta \(t^{n}\), birinci çarpandan \(t^{x}\) ve ikincisinden \(t^{n-x}\) alınarak oluşur; katsayısı \(\sum_{x} \binom{M}{x}\binom{N-M}{n-x}\)’dir (toplam, her iki binom katsayısının sıfırdan farklı olduğu \(x\)’ler, yani \(x \in D_X\) üzerindedir). Sağ tarafta katsayı \(\binom{N}{n}\)’dir. Öyleyse

\[\sum_{x \in D_X} \binom{M}{x}\binom{N-M}{n-x} = \binom{N}{n} \qquad \text{(Vandermonde özdeşliği)}\]

ve iki yanı \(\binom{N}{n}\)’ye bölmek \(\sum_{x} f_X(x) = 1\) verir.

(b) Çekilişi sıralı düşünelim: nesneler tek tek çekilsin. Sıralı sonuçlar, \(N\) nesneden \(n\) tanesinin sıralı dizilişleridir; sayıları \(N(N-1)\cdots(N-n+1)\)’dir ve hepsi eşit olasılıklıdır. Bu model, sırasız modelle tutarlıdır: belli bir \(n\) elemanlı alt kümeye tam \(n!\) sıralı diziliş karşılık gelir, dolayısıyla her alt kümenin olasılığı \(\dfrac{n!}{N(N-1)\cdots(N-n+1)} = \dfrac{1}{\binom{N}{n}}\)’dir. Öyleyse sıralı modelde de başarılı nesne sayısı \(\operatorname{HG}(N, M, n)\) dağılımlıdır.

\(k = 1, \dots, n\) için \(I_k\), \(k\)-ıncı çekilen nesne başarılıysa \(1\), değilse \(0\) olan gösterge değişkeni olsun. Açıkça \(X = I_1 + I_2 + \cdots + I_n\)’dir. \(k\)-ıncı çekilişte başarılı gelen sıralı dizilişleri sayalım: \(k\)-ıncı konuma \(M\) başarılıdan biri gelir (\(M\) seçenek), geri kalan \(n-1\) konum kalan \(N-1\) nesneden sırayla doldurulur (\((N-1)(N-2)\cdots(N-n+1)\) seçenek). Dolayısıyla

\[P(I_k = 1) = \frac{M \cdot (N-1)(N-2)\cdots(N-n+1)}{N(N-1)\cdots(N-n+1)} = \frac{M}{N} = p.\]

Bu, her çekilişin, ne kadar sonra yapılırsa yapılsın, ilk çekilişle aynı başarı olasılığına sahip olduğunu söyler. \(E(I_k) = 1 \cdot p + 0 \cdot (1-p) = p\) olduğundan, beklenen değerin toplamsallığıyla (Önerme 18.2, tümevarımla \(n\) toplanana genişletilerek)

\[E(X) = \sum_{k=1}^{n} E(I_k) = np = n \, \frac{M}{N}.\]

(c) \(I_k\) yalnızca \(0\) ve \(1\) değerlerini aldığından \(I_k^{2} = I_k\) ve \(E(I_k^{2}) = p\); dolayısıyla \(\operatorname{Var}(I_k) = p - p^{2} = p(1-p)\). Göstergeler bağımsız olmadığından kovaryansları gerekir. \(j \ne k\) için \(I_j I_k = 1\) olması, \(j\)-inci ve \(k\)-ıncı konumların ikisine de başarılı gelmesi demektir: bu konumlar \(M(M-1)\) biçimde doldurulur, kalan \(n-2\) konum kalan \(N-2\) nesneden \((N-2)(N-3)\cdots(N-n+1)\) biçimde doldurulur. Öyleyse

\[E(I_j I_k) = P(I_j = 1,\, I_k = 1) = \frac{M(M-1)(N-2)\cdots(N-n+1)}{N(N-1)(N-2)\cdots(N-n+1)} = \frac{M(M-1)}{N(N-1)}\]

ve

\[\operatorname{Cov}(I_j, I_k) = E(I_j I_k) - E(I_j)E(I_k) = \frac{M(M-1)}{N(N-1)} - \frac{M^{2}}{N^{2}} = \frac{M \big[ N(M-1) - M(N-1) \big]}{N^{2}(N-1)} = \frac{M(M-N)}{N^{2}(N-1)} = -\frac{p(1-p)}{N-1}.\]

Kovaryans negatiftir: bir çekilişte başarılı gelmesi, kalan başarılı sayısını azalttığından ötekilerin başarı şansını düşürür. Toplamın varyansı formülünün \(n\) değişkenli biçimiyle (Teorem 18.4), \(n\) tane varyans ve \(\binom{n}{2} = \frac{n(n-1)}{2}\) tane sırasız çift olduğundan

\[\begin{aligned} \operatorname{Var}(X) &= \sum_{k=1}^{n} \operatorname{Var}(I_k) + 2 \sum_{1 \le j < k \le n} \operatorname{Cov}(I_j, I_k) = n p(1-p) + 2 \cdot \frac{n(n-1)}{2} \cdot \left( -\frac{p(1-p)}{N-1} \right) \\ &= n p (1-p) \left[ 1 - \frac{n-1}{N-1} \right] = n p (1-p) \, \frac{N - 1 - (n - 1)}{N-1} = n p (1-p) \, \frac{N-n}{N-1}. \end{aligned}\]

\(\blacksquare\)

Sonuçları binom dağılımıyla (Teorem 20.2) karşılaştıralım. \(p = \frac{M}{N}\) olmak üzere hipergeometrik beklenen değer \(np\), binomunkiyle aynıdır: iadesiz çekiliş ortalama başarı sayısını değiştirmez. Varyans ise \(np(1-p)\)’nin \(\dfrac{N-n}{N-1}\) katıdır. Bu çarpana sonlu kitle düzeltmesi denir; \(n \ge 2\) iken \(1\)’den küçüktür, yani iadesiz çekiliş yayılımı azaltır. İki uç durum anlamlıdır: \(n = 1\) için çarpan \(1\)’dir (tek çekilişte iadeli-iadesiz farkı yoktur); \(n = N\) için çarpan \(0\)’dır (bütün nesneler çekilince \(X = M\) kesindir). \(N\) büyüdükçe çarpan \(1\)’e yaklaşır; bunu aşağıda kesinleştireceğiz.

Örnek 22.3 (Torbadan İadesiz Çekiliş ve Parti Denetimi) (a) Bir torbada \(4\) sarı ve \(2\) kırmızı bilye vardır. Torbadan iadesiz olarak art arda \(3\) bilye çekiliyor. \(X\), çekilen kırmızı bilye sayısı olsun. \(X\)’in olasılık fonksiyonunu tablo hâlinde yazınız; \(E(X)\) ve \(\operatorname{Var}(X)\)’i hem tablodan hem de Teorem 22.4 ile hesaplayınız.

(b) \(50\) parçalık bir partide \(5\) kusurlu parça vardır. Partiden rastgele \(10\) parça iadesiz çekilip denetleniyor. Örnekte hiç kusurlu parça çıkmama olasılığını, en az bir kusurlu çıkma olasılığını, kusurlu sayısının beklenen değerini ve varyansını bulunuz. Sonuçları \(B(10;\ 0{,}1)\) dağılımının verdiği değerlerle karşılaştırınız.

(c) (b) şıkkındaki durumu kusurlu oranı \(\frac{1}{10}\)’da sabit tutarak \(N = 500\), \(N = 5000\) ve \(N = 50000\) parçalık partiler için yineleyiniz ve gözlemlerinizi yorumlayınız.

Çözüm

(a) Bu örnek Örnek 10.3’de elle sayarak çözülmüştü; şimdi onun bir hipergeometrik dağılım olduğunu görüyoruz. \(N = 6\) nesne, \(M = 2\) başarılı (kırmızı), \(n = 3\) iadesiz çekiliş: \(X \sim \operatorname{HG}(6, 2, 3)\). \(\max\{0, 3 - 4\} = 0 \le x \le \min\{3, 2\} = 2\) ve \(\binom{6}{3} = 20\) olduğundan

\[f_X(x) = \frac{\binom{2}{x}\binom{4}{3-x}}{20}, \qquad x = 0, 1, 2.\]

\(x\) \(0\) \(1\) \(2\)
\(f_X(x)\) \(\dfrac{\binom{2}{0}\binom{4}{3}}{20} = \dfrac{4}{20} = \dfrac{1}{5}\) \(\dfrac{\binom{2}{1}\binom{4}{2}}{20} = \dfrac{12}{20} = \dfrac{3}{5}\) \(\dfrac{\binom{2}{2}\binom{4}{1}}{20} = \dfrac{4}{20} = \dfrac{1}{5}\)

Toplam \(\frac{1}{5} + \frac{3}{5} + \frac{1}{5} = 1\)’dir. Tablodan

\[E(X) = 0 \cdot \frac{1}{5} + 1 \cdot \frac{3}{5} + 2 \cdot \frac{1}{5} = 1, \qquad E(X^{2}) = 0 + \frac{3}{5} + \frac{4}{5} = \frac{7}{5}, \qquad \operatorname{Var}(X) = \frac{7}{5} - 1 = \frac{2}{5}.\]

Formüllerle: \(p = \frac{M}{N} = \frac{1}{3}\) için \(E(X) = 3 \cdot \frac{1}{3} = 1\) ve

\[\operatorname{Var}(X) = 3 \cdot \frac{1}{3} \cdot \frac{2}{3} \cdot \frac{6-3}{6-1} = \frac{2}{3} \cdot \frac{3}{5} = \frac{2}{5}.\]

İki yol da aynı sonucu verir. Karşılaştırma için, çekilişler iadeli olsaydı \(X \sim B\!\left(3, \frac{1}{3}\right)\) ve \(\operatorname{Var}(X) = 3 \cdot \frac{1}{3} \cdot \frac{2}{3} = \frac{2}{3}\) olurdu; sonlu kitle düzeltmesi \(\frac{3}{5}\) varyansı \(\frac{2}{5}\)’e indirir.

(b) \(X \sim \operatorname{HG}(50, 5, 10)\). Hiç kusurlu çıkmaması:

\[P(X = 0) = \frac{\binom{5}{0}\binom{45}{10}}{\binom{50}{10}} = \frac{3190187286}{10272278170} = \frac{82251}{264845} \approx 0{,}3106.\]

Buradan \(P(X \ge 1) = 1 - P(X = 0) \approx 0{,}6894\). Ayrıca \(P(X = 1) = \dfrac{5 \binom{45}{9}}{\binom{50}{10}} \approx 0{,}4313\). Momentler, \(p = \frac{5}{50} = \frac{1}{10}\) ile

\[E(X) = 10 \cdot \frac{1}{10} = 1, \qquad \operatorname{Var}(X) = 10 \cdot \frac{1}{10} \cdot \frac{9}{10} \cdot \frac{50 - 10}{50 - 1} = \frac{9}{10} \cdot \frac{40}{49} = \frac{36}{49} \approx 0{,}735.\]

Binom modeli \(B(10;\ 0{,}1)\) ise \(P(X = 0) = (0{,}9)^{10} \approx 0{,}3487\), \(P(X = 1) = 10 \cdot 0{,}1 \cdot (0{,}9)^{9} \approx 0{,}3874\) ve \(\operatorname{Var}(X) = 0{,}9\) verir. Beklenen değerler aynı, ama olasılıklar ve varyans belirgin biçimde farklıdır: örnek partinin beşte birini kapsadığından (\(\frac{n}{N} = 0{,}2\)) iadesizlik önemlidir.

(c) Kusurlu oranı \(\frac{1}{10}\) olan \(N\) parçalık partide \(M = \frac{N}{10}\) ve \(n = 10\) için hipergeometrik olasılıklar aşağıdaki gibidir.

\(N\) \(50\) \(500\) \(5000\) \(50000\) binom (\(N \to \infty\))
\(P(X = 0)\) \(0{,}3106\) \(0{,}3452\) \(0{,}3483\) \(0{,}3486\) \(0{,}3487\)
\(P(X = 1)\) \(0{,}4313\) \(0{,}3913\) \(0{,}3878\) \(0{,}3875\) \(0{,}3874\)
\(\operatorname{Var}(X)\) \(0{,}7347\) \(0{,}8838\) \(0{,}8984\) \(0{,}8998\) \(0{,}9\)

\(N\) büyüdükçe hipergeometrik değerler binom değerlerine yaklaşır. Nedeni açıktır: \(50000\) parçadan \(10\) tanesini çekmek partiyi neredeyse hiç değiştirmez, her çekilişte kusurlu oranı \(\frac{1}{10}\)’a çok yakın kalır ve çekilişler pratik olarak bağımsızdır. Bu gözlemi bir teorem olarak ispatlayacağız.

\(\blacksquare\)

Binom Dağılımına Yaklaşım

Örneğin (c) şıkkındaki tablo, kitle büyüdükçe iadesizliğin önemini yitirdiğini gösterdi. Teorem, bunun bir limit ifadesi olduğunu söyler: örnek büyüklüğü \(n\) sabit tutulup kitle sonsuza götürüldüğünde, başarılı oranı \(p\)’ye yaklaştığı sürece, hipergeometrik olasılıklar binom olasılıklarına yakınsar.

Teorem 22.5 (Hipergeometrik Dağılımın Binom Dağılımına Yaklaşımı) \(n \in \mathbb{N}\) ve \(x \in \{0, 1, \dots, n\}\) sabit olsun. \((M_N)_{N \ge 1}\), \(M_N \in \{0, 1, \dots, N\}\) olan ve

\[\lim_{N \to \infty} \frac{M_N}{N} = p \in (0, 1)\]

koşulunu sağlayan bir dizi olsun. \(X_N \sim \operatorname{HG}(N, M_N, n)\) ise

\[\lim_{N \to \infty} P(X_N = x) = \binom{n}{x} p^{x} (1-p)^{n-x}.\]

İspat

\(M = M_N\) yazalım. \(\frac{M}{N} \to p > 0\) olduğundan \(M \to \infty\), \(\frac{N-M}{N} \to 1 - p > 0\) olduğundan \(N - M \to \infty\)’dur; dolayısıyla yeterince büyük \(N\) için \(M \ge x\) ve \(N - M \ge n - x\) olur ve \(x \in D_{X_N}\)’dir. Binom katsayılarını açık çarpımlar olarak yazalım:

\[\binom{M}{x} = \frac{M(M-1)\cdots(M-x+1)}{x!}, \quad \binom{N-M}{n-x} = \frac{(N-M)(N-M-1)\cdots(N-M-n+x+1)}{(n-x)!}, \quad \binom{N}{n} = \frac{N(N-1)\cdots(N-n+1)}{n!}.\]

Böylece

\[P(X_N = x) = \frac{n!}{x!\,(n-x)!} \cdot \frac{M(M-1)\cdots(M-x+1) \cdot (N-M)(N-M-1)\cdots(N-M-n+x+1)}{N(N-1)\cdots(N-n+1)}.\]

İlk çarpan \(\binom{n}{x}\)’tir. İkinci çarpanın payında \(x + (n-x) = n\), paydasında \(n\) çarpan vardır; her birini \(N\)’ye bölelim:

\[P(X_N = x) = \binom{n}{x} \cdot \frac{\displaystyle\prod_{i=0}^{x-1} \left( \frac{M}{N} - \frac{i}{N} \right) \cdot \prod_{j=0}^{n-x-1} \left( \frac{N-M}{N} - \frac{j}{N} \right)}{\displaystyle\prod_{k=0}^{n-1} \left( 1 - \frac{k}{N} \right)}.\]

\(N \to \infty\) iken çarpan sayıları sabit kaldığından limitler çarpım içine alınabilir: \(\frac{M}{N} - \frac{i}{N} \to p\), \(\frac{N-M}{N} - \frac{j}{N} \to 1 - p\) ve \(1 - \frac{k}{N} \to 1\). Öyleyse

\[\lim_{N \to \infty} P(X_N = x) = \binom{n}{x} \cdot \frac{p^{x} (1-p)^{n-x}}{1} = \binom{n}{x} p^{x} (1-p)^{n-x}.\]

0 1 2 3 4 5 0,1 0,2 0,3 0,4 x N = 20, M = 8, n = 5 HG(20, 8, 5) B(5; 0,4) 0 1 2 3 4 5 0,1 0,2 0,3 0,4 x N = 200, M = 80, n = 5 HG(200, 80, 5) B(5; 0,4)
İadesiz çekilişte başarı sayısının hipergeometrik dağılımı (geniş mavi çubuk) ile aynı n ve p = M/N için binom dağılımı (ince turuncu çubuk). Solda kitle küçükken (n/N = 0,25) hipergeometrik daha sivri: iadesiz çekiliş varyansı küçültür. Sağda kitle on kat büyüyünce (n/N = 0,025) çubuklar neredeyse çakışır; N → ∞ iken hipergeometrik dağılım binom dağılımına yaklaşır.

\(\blacksquare\)

Teorem, varyans formülüyle de uyumludur: \(\frac{M}{N} \to p\) ve \(\frac{N-n}{N-1} \to 1\) olduğundan \(\operatorname{Var}(X_N) \to np(1-p)\), yani binom varyansına gider. Örnekteki tablonun son satırı tam olarak bunu göstermektedir.

İpucuUygulamada hangi model?

Bir kitleden örnek çekerken doğru model hipergeometriktir; binom, hesabı kolaylaştıran bir yaklaşımdır. Yaygın kural şudur: örnek kitlenin yüzde \(5\)’inden küçükse (\(n \le 0{,}05 N\)) binom yaklaşımı yeterince iyidir. Bu durumda \(N - n \ge 0{,}95 N\) olduğundan sonlu kitle düzeltmesi \(\frac{N-n}{N-1} > 0{,}95\)’tir ve binom varyansı gerçek varyansı en çok yüzde \(5\) dolayında abartır. Örnekteki \(N = 50\), \(n = 10\) durumu bu kuralı sağlamaz (\(\frac{n}{N} = 0{,}2\)) ve gerçekten de iki model belirgin biçimde ayrışır; \(N = 500\) için (\(\frac{n}{N} = 0{,}02\)) olasılıklardaki bağıl fark yüzde bir dolayına, \(N = 5000\) için binde bir dolayına iner.

22.5 Kesikli Dağılımlar Arasındaki İlişkiler

Bu kısımda, şimdiye kadar tanıdığımız yedi kesikli dağılımı bir araya getirelim. Tabloda \(q = 1 - p\)’dir; hipergeometrik dağılım için \(p = \frac{M}{N}\) kısaltması kullanılmıştır. Önceki bölümlerdeki gibi Bernoulli dağılımı \(B(1, p)\), binom dağılımı \(B(n, p)\) ve Poisson dağılımı \(\operatorname{Poisson}(\lambda)\) ile gösterilmiştir.

dağılım \(D_X\) \(f_X(x)\) \(E(X)\) \(\operatorname{Var}(X)\) \(M_X(t)\)
Bernoulli \(B(1, p)\) \(\{0, 1\}\) \(p^{x} q^{1-x}\) \(p\) \(pq\) \(q + p e^{t}\)
\(B(n, p)\) \(\{0, \dots, n\}\) \(\binom{n}{x} p^{x} q^{n-x}\) \(np\) \(npq\) \((q + p e^{t})^{n}\)
\(\operatorname{Poisson}(\lambda)\) \(\{0, 1, \dots\}\) \(e^{-\lambda} \dfrac{\lambda^{x}}{x!}\) \(\lambda\) \(\lambda\) \(e^{\lambda(e^{t} - 1)}\)
kesikli düzgün \(\{1, \dots, n\}\) \(\dfrac{1}{n}\) \(\dfrac{n+1}{2}\) \(\dfrac{n^{2}-1}{12}\) \(\dfrac{e^{t}(1 - e^{nt})}{n(1 - e^{t})}\)
\(\operatorname{Geo}(p)\) \(\{1, 2, \dots\}\) \(q^{x-1} p\) \(\dfrac{1}{p}\) \(\dfrac{q}{p^{2}}\) \(\dfrac{p e^{t}}{1 - q e^{t}}\)
\(\operatorname{NB}(r, p)\) \(\{r, r+1, \dots\}\) \(\binom{x-1}{r-1} p^{r} q^{x-r}\) \(\dfrac{r}{p}\) \(\dfrac{rq}{p^{2}}\) \(\left(\dfrac{p e^{t}}{1 - q e^{t}}\right)^{r}\)
\(\operatorname{HG}(N, M, n)\) \(\{\max\{0, n-N+M\}, \dots, \min\{n, M\}\}\) \(\dfrac{\binom{M}{x}\binom{N-M}{n-x}}{\binom{N}{n}}\) \(np\) \(npq \, \dfrac{N-n}{N-1}\) kullanışlı kapalı biçimi yok

Tablo satırları birbirinden bağımsız değildir; dağılımlar, toplam alma ve limit işlemleriyle birbirine bağlıdır. Aşağıdaki önerme bu bağları toplu olarak verir. Çoğu, daha önce ispatladığımız sonuçların yeniden ifadesidir; yeni olan (e) ve (f) maddeleri, negatif binom ile binom dağılımının aynı deneme dizisi üzerindeki ilişkisini ve hipergeometrik dağılımın \(n = 1\) durumunu açıklar.

Önerme 22.3 (Kesikli Dağılımlar Arasındaki İlişkiler) (a) Bernoulli dağılımı \(B(1, p)\), \(n = 1\) parametreli binom dağılımıdır; \(n\) bağımsız \(B(1, p)\) değişkeninin toplamı \(B(n, p)\) dağılımlıdır.

(b) \(n p_n \to \lambda > 0\) olacak biçimde \(p_n \to 0\) ise \(B(n, p_n)\) olasılıkları \(\operatorname{Poisson}(\lambda)\) olasılıklarına yakınsar.

(c) \(\operatorname{Geo}(p)\) dağılımı \(\operatorname{NB}(1, p)\) dağılımıdır; \(r\) bağımsız \(\operatorname{Geo}(p)\) değişkeninin toplamı \(\operatorname{NB}(r, p)\) dağılımlıdır.

(d) \(\frac{M}{N} \to p \in (0,1)\) ve \(n\) sabit iken \(\operatorname{HG}(N, M, n)\) olasılıkları \(B(n, p)\) olasılıklarına yakınsar.

(e) Aynı Bernoulli deneme dizisinde \(X\), \(r\)-inci başarıya kadar yapılan deneme sayısı ve \(Y_n\), ilk \(n\) denemedeki başarı sayısı olsun (\(n \ge r\)). O zaman

\[P(X \le n) = P(Y_n \ge r), \qquad \text{yani} \qquad \sum_{x=r}^{n} \binom{x-1}{r-1} p^{r} q^{x-r} = \sum_{y=r}^{n} \binom{n}{y} p^{y} q^{n-y}.\]

(f) \(\operatorname{HG}(N, M, 1)\) dağılımı, \(p = \frac{M}{N}\) parametreli \(B(1, p)\) Bernoulli dağılımıdır.

İspat

(a) Tanım 20.2 ve Tanım 20.3’nde \(n = 1\) için olasılık fonksiyonları çakışır. Toplam iddiası Önerme 20.2’dur; moment üreten fonksiyonla da görülür: \(n\) bağımsız Bernoulli değişkeninin toplamının moment üreten fonksiyonu \((q + pe^{t})^{n}\), yani binom dağılımının moment üreten fonksiyonudur (Teorem 20.3) ve teklik teoremi (Teorem 17.5) sonucu verir.

(b) Bu, Teorem 21.4’nin ifadesidir.

(c) İlk kısım Tanım 22.3’nde gözlenmişti; ikincisi Önerme 22.2’dur.

(d) Bu, Teorem 22.5’nin ifadesidir.

(e) İki olayın aynı olduğunu gösterelim. “\(r\)-inci başarı en geç \(n\)-inci denemede gelir” demek, ilk \(n\) denemede en az \(r\) başarı bulunması demektir: \(r\)-inci başarı \(x \le n\) sırasında geldiyse ilk \(n\) denemede en az \(r\) başarı vardır; tersine ilk \(n\) denemede en az \(r\) başarı varsa \(r\)-inci başarı bu \(n\) denemenin birinde gelmiştir. Öyleyse \((X \le n) = (Y_n \ge r)\) ve olasılıkları eşittir. \(X \sim \operatorname{NB}(r, p)\) ve \(Y_n \sim B(n, p)\) olduğundan olasılıkları yazmak formülü verir.

(f) \(0 < M < N\) olsun (aksi hâlde \(X\) sabittir). \(n = 1\) için \(D_X = \{0, 1\}\) ve \(\binom{N}{1} = N\); dolayısıyla

\[f_X(1) = \frac{\binom{M}{1}\binom{N-M}{0}}{N} = \frac{M}{N}, \qquad f_X(0) = \frac{\binom{M}{0}\binom{N-M}{1}}{N} = \frac{N-M}{N} = 1 - \frac{M}{N}.\]

Bu, \(p = \frac{M}{N}\) parametreli Bernoulli dağılımıdır.

\(\blacksquare\)

(e) maddesi, negatif binom dağılımının dağılım fonksiyonunu binom tablosundan okumayı sağlar; Örnek 22.2 (a)’da \(P(X \le 5) = P(Y_5 \ge 3) = \frac{1}{2}\) eşitliğini bu yolla doğrulamıştık. Resmin bütünü şudur: Bernoulli denemeleri, bütün bu dağılımların ortak kaynağıdır. Deneme sayısını sabitleyip başarıları sayarsak binom; başarı sayısını sabitleyip denemeleri sayarsak geometrik ve negatif binom; nadir olaylar için binomu limite götürürsek Poisson; bağımsızlığı iadesiz çekilişle bozarsak hipergeometrik dağılım ortaya çıkar ve kitle büyüyünce bağımsızlık, dolayısıyla binom dağılımı geri gelir.

22.6 Alıştırmalar

Alıştırma 22.1 (Kesikli Düzgün, Geometrik, Negatif Binom ve Hipergeometrik Dağılımlar) (a) İyice karıştırılmış, \(1\)’den \(10\)’a kadar numaralanmış \(10\) karttan biri çekiliyor. Kart numarasının beklenen değerini ve varyansını bulunuz.

(b) Bir okçu her atışta hedefi bağımsız olarak \(0{,}2\) olasılıkla vuruyor. İlk isabetin en geç üçüncü atışta gelme olasılığını ve ilk iki atışın ıskaladığı bilindiğinde ilk isabetin beşinci atıştan sonra gelme olasılığını hesaplayınız. Atış sayısının beklenen değerini ve varyansını yazınız.

(c) \(X \sim \operatorname{Geo}(p)\) ve \(Y = X - 1\) (ilk başarıdan önceki başarısızlık sayısı) olsun. \(Y\)’nin moment üreten fonksiyonunu, beklenen değerini ve varyansını bulunuz.

(d) \(X \sim \operatorname{Geo}(p)\) için \(X\)’in çift sayı olma olasılığının \(\dfrac{q}{1+q}\) olduğunu gösteriniz ve zar örneği (\(p = \frac{1}{6}\)) için sayısal değerini bulunuz.

(e) Bir zar, ikinci kez \(5\) ya da \(6\) gelene kadar atılıyor. Tam dört atış yapılma olasılığını, atış sayısının beklenen değerini ve varyansını bulunuz.

(f) İyice karıştırılmış \(52\) kartlık bir desteden \(5\) kart çekiliyor. \(X\), çekilen as sayısı olsun. \(P(X = 0)\), \(P(X = 1)\), \(P(X \ge 2)\) olasılıklarını, \(E(X)\) ve \(\operatorname{Var}(X)\)’i hesaplayınız.

(g) \(X \sim \operatorname{HG}(N, M, n)\) ve \(p = \frac{M}{N}\) olsun. \(\operatorname{Var}(X) \le np(1-p)\) olduğunu, eşitliğin ancak \(n = 1\) için sağlandığını ve \(n = N\) için \(\operatorname{Var}(X) = 0\) olduğunu gösteriniz; son durumu olasılıksal olarak yorumlayınız.

Çözüm

(a) Kart numarası \(X\), \(\{1, \dots, 10\}\) üzerinde kesikli düzgün dağılımlıdır. Önerme 22.1 ile

\[E(X) = \frac{10 + 1}{2} = \frac{11}{2}, \qquad \operatorname{Var}(X) = \frac{10^{2} - 1}{12} = \frac{99}{12} = \frac{33}{4}.\]

(b) Atış sayısı \(X \sim \operatorname{Geo}(0{,}2)\), \(q = 0{,}8\). Teorem 22.1 (a) ile

\[P(X \le 3) = 1 - q^{3} = 1 - 0{,}512 = 0{,}488.\]

Hafızasızlık (Teorem 22.2) ile \(P(X > 5 \mid X > 2) = P(X > 3) = q^{3} = 0{,}512\). Momentler: \(E(X) = \frac{1}{0{,}2} = 5\) ve \(\operatorname{Var}(X) = \frac{0{,}8}{0{,}04} = 20\).

(c) \(Y = X - 1\) olduğundan \(M_Y(t) = E\big(e^{t(X-1)}\big) = e^{-t} M_X(t)\); Teorem 22.1 (b) ile

\[M_Y(t) = e^{-t} \cdot \frac{p e^{t}}{1 - q e^{t}} = \frac{p}{1 - q e^{t}}, \qquad t < -\ln q.\]

Doğrudan da görülebilir: \(M_Y(t) = \sum_{y \ge 0} e^{ty} q^{y} p = p \sum_{y \ge 0} (q e^{t})^{y} = \frac{p}{1 - qe^{t}}\). Teorem 16.2 gereği

\[E(Y) = E(X) - 1 = \frac{1}{p} - 1 = \frac{q}{p}, \qquad \operatorname{Var}(Y) = \operatorname{Var}(X) = \frac{q}{p^{2}}.\]

(d) \(X\)’in çift olması, \(X \in \{2, 4, 6, \dots\}\) demektir. Ayrık olayların olasılıkları toplanır:

\[P(X \text{ çift}) = \sum_{k=1}^{\infty} f_X(2k) = \sum_{k=1}^{\infty} q^{2k-1} p = p q \sum_{k=0}^{\infty} \big(q^{2}\big)^{k} = \frac{pq}{1 - q^{2}} = \frac{pq}{(1-q)(1+q)} = \frac{q}{1+q}.\]

\(p = \frac{1}{6}\), \(q = \frac{5}{6}\) için \(P(X \text{ çift}) = \dfrac{5/6}{11/6} = \dfrac{5}{11} \approx 0{,}4545\). Olasılığın \(\frac{1}{2}\)’den küçük olması doğaldır: tek sayılı atışlar her zaman “önce” gelir ve ilk atışın tek başına \(\frac{1}{6}\) olasılığı vardır.

(e) Her atışta “\(5\) ya da \(6\) gelmesi” başarısı \(p = \frac{2}{6} = \frac{1}{3}\) olasılıklıdır, \(q = \frac{2}{3}\). Atış sayısı \(X \sim \operatorname{NB}\!\left(2, \frac{1}{3}\right)\) ve

\[P(X = 4) = \binom{3}{1} \left(\frac{1}{3}\right)^{2} \left(\frac{2}{3}\right)^{2} = 3 \cdot \frac{1}{9} \cdot \frac{4}{9} = \frac{12}{81} = \frac{4}{27} \approx 0{,}1481.\]

Teorem 22.3 (c) ile \(E(X) = \frac{2}{1/3} = 6\) ve \(\operatorname{Var}(X) = \frac{2 \cdot \frac{2}{3}}{\frac{1}{9}} = 12\).

(f) \(X \sim \operatorname{HG}(52, 4, 5)\); \(\binom{52}{5} = 2598960\).

\[P(X = 0) = \frac{\binom{4}{0}\binom{48}{5}}{\binom{52}{5}} = \frac{1712304}{2598960} = \frac{35673}{54145} \approx 0{,}6588, \qquad P(X = 1) = \frac{\binom{4}{1}\binom{48}{4}}{\binom{52}{5}} = \frac{4 \cdot 194580}{2598960} = \frac{778320}{2598960} \approx 0{,}2995.\]

Dolayısıyla \(P(X \ge 2) = 1 - 0{,}6588 - 0{,}2995 \approx 0{,}0417\). Beş kartlık bir elde iki ya da daha çok as bulunma olasılığı yaklaşık yüzde \(4\)’tür. Momentler, \(p = \frac{4}{52} = \frac{1}{13}\) ile

\[E(X) = 5 \cdot \frac{1}{13} = \frac{5}{13} \approx 0{,}385, \qquad \operatorname{Var}(X) = 5 \cdot \frac{1}{13} \cdot \frac{12}{13} \cdot \frac{52-5}{52-1} = \frac{60}{169} \cdot \frac{47}{51} = \frac{940}{2873} \approx 0{,}327.\]

(g) Teorem 22.4 (c) gereği \(\operatorname{Var}(X) = np(1-p)\,\frac{N-n}{N-1}\)’dir. \(1 \le n \le N\) olduğundan \(N - n \le N - 1\), yani \(\frac{N-n}{N-1} \le 1\); \(np(1-p) \ge 0\) ile çarpınca \(\operatorname{Var}(X) \le np(1-p)\) çıkar. Eşitlik için ya \(np(1-p) = 0\) (yani \(M = 0\) ya da \(M = N\); bu durumda \(X\) zaten sabittir ve her iki taraf sıfırdır) ya da \(\frac{N-n}{N-1} = 1\), yani \(n = 1\) gerekir; \(0 < p < 1\) olan asıl durumda eşitlik yalnızca \(n = 1\)’de sağlanır. \(n = N\) için çarpan \(\frac{N-N}{N-1} = 0\) ve \(\operatorname{Var}(X) = 0\)’dır. Yorum: bütün nesneler çekildiğinde çekilenler arasındaki başarılı sayısı kesinlikle \(M\)’dir; gerçekten \(D_X = \{M\}\) ve \(f_X(M) = \frac{\binom{M}{M}\binom{N-M}{N-M}}{\binom{N}{N}} = 1\) olur. Sabit bir rastgele değişkenin varyansı sıfırdır.

\(\blacksquare\)

Kesikli dünyada bekleme sürelerini ve iadesiz çekilişi tamamladık. Bir sonraki bölümde sürekli dünyaya geçiyor; hafızasızlığın sürekli karşılığı olan üstel dağılımı, en yalın sürekli dağılım olan düzgün dağılımı ve olasılık teorisinin merkezindeki normal dağılımı inceliyoruz: Düzgün, Üstel ve Normal Dağılımlar.