16 Beklenen Değer, Momentler ve Varyans
Rastgele Vektörlerin Dönüşümleri bölümüyle birlikte bir rastgele değişkenin ya da rastgele vektörün dağılımını betimlemenin bütün araçlarını edindik: dağılım fonksiyonu, olasılık fonksiyonu, yoğunluk fonksiyonu ve bunların bir dönüşüm altında nasıl değiştiği. Ancak bir dağılımın tamamı çoğu zaman gereğinden fazla bilgidir. Bir zarın “ortalama” kaç geldiğini, bir makine parçasının ömrünün ortalama ne kadar sürdüğünü, ölçümlerin bu ortalamadan ne kadar saptığını sormak isteriz. Bu bölümde bir dağılımı birkaç sayıya sıkıştıran ilk ve en önemli araçları tanıtıyoruz: beklenen değer, momentler ve varyans.
Fikir basittir. Bir zar \(N\) kez atılsın ve \(1, 2, \dots, 6\) değerlerinin sırasıyla \(n_1, \dots, n_6\) kez geldiğini varsayalım. Gelen sayıların aritmetik ortalaması
\[\frac{1 \cdot n_1 + 2 \cdot n_2 + \dots + 6 \cdot n_6}{N} = 1 \cdot \frac{n_1}{N} + 2 \cdot \frac{n_2}{N} + \dots + 6 \cdot \frac{n_6}{N}\]
biçiminde yazılabilir; yani her değer, gözlenme sıklığıyla ağırlıklandırılarak toplanmıştır. Atış sayısı büyüdükçe sıklıkların olasılıklara yaklaşmasını bekleriz. Öyleyse “uzun vadedeki ortalama” için doğal aday, her değerin kendi olasılığıyla ağırlıklandırılmış toplamı \(\sum_{x \in D_X} x\, f_X(x)\) olur. Beklenen değer tam olarak budur; sürekli durumda toplamın yerini integral alır.
Bu bölümde şunları öğreneceğiz: bir rastgele değişkenin fonksiyonunun beklenen değerinin tanımı ve bu tanımın anlamlı olması için gereken mutlak yakınsaklık koşulu; beklenen değeri olmayan rastgele değişkenlerin gerçekten var olduğu; momentler, varyans ve standart sapma; beklenen değerin en çok kullanılan özelliği olan lineerlik; doğrusal bir dönüşümün beklenen değeri ve varyansı nasıl değiştirdiği; varyansı hesaplamanın pratik formülü; ve varyansın ne ölçtüğünü kesin bir eşitsizliğe dönüştüren Markov ve Chebyshev eşitsizlikleri.
16.1 Bir Rastgele Değişkenin Fonksiyonunun Beklenen Değeri
Beklenen değeri yalnız \(X\) için değil, \(X\)’in bir fonksiyonu \(g(X)\) için tanımlamak daha kullanışlıdır; çünkü \(X^2\), \(|X - c|\), \(e^{tX}\) gibi nesnelerin beklenen değerleri ilerleyen bölümlerde sürekli karşımıza çıkacak. \(g(X)\)’in bir rastgele değişken olabilmesi için her Borel kümesinin \(g\) altındaki ters görüntüsünün yine bir Borel kümesi olması gerekir; bu koşulu sağlayan fonksiyonlara Borel ölçülebilir fonksiyon denir. Sürekli fonksiyonlar, parçalı sürekli fonksiyonlar ve bunların bileşkeleri, toplamları, çarpımları hep Borel ölçülebilirdir; bu kitapta karşılaşacağımız her \(g\) bu sınıftadır.
Tanım 16.1 (Beklenen Değer) \(X\) bir rastgele değişken ve \(g : \mathbb{R} \to \mathbb{R}\), her \(B \in \mathcal{B}(\mathbb{R})\) için \(\{x : g(x) \in B\} \in \mathcal{B}(\mathbb{R})\) özelliğini taşıyan bir fonksiyon olsun.
(i) \(X\) kesikli bir rastgele değişken ve
\[\sum_{x \in D_X} |g(x)|\, f_X(x) < \infty\]
ise
\[E\big[g(X)\big] = \sum_{x \in D_X} g(x)\, f_X(x),\]
(ii) \(X\) sürekli bir rastgele değişken ve
\[\int_{-\infty}^{\infty} |g(x)|\, f_X(x)\,dx < \infty\]
ise
\[E\big[g(X)\big] = \int_{-\infty}^{\infty} g(x)\, f_X(x)\,dx\]
sayısına \(g(X)\) rastgele değişkeninin beklenen değeri denir. Yakınsaklık koşulu sağlanmıyorsa \(g(X)\)’in beklenen değeri yoktur denir.
Tanım üzerine birkaç açıklama gerekir.
- \(g(x) = x\) seçimi \(E(X)\)’i verir: kesikli durumda \(E(X) = \sum_{x \in D_X} x\, f_X(x)\), sürekli durumda \(E(X) = \int_{-\infty}^{\infty} x\, f_X(x)\,dx\). Girişteki “olasılıkla ağırlıklandırılmış ortalama” tam olarak budur.
- Kesikli durumda \(D_X\) sonlu ise koşul kendiliğinden sağlanır; toplam sonlu terimlidir. \(D_X\) sayılabilir sonsuz ise \(\sum_{x \in D_X} g(x) f_X(x)\) bir seridir ve \(D_X\)’in elemanlarını numaralandırmanın ayrıcalıklı bir yolu yoktur. Serinin değeri sıralamaya bağlı olmasın diye mutlak yakınsaklık istenir; mutlak yakınsak bir serinin terimleri hangi sırayla toplanırsa toplansın aynı sayı çıkar.
- Sürekli durumda integral yalnız \(D_X\) üzerinden, yani \(\int_{D_X} g(x) f_X(x)\,dx\) biçiminde de yazılabilir; \(D_X\) dışında \(f_X\) sıfır olduğundan ikisi aynıdır. Mutlak yakınsaklık koşulu burada da integralin “\(\infty - \infty\)” belirsizliğine düşmemesini sağlar.
- Yakınsaklık koşulu sağlandığında, üçgen eşitsizliği gereği \(\big|E[g(X)]\big| \le E\big[|g(X)|\big]\) olur; yani beklenen değer sonlu bir gerçel sayıdır.
\(Y = g(X)\) kendisi bir rastgele değişkendir (Tanım 8.1). Öyleyse beklenen değerini, tanımdaki \(g(y) = y\) seçimiyle, \(Y\)’nin kendi olasılık fonksiyonu \(f_Y\) üzerinden de yazabilirdik: \(E(Y) = \sum_{y \in D_Y} y\, f_Y(y)\). İki hesabın aynı sayıyı verdiğini kesikli durumda gösterelim. Tanım 10.2 gereği
\[f_Y(y) = P(Y = y) = P\big(g(X) = y\big) = \sum_{x \in D_X : \, g(x) = y} f_X(x)\]
olduğundan
\[\sum_{y \in D_Y} y\, f_Y(y) = \sum_{y \in D_Y} \; \sum_{x \in D_X : \, g(x) = y} y\, f_X(x) = \sum_{y \in D_Y} \; \sum_{x \in D_X : \, g(x) = y} g(x)\, f_X(x) = \sum_{x \in D_X} g(x)\, f_X(x)\]
bulunur. Terimler mutlak toplanabilir olduğundan, yani \(\sum_{x \in D_X} |g(x)|\, f_X(x) < \infty\) olduğundan, iki katlı toplam istenen sırada düzenlenebilir; son adımda \(D_X\), \(g\)’nin aldığı değerlere göre ayrık parçalara bölünmüştür. Demek ki \(E[g(X)]\)’i hesaplamak için \(g(X)\)’in dağılımını bulmaya gerek yoktur; \(X\)’in dağılımı yeter. Tanımın asıl gücü budur: \(X^2\)’nin ya da \(e^{tX}\)’in dağılımını hiç bilmeden beklenen değerleri yazılabilir. Sürekli durumda da aynı sonuç geçerlidir; ispatı dönüşüm formülünün genel biçimini gerektirdiğinden burada verilmeyecektir.
Bundan sonra, aksi söylenmedikçe, göz önüne alınan \(g(X)\) rastgele değişkenlerinin beklenen değerlerinin var olduğu varsayılacaktır. Bir teoremde “\(E(X)\) ve \(E(X^2)\) var olsun” gibi bir hipotez yazılmamışsa, ifadede geçen bütün beklenen değerlerin var olduğu anlaşılmalıdır.
Beklenen değerin var olup olmadığına her seferinde tanımdan bakmak zahmetlidir. Aşağıdaki gözlemler, çoğu durumda varlığı bir bakışta görmeyi sağlar.
Önerme 16.1 (Beklenen Değerin Varlığı İçin Yeter Koşullar) \(X\) bir rastgele değişken, \(g\) ve \(h\) Borel ölçülebilir fonksiyonlar olsun.
(a) \(g\) sınırlı ise, yani her \(x\) için \(|g(x)| \le M\) olacak biçimde bir \(M\) varsa, \(E[g(X)]\) vardır ve \(\big|E[g(X)]\big| \le M\)’dir.
(b) Her \(x \in D_X\) için \(|g(x)| \le |h(x)|\) ve \(E[h(X)]\) varsa \(E[g(X)]\) de vardır.
(c) Bir \(k \in \mathbb{N}\) için \(E(X^k)\) varsa, her \(j \in \{1, 2, \dots, k\}\) için \(E(X^j)\) vardır.
İspat
İspatı kesikli durum için yazıyoruz; sürekli durumda toplamların yerine integraller gelir, hiçbir adım değişmez.
(a) \(\sum_{x \in D_X} |g(x)| f_X(x) \le M \sum_{x \in D_X} f_X(x) = M < \infty\). Böylece \(E[g(X)]\) vardır ve \(\big|E[g(X)]\big| \le \sum_{x \in D_X} |g(x)| f_X(x) \le M\) olur.
(b) \(\sum_{x \in D_X} |g(x)| f_X(x) \le \sum_{x \in D_X} |h(x)| f_X(x) < \infty\).
(c) Her gerçel \(x\) ve her \(j \le k\) için \(|x|^j \le 1 + |x|^k\) eşitsizliği geçerlidir: \(|x| \le 1\) ise \(|x|^j \le 1\), \(|x| > 1\) ise \(|x|^j \le |x|^k\) olur. Öyleyse
\[\sum_{x \in D_X} |x|^j f_X(x) \le \sum_{x \in D_X} f_X(x) + \sum_{x \in D_X} |x|^k f_X(x) = 1 + \sum_{x \in D_X} |x|^k f_X(x) < \infty\]
olur; yani \(E(X^j)\) vardır.
\(\blacksquare\)
(c) maddesinin karşıt tersi de düşünmeye değer: bir moment yoksa, ondan daha yüksek mertebeden hiçbir moment yoktur. Aşağıdaki örnek en alt basamağın bile boş kalabileceğini gösterir.
Örnek 16.1 (Beklenen Değeri Olmayan Bir Rastgele Değişken) \(X\) sürekli rastgele değişkeninin yoğunluk fonksiyonu
\[f_X(x) = \begin{cases} \dfrac{1}{x^2}, & x > 1 \\[2mm] 0, & \text{diğer durumlarda} \end{cases}\]
olsun. \(f_X\)’in gerçekten bir yoğunluk fonksiyonu olduğunu, ama \(E(X)\)’in var olmadığını gösteriniz.
Çözüm
\(f_X \ge 0\) açıktır ve
\[\int_{-\infty}^{\infty} f_X(x)\,dx = \int_{1}^{\infty} \frac{dx}{x^2} = \lim_{b \to \infty} \left[ -\frac{1}{x} \right]_{1}^{b} = \lim_{b \to \infty} \left( 1 - \frac{1}{b} \right) = 1\]
olduğundan \(f_X\) bir yoğunluk fonksiyonudur (Tanım 11.2). Beklenen değer için tanımdaki koşula bakalım; \(x > 1\) için \(|x| = x\) olduğundan
\[\int_{-\infty}^{\infty} |x|\, f_X(x)\,dx = \int_{1}^{\infty} x \cdot \frac{1}{x^2}\,dx = \int_{1}^{\infty} \frac{dx}{x} = \lim_{b \to \infty} \ln b = \infty.\]
Koşul sağlanmaz; \(E(X)\) yoktur. Önerme 16.1’in (c) maddesi gereği \(X\)’in hiçbir \(k \ge 1\) mertebeli momenti yoktur.
Bunun anlamı şudur: \(X\)’in dağılımı kusursuz biçimde tanımlıdır, her \(a > 1\) için \(P(X > a) = \int_a^\infty x^{-2}\,dx = \frac{1}{a}\) hesaplanabilir; ama bu kuyruk o kadar yavaş söner ki “ortalama değer” sonlu bir sayı olarak var olmaz. \(X\)’in bağımsız gözlemlerinin aritmetik ortalaması, gözlem sayısı arttıkça bir sayıya yerleşmez; sınırsız büyür.
\(\blacksquare\)
\(f(x) = \dfrac{1}{\pi (1 + x^2)}\), \(x \in \mathbb{R}\), bir yoğunluk fonksiyonudur (Cauchy yoğunluğu): \(\int_{-\infty}^{\infty} f(x)\,dx = \frac{1}{\pi} \big[\arctan x\big]_{-\infty}^{\infty} = \frac{1}{\pi} \left( \frac{\pi}{2} + \frac{\pi}{2} \right) = 1\). Grafiği \(0\)’a göre simetriktir ve \(x f(x)\) tek fonksiyondur; bu yüzden “\(E(X) = 0\)” demek çekicidir. Ama
\[\int_{-\infty}^{\infty} |x|\, f(x)\,dx = \frac{2}{\pi} \int_{0}^{\infty} \frac{x}{1 + x^2}\,dx = \frac{1}{\pi} \lim_{b \to \infty} \ln(1 + b^2) = \infty\]
olduğundan \(E(X)\) yoktur. Simetriden \(E(X) = 0\) sonucunu çıkarmak ancak mutlak yakınsaklık koşulu sağlandığında geçerlidir: o zaman integral iki yarımın toplamı olarak parçalanabilir ve yarımlar birbirini götürür. Koşul sağlanmıyorsa integral “\(\infty - \infty\)” biçimindedir ve hiçbir değer taşımaz.
16.2 Momentler, Varyans ve Standart Sapma
\(g\) fonksiyonunun belirli seçimleri o kadar sık kullanılır ki özel adlar almıştır.
Tanım 16.2 (Momentler) \(X\) bir rastgele değişken, \(c \in \mathbb{R}\) ve \(k \in \mathbb{N}\) olsun.
(a) \(E\big[(X - c)^k\big]\) değerine \(X\)’in \(c\)’ye göre \(k\). mertebeden momenti,
(b) \(E\big[X^k\big]\) değerine \(X\)’in \(k\). mertebeden momenti (sıfıra göre \(k\). moment),
(c) \(\mu_X = \mu = E(X)\) değerine \(X\)’in beklenen değeri (birinci moment),
(d) \(E\big[X(X-1)(X-2)\cdots(X-k+1)\big]\) değerine \(X\)’in \(k\). çarpımsal momenti
denir. Beklenen değere göre momentlere, yani \(E\big[(X - \mu)^k\big]\) değerlerine, merkezi momentler de denir.
Merkezi momentlerin ilki her zaman sıfırdır: birazdan ispatlayacağımız lineerlik gereği \(E(X - \mu) = E(X) - \mu = 0\). Bilgi taşıyan ilk merkezi moment ikincisidir ve kendi adı vardır.
Tanım 16.3 (Varyans) \(X\), beklenen değeri \(\mu = E(X)\) olan bir rastgele değişken olsun. \(X\)’in beklenen değerine göre ikinci momentine, yani
\[\sigma_X^2 = \sigma^2 = \operatorname{Var}(X) = E\Big[\big(X - E(X)\big)^2\Big]\]
değerine \(X\)’in varyansı denir.
Tanım 16.4 (Standart Sapma) \(X\)’in varyansının negatif olmayan kareköküne \(X\)’in standart sapması denir ve
\[\sigma_X = \sqrt{\operatorname{Var}(X)}\]
ile gösterilir.
Bu iki büyüklüğün yorumu şöyledir. Kesikli bir dağılımı, sayı doğrusu üzerinde \(x \in D_X\) noktalarına yerleştirilmiş \(f_X(x)\) ağırlıklarında kütleler gibi düşünelim; toplam kütle \(1\)’dir. Bu kütle sisteminin ağırlık merkezi \(\dfrac{\sum_{x \in D_X} x\, f_X(x)}{\sum_{x \in D_X} f_X(x)} = E(X)\) noktasıdır. Yani beklenen değer, dağılımın “merkezi”, dağılımın dengede durduğu noktadır. Varyans ise kütlelerin bu merkezden uzaklıklarının karelerinin ağırlıklı ortalamasıdır, mekanikteki eylemsizlik momentinin karşılığıdır: kütleler merkeze yığılmışsa küçük, merkezden uzağa saçılmışsa büyüktür. Varyans, dağılımın merkez etrafındaki “yayılımının” bir ölçüsüdür. Varyansın birimi \(X\)’in biriminin karesidir; \(X\) santimetreyle ölçülüyorsa \(\operatorname{Var}(X)\) santimetrekaredir. Standart sapma karekök alarak \(X\) ile aynı birime döner; bu yüzden yayılımı somut olarak ifade etmek istendiğinde \(\sigma_X\) kullanılır.
Bir dağılımın momentleri hakkında ilk soru, hangilerinin var olduğudur. Önerme 16.1’in (c) maddesi bunun düzenli bir yapı taşıdığını söyler: \(E(X^k)\) varsa daha düşük mertebeli bütün momentler de vardır. Özellikle \(E(X^2)\) varsa \(E(X)\) de vardır ve birazdan göreceğimiz gibi varyans da var olur.
16.3 Beklenen Değerin Lineerliği
Beklenen değerin hesaplarda en çok kullanılan özelliği, toplamın beklenen değerinin beklenen değerlerin toplamı olmasıdır. Bu özellik olmadan \(E\big[(X - \mu)^2\big]\) gibi ifadeleri açmak bile mümkün olmazdı. Aşağıdaki teoremde \(g_1, \dots, g_n\) fonksiyonlarının toplamı da Borel ölçülebilirdir; bu, ölçülebilir fonksiyonların sonlu toplamlarının ölçülebilir olduğu genel gerçeğinin bir sonucudur ve burada ispatsız kullanılacaktır.
Teorem 16.1 (Beklenen Değerin Lineerliği) \(X\) bir rastgele değişken ve \(g_i : \mathbb{R} \to \mathbb{R}\), \(i = 1, 2, \dots, n\), her \(B \in \mathcal{B}(\mathbb{R})\) için \(\{x : g_i(x) \in B\} \in \mathcal{B}(\mathbb{R})\) özelliğini taşıyan fonksiyonlar olsun. Her \(i\) için \(E[g_i(X)]\) beklenen değeri varsa \(\sum_{i=1}^{n} g_i(X)\) rastgele değişkeninin beklenen değeri vardır ve
\[E\left[ \sum_{i=1}^{n} g_i(X) \right] = \sum_{i=1}^{n} E\big[g_i(X)\big]\]
olur.
İspat
\(g = g_1 + g_2 + \dots + g_n\) yazalım.
\(X\) kesikli ise. Önce varlık: her \(x\) için üçgen eşitsizliği \(|g(x)| \le \sum_{i=1}^{n} |g_i(x)|\) verir. Buradan
\[\sum_{x \in D_X} |g(x)|\, f_X(x) \le \sum_{x \in D_X} \sum_{i=1}^{n} |g_i(x)|\, f_X(x) = \sum_{i=1}^{n} \sum_{x \in D_X} |g_i(x)|\, f_X(x) < \infty\]
olur; sonlu sayıda yakınsak serinin toplamı yakınsak olduğundan sonlu toplam ile seri yer değiştirebilmiştir. Demek ki \(E[g(X)]\) vardır. Şimdi beklenen değerin kendisini hesaplayalım:
\[E[g(X)] = \sum_{x \in D_X} \left( \sum_{i=1}^{n} g_i(x) \right) f_X(x) = \sum_{i=1}^{n} \sum_{x \in D_X} g_i(x)\, f_X(x) = \sum_{i=1}^{n} E\big[g_i(X)\big].\]
Yer değiştirme yine geçerlidir, çünkü içteki \(n\) serinin her biri mutlak yakınsaktır.
\(X\) sürekli ise. Aynı adımlar integralle yazılır:
\[\int_{-\infty}^{\infty} |g(x)|\, f_X(x)\,dx \le \sum_{i=1}^{n} \int_{-\infty}^{\infty} |g_i(x)|\, f_X(x)\,dx < \infty\]
ve
\[E[g(X)] = \int_{-\infty}^{\infty} \sum_{i=1}^{n} g_i(x)\, f_X(x)\,dx = \sum_{i=1}^{n} \int_{-\infty}^{\infty} g_i(x)\, f_X(x)\,dx = \sum_{i=1}^{n} E\big[g_i(X)\big].\]
Burada da sonlu sayıda yakınsak integralin toplamı terim terim alınabilir.
\(\blacksquare\)
Lineerliğin öteki yarısı, sabitlerin dışarı alınabilmesidir.
Önerme 16.2 (Sabitin Beklenen Değeri ve Sabitle Çarpım) \(X\) bir rastgele değişken, \(c \in \mathbb{R}\) ve \(g\) Borel ölçülebilir bir fonksiyon olsun.
(a) \(E(c) = c\); yani sabit \(c\) değerini alan rastgele değişkenin beklenen değeri \(c\)’dir.
(b) \(E[g(X)]\) varsa \(E\big[c\, g(X)\big]\) de vardır ve \(E\big[c\, g(X)\big] = c\, E\big[g(X)\big]\) olur.
İspat
(a) \(g(x) = c\) sabit fonksiyonu Borel ölçülebilirdir: \(\{x : c \in B\}\) kümesi \(c \in B\) ise \(\mathbb{R}\), değilse \(\varnothing\)’dir ve ikisi de Borel kümesidir. Kesikli durumda \(\sum_{x \in D_X} |c|\, f_X(x) = |c| < \infty\) olduğundan beklenen değer vardır ve
\[E(c) = \sum_{x \in D_X} c\, f_X(x) = c \sum_{x \in D_X} f_X(x) = c \cdot 1 = c.\]
Sürekli durumda \(E(c) = \int_{-\infty}^{\infty} c\, f_X(x)\,dx = c \int_{-\infty}^{\infty} f_X(x)\,dx = c\).
(b) \(\sum_{x \in D_X} |c\, g(x)|\, f_X(x) = |c| \sum_{x \in D_X} |g(x)|\, f_X(x) < \infty\) olduğundan \(E[c\, g(X)]\) vardır ve
\[E\big[c\, g(X)\big] = \sum_{x \in D_X} c\, g(x)\, f_X(x) = c \sum_{x \in D_X} g(x)\, f_X(x) = c\, E\big[g(X)\big].\]
Sürekli durum, toplam yerine integralle aynıdır.
\(\blacksquare\)
Teorem 16.1 ile Önerme 16.2 birleşince, \(c_1, \dots, c_n\) sabitleri için
\[E\left[ \sum_{i=1}^{n} c_i\, g_i(X) \right] = \sum_{i=1}^{n} c_i\, E\big[g_i(X)\big]\]
elde edilir. Bu yüzden beklenen değer, ya da \(E\) operatörü, lineer bir dönüşümdür. Bundan sonraki hesapların çoğu bu tek cümleye dayanır.
Lineerliğin en basit ve en sık kullanılan hâli, \(X\)’in yerine \(aX + b\) konulmasıdır. Bir sıcaklık ölçümünü Celsius’tan Fahrenheit’a çevirmek, bir fiyata sabit bir vergi eklemek, bir ölçümü başka birime dönüştürmek hep bu türdendir. Beklenen değer ve varyans bu dönüşüm altında öngörülebilir biçimde değişir.
Teorem 16.2 (Doğrusal Dönüşümün Beklenen Değeri ve Varyansı) \(X\) bir rastgele değişken ve \(a, b \in \mathbb{R}\) olsun.
(a) \(E(X)\) varsa \(E(aX + b)\) de vardır ve \(E(aX + b) = a\,E(X) + b\) olur.
(b) \(\operatorname{Var}(X)\) varsa \(\operatorname{Var}(aX + b)\) de vardır ve \(\operatorname{Var}(aX + b) = a^2 \operatorname{Var}(X)\) olur.
İspat
(a) Önce varlık. \(|ax + b| \le |a|\,|x| + |b|\) olduğundan kesikli durumda
\[\sum_{x \in D_X} |ax + b|\, f_X(x) \le |a| \sum_{x \in D_X} |x|\, f_X(x) + |b| \sum_{x \in D_X} f_X(x) = |a| \sum_{x \in D_X} |x|\, f_X(x) + |b| < \infty\]
olur; sağdaki seri \(E(X)\)’in varlık koşulundan yakınsaktır. Sürekli durumda aynı sınır integralle yazılır. Demek ki \(E(aX + b)\) vardır. Değeri doğrudan hesaplayalım. \(X\) kesikli ise
\[E(aX + b) = \sum_{x \in D_X} (ax + b)\, f_X(x) = a \underbrace{\sum_{x \in D_X} x\, f_X(x)}_{= E(X)} + b \underbrace{\sum_{x \in D_X} f_X(x)}_{= 1} = a\,E(X) + b.\]
\(X\) sürekli ise
\[E(aX + b) = \int_{-\infty}^{\infty} (ax + b)\, f_X(x)\,dx = a \int_{-\infty}^{\infty} x\, f_X(x)\,dx + b \int_{-\infty}^{\infty} f_X(x)\,dx = a\,E(X) + b.\]
(b) \(\mu = E(X)\) yazalım. (a) gereği \(E(aX + b) = a\mu + b\) olduğundan, varyansın tanımına göre
\[\operatorname{Var}(aX + b) = E\Big[\big(aX + b - E(aX + b)\big)^2\Big] = E\Big[\big(aX + b - a\mu - b\big)^2\Big] = E\Big[a^2 (X - \mu)^2\Big].\]
\(E[(X - \mu)^2] = \operatorname{Var}(X)\) var olduğundan Önerme 16.2’in (b) maddesi sabit \(a^2\)’yi dışarı alır:
\[\operatorname{Var}(aX + b) = a^2\, E\big[(X - \mu)^2\big] = a^2 \operatorname{Var}(X).\]
\(\blacksquare\)
Sonucun iki yanı ayrı ayrı yorumlanmalıdır. \(b\) sabitini eklemek dağılımı bütünüyle \(b\) kadar kaydırır: merkez \(b\) kadar kayar, ama yayılım değişmez; \(\operatorname{Var}(X + b) = \operatorname{Var}(X)\). \(a\) ile çarpmak ise dağılımı \(|a|\) kat gerer ya da sıkıştırır; uzaklıklar \(|a|\) katına, uzaklıkların kareleri \(a^2\) katına çıkar. Standart sapma cinsinden yazılırsa \(\sigma_{aX + b} = |a|\, \sigma_X\) olur. Bu gözlemin en yararlı uygulaması standartlaştırmadır: \(\sigma_X > 0\) ise
\[Z = \frac{X - \mu_X}{\sigma_X} = \frac{1}{\sigma_X} X - \frac{\mu_X}{\sigma_X}\]
rastgele değişkeni için \(E(Z) = \frac{1}{\sigma_X}\mu_X - \frac{\mu_X}{\sigma_X} = 0\) ve \(\operatorname{Var}(Z) = \frac{1}{\sigma_X^2} \operatorname{Var}(X) = 1\) olur. Yani her rastgele değişken, doğrusal bir dönüşümle beklenen değeri \(0\) ve varyansı \(1\) olan bir değişkene çevrilebilir.
16.4 Varyansın Hesaplanması
Varyansı tanımından, yani \(\sum_{x \in D_X} (x - \mu)^2 f_X(x)\) toplamından hesaplamak, önce \(\mu\)’yü bulmayı, sonra her terimde bir fark ve bir kare almayı gerektirir. Aşağıdaki formül bu işi \(E(X)\) ve \(E(X^2)\) gibi iki bağımsız hesaba indirger; uygulamada varyans hemen her zaman bu yolla bulunur.
Önerme 16.3 (Varyans Hesap Formülü) \(X\), ikinci momenti \(E(X^2)\) var olan bir rastgele değişken ve \(\mu = E(X)\) olsun.
(a) \(\operatorname{Var}(X)\) vardır ve
\[\operatorname{Var}(X) = E\big(X^2\big) - \big(E(X)\big)^2\]
olur.
(b) Her \(c \in \mathbb{R}\) için
\[E\big[(X - c)^2\big] = \operatorname{Var}(X) + (\mu - c)^2\]
olur. Dolayısıyla \(c\)’ye göre ikinci moment en küçük değerini yalnız \(c = \mu\)’de alır ve bu en küçük değer \(\operatorname{Var}(X)\)’tir.
İspat
(a) \(E(X^2)\) var olduğundan Önerme 16.1’in (c) maddesi gereği \(E(X)\) de vardır; \(\mu\) sonlu bir sayıdır. \((X - \mu)^2 = X^2 - 2\mu X + \mu^2\) açılımındaki üç terimin de beklenen değeri vardır, öyleyse Teorem 16.1 ve Önerme 16.2 gereği \(E[(X-\mu)^2]\) vardır ve
\[\operatorname{Var}(X) = E\big[X^2 - 2\mu X + \mu^2\big] = E\big(X^2\big) - 2\mu\, E(X) + \mu^2 = E\big(X^2\big) - 2\mu^2 + \mu^2 = E\big(X^2\big) - \mu^2.\]
Kesikli durumda bu hesap açıkça
\[\sum_{x \in D_X} (x - \mu)^2 f_X(x) = \sum_{x \in D_X} x^2 f_X(x) - 2\mu \sum_{x \in D_X} x\, f_X(x) + \mu^2 \sum_{x \in D_X} f_X(x) = E\big(X^2\big) - 2\mu \cdot \mu + \mu^2 = E\big(X^2\big) - \mu^2\]
biçimindedir; sürekli durumda toplamların yerini integraller alır.
(b) \(X - c = (X - \mu) + (\mu - c)\) yazıp kare alalım:
\[(X - c)^2 = (X - \mu)^2 + 2(\mu - c)(X - \mu) + (\mu - c)^2.\]
Beklenen değer alındığında lineerlik gereği
\[E\big[(X - c)^2\big] = E\big[(X - \mu)^2\big] + 2(\mu - c)\, E(X - \mu) + (\mu - c)^2\]
olur. \(E(X - \mu) = E(X) - \mu = 0\) olduğundan ortadaki terim düşer ve \(E[(X - c)^2] = \operatorname{Var}(X) + (\mu - c)^2\) kalır. \((\mu - c)^2 \ge 0\) ve yalnız \(c = \mu\)’de sıfır olduğundan en küçük değer \(c = \mu\)’de alınır.
\(\blacksquare\)
(b) maddesi beklenen değerin “merkez” yorumunu kesinleştirir: \(X\)’i tek bir \(c\) sayısıyla temsil etmek isteyip hatayı \((X - c)^2\)’nin beklenen değeriyle ölçersek, en iyi seçim \(c = \mu\)’dür ve o zaman kalan hata tam olarak varyanstır.
Bir başka sonuç da varlıkla ilgilidir: \(E(X^2)\) varsa varyans vardır. Tersi de doğrudur; \(\mu\) ve \(\operatorname{Var}(X)\) varsa \(X^2 = (X - \mu)^2 + 2\mu X - \mu^2\) eşitliği \(E(X^2)\)’nin varlığını verir. Yani varyansın var olması ile ikinci momentin var olması aynı şeydir.
Varyans, karelerin ağırlıklı ortalaması olduğundan negatif olamaz. Bu basit gözlemin hesap formülüyle birleşmesi, sık kullanılan bir eşitsizlik verir.
Önerme 16.4 (Varyans Negatif Olamaz) \(X\), ikinci momenti var olan bir rastgele değişken olsun.
(a) \(\operatorname{Var}(X) \ge 0\).
(b) \(E\big(X^2\big) \ge \big(E(X)\big)^2\).
(c) \(X\) kesikli ise, \(\operatorname{Var}(X) = 0\) olması için gerek ve yeter koşul \(P\big(X = E(X)\big) = 1\) olmasıdır.
İspat
(a) \(\mu = E(X)\) olsun. Kesikli durumda \(\operatorname{Var}(X) = \sum_{x \in D_X} (x - \mu)^2 f_X(x)\) toplamının her terimi, negatif olmayan \((x - \mu)^2\) ile negatif olmayan \(f_X(x)\)’in çarpımıdır; öyleyse toplam \(\ge 0\)’dır. Sürekli durumda \(\int_{-\infty}^{\infty} (x - \mu)^2 f_X(x)\,dx\) integralinin integrandı her yerde \(\ge 0\) olduğundan integral \(\ge 0\)’dır.
(b) Önerme 16.3 gereği \(0 \le \operatorname{Var}(X) = E(X^2) - (E(X))^2\); taraflar düzenlenince \(E(X^2) \ge (E(X))^2\) çıkar.
(c) \(X\) kesikli olsun ve \(D_X\), olasılığı pozitif olan değerlerden oluşsun. \(\operatorname{Var}(X) = 0\) ise, negatif olmayan terimlerden oluşan \(\sum_{x \in D_X} (x - \mu)^2 f_X(x)\) toplamı sıfırdır; bu ancak her terim sıfırsa olur. \(f_X(x) > 0\) olduğundan her \(x \in D_X\) için \((x - \mu)^2 = 0\), yani \(x = \mu\) olmalıdır. Demek ki \(D_X = \{\mu\}\) ve \(P(X = \mu) = f_X(\mu) = 1\). Tersine \(P(X = \mu) = 1\) ise \(D_X = \{\mu\}\) ve \(\operatorname{Var}(X) = (\mu - \mu)^2 \cdot 1 = 0\) olur.
\(\blacksquare\)
(c) maddesi varyansın yayılım ölçüsü olduğunu en uç durumda doğrular: varyansın sıfır olması, rastgele değişkenin aslında rastgele olmaması, tek bir değere çakılmış olması demektir. Sürekli bir rastgele değişkenin varyansı hiçbir zaman sıfır olamaz; bunu Chebyshev eşitsizliğinden sonra göstereceğiz.
16.5 Örnekler
Şimdi tanımları ve formülleri somut dağılımlar üzerinde işletelim. Her örnekte aynı üç adım tekrarlanır: \(E(X)\), \(E(X^2)\) ve \(\operatorname{Var}(X) = E(X^2) - (E(X))^2\).
Örnek 16.2 (Kesikli Düzgün Dağılımın Momentleri) \(X\) kesikli rastgele değişkeninin olasılık fonksiyonu
\[f_X(x) = \frac{1}{6}, \qquad x \in \{-2, -1, 0, 1, 2, 3\}\]
olsun. \(E(X)\), \(E(X^2)\), \(\operatorname{Var}(X)\) ve \(\sigma_X\) değerlerini bulunuz.
Çözüm
\(D_X\) sonlu olduğundan bütün momentler vardır. Beklenen değer:
\[E(X) = \sum_{x = -2}^{3} x\, f_X(x) = (-2) \cdot \frac{1}{6} + (-1) \cdot \frac{1}{6} + 0 \cdot \frac{1}{6} + 1 \cdot \frac{1}{6} + 2 \cdot \frac{1}{6} + 3 \cdot \frac{1}{6} = \frac{-2 - 1 + 0 + 1 + 2 + 3}{6} = \frac{3}{6} = \frac{1}{2}.\]
İkinci moment:
\[E\big(X^2\big) = \sum_{x = -2}^{3} x^2 f_X(x) = \frac{(-2)^2 + (-1)^2 + 0^2 + 1^2 + 2^2 + 3^2}{6} = \frac{4 + 1 + 0 + 1 + 4 + 9}{6} = \frac{19}{6}.\]
Varyans, Önerme 16.3 ile:
\[\operatorname{Var}(X) = E\big(X^2\big) - \big(E(X)\big)^2 = \frac{19}{6} - \left( \frac{1}{2} \right)^2 = \frac{38}{12} - \frac{3}{12} = \frac{35}{12}.\]
Aynı sonucu tanımdan da doğrulayalım. \(\mu = \frac{1}{2}\) için \(x - \mu\) farkları \(-\frac{5}{2}, -\frac{3}{2}, -\frac{1}{2}, \frac{1}{2}, \frac{3}{2}, \frac{5}{2}\); kareleri \(\frac{25}{4}, \frac{9}{4}, \frac{1}{4}, \frac{1}{4}, \frac{9}{4}, \frac{25}{4}\)’tür ve
\[\operatorname{Var}(X) = \frac{1}{6} \cdot \frac{25 + 9 + 1 + 1 + 9 + 25}{4} = \frac{1}{6} \cdot \frac{70}{4} = \frac{35}{12}.\]
Standart sapma \(\sigma_X = \sqrt{\frac{35}{12}} \approx 1{,}71\)’dir.
Beklenen değerin \(\frac{1}{2}\) çıkması şaşırtıcı değildir: \(\frac{1}{2}\), \(D_X = \{-2, \dots, 3\}\) kümesinin tam ortasıdır; altı eşit kütle \(-2\) ile \(3\) arasına eşit aralıklarla dizilmiştir ve sistem bu iki ucun ortasında dengede durur. \(\frac{1}{2}\)’nin \(X\)’in alabileceği bir değer olmadığına dikkat ediniz; beklenen değer bir “olası sonuç” değil, dağılımın ağırlık merkezidir.
\(\blacksquare\)
Örnek 16.3 (Sürekli Düzgün Dağılımın Momentleri) \(X\) sürekli rastgele değişkeninin yoğunluk fonksiyonu
\[f_X(x) = \begin{cases} \dfrac{1}{2}, & 0 < x < 2 \\[2mm] 0, & \text{diğer durumlarda} \end{cases}\]
olsun. \(E(X)\), \(E(X^2)\) ve \(\operatorname{Var}(X)\) değerlerini bulunuz.
Çözüm
\(f_X\) sınırlı bir aralık dışında sıfır olduğundan bütün momentler vardır. Beklenen değer:
\[E(X) = \int_{0}^{2} x \cdot \frac{1}{2}\,dx = \frac{1}{2} \left[ \frac{x^2}{2} \right]_{0}^{2} = \frac{1}{2} \cdot 2 = 1.\]
İkinci moment:
\[E\big(X^2\big) = \int_{0}^{2} x^2 \cdot \frac{1}{2}\,dx = \frac{1}{2} \left[ \frac{x^3}{3} \right]_{0}^{2} = \frac{1}{2} \cdot \frac{8}{3} = \frac{4}{3}.\]
Varyans:
\[\operatorname{Var}(X) = E\big(X^2\big) - \big(E(X)\big)^2 = \frac{4}{3} - 1 = \frac{1}{3}.\]
Tanımdan doğrulama: \(\mu = 1\) için
\[\operatorname{Var}(X) = \int_{0}^{2} (x - 1)^2 \cdot \frac{1}{2}\,dx = \frac{1}{2} \left[ \frac{(x - 1)^3}{3} \right]_{0}^{2} = \frac{1}{2} \left( \frac{1}{3} - \left( -\frac{1}{3} \right) \right) = \frac{1}{3}.\]
Standart sapma \(\sigma_X = \frac{1}{\sqrt{3}} \approx 0{,}58\)’dir. Beklenen değerin \((0, 2)\) aralığının orta noktası olan \(1\) çıkması, yoğunluğun simetrisinin doğal bir sonucudur.
Teorem 16.2’ı bu örnekte deneyelim: \(Y = 3X - 1\) için hiçbir yeni integral hesaplamadan \(E(Y) = 3 \cdot 1 - 1 = 2\) ve \(\operatorname{Var}(Y) = 9 \cdot \frac{1}{3} = 3\) bulunur.
\(\blacksquare\)
Örnek 16.4 (Kuyruğu Kuvvet Gibi Sönen Bir Yoğunluk) \(X\) sürekli rastgele değişkeninin yoğunluk fonksiyonu
\[f_X(x) = \begin{cases} 3x^{-4}, & x > 1 \\[1mm] 0, & \text{diğer durumlarda} \end{cases}\]
olsun. \(E(X)\), \(E(X^2)\) ve \(\operatorname{Var}(X)\) değerlerini bulunuz. \(X\)’in hangi mertebeden momentleri vardır?
Çözüm
Önce \(f_X\)’in bir yoğunluk olduğunu görelim: \(f_X \ge 0\) ve
\[\int_{1}^{\infty} 3x^{-4}\,dx = \lim_{b \to \infty} \Big[ -x^{-3} \Big]_{1}^{b} = \lim_{b \to \infty} \left( 1 - \frac{1}{b^3} \right) = 1.\]
Beklenen değer. İntegrand \(x > 1\) üzerinde pozitif olduğundan mutlak yakınsaklık ile yakınsaklık aynı şeydir:
\[E(X) = \int_{1}^{\infty} x \cdot 3x^{-4}\,dx = \int_{1}^{\infty} 3x^{-3}\,dx = \lim_{b \to \infty} \left[ -\frac{3}{2} x^{-2} \right]_{1}^{b} = \frac{3}{2}.\]
İkinci moment:
\[E\big(X^2\big) = \int_{1}^{\infty} x^2 \cdot 3x^{-4}\,dx = \int_{1}^{\infty} 3x^{-2}\,dx = \lim_{b \to \infty} \Big[ -3x^{-1} \Big]_{1}^{b} = 3.\]
Varyans:
\[\operatorname{Var}(X) = E\big(X^2\big) - \big(E(X)\big)^2 = 3 - \left( \frac{3}{2} \right)^2 = 3 - \frac{9}{4} = \frac{3}{4}.\]
Standart sapma \(\sigma_X = \frac{\sqrt{3}}{2} \approx 0{,}87\)’dir.
Üçüncü momente bakalım:
\[\int_{1}^{\infty} x^3 \cdot 3x^{-4}\,dx = \int_{1}^{\infty} \frac{3}{x}\,dx = \lim_{b \to \infty} 3 \ln b = \infty.\]
Öyleyse \(E(X^3)\) yoktur; Önerme 16.1’in (c) maddesi gereği \(k \ge 3\) için hiçbir \(E(X^k)\) yoktur. Genel olarak \(x^{-4}\) gibi kuvvet biçiminde sönen bir kuyruk, ancak sönme hızının izin verdiği kadar momente sahiptir: \(x^k \cdot x^{-4}\) integrallenebilir olsun diye \(k - 4 < -1\), yani \(k < 3\) gerekir. Örnek 16.1’taki \(x^{-2}\) kuyruğu için aynı ölçüt \(k < 1\) verir; bu yüzden orada birinci moment bile yoktu.
\(\blacksquare\)
Örnek 16.5 (Üçgen Yoğunluğun Momentleri) \(X\) sürekli rastgele değişkeninin yoğunluk fonksiyonu
\[f_X(x) = \begin{cases} \dfrac{1}{4}\big(2 - |x|\big), & -2 \le x \le 2 \\[2mm] 0, & \text{diğer durumlarda} \end{cases}\]
olsun. \(E(X)\) ve \(\operatorname{Var}(X)\) değerlerini bulunuz.
Çözüm
Grafiği \((-2, 0)\), \((0, \frac{1}{2})\) ve \((2, 0)\) köşeli bir üçgen olan bu fonksiyon negatif değildir ve altında kalan alan üçgenin alanıdır: \(\frac{1}{2} \cdot 4 \cdot \frac{1}{2} = 1\). İntegralle de doğrulayalım; \(f_X\) çift fonksiyon olduğundan
\[\int_{-2}^{2} f_X(x)\,dx = 2 \int_{0}^{2} \frac{1}{4}(2 - x)\,dx = \frac{1}{2} \left[ 2x - \frac{x^2}{2} \right]_{0}^{2} = \frac{1}{2}(4 - 2) = 1.\]
Beklenen değer. \(x f_X(x)\) tek fonksiyondur ve \([-2, 2]\) sınırlı aralığında integrallenebilir; öyleyse mutlak yakınsaklık koşulu sağlanır ve simetri kullanılabilir: \(E(X) = 0\). Açık hesapla da görelim:
\[E(X) = \int_{-2}^{0} x \cdot \frac{2 + x}{4}\,dx + \int_{0}^{2} x \cdot \frac{2 - x}{4}\,dx = \frac{1}{4} \left[ x^2 + \frac{x^3}{3} \right]_{-2}^{0} + \frac{1}{4} \left[ x^2 - \frac{x^3}{3} \right]_{0}^{2} = \frac{1}{4} \left( -\frac{4}{3} \right) + \frac{1}{4} \cdot \frac{4}{3} = 0.\]
İkinci moment. \(x^2 f_X(x)\) çift fonksiyondur:
\[E\big(X^2\big) = 2 \int_{0}^{2} x^2 \cdot \frac{1}{4}(2 - x)\,dx = \frac{1}{2} \int_{0}^{2} \big(2x^2 - x^3\big)\,dx = \frac{1}{2} \left[ \frac{2x^3}{3} - \frac{x^4}{4} \right]_{0}^{2} = \frac{1}{2} \left( \frac{16}{3} - 4 \right) = \frac{1}{2} \cdot \frac{4}{3} = \frac{2}{3}.\]
Varyans. \(E(X) = 0\) olduğundan
\[\operatorname{Var}(X) = E\big(X^2\big) - 0^2 = \frac{2}{3}, \qquad \sigma_X = \sqrt{\frac{2}{3}} \approx 0{,}82.\]
Karşılaştırma için \([-2, 2]\) üzerindeki düzgün yoğunluğu, \(f(x) = \frac{1}{4}\), düşünelim: beklenen değeri yine \(0\), ikinci momenti \(\int_{-2}^{2} \frac{x^2}{4}\,dx = \frac{4}{3}\)’tür. Üçgen yoğunluk kütlesini merkeze yığdığından varyansı düzgün yoğunluğunkinin yarısıdır. Varyans, aynı aralık üzerindeki iki dağılımı yayılımlarına göre ayırt etmektedir.
\(\blacksquare\)
16.6 Markov ve Chebyshev Eşitsizlikleri
Varyansın yayılımı ölçtüğünü söyledik; ama “küçük varyans, merkeze yakın değerler” cümlesi şimdilik bir slogandan ibarettir. Bunu kesin bir ifadeye çevirmek istiyoruz: varyansı bilinen bir rastgele değişkenin, beklenen değerinden en az \(\varepsilon\) uzağa düşme olasılığı en çok ne olabilir? Dağılımın kendisi hakkında hiçbir şey bilmeden yanıt verilebilmesi şaşırtıcıdır. Önce daha temel bir eşitsizlik gerekir.
Teorem 16.3 (Markov Eşitsizliği) \(X\), değer kümesi \(D_X \subseteq [0, \infty)\) olan ve beklenen değeri var olan bir rastgele değişken olsun. Her \(a > 0\) için
\[P(X \ge a) \le \frac{E(X)}{a}\]
olur.
İspat
\(X\) kesikli ise. \(D_X\)’teki her \(x\) negatif olmadığından \(x f_X(x) \ge 0\)’dır; toplamdan \(x < a\) olan terimleri atmak toplamı küçültür ya da değiştirmez:
\[E(X) = \sum_{x \in D_X} x\, f_X(x) \ge \sum_{x \in D_X,\; x \ge a} x\, f_X(x) \ge \sum_{x \in D_X,\; x \ge a} a\, f_X(x) = a \sum_{x \in D_X,\; x \ge a} f_X(x) = a\, P(X \ge a).\]
İkinci eşitsizlikte, kalan terimlerde \(x \ge a\) olduğundan \(x\)’in yerine daha küçük olan \(a\) yazılmıştır. Her iki taraf \(a > 0\)’a bölünürse istenen çıkar.
\(X\) sürekli ise. \(x < 0\) için \(f_X(x) = 0\) olduğundan integrand \([0, \infty)\) dışında sıfırdır ve aynı adımlar integralle yazılır:
\[E(X) = \int_{0}^{\infty} x\, f_X(x)\,dx \ge \int_{a}^{\infty} x\, f_X(x)\,dx \ge \int_{a}^{\infty} a\, f_X(x)\,dx = a\, P(X \ge a).\]
\(\blacksquare\)
Markov eşitsizliği yalnız beklenen değeri kullanır ve \(X \ge 0\) koşuluna dayanır. Örneğin ortalama geliri \(E(X)\) olan bir toplulukta, gelirin dağılımı ne olursa olsun, geliri ortalamanın \(10\) katından fazla olanların oranı \(\frac{1}{10}\)’u geçemez. Şimdi bunu \((X - \mu)^2\) rastgele değişkenine uygulayalım.
Teorem 16.4 (Chebyshev Eşitsizliği) \(X\), varyansı var olan bir rastgele değişken, \(\mu = E(X)\) ve \(\sigma^2 = \operatorname{Var}(X)\) olsun. Her \(\varepsilon > 0\) için
\[P\big(|X - \mu| \ge \varepsilon\big) \le \frac{\sigma^2}{\varepsilon^2}, \qquad \text{eşdeğer olarak} \qquad P\big(|X - \mu| < \varepsilon\big) \ge 1 - \frac{\sigma^2}{\varepsilon^2}\]
olur. Özel olarak \(\sigma > 0\) ve \(k > 0\) için \(\varepsilon = k\sigma\) alınırsa
\[P\big(|X - \mu| \ge k\sigma\big) \le \frac{1}{k^2}\]
bulunur.
İspat
\(g(x) = (x - \mu)^2\) Borel ölçülebilir bir fonksiyondur (sürekli); \(Y = g(X) = (X - \mu)^2\) rastgele değişkeninin değerleri negatif değildir ve \(E(Y) = \operatorname{Var}(X) = \sigma^2\) vardır. \(|X - \mu| \ge \varepsilon\) olayı ile \(Y \ge \varepsilon^2\) olayı aynıdır, çünkü her iki taraf da negatif olmayan sayılardır ve kare alma \([0, \infty)\) üzerinde artandır. \(Y\)’ye \(a = \varepsilon^2\) ile Teorem 16.3 uygulanırsa
\[P\big(|X - \mu| \ge \varepsilon\big) = P\big(Y \ge \varepsilon^2\big) \le \frac{E(Y)}{\varepsilon^2} = \frac{\sigma^2}{\varepsilon^2}\]
çıkar. İkinci biçim tümleyen olayın olasılığıdır; üçüncüsü \(\varepsilon = k\sigma\) yazılarak elde edilir.
\(\blacksquare\)
Chebyshev eşitsizliği varyansın anlamını kesinleştirir: \(X\)’in beklenen değerinden \(2\sigma\)’dan fazla sapma olasılığı en çok \(\frac{1}{4}\), \(3\sigma\)’dan fazla sapma olasılığı en çok \(\frac{1}{9}\)’dur. Standart sapma, dağılımın “doğal uzunluk birimi”dir; merkezden birkaç \(\sigma\) uzağa gidildiğinde olasılık kütlesinin büyük bölümü geride kalmak zorundadır. Eşitsizliğin gücü genelliğindedir: \(X\)’in dağılımı hakkında \(\mu\) ve \(\sigma^2\) dışında hiçbir bilgi gerektirmez. Bedeli de aynı genelliktir; somut bir dağılım için verdiği sınır çoğu zaman gerçek olasılıktan çok kabadır. Aşağıdaki örnek her iki yönü de gösterir.
Örnek 16.6 (Chebyshev Eşitsizliğinin Uygulanması) (a) Bir dolum makinesinin doldurduğu paketlerin ağırlığı \(X\) (gram) rastgele değişkeninin dağılımı bilinmiyor; yalnız \(E(X) = 500\) ve \(\sigma_X = 10\) olduğu biliniyor. Bir paketin ağırlığının \(480\) ile \(520\) gram arasında olma olasılığı için bir alt sınır, \(500\)’den en az \(30\) gram sapma olasılığı için bir üst sınır bulunuz.
(b) Örnek 16.3’teki \(X\) için Chebyshev eşitsizliğinin \(\varepsilon = 1\)’de verdiği sınırı gerçek olasılıkla karşılaştırınız.
(c) \(k \ge 1\) bir tam sayı olmak üzere, \(X\) kesikli rastgele değişkeninin olasılık fonksiyonu
\[f_X(-1) = f_X(1) = \frac{1}{2k^2}, \qquad f_X(0) = 1 - \frac{1}{k^2}\]
olsun. Chebyshev eşitsizliğinin bu değişken için \(\varepsilon = 1\)’de eşitlikle sağlandığını gösteriniz.
Çözüm
(a) \(\mu = 500\), \(\sigma^2 = 100\). \(480 < X < 520\) olayı \(|X - 500| < 20\) olayıdır; \(\varepsilon = 20\) ile
\[P\big(480 < X < 520\big) = P\big(|X - 500| < 20\big) \ge 1 - \frac{100}{400} = \frac{3}{4}.\]
\(\varepsilon = 30\) ile
\[P\big(|X - 500| \ge 30\big) \le \frac{100}{900} = \frac{1}{9}.\]
Demek ki makine hakkında yalnız ortalama ve standart sapma bilinse bile, paketlerin en az dörtte üçünün \(480\)–\(520\) gram aralığında olduğu ve en çok dokuzda birinin \(500\) gramdan en az \(30\) gram saptığı söylenebilir.
(b) \(X\), \((0, 2)\) üzerinde düzgün dağılmıştı: \(\mu = 1\), \(\sigma^2 = \frac{1}{3}\). Chebyshev eşitsizliği \(\varepsilon = 1\) için
\[P\big(|X - 1| \ge 1\big) \le \frac{1/3}{1} = \frac{1}{3}\]
der. Oysa \(X\) değerlerini yalnız \((0, 2)\) aralığında aldığından \(|X - 1| \ge 1\) olayı, yani \(X \le 0\) ya da \(X \ge 2\) olayı, sıfır olasılıklıdır: gerçek olasılık \(0\)’dır. Sınır doğru ama kabadır.
(c) Önce \(f_X\)’in bir olasılık fonksiyonu olduğunu görelim: değerler negatif değildir ve toplamları \(\frac{1}{2k^2} + \frac{1}{2k^2} + 1 - \frac{1}{k^2} = 1\)’dir. Beklenen değer, simetri gereği ya da doğrudan,
\[\mu = (-1) \cdot \frac{1}{2k^2} + 0 \cdot \left( 1 - \frac{1}{k^2} \right) + 1 \cdot \frac{1}{2k^2} = 0;\]
varyans
\[\sigma^2 = E\big(X^2\big) - \mu^2 = E\big(X^2\big) = (-1)^2 \cdot \frac{1}{2k^2} + 0^2 \cdot \left( 1 - \frac{1}{k^2} \right) + 1^2 \cdot \frac{1}{2k^2} = \frac{1}{k^2}.\]
\(\varepsilon = 1\) için Chebyshev sınırı \(\frac{\sigma^2}{\varepsilon^2} = \frac{1}{k^2}\)’dir. Gerçek olasılık ise
\[P\big(|X - \mu| \ge 1\big) = P(X = -1) + P(X = 1) = \frac{1}{2k^2} + \frac{1}{2k^2} = \frac{1}{k^2}.\]
İki taraf eşittir. Demek ki Chebyshev eşitsizliğindeki \(\frac{\sigma^2}{\varepsilon^2}\) sınırı genel olarak iyileştirilemez: kütlesini merkeze ve iki uca dağıtan bu dağılım sınırı tam olarak doldurur.
\(\blacksquare\)
Söz verdiğimiz gibi, sürekli bir rastgele değişkenin varyansının sıfır olamayacağını Chebyshev eşitsizliğiyle gösterelim. \(X\) sürekli ve \(\operatorname{Var}(X) = 0\) olsa, her \(\varepsilon > 0\) için \(P(|X - \mu| \ge \varepsilon) \le 0\), yani \(P(|X - \mu| < \varepsilon) = 1\) olurdu. \(A_n = \big(|X - \mu| < \tfrac{1}{n}\big)\) olayları azalan bir dizi oluşturur ve kesişimleri \((X = \mu)\) olayıdır; Teorem 3.5 gereği
\[P(X = \mu) = \lim_{n \to \infty} P(A_n) = 1\]
olurdu. Oysa sürekli bir rastgele değişkende her nokta sıfır olasılıklıdır: \(P(X = \mu) = 0\). Bu çelişki gösterir ki sürekli bir rastgele değişkenin varyansı her zaman pozitiftir.
16.7 Alıştırmalar
Alıştırma 16.1 (Beklenen Değer, Momentler ve Varyans) (a) \(X\) kesikli rastgele değişkeninin olasılık fonksiyonu \(f_X(x) = \dfrac{x}{10}\), \(x \in \{1, 2, 3, 4\}\) olsun. \(E(X)\), \(E(X^2)\), \(\operatorname{Var}(X)\) ve \(\sigma_X\) değerlerini bulunuz.
(b) \(X\) sürekli rastgele değişkeninin yoğunluk fonksiyonu \(f_X(x) = 2x\) (\(0 < x < 1\)), diğer durumlarda \(0\) olsun. \(E(X)\), \(\operatorname{Var}(X)\) ve \(E\!\left( \dfrac{1}{X} \right)\) değerlerini bulunuz.
(c) \(X\) sürekli rastgele değişkeninin yoğunluk fonksiyonu \(f_X(x) = e^{-x}\) (\(x > 0\)), diğer durumlarda \(0\) olsun. Her \(k \in \mathbb{N}\) için \(E(X^k) = k!\) olduğunu gösteriniz; buradan \(\operatorname{Var}(X)\)’i bulunuz.
(d) \(E(X) = 2\) ve \(\operatorname{Var}(X) = 5\) olsun. \(Y = 3X - 2\) için \(E(Y)\), \(\operatorname{Var}(Y)\) ve \(E(Y^2)\) değerlerini bulunuz.
(e) \(X\) kesikli rastgele değişkeninin olasılık fonksiyonu \(f_X(x) = \dfrac{1}{x(x + 1)}\), \(x \in \{1, 2, 3, \dots\}\) olsun. \(f_X\)’in bir olasılık fonksiyonu olduğunu, ama \(E(X)\)’in var olmadığını gösteriniz.
(f) İkinci momenti var olan her \(X\) için \(\operatorname{Var}(X) = E\big[X(X - 1)\big] + E(X) - \big(E(X)\big)^2\) olduğunu gösteriniz. Örnek 16.2’teki \(X\) için ikinci çarpımsal moment \(E[X(X - 1)]\)’i hesaplayıp formülü doğrulayınız.
(g) Bir ölçüm aletinin verdiği değer \(X\) için \(E(X) = 50\) ve \(\sigma_X = 5\) biliniyor. \(P(35 < X < 65)\) için bir alt sınır bulunuz. \(P(|X - 50| < k\sigma_X) \ge 0{,}99\) olmasını garanti eden en küçük \(k\) tam sayısını ve buna karşılık gelen aralığı belirleyiniz.
Çözüm
(a) \(\sum_{x=1}^{4} \frac{x}{10} = \frac{10}{10} = 1\), gerçekten bir olasılık fonksiyonudur.
\[E(X) = \sum_{x=1}^{4} x \cdot \frac{x}{10} = \frac{1 + 4 + 9 + 16}{10} = \frac{30}{10} = 3, \qquad E\big(X^2\big) = \sum_{x=1}^{4} x^2 \cdot \frac{x}{10} = \frac{1 + 8 + 27 + 64}{10} = \frac{100}{10} = 10.\]
\(\operatorname{Var}(X) = 10 - 3^2 = 1\) ve \(\sigma_X = 1\).
(b) \(\int_0^1 2x\,dx = 1\), bir yoğunluktur.
\[E(X) = \int_{0}^{1} x \cdot 2x\,dx = \left[ \frac{2x^3}{3} \right]_{0}^{1} = \frac{2}{3}, \qquad E\big(X^2\big) = \int_{0}^{1} x^2 \cdot 2x\,dx = \left[ \frac{x^4}{2} \right]_{0}^{1} = \frac{1}{2}.\]
\(\operatorname{Var}(X) = \frac{1}{2} - \frac{4}{9} = \frac{9 - 8}{18} = \frac{1}{18}\). \(g(x) = \frac{1}{x}\) için
\[E\!\left( \frac{1}{X} \right) = \int_{0}^{1} \frac{1}{x} \cdot 2x\,dx = \int_{0}^{1} 2\,dx = 2.\]
\(g\) fonksiyonu \((0, 1)\) üzerinde sınırsız olduğu hâlde \(g(x) f_X(x) = 2\) sınırlı kaldığından beklenen değer vardır. \(E\!\left( \frac{1}{X} \right) = 2 \ne \frac{3}{2} = \frac{1}{E(X)}\) olduğuna dikkat ediniz; beklenen değer doğrusal olmayan fonksiyonların içine girmez.
(c) \(I_k = \int_{0}^{\infty} x^k e^{-x}\,dx\) yazalım; integrand pozitif olduğundan mutlak yakınsaklık ile yakınsaklık aynıdır. \(I_0 = \int_0^\infty e^{-x}\,dx = 1\)’dir; bu aynı zamanda \(f_X\)’in bir yoğunluk olduğunu gösterir. \(k \ge 1\) için \(u = x^k\), \(dv = e^{-x}\,dx\) ile kısmi integrasyon:
\[I_k = \Big[ -x^k e^{-x} \Big]_{0}^{\infty} + k \int_{0}^{\infty} x^{k-1} e^{-x}\,dx = 0 + k\, I_{k-1},\]
çünkü \(x \to \infty\) iken \(x^k e^{-x} \to 0\)’dır. Tümevarımla \(I_k = k \cdot (k-1) \cdots 1 \cdot I_0 = k!\) bulunur; yani her mertebeden moment vardır ve \(E(X^k) = k!\)’dir. Özel olarak \(E(X) = 1\), \(E(X^2) = 2\) ve
\[\operatorname{Var}(X) = 2 - 1^2 = 1.\]
(d) Teorem 16.2 ile \(E(Y) = 3 \cdot 2 - 2 = 4\) ve \(\operatorname{Var}(Y) = 3^2 \cdot 5 = 45\). Önerme 16.3’nü \(Y\) için ters yönde kullanırsak
\[E\big(Y^2\big) = \operatorname{Var}(Y) + \big(E(Y)\big)^2 = 45 + 16 = 61.\]
Aynı sonuca \(E(X^2) = 5 + 4 = 9\) ve lineerlik yoluyla da ulaşılır: \(E(Y^2) = E(9X^2 - 12X + 4) = 9 \cdot 9 - 12 \cdot 2 + 4 = 61\).
(e) Değerler pozitiftir. \(\frac{1}{x(x+1)} = \frac{1}{x} - \frac{1}{x + 1}\) olduğundan kısmi toplamlar iç içe sadeleşir:
\[\sum_{x=1}^{n} \frac{1}{x(x+1)} = \sum_{x=1}^{n} \left( \frac{1}{x} - \frac{1}{x+1} \right) = 1 - \frac{1}{n+1} \xrightarrow{\; n \to \infty \;} 1.\]
Demek ki \(f_X\) bir olasılık fonksiyonudur. Beklenen değer için mutlak yakınsaklık koşuluna bakalım; terimler pozitif olduğundan koşul serinin yakınsaması demektir:
\[\sum_{x=1}^{\infty} x \cdot \frac{1}{x(x+1)} = \sum_{x=1}^{\infty} \frac{1}{x+1} = \frac{1}{2} + \frac{1}{3} + \frac{1}{4} + \cdots = \infty,\]
çünkü bu, harmonik serinin ilk terimi atılmış hâlidir ve harmonik seri ıraksaktır. \(E(X)\) yoktur. Bu, Örnek 16.1’un kesikli karşılığıdır: \(f_X(x)\), \(x^{-2}\) hızıyla sönmektedir.
(f) \(X(X - 1) = X^2 - X\) olduğundan lineerlik gereği \(E[X(X-1)] = E(X^2) - E(X)\), yani \(E(X^2) = E[X(X-1)] + E(X)\)’tir. Bunu Önerme 16.3’nde yerine koyarsak
\[\operatorname{Var}(X) = E\big(X^2\big) - \big(E(X)\big)^2 = E\big[X(X-1)\big] + E(X) - \big(E(X)\big)^2.\]
Örnek 16.2’te \(E(X) = \frac{1}{2}\) ve \(E(X^2) = \frac{19}{6}\) bulunmuştu; öyleyse \(E[X(X-1)] = \frac{19}{6} - \frac{1}{2} = \frac{16}{6} = \frac{8}{3}\). Doğrudan da hesaplanabilir: \(x(x-1)\) değerleri \(x = -2, \dots, 3\) için \(6, 2, 0, 0, 2, 6\)’dır ve ortalamaları \(\frac{16}{6} = \frac{8}{3}\)’tür. Formül:
\[\frac{8}{3} + \frac{1}{2} - \frac{1}{4} = \frac{32 + 6 - 3}{12} = \frac{35}{12} = \operatorname{Var}(X).\]
Çarpımsal momentler, kesikli dağılımlarda \(E(X^2)\)’den daha kolay hesaplanır; bunun nedenini sonraki bölümde çarpımsal moment üreten fonksiyonla göreceğiz.
(g) \(35 < X < 65\) olayı \(|X - 50| < 15 = 3\sigma_X\) olayıdır. Teorem 16.4 ile
\[P\big(35 < X < 65\big) \ge 1 - \frac{1}{3^2} = \frac{8}{9}.\]
\(P(|X - 50| < k\sigma_X) \ge 1 - \frac{1}{k^2}\) olduğundan, \(1 - \frac{1}{k^2} \ge 0{,}99\), yani \(k^2 \ge 100\) olması yeter; en küçük tam sayı \(k = 10\)’dur. Karşılık gelen aralık \(|X - 50| < 50\), yani \((0, 100)\)’dür: dağılım ne olursa olsun, ölçümlerin en az yüzde \(99\)’u \(0\) ile \(100\) arasındadır.
\(\blacksquare\)
Beklenen değer ve varyans, bir dağılımın iki sayıya sığan özetidir; ama dağılımın bütün momentlerini tek bir fonksiyonda toplamak ve bu fonksiyondan dağılımı geri okumak da mümkündür: Karakteristik ve Moment Üreten Fonksiyonlar.