18 Rastgele Vektörlerde Beklenen Değer, Kovaryans ve Korelasyon
Karakteristik ve Moment Üreten Fonksiyonlar bölümü de içinde olmak üzere, şimdiye kadar beklenen değeri hep tek bir rastgele değişken için inceledik: \(E(X)\), \(E(X^2)\), \(\operatorname{Var}(X)\), \(M_X(t)\). Oysa uygulamada rastgele değişkenler çoğunlukla birlikte gelir: bir kişinin boyu ile kilosu, iki zarın gösterdiği sayılar, bir cihazın iki parçasının ömürleri. İki değişkenin birlikte nasıl davrandığını anlamak için, ortak dağılımdan hesaplanan beklenen değerlere ihtiyacımız vardır.
Bu bölümde önce \(g(X_1, X_2)\) biçimindeki bir rastgele değişkenin beklenen değerini ortak olasılık fonksiyonu ya da ortak yoğunluk fonksiyonu üzerinden tanımlayacağız. Bu tanım bize iki yeni araç verecek: beklenen değerin farklı değişkenlerin toplamı üzerinde de lineer olması ve bağımsız değişkenlerde çarpımın beklenen değerinin beklenen değerlerin çarpımına ayrılması. Ardından iki değişken arasındaki lineer ilişkiyi ölçen iki sayıyı, kovaryans ve korelasyon katsayısını tanımlayacağız; korelasyon katsayısının her zaman \(-1\) ile \(1\) arasında kaldığını Cauchy–Schwarz eşitsizliğiyle ispatlayacağız ve bağımsızlık ile kovaryansın sıfır olması arasındaki ilişkinin tek yönlü olduğunu bir örnekle göreceğiz.
Bölümün son iki kısmı hesaba ayrılmıştır: bir lineer birleşimin varyansı için genel formül ve aynı beklenen değeri birden çok yolla hesaplayan çözümlü örnekler. Bu örneklerde ortak yoğunluk, marjinal yoğunluk, ortak moment üreten fonksiyon ve dönüştürülmüş değişkenin kendi dağılımı gibi farklı yolların hep aynı sayıya ulaştığını görmek, sonraki bölümlerde en kısa yolu seçebilmemizi sağlayacaktır.
18.1 Rastgele Vektörün Fonksiyonunun Beklenen Değeri
Tek değişkenli beklenen değeri (Tanım 16.1) tanımlarken \(X\)’in olasılık fonksiyonunu ya da yoğunluk fonksiyonunu kullandık. \((X_1, X_2)\) bir rastgele vektörse elimizdeki nesne ortak olasılık fonksiyonu \(f_{X_1,X_2}\) (Tanım 13.4) ya da ortak yoğunluk fonksiyonu \(f_{X_1,X_2}\)’dir (Tanım 13.6). \(g(X_1, X_2)\) biçimindeki bir rastgele değişkenin beklenen değeri de aynı düşünceyle, \(g\)’nin aldığı değerlerin ortak olasılıkla ağırlıklı ortalaması olarak tanımlanır.
Tanım 18.1 (Rastgele Vektörün Fonksiyonunun Beklenen Değeri) \((X_1, X_2)\) bir rastgele vektör ve \(g : \mathbb{R}^2 \to \mathbb{R}\), her \(B \in \mathcal{B}(\mathbb{R})\) için
\[\{(x_1, x_2) \in \mathbb{R}^2 : g(x_1, x_2) \in B\} \in \mathcal{B}(\mathbb{R}^2)\]
koşulunu sağlayan (Borel ölçülebilir) bir fonksiyon olsun.
(i) \((X_1, X_2)\) kesikli bir rastgele vektör ve ortak olasılık fonksiyonu \(f_{X_1,X_2}\) ise,
\[\sum_{x_1 \in D_{X_1}} \sum_{x_2 \in D_{X_2}} \big| g(x_1, x_2) \big|\, f_{X_1,X_2}(x_1, x_2) < \infty\]
olduğunda
\[E\big[ g(X_1, X_2) \big] = \sum_{x_1 \in D_{X_1}} \sum_{x_2 \in D_{X_2}} g(x_1, x_2)\, f_{X_1,X_2}(x_1, x_2),\]
(ii) \((X_1, X_2)\) sürekli bir rastgele vektör ve ortak yoğunluk fonksiyonu \(f_{X_1,X_2}\) ise,
\[\int_{-\infty}^{\infty} \int_{-\infty}^{\infty} \big| g(x_1, x_2) \big|\, f_{X_1,X_2}(x_1, x_2)\, dx_1\, dx_2 < \infty\]
olduğunda
\[E\big[ g(X_1, X_2) \big] = \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} g(x_1, x_2)\, f_{X_1,X_2}(x_1, x_2)\, dx_1\, dx_2\]
sayısına \(g(X_1, X_2)\) rastgele değişkeninin beklenen değeri denir. Mutlak yakınsaklık koşulu sağlanmıyorsa beklenen değer tanımsızdır.
Tanımdaki ölçülebilirlik koşulu, \(g(X_1, X_2)\)’nin gerçekten bir rastgele değişken olmasını güvence altına alır; sürekli fonksiyonlar, polinomlar, parçalı sürekli fonksiyonlar bu koşulu sağlar ve bu bölümde karşımıza çıkacak bütün \(g\)’ler bu türdendir.
Tanımın ilk sınaması, tek değişkenli tanımla çelişmemesidir. \(g(x_1, x_2) = x_1\) alalım. Sürekli durumda iç integral marjinal yoğunluğu verir (Tanım 13.8):
\[\int_{-\infty}^{\infty} \int_{-\infty}^{\infty} x_1\, f_{X_1,X_2}(x_1, x_2)\, dx_2\, dx_1 = \int_{-\infty}^{\infty} x_1 \left( \int_{-\infty}^{\infty} f_{X_1,X_2}(x_1, x_2)\, dx_2 \right) dx_1 = \int_{-\infty}^{\infty} x_1\, f_{X_1}(x_1)\, dx_1 = E(X_1).\]
Kesikli durumda aynı hesap toplamlarla yapılır. Demek ki \(E(X_1)\)’i ister ortak dağılımdan ister marjinal dağılımdan hesaplayalım, aynı sayıyı buluruz. Daha genel olarak \(g(X_1, X_2)\) rastgele değişkeninin dağılımı bulunup (bunun için Teorem 15.1 kullanılabilir) beklenen değeri kendi dağılımından hesaplansa da yine yukarıdaki tanımla aynı sayı elde edilir; bu, tek değişkenli dönüşüm formülünün (Teorem 12.2) iki boyutlu karşılığıdır. Kesikli durumda gerekçesi kısadır: \(Z = g(X_1, X_2)\) için \((Z = z)\) olayı, \(g(x_1, x_2) = z\) eşitliğini sağlayan hücrelerin ayrık birleşimidir, dolayısıyla
\[E(Z) = \sum_{z \in D_Z} z\, P(Z = z) = \sum_{z \in D_Z} z \sum_{(x_1, x_2) :\, g(x_1, x_2) = z} f_{X_1,X_2}(x_1, x_2) = \sum_{x_1 \in D_{X_1}} \sum_{x_2 \in D_{X_2}} g(x_1, x_2)\, f_{X_1,X_2}(x_1, x_2).\]
Son adımda hücreler \(g\)’nin değerine göre öbeklenmiş olduğundan her hücre tam bir kez sayılır; mutlak yakınsaklık da toplama sırasının değiştirilmesini haklı kılar. Sürekli durumda aynı akıl yürütme integrallerle yapılır. Bu bölümdeki örneklerde her iki yolu da izleyip aynı sonuca ulaştığımızı defalarca göreceğiz.
Tek değişkende \(E(X^k)\) momentlerini (Tanım 16.2) tanımlamıştık. İki değişkende, iki değişkenin kuvvetlerinin çarpımının beklenen değeri “ortak moment” adını alır.
Tanım 18.2 (Ortak Momentler ve Merkezi Ortak Momentler) \((X_1, X_2)\) bir rastgele vektör ve \(k_1, k_2 \in \{0, 1, 2, \dots\}\) negatif olmayan tam sayılar olsun. İlgili beklenen değerler var olduğunda,
(a) \(E\big( X_1^{k_1} X_2^{k_2} \big)\) sayısına \((X_1, X_2)\) rastgele vektörünün \((k_1, k_2)\)-ortak momenti,
(b) \(E\Big[ \big( X_1 - E(X_1) \big)^{k_1} \big( X_2 - E(X_2) \big)^{k_2} \Big]\) sayısına \((X_1, X_2)\) rastgele vektörünün \((k_1, k_2)\)-merkezi ortak momenti
denir.
\(k_2 = 0\) alınırsa \((k_1, 0)\)-ortak momenti \(E(X_1^{k_1})\), yani \(X_1\)’in kendi \(k_1\). momentidir; merkezi ortak moment de \(X_1\)’in merkezi momentine döner. Bu bölümün ana kavramı olan kovaryans, \((1,1)\)-merkezi ortak momentten başka bir şey değildir.
Tek değişkenli moment üreten fonksiyonun (Tanım 17.2) iki değişkenli karşılığı, üstel ifadeye her iki değişkeni de kendi parametresiyle koyarak elde edilir.
Tanım 18.3 (Ortak Moment Üreten Fonksiyon) \((X_1, X_2)\) bir rastgele vektör olsun. Her \(t_1 \in (-h_1, h_1)\) ve \(t_2 \in (-h_2, h_2)\) için \(E\big( e^{t_1 X_1 + t_2 X_2} \big)\) beklenen değerinin sonlu olduğu \(h_1, h_2 > 0\) sayıları varsa,
\[M_{X_1,X_2}(t_1, t_2) = E\big( e^{t_1 X_1 + t_2 X_2} \big), \qquad |t_1| < h_1,\ |t_2| < h_2\]
fonksiyonuna \((X_1, X_2)\) rastgele vektörünün ortak moment üreten fonksiyonu (ortak moment çıkaran fonksiyonu) denir.
Tek değişkenli moment üreten fonksiyonun türevleri momentleri veriyordu (Teorem 17.4). Ortak moment üreten fonksiyonun kısmi türevleri de ortak momentleri verir; üstelik marjinal moment üreten fonksiyonlar, ortak olanın bir değişkeni sıfırlanarak elde edilir. Bu iki özellik, örneklerde \(E(X_1 X_2)\) gibi beklenen değerleri integral almadan bulmamızı sağlayacak.
Önerme 18.1 (Ortak Moment Üreten Fonksiyonun Özellikleri) \((X_1, X_2)\) rastgele vektörünün ortak moment üreten fonksiyonu \(M_{X_1,X_2}\), \(|t_1| < h_1\), \(|t_2| < h_2\) için var olsun.
(a) \(M_{X_1,X_2}(t_1, 0) = M_{X_1}(t_1)\) ve \(M_{X_1,X_2}(0, t_2) = M_{X_2}(t_2)\); yani marjinal moment üreten fonksiyonlar ortak olanın kesitleridir.
(b) Her \(k_1, k_2 \in \{0, 1, 2, \dots\}\) için
\[\left. \frac{\partial^{k_1 + k_2}}{\partial t_1^{k_1} \partial t_2^{k_2}} M_{X_1,X_2}(t_1, t_2) \right|_{t_1 = t_2 = 0} = E\big( X_1^{k_1} X_2^{k_2} \big).\]
Özel olarak
\[\left. \frac{\partial M_{X_1,X_2}}{\partial t_1} \right|_{t_1 = t_2 = 0} = E(X_1), \qquad \left. \frac{\partial^2 M_{X_1,X_2}}{\partial t_1 \partial t_2} \right|_{t_1 = t_2 = 0} = E(X_1 X_2).\]
İspat
(a) \(t_2 = 0\) konulduğunda \(e^{t_1 X_1 + 0 \cdot X_2} = e^{t_1 X_1}\) olur; dolayısıyla \(M_{X_1,X_2}(t_1, 0) = E(e^{t_1 X_1}) = M_{X_1}(t_1)\). Buradaki \(E(e^{t_1 X_1})\) ortak dağılımdan hesaplanan beklenen değerdir; Tanım 18.1’den hemen sonra gösterdiğimiz gibi bu, marjinal dağılımdan hesaplananla aynıdır. Öteki eşitlik aynı biçimde çıkar.
(b) Sürekli durumu yazalım. \(|t_1| < h_1\), \(|t_2| < h_2\) için
\[M_{X_1,X_2}(t_1, t_2) = \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} e^{t_1 x_1 + t_2 x_2}\, f_{X_1,X_2}(x_1, x_2)\, dx_1\, dx_2.\]
Teorem 17.4’in ispatındaki gerekçeyle türev integralin altına alınabilir; \(t_1\)’e göre \(k_1\) kez ve \(t_2\)’ye göre \(k_2\) kez türev almak integrandı \(x_1^{k_1} x_2^{k_2}\) ile çarpar:
\[\frac{\partial^{k_1 + k_2}}{\partial t_1^{k_1} \partial t_2^{k_2}} M_{X_1,X_2}(t_1, t_2) = \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} x_1^{k_1} x_2^{k_2}\, e^{t_1 x_1 + t_2 x_2}\, f_{X_1,X_2}(x_1, x_2)\, dx_1\, dx_2.\]
\(t_1 = t_2 = 0\) konulduğunda üstel çarpan \(1\) olur ve sağ taraf, Tanım 18.1 gereği \(E(X_1^{k_1} X_2^{k_2})\) sayısına eşittir. Kesikli durumda integrallerin yerini toplamlar alır, hesap aynıdır.
\(\blacksquare\)
Beklenen değerin lineerliğini tek değişken için Teorem 16.1 ile göstermiştik; ama o sonuç yalnızca aynı değişkenin fonksiyonlarını toplayabiliyordu. \(E(X_1 + X_2) = E(X_1) + E(X_2)\) gibi bir eşitlik için iki değişkenin ortak dağılımına ihtiyaç vardır. Aşağıdaki önerme bunu sağlar ve dikkat edilirse bağımsızlık gerektirmez.
Önerme 18.2 (Beklenen Değerin Lineerliği) \((X_1, X_2)\) bir rastgele vektör, \(g_1, g_2 : \mathbb{R}^2 \to \mathbb{R}\) Borel ölçülebilir fonksiyonlar ve \(E[g_1(X_1, X_2)]\) ile \(E[g_2(X_1, X_2)]\) var olsun. \(c_1, c_2 \in \mathbb{R}\) sabitleri için \(E[c_1 g_1(X_1, X_2) + c_2 g_2(X_1, X_2)]\) vardır ve
\[E\left[ \sum_{i=1}^{2} c_i\, g_i(X_1, X_2) \right] = \sum_{i=1}^{2} c_i\, E\big[ g_i(X_1, X_2) \big]\]
olur. Özel olarak, \(E(X_1)\) ve \(E(X_2)\) var olduğunda
\[E(X_1 + X_2) = E(X_1) + E(X_2), \qquad E(c) = c \quad (c \in \mathbb{R}).\]
İspat
Sürekli durumu yazalım; kesikli durumda integrallerin yerini toplamlar alır. Önce beklenen değerin varlığı: her \((x_1, x_2)\) için üçgen eşitsizliğinden
\[\big| c_1 g_1(x_1, x_2) + c_2 g_2(x_1, x_2) \big|\, f_{X_1,X_2}(x_1, x_2) \le |c_1|\, |g_1(x_1, x_2)|\, f_{X_1,X_2}(x_1, x_2) + |c_2|\, |g_2(x_1, x_2)|\, f_{X_1,X_2}(x_1, x_2)\]
olur; sağ tarafın integrali varsayım gereği sonludur, dolayısıyla sol tarafınki de sonludur. Şimdi integralin lineerliğinden
\[E\big[ c_1 g_1(X_1, X_2) + c_2 g_2(X_1, X_2) \big] = \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} \big( c_1 g_1 + c_2 g_2 \big)(x_1, x_2)\, f_{X_1,X_2}(x_1, x_2)\, dx_1\, dx_2 = c_1 E\big[ g_1(X_1, X_2) \big] + c_2 E\big[ g_2(X_1, X_2) \big].\]
\(g_1(x_1, x_2) = x_1\), \(g_2(x_1, x_2) = x_2\) ve \(c_1 = c_2 = 1\) alınırsa \(E(X_1 + X_2) = E(X_1) + E(X_2)\) çıkar; burada \(E(X_1)\) ve \(E(X_2)\)’nin ortak dağılımdan ya da marjinallerden hesaplanmasının fark etmediğini yukarıda görmüştük. Sabit için \(g(x_1, x_2) = c\) alınır: \(E(c) = c \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} f_{X_1,X_2}(x_1, x_2)\, dx_1\, dx_2 = c \cdot 1 = c\).
\(\blacksquare\)
Tanım 18.1 ile Önerme 18.2’i iki boyutta yazdık; ikisi de \(n\) boyutlu rastgele vektörler için sözcüğü sözcüğüne geçerlidir. \((X_1, \dots, X_n)\) vektörü ve \(g : \mathbb{R}^n \to \mathbb{R}\) için beklenen değer \(n\) katlı toplam ya da \(n\) katlı integralle tanımlanır, lineerlik ispatı da aynen tekrarlanır. Aşağıda üç değişkenli ve \(n\) değişkenli kullanımlarda bu genel biçime dayanacağız.
Toplamın beklenen değeri her zaman beklenen değerlerin toplamıdır; ama çarpımın beklenen değeri genel olarak beklenen değerlerin çarpımı değildir. Bu eşitliğin sağlandığı en önemli durum bağımsızlıktır. Aşağıdaki teorem, bağımsız değişkenlerin ayrı ayrı fonksiyonlarının çarpımı için bunu söyler; hem \(E(X_1 X_2)\) hem de ortak moment üreten fonksiyonun çarpanlara ayrılması bu teoremin özel hâlleridir.
Teorem 18.1 (Bağımsız Değişkenlerde Çarpımın Beklenen Değeri) \(X_1\) ve \(X_2\) bağımsız rastgele değişkenler; \(g_1, g_2 : \mathbb{R} \to \mathbb{R}\), her \(B \in \mathcal{B}(\mathbb{R})\) için \(\{x : g_i(x) \in B\} \in \mathcal{B}(\mathbb{R})\) koşulunu sağlayan fonksiyonlar olsun. \(E[g_1(X_1)]\) ve \(E[g_2(X_2)]\) varsa \(E[g_1(X_1)\, g_2(X_2)]\) de vardır ve
\[E\left[ \prod_{i=1}^{2} g_i(X_i) \right] = \prod_{i=1}^{2} E\big[ g_i(X_i) \big]\]
olur.
İspat
Kesikli durum. \(X_1\) ile \(X_2\) bağımsız olduğundan her \((x_1, x_2)\) için ortak olasılık fonksiyonu marjinallerin çarpımıdır (Tanım 14.1):
\[f_{X_1,X_2}(x_1, x_2) = f_{X_1}(x_1)\, f_{X_2}(x_2).\]
Önce varlık: terimleri negatif olmayan iki serinin çarpımı, terimlerin ikişerli çarpımlarından oluşan çift toplama eşittir, dolayısıyla
\[\sum_{x_1 \in D_{X_1}} \sum_{x_2 \in D_{X_2}} \big| g_1(x_1)\, g_2(x_2) \big|\, f_{X_1}(x_1)\, f_{X_2}(x_2) = \left( \sum_{x_1 \in D_{X_1}} |g_1(x_1)|\, f_{X_1}(x_1) \right) \left( \sum_{x_2 \in D_{X_2}} |g_2(x_2)|\, f_{X_2}(x_2) \right) < \infty.\]
Mutlak yakınsaklık sağlandığından toplama sırası serbestçe değiştirilebilir ve
\[\begin{aligned} E\big[ g_1(X_1)\, g_2(X_2) \big] &= \sum_{x_1 \in D_{X_1}} \sum_{x_2 \in D_{X_2}} g_1(x_1)\, g_2(x_2)\, f_{X_1,X_2}(x_1, x_2) \\ &= \sum_{x_1 \in D_{X_1}} g_1(x_1)\, f_{X_1}(x_1) \left( \sum_{x_2 \in D_{X_2}} g_2(x_2)\, f_{X_2}(x_2) \right) \\ &= E\big[ g_2(X_2) \big] \sum_{x_1 \in D_{X_1}} g_1(x_1)\, f_{X_1}(x_1) = E\big[ g_1(X_1) \big]\, E\big[ g_2(X_2) \big] \end{aligned}\]
bulunur.
Sürekli durum. Bağımsızlık gereği \(f_{X_1,X_2}(x_1, x_2) = f_{X_1}(x_1)\, f_{X_2}(x_2)\)’dir. Mutlak integrallenebilirlik, kesikli durumdaki gibi iki tek katlı integralin çarpımından okunur:
\[\int_{-\infty}^{\infty} \int_{-\infty}^{\infty} \big| g_1(x_1)\, g_2(x_2) \big|\, f_{X_1}(x_1)\, f_{X_2}(x_2)\, dx_1\, dx_2 = \left( \int_{-\infty}^{\infty} |g_1(x_1)|\, f_{X_1}(x_1)\, dx_1 \right) \left( \int_{-\infty}^{\infty} |g_2(x_2)|\, f_{X_2}(x_2)\, dx_2 \right) < \infty.\]
Böylece iki katlı integral ardışık integrallere ayrılabilir:
\[E\big[ g_1(X_1)\, g_2(X_2) \big] = \int_{-\infty}^{\infty} g_1(x_1)\, f_{X_1}(x_1) \left( \int_{-\infty}^{\infty} g_2(x_2)\, f_{X_2}(x_2)\, dx_2 \right) dx_1 = E\big[ g_1(X_1) \big]\, E\big[ g_2(X_2) \big].\]
\(\blacksquare\)
Teoremde \(g_1\) ve \(g_2\) için özel seçimler yapınca sık kullanılan üç sonuç ortaya çıkar.
Sonuç 18.1 (Bağımsızlığın Beklenen Değere Yansımaları) \(X_1\) ve \(X_2\) bağımsız rastgele değişkenler olsun. İlgili beklenen değerler var olduğunda:
(1) \(E(X_1 X_2) = E(X_1)\, E(X_2)\); daha genel olarak her \(k_1, k_2 \in \{0, 1, 2, \dots\}\) için \(E\big( X_1^{k_1} X_2^{k_2} \big) = E\big( X_1^{k_1} \big)\, E\big( X_2^{k_2} \big)\), yani ortak momentler momentlerin çarpımıdır.
(2) \(X_1, X_2 \ge 0\) ise \(E\big( \sqrt{X_1 X_2} \big) = E\big( \sqrt{X_1} \big)\, E\big( \sqrt{X_2} \big)\).
(3) Marjinal moment üreten fonksiyonlar \(|t_1| < h_1\), \(|t_2| < h_2\) için varsa ortak moment üreten fonksiyon da vardır ve
\[M_{X_1,X_2}(t_1, t_2) = M_{X_1}(t_1)\, M_{X_2}(t_2).\]
İspat
Üçü de Teorem 18.1’in doğrudan uygulamasıdır. (1) için \(g_1(x) = x^{k_1}\), \(g_2(x) = x^{k_2}\) alınır; \(k_1 = k_2 = 1\) özel hâli ilk eşitliği verir. (2) için \(g_1(x) = g_2(x) = \sqrt{x}\) alınır; \(\sqrt{X_1 X_2} = \sqrt{X_1}\, \sqrt{X_2}\) olduğu için teorem uygulanabilir. (3) için \(t_1, t_2\) sabitlenip \(g_1(x) = e^{t_1 x}\), \(g_2(x) = e^{t_2 x}\) alınır:
\[M_{X_1,X_2}(t_1, t_2) = E\big( e^{t_1 X_1}\, e^{t_2 X_2} \big) = E\big( e^{t_1 X_1} \big)\, E\big( e^{t_2 X_2} \big) = M_{X_1}(t_1)\, M_{X_2}(t_2).\]
\(\blacksquare\)
Sonucun (3) maddesi, ortak moment üreten fonksiyon hesaplanmış bir vektörün bağımsız olmadığını göstermek için de kullanılabilir: \(M_{X_1,X_2}(t_1, t_2) \ne M_{X_1,X_2}(t_1, 0)\, M_{X_1,X_2}(0, t_2)\) ise, (3) bozulduğundan \(X_1\) ile \(X_2\) bağımsız olamaz.
18.2 Kovaryans ve Korelasyon Katsayısı
\(E(X_1 X_2)\) ile \(E(X_1)\, E(X_2)\) arasındaki fark, bağımsızlıktan ne kadar uzaklaşıldığının bir ölçüsü gibi görünür; bağımsız değişkenlerde bu fark sıfırdır. Bu farkı merkezi ortak moment biçiminde yazarak adlandırıyoruz. Tanımın anlamlı olması için ikinci momentlerin sonlu olması yeter: her \(x, y\) reel sayısı için \(|xy| \le \frac{1}{2}(x^2 + y^2)\) olduğundan, \(E(X^2)\) ve \(E(Y^2)\) sonluysa \(E|XY|\) de sonludur ve \(E(XY)\) tanımlıdır.
Tanım 18.4 (Kovaryans) \((X, Y)\), \(E(X^2) < \infty\) ve \(E(Y^2) < \infty\) olan bir rastgele vektör olsun.
\[\operatorname{Cov}(X, Y) = E\Big[ \big( X - E(X) \big) \big( Y - E(Y) \big) \Big]\]
sayısına \(X\) ile \(Y\) rastgele değişkenlerinin kovaryansı denir. Kovaryans, \((X, Y)\) vektörünün \((1,1)\)-merkezi ortak momentidir.
Kovaryansın işareti ilişkinin yönünü söyler: \(X\) ortalamasının üstündeyken \(Y\) de çoğunlukla ortalamasının üstündeyse çarpım \((X - E(X))(Y - E(Y))\) çoğunlukla pozitiftir ve kovaryans pozitif çıkar; \(X\) büyükken \(Y\) küçük olma eğilimindeyse kovaryans negatiftir. Ancak kovaryansın büyüklüğü birimlere bağlıdır: \(X\) metre yerine santimetreyle ölçülürse kovaryans \(100\) katına çıkar (bunu birazdan ispatlayacağız). Birimden bağımsız bir ölçü elde etmek için kovaryans, standart sapmaların çarpımına bölünür.
Tanım 18.5 (Korelasyon Katsayısı) \((X, Y)\), \(E(X^2) < \infty\), \(E(Y^2) < \infty\), \(\operatorname{Var}(X) > 0\) ve \(\operatorname{Var}(Y) > 0\) olan bir rastgele vektör olsun. \(\sigma_X = \sqrt{\operatorname{Var}(X)}\) ve \(\sigma_Y = \sqrt{\operatorname{Var}(Y)}\) olmak üzere
\[\rho_{X,Y} = \frac{\operatorname{Cov}(X, Y)}{\sigma_X\, \sigma_Y} = \frac{\operatorname{Cov}(X, Y)}{\sqrt{\operatorname{Var}(X)\, \operatorname{Var}(Y)}}\]
sayısına \(X\) ile \(Y\) arasındaki korelasyon katsayısı (Pearson korelasyon katsayısı) denir. \(\operatorname{Cov}(X, Y) = 0\), dolayısıyla \(\rho_{X,Y} = 0\) ise \(X\) ile \(Y\)’ye ilişkisiz (korelasyonsuz) denir.
Korelasyon katsayısı, \(X\) ile \(Y\) arasındaki lineer ilişkinin ölçüsüdür. Bu bölümde şunları göstereceğiz: \(\rho_{X,Y}\) her zaman \([-1, 1]\) aralığındadır; \(\rho_{X,Y} = 1\) ancak ve ancak \(Y\), olasılığı \(1\) olan bir olay üzerinde \(X\)’in artan bir lineer fonksiyonuysa (\(Y = aX + b\), \(a > 0\)); \(\rho_{X,Y} = -1\) ancak ve ancak azalan bir lineer fonksiyonuysa (\(a < 0\)). \(\rho_{X,Y} = 0\) olması ise \(X\) ile \(Y\) arasında lineer bir ilişki bulunmadığını söyler; bu, aralarında hiçbir ilişki olmadığı anlamına gelmez, ilişki lineer olmayan bir biçimde pekâlâ var olabilir. Bu ayrımı önce kovaryansın hesap kurallarını çıkararak, sonra somut bir örnekle netleştireceğiz.
Önerme 18.3 (Kovaryansın ve Korelasyon Katsayısının Özellikleri) \(X\), \(Y\), \(Z\) ikinci momentleri sonlu rastgele değişkenler ve \(a, b, c, d \in \mathbb{R}\) olsun.
(a) \(\operatorname{Cov}(X, Y) = E(XY) - E(X)\, E(Y)\).
(b) \(\operatorname{Cov}(X, Y) = \operatorname{Cov}(Y, X)\).
(c) \(\operatorname{Cov}(X, X) = \operatorname{Var}(X)\).
(d) \(\operatorname{Cov}(X + a, Y + b) = \operatorname{Cov}(X, Y)\): sabit eklemek kovaryansı değiştirmez.
(e) \(\operatorname{Cov}(aX, bY) = ab\, \operatorname{Cov}(X, Y)\).
(f) \(\operatorname{Cov}(X, Y + Z) = \operatorname{Cov}(X, Y) + \operatorname{Cov}(X, Z)\); (b) ile birlikte kovaryans her iki girdisinde de toplamsaldır.
(g) \(\operatorname{Var}(X) > 0\), \(\operatorname{Var}(Y) > 0\) ve \(ac \ne 0\) ise
\[\rho_{aX + b,\, cY + d} = \begin{cases} \rho_{X,Y}, & ac > 0 \\ -\rho_{X,Y}, & ac < 0. \end{cases}\]
Yani korelasyon katsayısı birim ve başlangıç noktası değişimlerinden etkilenmez; yalnızca yön ters çevrilirse işaret değiştirir.
İspat
\(\mu_X = E(X)\), \(\mu_Y = E(Y)\), \(\mu_Z = E(Z)\) yazalım.
(a) Çarpımı açıp Önerme 18.2’i uygulayalım; \(\mu_X\), \(\mu_Y\) sabittir:
\[\begin{aligned} \operatorname{Cov}(X, Y) &= E\big[ XY - \mu_Y X - \mu_X Y + \mu_X \mu_Y \big] \\ &= E(XY) - \mu_Y E(X) - \mu_X E(Y) + \mu_X \mu_Y = E(XY) - \mu_X \mu_Y. \end{aligned}\]
(b) Tanımda çarpanların sırası değiştirilebilir: \((X - \mu_X)(Y - \mu_Y) = (Y - \mu_Y)(X - \mu_X)\).
(c) \(Y = X\) alınırsa tanım \(E[(X - \mu_X)^2] = \operatorname{Var}(X)\)’i verir (Tanım 16.3).
(d) \(E(X + a) = \mu_X + a\) ve \(E(Y + b) = \mu_Y + b\) olduğundan (Teorem 16.2)
\[(X + a) - E(X + a) = X - \mu_X, \qquad (Y + b) - E(Y + b) = Y - \mu_Y;\]
sapmalar değişmediği için kovaryans da değişmez.
(e) \(E(aX) = a\mu_X\) ve \(E(bY) = b\mu_Y\) olduğundan
\[\operatorname{Cov}(aX, bY) = E\big[ (aX - a\mu_X)(bY - b\mu_Y) \big] = E\big[ ab\, (X - \mu_X)(Y - \mu_Y) \big] = ab\, \operatorname{Cov}(X, Y).\]
(f) \(E(Y + Z) = \mu_Y + \mu_Z\) olduğundan
\[\operatorname{Cov}(X, Y + Z) = E\big[ (X - \mu_X)\big( (Y - \mu_Y) + (Z - \mu_Z) \big) \big] = E\big[ (X - \mu_X)(Y - \mu_Y) \big] + E\big[ (X - \mu_X)(Z - \mu_Z) \big],\]
son adımda Önerme 18.2 kullanıldı.
(g) (d) ve (e) ile \(\operatorname{Cov}(aX + b, cY + d) = \operatorname{Cov}(aX, cY) = ac\, \operatorname{Cov}(X, Y)\). Öte yandan \(\operatorname{Var}(aX + b) = a^2 \operatorname{Var}(X)\) ve \(\operatorname{Var}(cY + d) = c^2 \operatorname{Var}(Y)\) olduğundan (Teorem 16.2) \(\sigma_{aX+b} = |a|\, \sigma_X\), \(\sigma_{cY+d} = |c|\, \sigma_Y\). Böylece
\[\rho_{aX+b,\, cY+d} = \frac{ac\, \operatorname{Cov}(X, Y)}{|a|\, |c|\, \sigma_X \sigma_Y} = \frac{ac}{|ac|}\, \rho_{X,Y},\]
ve \(\frac{ac}{|ac|}\) çarpanı \(ac > 0\) iken \(1\), \(ac < 0\) iken \(-1\)’dir.
\(\blacksquare\)
Önermenin (a) maddesi hesap için en kullanışlı biçimdir: kovaryans için ortak dağılımdan yalnızca \(E(XY)\)’yi, marjinallerden \(E(X)\) ve \(E(Y)\)’yi hesaplamak yeter. Tek değişkenli karşılığı \(\operatorname{Var}(X) = E(X^2) - [E(X)]^2\) formülüdür (Önerme 16.3); (c) gereği bu formül (a)’nın \(Y = X\) hâlidir.
Bağımsızlığın kovaryansa yansıması artık tek satırdır.
Teorem 18.2 (Bağımsız Değişkenlerin Kovaryansı Sıfırdır) \(X\) ve \(Y\) ikinci momentleri sonlu, bağımsız rastgele değişkenler ise \(\operatorname{Cov}(X, Y) = 0\)’dır. Ayrıca \(\operatorname{Var}(X) > 0\) ve \(\operatorname{Var}(Y) > 0\) ise \(\rho_{X,Y} = 0\)’dır; yani bağımsız değişkenler ilişkisizdir.
İspat
Bağımsızlık gereği \(E(XY) = E(X)\, E(Y)\) (Sonuç 18.1 (1)). Önerme 18.3 (a) ile \(\operatorname{Cov}(X, Y) = E(XY) - E(X)\, E(Y) = 0\) olur; korelasyon katsayısı kovaryansın pozitif bir sayıya bölümü olduğundan o da sıfırdır.
\(\blacksquare\)
Teoremin tersi doğru değildir: kovaryansı sıfır olan iki değişken bağımsız olmayabilir. Aşağıdaki örnek bunu bir tabloyla gösterir; aynı tabloda \(E(X^2 Y)\)’yi iki yolla hesaplayıp Tanım 18.1’den sonra söylediğimiz “iki yol aynı sonucu verir” ilkesini de doğrulayacağız.
Örnek 18.1 (Kovaryansı Sıfır Olan Bağımlı Değişkenler) \((X, Y)\) rastgele vektörünün ortak olasılık fonksiyonu aşağıdaki tabloyla verilsin; son satır ve son sütun marjinal olasılık fonksiyonlarıdır.
| \(x \setminus y\) | \(0\) | \(1\) | \(2\) | \(f_X(x)\) |
|---|---|---|---|---|
| \(0\) | \(\frac{1}{8}\) | \(\frac{1}{8}\) | \(\frac{1}{8}\) | \(\frac{3}{8}\) |
| \(1\) | \(\frac{1}{8}\) | \(0\) | \(\frac{1}{8}\) | \(\frac{2}{8}\) |
| \(2\) | \(\frac{1}{8}\) | \(\frac{1}{8}\) | \(\frac{1}{8}\) | \(\frac{3}{8}\) |
| \(f_Y(y)\) | \(\frac{3}{8}\) | \(\frac{2}{8}\) | \(\frac{3}{8}\) | \(1\) |
(a) \(X\) ile \(Y\) bağımsız mıdır?
(b) \(E(X)\), \(E(Y)\), \(\operatorname{Var}(X)\), \(\operatorname{Var}(Y)\), \(E(XY)\), \(\operatorname{Cov}(X, Y)\) ve \(\rho_{X,Y}\) değerlerini hesaplayınız.
(c) \(E(X^2 Y)\) değerini iki yolla hesaplayınız.
(d) \(\operatorname{Var}(X^2 Y)\) değerini hesaplayınız.
Çözüm
(a) Marjinaller satır ve sütun toplamlarıdır: \(f_X(0) = f_X(2) = \frac{3}{8}\), \(f_X(1) = \frac{2}{8}\) ve \(f_Y\) de aynıdır. Bağımsızlık için her \((x, y)\) çiftinde \(f_{X,Y}(x, y) = f_X(x)\, f_Y(y)\) olmalıdır (Tanım 14.1). Oysa
\[f_{X,Y}(1, 1) = 0 \ne \frac{2}{8} \cdot \frac{2}{8} = f_X(1)\, f_Y(1).\]
Tek bir çiftte bozulma yeter: \(X\) ile \(Y\) bağımsız değildir.
(b) Marjinalden
\[E(X) = 0 \cdot \frac{3}{8} + 1 \cdot \frac{2}{8} + 2 \cdot \frac{3}{8} = 1, \qquad E(X^2) = 0 \cdot \frac{3}{8} + 1 \cdot \frac{2}{8} + 4 \cdot \frac{3}{8} = \frac{14}{8} = \frac{7}{4},\]
\[\operatorname{Var}(X) = E(X^2) - [E(X)]^2 = \frac{7}{4} - 1 = \frac{3}{4}.\]
Aynı \(E(X)\)’i ortak dağılımdan da hesaplayabiliriz (Tanım 18.1, \(g(x, y) = x\)): \(x = 0\) satırı katkı vermez,
\[E(X) = \sum_{x=0}^{2} \sum_{y=0}^{2} x\, f_{X,Y}(x, y) = 1 \cdot \left( \frac{1}{8} + 0 + \frac{1}{8} \right) + 2 \cdot \left( \frac{1}{8} + \frac{1}{8} + \frac{1}{8} \right) = \frac{2}{8} + \frac{6}{8} = 1.\]
Tablo \(x\) ile \(y\)’nin yer değiştirmesine göre bakışımlı olduğundan \(E(Y) = 1\) ve \(\operatorname{Var}(Y) = \frac{3}{4}\)’tür.
\(E(XY)\) için yalnızca \(x \ge 1\) ve \(y \ge 1\) olan hücreler katkı verir:
\[E(XY) = 1 \cdot 1 \cdot 0 + 1 \cdot 2 \cdot \frac{1}{8} + 2 \cdot 1 \cdot \frac{1}{8} + 2 \cdot 2 \cdot \frac{1}{8} = \frac{2 + 2 + 4}{8} = 1.\]
Böylece Önerme 18.3 (a) ile
\[\operatorname{Cov}(X, Y) = E(XY) - E(X)\, E(Y) = 1 - 1 \cdot 1 = 0, \qquad \rho_{X,Y} = \frac{0}{\sqrt{\frac{3}{4} \cdot \frac{3}{4}}} = 0.\]
Demek ki \(X\) ile \(Y\) ilişkisizdir, ama (a) gereği bağımsız değildir.
(c) Birinci yol: ortak dağılımdan. \(g(x, y) = x^2 y\) alınır; yine yalnızca \(x, y \ge 1\) hücreleri katkı verir:
\[E(X^2 Y) = 1^2 \cdot 1 \cdot 0 + 1^2 \cdot 2 \cdot \frac{1}{8} + 2^2 \cdot 1 \cdot \frac{1}{8} + 2^2 \cdot 2 \cdot \frac{1}{8} = \frac{2 + 4 + 8}{8} = \frac{14}{8} = \frac{7}{4}.\]
İkinci yol: \(Z = X^2 Y\)’nin kendi dağılımından. \(Z\)’nin değer kümesi \(D_Z = \{0, 1, 2, 4, 8\}\)’dir. \(Z = 0\) olayı \(X = 0\) ya da \(Y = 0\) olmasıdır:
\[P(Z = 0) = P(X = 0) + P(Y = 0) - P(X = 0, Y = 0) = \frac{3}{8} + \frac{3}{8} - \frac{1}{8} = \frac{5}{8}.\]
Öteki değerler tek bir hücreden gelir: \(Z = 1\) yalnızca \((1,1)\)’den, \(Z = 2\) yalnızca \((1,2)\)’den, \(Z = 4\) yalnızca \((2,1)\)’den, \(Z = 8\) yalnızca \((2,2)\)’den.
| \(z\) | \(0\) | \(1\) | \(2\) | \(4\) | \(8\) |
|---|---|---|---|---|---|
| \(P(Z = z)\) | \(\frac{5}{8}\) | \(0\) | \(\frac{1}{8}\) | \(\frac{1}{8}\) | \(\frac{1}{8}\) |
Olasılıkların toplamı \(\frac{5 + 0 + 1 + 1 + 1}{8} = 1\)’dir. Tanım 16.1 ile
\[E(Z) = 0 \cdot \frac{5}{8} + 1 \cdot 0 + 2 \cdot \frac{1}{8} + 4 \cdot \frac{1}{8} + 8 \cdot \frac{1}{8} = \frac{14}{8} = \frac{7}{4}.\]
İki yol da aynı sonucu verdi.
(d) \(Z\)’nin dağılımı elimizde olduğuna göre
\[E(Z^2) = 4 \cdot \frac{1}{8} + 16 \cdot \frac{1}{8} + 64 \cdot \frac{1}{8} = \frac{84}{8} = \frac{21}{2}, \qquad \operatorname{Var}(X^2 Y) = \operatorname{Var}(Z) = \frac{21}{2} - \left( \frac{7}{4} \right)^2 = \frac{168 - 49}{16} = \frac{119}{16}.\]
\(\blacksquare\)
Gerektirme tek yönlüdür:
\[X, Y \text{ bağımsız} \ \Longrightarrow\ \operatorname{Cov}(X, Y) = 0, \qquad \text{ama} \qquad \operatorname{Cov}(X, Y) = 0 \ \not\Longrightarrow\ X, Y \text{ bağımsız}.\]
Yukarıdaki tabloda \(X = 1\) olduğu bilinirse \(Y\)’nin \(1\) olamayacağı kesindir; bu güçlü bir bağımlılıktır, ama lineer bir bağımlılık değildir ve korelasyon katsayısı onu görmez. Karşıt yönde kullanım ise geçerlidir: \(\operatorname{Cov}(X, Y) \ne 0\) bulunursa \(X\) ile \(Y\)’nin bağımsız olmadığı kesinleşir.
Şimdi korelasyon katsayısının neden \([-1, 1]\) aralığında kaldığını gösterelim. İspatın özü, olasılık kuramında sık kullanılan Cauchy–Schwarz eşitsizliğidir: ikinci momentleri sonlu \(U\) ve \(V\) için \([E(UV)]^2 \le E(U^2)\, E(V^2)\). Eşitsizliği doğrudan ispatlayıp ardından sapmalara uygulayacağız; eşitlik hâlini incelemek de \(\rho_{X,Y} = \pm 1\) olan durumların ne olduğunu tam olarak söyleyecek.
Teorem 18.3 (Korelasyon Katsayısının Sınırları (Cauchy–Schwarz Eşitsizliği)) \(X\) ve \(Y\), ikinci momentleri sonlu, \(\operatorname{Var}(X) > 0\) ve \(\operatorname{Var}(Y) > 0\) olan rastgele değişkenler olsun.
(a) \([\operatorname{Cov}(X, Y)]^2 \le \operatorname{Var}(X)\, \operatorname{Var}(Y)\); yani
\[-1 \le \rho_{X,Y} \le 1.\]
(b) \(|\rho_{X,Y}| = 1\) olması için gerek ve yeter koşul, \(P(Y = aX + b) = 1\) olacak biçimde \(a \ne 0\) ve \(b\) sabitlerinin bulunmasıdır. Bu durumda \(a > 0\) ise \(\rho_{X,Y} = 1\), \(a < 0\) ise \(\rho_{X,Y} = -1\)’dir.
İspat
\(\mu_X = E(X)\), \(\mu_Y = E(Y)\) olsun.
Adım 1: Cauchy–Schwarz eşitsizliği. \(U\) ve \(V\), \(E(U^2) < \infty\), \(0 < E(V^2) < \infty\) olan rastgele değişkenler olsun. \(|uv| \le \frac{1}{2}(u^2 + v^2)\) olduğundan \(E(UV)\) tanımlıdır. Her \(t \in \mathbb{R}\) için \((U - tV)^2 \ge 0\) olduğundan beklenen değeri de negatif değildir; kareyi açıp Önerme 18.2’i uygularsak
\[0 \le E\big[ (U - tV)^2 \big] = E(U^2) - 2t\, E(UV) + t^2\, E(V^2).\]
Bu, her \(t\) için geçerlidir; özel olarak \(t_0 = \dfrac{E(UV)}{E(V^2)}\) seçelim:
\[0 \le E(U^2) - 2 \frac{[E(UV)]^2}{E(V^2)} + \frac{[E(UV)]^2}{E(V^2)} = E(U^2) - \frac{[E(UV)]^2}{E(V^2)}.\]
\(E(V^2) > 0\) ile çarpınca
\[[E(UV)]^2 \le E(U^2)\, E(V^2)\]
elde edilir. Ayrıca eşitliğin sağlanması, \(E\big[ (U - t_0 V)^2 \big] = 0\) olmasına denktir.
Adım 2: (a) maddesi. \(U = X - \mu_X\) ve \(V = Y - \mu_Y\) alalım. \(E(U^2) = \operatorname{Var}(X)\), \(E(V^2) = \operatorname{Var}(Y) > 0\) ve \(E(UV) = \operatorname{Cov}(X, Y)\)’dir. Adım 1 ile
\[[\operatorname{Cov}(X, Y)]^2 \le \operatorname{Var}(X)\, \operatorname{Var}(Y).\]
Her iki taraf \(\operatorname{Var}(X)\, \operatorname{Var}(Y) > 0\)’a bölünürse \(\rho_{X,Y}^2 \le 1\), yani \(-1 \le \rho_{X,Y} \le 1\) bulunur.
Adım 3: \(|\rho_{X,Y}| = 1\) ise \(Y\), \(X\)’in lineer fonksiyonudur. \(\rho_{X,Y}^2 = 1\) olsun. O zaman Adım 1’deki eşitsizlik eşitlikle sağlanır; dolayısıyla \(t_0 = \dfrac{\operatorname{Cov}(X, Y)}{\operatorname{Var}(Y)}\) için
\[W = U - t_0 V = (X - \mu_X) - t_0\, (Y - \mu_Y)\]
rastgele değişkeni \(E(W^2) = 0\) sağlar. \(E(W) = E(U) - t_0 E(V) = 0\) olduğundan \(\operatorname{Var}(W) = E(W^2) = 0\)’dır. Chebyshev eşitsizliği (Teorem 16.4) her \(n \in \mathbb{N}\) için
\[P\left( |W| \ge \frac{1}{n} \right) \le n^2\, \operatorname{Var}(W) = 0\]
verir. \((W \ne 0) = \bigcup_{n=1}^{\infty} \left( |W| \ge \frac{1}{n} \right)\) olduğundan, olasılık ölçüsünün sayılabilir alt toplamsallığıyla (Sonuç 3.1)
\[P(W \ne 0) \le \sum_{n=1}^{\infty} P\left( |W| \ge \frac{1}{n} \right) = 0,\]
yani \(P(W = 0) = 1\). Demek ki olasılığı \(1\) olan bir olay üzerinde
\[X - \mu_X = t_0\, (Y - \mu_Y).\]
\(\rho_{X,Y} \ne 0\) olduğundan \(\operatorname{Cov}(X, Y) \ne 0\), dolayısıyla \(t_0 \ne 0\)’dır; eşitlik \(Y\) için çözülebilir:
\[Y = \mu_Y + \frac{1}{t_0}\, (X - \mu_X) = aX + b, \qquad a = \frac{1}{t_0} = \frac{\operatorname{Var}(Y)}{\operatorname{Cov}(X, Y)}, \quad b = \mu_Y - a\mu_X.\]
\(a\)’nın işareti \(\operatorname{Cov}(X, Y)\)’nin, yani \(\rho_{X,Y}\)’nin işaretidir: \(\rho_{X,Y} = 1\) ise \(a > 0\), \(\rho_{X,Y} = -1\) ise \(a < 0\).
Adım 4: \(Y\), \(X\)’in lineer fonksiyonuysa \(|\rho_{X,Y}| = 1\). \(a \ne 0\) ve \(P(Y = aX + b) = 1\) olsun. Beklenen değer hesaplarında olasılığı sıfır olan bir olay sonucu değiştirmediğinden \(Y\) yerine \(aX + b\) yazılabilir. Önerme 18.3 (d), (e) ve (c) ile
\[\operatorname{Cov}(X, Y) = \operatorname{Cov}(X, aX + b) = \operatorname{Cov}(X, aX) = a\, \operatorname{Cov}(X, X) = a\, \operatorname{Var}(X),\]
ve Teorem 16.2 ile \(\operatorname{Var}(Y) = a^2 \operatorname{Var}(X)\), yani \(\sigma_Y = |a|\, \sigma_X\). Böylece
\[\rho_{X,Y} = \frac{a\, \operatorname{Var}(X)}{\sigma_X \cdot |a|\, \sigma_X} = \frac{a}{|a|},\]
bu da \(a > 0\) için \(1\), \(a < 0\) için \(-1\)’dir. Adım 3 ile birlikte (b) ispatlanmış olur.
\(\blacksquare\)
Teorem, korelasyon katsayısının okunuşunu kesinleştirir: \(\rho_{X,Y}\)’nin \(1\)’e ya da \(-1\)’e yakın olması, \((X, Y)\) değer çiftlerinin bir doğru çevresinde toplandığını; \(0\)’a yakın olması, lineer bir eğilimin bulunmadığını söyler. Ancak \(\rho_{X,Y} = 0\) olduğunda bile, Örnek 18.1’deki gibi, lineer olmayan güçlü bir bağımlılık var olabilir.
Sürekli bir örnekle kovaryans ve korelasyon hesabının bütün adımlarını görelim.
Örnek 18.2 (Sürekli Bir Vektörde Kovaryans ve Korelasyon) \((X, Y)\) rastgele vektörünün ortak yoğunluk fonksiyonu
\[f_{X,Y}(x, y) = \begin{cases} \dfrac{3x^2 + xy}{3}, & 0 < x < 1,\ 0 < y < 2 \\[2mm] 0, & \text{diğer durumlarda} \end{cases}\]
olsun. \(E(X)\), \(E(Y)\), \(E(XY)\), \(\operatorname{Cov}(X, Y)\), \(\operatorname{Var}(X)\), \(\operatorname{Var}(Y)\) ve \(\rho_{X,Y}\) değerlerini hesaplayınız.
Çözüm
Önce marjinal yoğunlukları bulalım (Tanım 13.8). \(0 < x < 1\) için
\[f_X(x) = \int_0^2 \frac{3x^2 + xy}{3}\, dy = \frac{1}{3} \left[ 3x^2 y + \frac{x y^2}{2} \right]_{y=0}^{y=2} = \frac{6x^2 + 2x}{3} = 2x^2 + \frac{2x}{3},\]
ve \(0 < y < 2\) için
\[f_Y(y) = \int_0^1 \frac{3x^2 + xy}{3}\, dx = \frac{1}{3} \left[ x^3 + \frac{x^2 y}{2} \right]_{x=0}^{x=1} = \frac{1}{3} + \frac{y}{6}.\]
Sağlama: \(\int_0^1 \left( 2x^2 + \frac{2x}{3} \right) dx = \frac{2}{3} + \frac{1}{3} = 1\).
Beklenen değerler. Marjinallerden
\[E(X) = \int_0^1 x \left( 2x^2 + \frac{2x}{3} \right) dx = \frac{2}{4} + \frac{2}{9} = \frac{13}{18}, \qquad E(X^2) = \int_0^1 x^2 \left( 2x^2 + \frac{2x}{3} \right) dx = \frac{2}{5} + \frac{2}{12} = \frac{17}{30},\]
\[E(Y) = \int_0^2 y \left( \frac{1}{3} + \frac{y}{6} \right) dy = \frac{1}{3} \cdot 2 + \frac{1}{6} \cdot \frac{8}{3} = \frac{2}{3} + \frac{4}{9} = \frac{10}{9}, \qquad E(Y^2) = \int_0^2 y^2 \left( \frac{1}{3} + \frac{y}{6} \right) dy = \frac{8}{9} + \frac{16}{24} = \frac{14}{9}.\]
\(E(XY)\) için ortak yoğunluk gerekir (Tanım 18.1):
\[E(XY) = \int_0^1 \int_0^2 xy\, \frac{3x^2 + xy}{3}\, dy\, dx = \frac{1}{3} \int_0^1 \left[ \frac{3x^3 y^2}{2} + \frac{x^2 y^3}{3} \right]_{y=0}^{y=2} dx = \frac{1}{3} \int_0^1 \left( 6x^3 + \frac{8x^2}{3} \right) dx = \frac{1}{3} \left( \frac{3}{2} + \frac{8}{9} \right) = \frac{43}{54}.\]
Kovaryans ve varyanslar. Önerme 18.3 (a) ve Önerme 16.3 ile
\[\operatorname{Cov}(X, Y) = \frac{43}{54} - \frac{13}{18} \cdot \frac{10}{9} = \frac{129}{162} - \frac{130}{162} = -\frac{1}{162},\]
\[\operatorname{Var}(X) = \frac{17}{30} - \left( \frac{13}{18} \right)^2 = \frac{918}{1620} - \frac{845}{1620} = \frac{73}{1620}, \qquad \operatorname{Var}(Y) = \frac{14}{9} - \left( \frac{10}{9} \right)^2 = \frac{126}{81} - \frac{100}{81} = \frac{26}{81}.\]
Korelasyon katsayısı.
\[\rho_{X,Y} = \frac{-\frac{1}{162}}{\sqrt{\frac{73}{1620} \cdot \frac{26}{81}}} \approx \frac{-0{,}00617}{0{,}1203} \approx -0{,}051.\]
Kovaryans negatif ama sıfıra çok yakındır; korelasyon katsayısı da \([-1, 1]\) aralığında, Teorem 18.3’nin öngördüğü gibi, sıfıra çok yakın çıkmıştır. Yine de \(X\) ile \(Y\) bağımsız değildir: örneğin yoğunluğun tanımlı olduğu bölgenin iç noktalarından \(x = \frac{1}{2}\), \(y = \frac{3}{2}\) noktasında \(f_{X,Y}\!\left( \frac{1}{2}, \frac{3}{2} \right) = \frac{3/4 + 3/4}{3} = \frac{1}{2} = \frac{36}{72}\), oysa \(f_X\!\left( \frac{1}{2} \right) f_Y\!\left( \frac{3}{2} \right) = \frac{5}{6} \cdot \frac{7}{12} = \frac{35}{72} \ne \frac{36}{72}\). Bu, \(\operatorname{Cov}(X, Y) \ne 0\) bulgusuyla da tutarlıdır: kovaryansı sıfırdan farklı olan değişkenler bağımsız olamaz.
\(\blacksquare\)
18.3 Lineer Birleşimin Varyansı
Beklenen değer toplam üzerinde lineerdir; varyans değildir. \(\operatorname{Var}(X_1 + X_2)\)’yi hesaplamaya kalkınca, iki değişkenin sapmalarının çarpımı, yani kovaryans, kaçınılmaz olarak ortaya çıkar. Aşağıdaki teorem genel formülü verir; sonrasında bağımsız (daha doğrusu ilişkisiz) değişkenlerde formülün nasıl sadeleştiğini göreceğiz.
Teorem 18.4 (Lineer Birleşimin Varyansı) \(X_1\) ve \(X_2\) ikinci momentleri sonlu rastgele değişkenler ve \(a_1, a_2 \in \mathbb{R}\) olsun.
\[\operatorname{Var}\left( \sum_{i=1}^{2} a_i X_i \right) = \sum_{i=1}^{2} a_i^2\, \operatorname{Var}(X_i) + 2 a_1 a_2\, \operatorname{Cov}(X_1, X_2).\]
Özel olarak
\[\operatorname{Var}(X_1 + X_2) = \operatorname{Var}(X_1) + \operatorname{Var}(X_2) + 2\, \operatorname{Cov}(X_1, X_2), \qquad \operatorname{Var}(X_1 - X_2) = \operatorname{Var}(X_1) + \operatorname{Var}(X_2) - 2\, \operatorname{Cov}(X_1, X_2).\]
İspat
\(\mu_i = E(X_i)\) olsun ve \(S = a_1 X_1 + a_2 X_2\) yazalım. Önerme 18.2 ile \(E(S) = a_1 \mu_1 + a_2 \mu_2\); dolayısıyla
\[S - E(S) = a_1 (X_1 - \mu_1) + a_2 (X_2 - \mu_2).\]
Karesini alalım:
\[\big( S - E(S) \big)^2 = a_1^2 (X_1 - \mu_1)^2 + a_2^2 (X_2 - \mu_2)^2 + 2 a_1 a_2 (X_1 - \mu_1)(X_2 - \mu_2).\]
Her üç terimin beklenen değeri vardır (ikinci momentler sonlu ve \(|uv| \le \frac{1}{2}(u^2 + v^2)\)). Beklenen değer alıp lineerliği kullanırsak
\[\operatorname{Var}(S) = a_1^2\, E\big[ (X_1 - \mu_1)^2 \big] + a_2^2\, E\big[ (X_2 - \mu_2)^2 \big] + 2 a_1 a_2\, E\big[ (X_1 - \mu_1)(X_2 - \mu_2) \big],\]
ve sağdaki üç beklenen değer sırasıyla \(\operatorname{Var}(X_1)\), \(\operatorname{Var}(X_2)\) ve \(\operatorname{Cov}(X_1, X_2)\)’dir. Özel durumlar \(a_1 = 1\), \(a_2 = \pm 1\) ile elde edilir.
\(\blacksquare\)
Sonuç 18.2 (Bağımsız Değişkenlerde Toplamın Varyansı) \(X_1\) ve \(X_2\) ikinci momentleri sonlu, bağımsız rastgele değişkenler ise
\[\operatorname{Var}(X_1 + X_2) = \operatorname{Var}(X_1 - X_2) = \operatorname{Var}(X_1) + \operatorname{Var}(X_2)\]
ve daha genel olarak \(\operatorname{Var}(a_1 X_1 + a_2 X_2) = a_1^2 \operatorname{Var}(X_1) + a_2^2 \operatorname{Var}(X_2)\) olur.
İspat
Bağımsızlık gereği \(\operatorname{Cov}(X_1, X_2) = 0\)’dır (Teorem 18.2). Teorem 18.4’ndeki kovaryans terimi düşer; \(a_1 = 1\), \(a_2 = \pm 1\) alınırsa iki özel eşitlik çıkar. Farkın varyansında da varyansların toplanmasının nedeni, \(a_2 = -1\) değerinin formüle yalnızca karesiyle girmesidir.
\(\blacksquare\)
Sonucun ispatında bağımsızlığın tek kullanımı \(\operatorname{Cov}(X_1, X_2) = 0\) eşitliğidir. Dolayısıyla \(\operatorname{Var}(X_1 \pm X_2) = \operatorname{Var}(X_1) + \operatorname{Var}(X_2)\) eşitliği, bağımsız olmayan ama ilişkisiz değişkenler için de geçerlidir; Örnek 18.1’deki \(X\) ile \(Y\) buna örnektir.
Aynı hesap \(n\) değişken için de yapılır: \(S = \sum_{i=1}^{n} a_i X_i\) için \(\big( S - E(S) \big)^2\) açıldığında \(i = j\) terimleri varyansları, \(i \ne j\) terimleri kovaryansları verir ve
\[\operatorname{Var}\left( \sum_{i=1}^{n} a_i X_i \right) = \sum_{i=1}^{n} a_i^2\, \operatorname{Var}(X_i) + 2 \sum_{1 \le i < j \le n} a_i a_j\, \operatorname{Cov}(X_i, X_j)\]
bulunur. Değişkenler ikişer ikişer ilişkisizse yalnızca ilk toplam kalır.
18.4 Çözümlü Örnekler
Bu kısımdaki örneklerin ortak amacı, aynı beklenen değere giden farklı yolları yan yana görmektir: ortak yoğunlukla doğrudan integral, marjinal yoğunluk, ortak moment üreten fonksiyonun türevleri, bağımsızlıkla çarpanlara ayırma ve dönüştürülmüş değişkenin kendi yoğunluğu. Hangi yolun kısa olduğu probleme göre değişir.
Örnek 18.3 (Bağımsız Üstel Değişkenlerde Ortak Moment Üreten Fonksiyon) \(X\) ve \(Y\) rastgele değişkenlerinin ortak yoğunluk fonksiyonu
\[f_{X,Y}(x, y) = \begin{cases} 6 e^{-3x - 2y}, & x > 0,\ y > 0 \\ 0, & \text{diğer durumlarda} \end{cases}\]
olsun.
(a) Marjinal yoğunluk fonksiyonlarını bulunuz; \(X\) ile \(Y\) bağımsız mıdır?
(b) Ortak moment üreten fonksiyonu bulunuz.
(c) Marjinal moment üreten fonksiyonları bulunuz ve ortak olanla karşılaştırınız.
(d) \(E(XY)\) değerini üç farklı yolla hesaplayınız.
Çözüm
(a) \(x > 0\) için
\[f_X(x) = \int_0^{\infty} 6 e^{-3x - 2y}\, dy = 6 e^{-3x} \int_0^{\infty} e^{-2y}\, dy = 6 e^{-3x} \cdot \frac{1}{2} = 3 e^{-3x},\]
ve \(y > 0\) için
\[f_Y(y) = \int_0^{\infty} 6 e^{-3x - 2y}\, dx = 6 e^{-2y} \cdot \frac{1}{3} = 2 e^{-2y}.\]
Her \((x, y)\) için \(f_X(x)\, f_Y(y) = 3 e^{-3x} \cdot 2 e^{-2y} = 6 e^{-3x - 2y} = f_{X,Y}(x, y)\) olduğundan (\(x \le 0\) ya da \(y \le 0\) olduğunda her iki taraf \(0\)’dır) \(X\) ile \(Y\) bağımsızdır (Tanım 14.1).
(b) Tanım 18.3 ile
\[M_{X,Y}(t_1, t_2) = E\big( e^{t_1 X + t_2 Y} \big) = \int_0^{\infty} \int_0^{\infty} e^{t_1 x + t_2 y}\, 6 e^{-3x - 2y}\, dx\, dy = 6 \int_0^{\infty} e^{-(3 - t_1) x}\, dx \int_0^{\infty} e^{-(2 - t_2) y}\, dy.\]
İntegraller \(3 - t_1 > 0\) ve \(2 - t_2 > 0\) iken yakınsar ve sırasıyla \(\frac{1}{3 - t_1}\), \(\frac{1}{2 - t_2}\) değerini alır:
\[M_{X,Y}(t_1, t_2) = \frac{6}{(3 - t_1)(2 - t_2)}, \qquad t_1 < 3,\ t_2 < 2.\]
(c) Tanım 17.2 ile
\[M_X(t_1) = \int_0^{\infty} e^{t_1 x}\, 3 e^{-3x}\, dx = \frac{3}{3 - t_1} \ (t_1 < 3), \qquad M_Y(t_2) = \int_0^{\infty} e^{t_2 y}\, 2 e^{-2y}\, dy = \frac{2}{2 - t_2} \ (t_2 < 2).\]
Çarpımları \(\frac{3}{3 - t_1} \cdot \frac{2}{2 - t_2} = \frac{6}{(3 - t_1)(2 - t_2)} = M_{X,Y}(t_1, t_2)\)’dir; bu, bağımsız değişkenler için Sonuç 18.1 (3)’ün söylediğidir. Ayrıca \(M_{X,Y}(t_1, 0) = \frac{6}{(3 - t_1) \cdot 2} = M_X(t_1)\) olması Önerme 18.1 (a) ile uyumludur.
(d) Birinci yol: ortak moment üreten fonksiyonun karma türevi. Önerme 18.1 (b) gereği
\[\frac{\partial^2 M_{X,Y}}{\partial t_1 \partial t_2} = \frac{\partial}{\partial t_1} \left( \frac{6}{(3 - t_1)(2 - t_2)^2} \right) = \frac{6}{(3 - t_1)^2 (2 - t_2)^2}, \qquad E(XY) = \left. \frac{6}{(3 - t_1)^2 (2 - t_2)^2} \right|_{t_1 = t_2 = 0} = \frac{6}{9 \cdot 4} = \frac{1}{6}.\]
İkinci yol: ortak yoğunlukla doğrudan integral. Tanım 18.1 ile, \(\int_0^{\infty} u e^{-cu}\, du = \frac{1}{c^2}\) (\(c > 0\)) olduğundan,
\[E(XY) = \int_0^{\infty} \int_0^{\infty} xy\, 6 e^{-3x - 2y}\, dx\, dy = 6 \int_0^{\infty} x e^{-3x}\, dx \int_0^{\infty} y e^{-2y}\, dy = 6 \cdot \frac{1}{9} \cdot \frac{1}{4} = \frac{1}{6}.\]
Üçüncü yol: bağımsızlık. \(X\) ile \(Y\) bağımsız olduğundan \(E(XY) = E(X)\, E(Y)\)’dir (Sonuç 18.1 (1)). Marjinallerden \(E(X) = \int_0^{\infty} 3x e^{-3x}\, dx = \frac{3}{9} = \frac{1}{3}\) ve \(E(Y) = \int_0^{\infty} 2y e^{-2y}\, dy = \frac{2}{4} = \frac{1}{2}\); aynı değerler \(M_X'(0) = \frac{3}{(3 - t_1)^2}\big|_{0} = \frac{1}{3}\) ve \(M_Y'(0) = \frac{1}{2}\) türevlerinden de okunur (Teorem 17.4). Böylece
\[E(XY) = \frac{1}{3} \cdot \frac{1}{2} = \frac{1}{6}.\]
Üç yol da \(\frac{1}{6}\) verdi. Sonuç olarak \(\operatorname{Cov}(X, Y) = E(XY) - E(X)\, E(Y) = \frac{1}{6} - \frac{1}{6} = 0\)’dır; Teorem 18.2’ın söylediği gibi.
\(\blacksquare\)
Örnek 18.4 (Üçgen Bölge Üzerinde Beklenen Değerin İki Yolla Hesabı) \((X, Y)\) rastgele vektörünün ortak yoğunluk fonksiyonu
\[f_{X,Y}(x, y) = \begin{cases} \dfrac{1}{2}, & 0 < y < x < 2 \\[2mm] 0, & \text{diğer durumlarda} \end{cases}\]
olsun.
(a) Marjinal yoğunluk fonksiyonlarını bulunuz.
(b) \(E(X)\) değerini ortak yoğunlukla ve marjinal yoğunlukla hesaplayınız.
(c) \(E(XY)\) değerini ortak yoğunlukla ve \(Z = XY\)’nin yoğunluk fonksiyonuyla hesaplayınız.
Çözüm
Yoğunluk, köşeleri \((0,0)\), \((2,0)\), \((2,2)\) olan, alanı \(2\) olan üçgen üzerinde sabittir; \(\frac{1}{2} \cdot 2 = 1\) olduğundan toplam olasılık \(1\)’dir.
(a) \(0 < x < 2\) için \(y\), \(0\)’dan \(x\)’e kadar değişir:
\[f_X(x) = \int_0^x \frac{1}{2}\, dy = \frac{x}{2}.\]
\(0 < y < 2\) için \(x\), \(y\)’den \(2\)’ye kadar değişir:
\[f_Y(y) = \int_y^2 \frac{1}{2}\, dx = \frac{2 - y}{2}.\]
(b) Ortak yoğunlukla. Tanım 18.1’de \(g(x, y) = x\):
\[E(X) = \int_0^2 \int_0^x x \cdot \frac{1}{2}\, dy\, dx = \int_0^2 \frac{x^2}{2}\, dx = \frac{8}{6} = \frac{4}{3}.\]
Marjinal yoğunlukla. Tanım 16.1 ile
\[E(X) = \int_0^2 x \cdot \frac{x}{2}\, dx = \frac{8}{6} = \frac{4}{3}.\]
İki hesap aynıdır; aslında birincideki iç integral tam olarak \(f_X(x)\)’i üretmektedir.
(c) Ortak yoğunlukla.
\[E(XY) = \int_0^2 \int_0^x xy \cdot \frac{1}{2}\, dy\, dx = \int_0^2 \frac{x}{2} \cdot \frac{x^2}{2}\, dx = \int_0^2 \frac{x^3}{4}\, dx = \frac{16}{16} = 1.\]
\(Z = XY\)’nin yoğunluğuyla. Önce \(Z\)’nin yoğunluğunu Teorem 15.1 ile bulalım. \(Z = XY\), \(U = X\) dönüşümünün tersi \(x = u\), \(y = \frac{z}{u}\)’dur ve
\[\left| \frac{\partial(x, y)}{\partial(u, z)} \right| = \left| \det \begin{pmatrix} 1 & 0 \\[1mm] -\dfrac{z}{u^2} & \dfrac{1}{u} \end{pmatrix} \right| = \frac{1}{u}.\]
\(0 < y < x < 2\) koşulu \(0 < \frac{z}{u} < u < 2\)’ye, yani \(z > 0\), \(u > \sqrt{z}\) ve \(u < 2\)’ye dönüşür; bu bölge boş olmasın diye \(0 < z < 4\) olmalıdır. Dolayısıyla \(f_{U,Z}(u, z) = \frac{1}{2} \cdot \frac{1}{u}\) (\(\sqrt{z} < u < 2\)) ve
\[f_Z(z) = \int_{\sqrt{z}}^{2} \frac{1}{2u}\, du = \frac{1}{2} \big( \ln 2 - \ln \sqrt{z} \big) = \frac{1}{2} \ln 2 - \frac{1}{4} \ln z = \frac{1}{4} \ln \frac{4}{z}, \qquad 0 < z < 4.\]
Hesaplarda \(z = 4w\) dönüşümü ve
\[\int_0^1 w^n\, (-\ln w)\, dw = \frac{1}{(n+1)^2} \qquad (n = 0, 1, 2, \dots)\]
formülü işimize yarayacak. Formül kısmi integrasyonla çıkar:
\[\int_0^1 w^n (-\ln w)\, dw = \left[ -\ln w \cdot \frac{w^{n+1}}{n+1} \right]_0^1 + \int_0^1 \frac{w^n}{n+1}\, dw = 0 + \frac{1}{(n+1)^2}.\]
Sınır terimi \(w \to 0^+\) iken \(w^{n+1} \ln w \to 0\) olduğu için düşer. Buna göre
\[\int_0^4 f_Z(z)\, dz = \int_0^1 \frac{1}{4} \ln \frac{1}{w} \cdot 4\, dw = \int_0^1 (-\ln w)\, dw = 1,\]
yani \(f_Z\) gerçekten bir yoğunluktur, ve
\[E(Z) = \int_0^4 z \cdot \frac{1}{4} \ln \frac{4}{z}\, dz = \int_0^1 4w \cdot \frac{1}{4} \ln \frac{1}{w} \cdot 4\, dw = 4 \int_0^1 w\, (-\ln w)\, dw = 4 \cdot \frac{1}{4} = 1.\]
Bu da \(E(XY) = 1\) sonucunu doğrular. Marjinalden \(E(Y) = \int_0^2 y \cdot \frac{2 - y}{2}\, dy = \frac{2}{3}\) olduğundan \(\operatorname{Cov}(X, Y) = 1 - \frac{4}{3} \cdot \frac{2}{3} = \frac{1}{9} > 0\)’dır: \(Y < X\) kısıtı yüzünden \(X\) büyükken \(Y\) de büyük olma eğilimindedir.
\(\blacksquare\)
Örnek 18.5 (Çarpımın Varyansının İki Yolla Hesabı) \((X, Y)\) rastgele vektörünün ortak yoğunluk fonksiyonu
\[f_{X,Y}(x, y) = \begin{cases} 2, & 0 < x < y < 1 \\ 0, & \text{diğer durumlarda} \end{cases}\]
olsun. \(Z = XY\) rastgele değişkeninin varyansını iki yolla hesaplayınız.
Çözüm
Birinci yol: ortak yoğunlukla. \(\operatorname{Var}(Z) = E(Z^2) - [E(Z)]^2\) formülünü (Önerme 16.3) kullanacağız; iki beklenen değer de Tanım 18.1 ile ortak yoğunluktan hesaplanır. Bölge \(0 < x < y < 1\) olduğundan iç integral \(y\) üzerinden \(x\)’ten \(1\)’e alınır:
\[E(XY) = \int_0^1 \int_x^1 2xy\, dy\, dx = \int_0^1 x \left( 1 - x^2 \right) dx = \frac{1}{2} - \frac{1}{4} = \frac{1}{4},\]
\[E\big[ (XY)^2 \big] = \int_0^1 \int_x^1 2x^2 y^2\, dy\, dx = \int_0^1 \frac{2x^2}{3} \left( 1 - x^3 \right) dx = \frac{2}{3} \left( \frac{1}{3} - \frac{1}{6} \right) = \frac{1}{9}.\]
Böylece
\[\operatorname{Var}(XY) = \frac{1}{9} - \frac{1}{16} = \frac{16 - 9}{144} = \frac{7}{144}.\]
Aynı sonuç varyansın tanımıyla da bulunur:
\[\begin{aligned} E\left[ \left( XY - \frac{1}{4} \right)^2 \right] &= E[(XY)^2] - \frac{1}{2} E(XY) + \frac{1}{16} \\ &= \frac{1}{9} - \frac{1}{8} + \frac{1}{16} = \frac{16 - 18 + 9}{144} = \frac{7}{144}. \end{aligned}\]
İkinci yol: \(Z\)’nin yoğunluğuyla. \(Z = XY\), \(U = X\) dönüşümü için ters dönüşüm \(x = u\), \(y = \frac{z}{u}\) ve Jacobian mutlak değeri \(\frac{1}{u}\)’dur (Örnek 18.4’daki hesabın aynısı). \(0 < x < y < 1\) koşulu \(0 < u < \frac{z}{u} < 1\)’e dönüşür: \(u > 0\), \(u^2 < z\) (yani \(u < \sqrt{z}\)) ve \(z < u\). Demek ki \(z < u < \sqrt{z}\), bu aralığın boş olmaması için \(0 < z < 1\) gerekir. Teorem 15.1 ile \(f_{U,Z}(u, z) = 2 \cdot \frac{1}{u}\) (\(z < u < \sqrt{z}\)) ve
\[f_Z(z) = \int_z^{\sqrt{z}} \frac{2}{u}\, du = 2 \big( \ln \sqrt{z} - \ln z \big) = 2 \left( \frac{1}{2} \ln z - \ln z \right) = -\ln z, \qquad 0 < z < 1.\]
\(\int_0^1 (-\ln z)\, dz = 1\) olduğundan bu bir yoğunluktur. Örnek 18.4’da ispatladığımız \(\int_0^1 z^n (-\ln z)\, dz = \frac{1}{(n+1)^2}\) formülüyle
\[E(Z) = \int_0^1 z\, (-\ln z)\, dz = \frac{1}{4}, \qquad E(Z^2) = \int_0^1 z^2\, (-\ln z)\, dz = \frac{1}{9},\]
\[\operatorname{Var}(Z) = \frac{1}{9} - \frac{1}{16} = \frac{7}{144}.\]
İki yol aynı sonucu verdi. Birinci yol \(Z\)’nin dağılımını hiç gerektirmez; ikinci yol ise \(Z\) hakkında daha fazlasını, örneğin \(P(Z \le \frac{1}{2})\)’yi de hesaplamaya izin verir.
\(\blacksquare\)
Örnek 18.6 (Bağımsız Üstel Değişkenlerin Ölçekli Farkının Moment Üreten Fonksiyonu) \(X_1\) ve \(X_2\) rastgele değişkenlerinin ortak yoğunluk fonksiyonu
\[f_{X_1,X_2}(x_1, x_2) = \begin{cases} \dfrac{1}{4}\, e^{-\frac{x_1 + x_2}{2}}, & x_1 > 0,\ x_2 > 0 \\[2mm] 0, & \text{diğer durumlarda} \end{cases}\]
olsun. \(Y = \dfrac{X_1 - X_2}{2}\) rastgele değişkeninin moment üreten fonksiyonunu bulunuz; buradan \(E(Y)\) ve \(\operatorname{Var}(Y)\)’yi okuyup Teorem 18.4 ile doğrulayınız.
Çözüm
Moment üreten fonksiyon. \(Y = g(X_1, X_2)\) olduğundan \(M_Y(t) = E(e^{tY})\) ortak yoğunlukla hesaplanır (Tanım 18.1):
\[M_Y(t) = E\left( e^{\frac{t}{2} X_1 - \frac{t}{2} X_2} \right) = \int_0^{\infty} \int_0^{\infty} e^{\frac{t}{2} x_1}\, e^{-\frac{t}{2} x_2}\, \frac{1}{4}\, e^{-\frac{x_1}{2}}\, e^{-\frac{x_2}{2}}\, dx_1\, dx_2 = \left( \frac{1}{2} \int_0^{\infty} e^{-\frac{(1 - t) x_1}{2}}\, dx_1 \right) \left( \frac{1}{2} \int_0^{\infty} e^{-\frac{(1 + t) x_2}{2}}\, dx_2 \right).\]
Birinci integral \(1 - t > 0\) iken \(\frac{2}{1 - t}\), ikincisi \(1 + t > 0\) iken \(\frac{2}{1 + t}\) değerini alır. Böylece
\[M_Y(t) = \frac{1}{1 - t} \cdot \frac{1}{1 + t} = \frac{1}{1 - t^2}, \qquad -1 < t < 1.\]
Bu çarpanlara ayrılma rastlantı değildir. Ortak yoğunluk \(f_{X_1,X_2}(x_1, x_2) = \frac{1}{2} e^{-x_1/2} \cdot \frac{1}{2} e^{-x_2/2}\) biçiminde marjinallerin çarpımıdır, dolayısıyla \(X_1\) ile \(X_2\) bağımsızdır ve her birinin moment üreten fonksiyonu \(M_{X_i}(s) = \frac{1}{2} \int_0^{\infty} e^{sx} e^{-x/2}\, dx = \frac{1}{1 - 2s}\) (\(s < \frac{1}{2}\))’dir. Teorem 18.1’i \(g_1(x) = e^{tx/2}\), \(g_2(x) = e^{-tx/2}\) ile uygularsak
\[M_Y(t) = E\big( e^{\frac{t}{2} X_1} \big)\, E\big( e^{-\frac{t}{2} X_2} \big) = M_{X_1}\!\left( \frac{t}{2} \right) M_{X_2}\!\left( -\frac{t}{2} \right) = \frac{1}{1 - t} \cdot \frac{1}{1 + t},\]
aynı sonuç.
Momentler. \(|t| < 1\) için \(\frac{1}{1 - t^2} = 1 + t^2 + t^4 + \cdots\) açılımında \(t\)’nin katsayısı \(0\), \(t^2\)’nin katsayısı \(1\)’dir. Teorem 17.4 gereği \(E(Y) = M_Y'(0) = 0\) ve \(E(Y^2) = M_Y''(0) = 2! \cdot 1 = 2\); dolayısıyla
\[\operatorname{Var}(Y) = E(Y^2) - [E(Y)]^2 = 2.\]
Doğrulama. \(M_{X_i}(s) = (1 - 2s)^{-1}\)’den \(M_{X_i}'(s) = 2(1 - 2s)^{-2}\) ve \(M_{X_i}''(s) = 8(1 - 2s)^{-3}\); böylece \(E(X_i) = 2\), \(E(X_i^2) = 8\) ve \(\operatorname{Var}(X_i) = 8 - 4 = 4\). \(Y = \frac{1}{2} X_1 - \frac{1}{2} X_2\) için Önerme 18.2 ile \(E(Y) = \frac{1}{2} \cdot 2 - \frac{1}{2} \cdot 2 = 0\), ve \(X_1\) ile \(X_2\) bağımsız olduğundan Sonuç 18.2 ile
\[\operatorname{Var}(Y) = \left( \frac{1}{2} \right)^2 \operatorname{Var}(X_1) + \left( -\frac{1}{2} \right)^2 \operatorname{Var}(X_2) = \frac{4}{4} + \frac{4}{4} = 2.\]
Her iki yol da \(E(Y) = 0\), \(\operatorname{Var}(Y) = 2\) verir.
\(\blacksquare\)
18.5 Alıştırmalar
Alıştırma 18.1 (Rastgele Vektörlerde Beklenen Değer, Kovaryans ve Korelasyon) (a) \((X, Y)\) rastgele vektörünün ortak olasılık fonksiyonu aşağıdaki tabloyla verilsin.
| \(x \setminus y\) | \(0\) | \(1\) | \(2\) |
|---|---|---|---|
| \(0\) | \(\frac{1}{8}\) | \(\frac{1}{4}\) | \(\frac{1}{8}\) |
| \(1\) | \(\frac{1}{4}\) | \(\frac{1}{8}\) | \(\frac{1}{8}\) |
\(\operatorname{Cov}(X, Y)\) ve \(\rho_{X,Y}\) değerlerini hesaplayınız. \(X\) ile \(Y\) bağımsız mıdır?
(b) İkinci momentleri sonlu \(X\) ve \(Y\) için \(\operatorname{Cov}(X + Y, X - Y) = \operatorname{Var}(X) - \operatorname{Var}(Y)\) olduğunu gösteriniz. \(\operatorname{Var}(X) = \operatorname{Var}(Y)\) ise \(X + Y\) ile \(X - Y\)’nin ilişkisiz olduğu sonucunu çıkarınız.
(c) \((X, Y)\) rastgele vektörünün ortak yoğunluk fonksiyonu \(0 < x < 1\), \(0 < y < 1\) için \(f_{X,Y}(x, y) = x + y\), diğer durumlarda \(0\) olsun. \(\operatorname{Cov}(X, Y)\) ve \(\rho_{X,Y}\) değerlerini hesaplayınız.
(d) \(X\) ve \(Y\) bağımsız, \(E(X) = 1\), \(\operatorname{Var}(X) = 2\), \(E(Y) = -1\), \(\operatorname{Var}(Y) = 3\) olsun. \(E(XY)\), \(\operatorname{Var}(2X - 3Y)\), \(\operatorname{Cov}(X + Y, X - Y)\) ve \(E\big[ (X + Y)^2 \big]\) değerlerini hesaplayınız.
(e) \((X_1, X_2)\) rastgele vektörünün ortak moment üreten fonksiyonu her \((t_1, t_2) \in \mathbb{R}^2\) için
\[M_{X_1,X_2}(t_1, t_2) = \exp\left( t_1 + 2t_2 + \frac{t_1^2 + 2 t_1 t_2 + 4 t_2^2}{2} \right)\]
olsun. \(E(X_1)\), \(E(X_2)\), \(\operatorname{Var}(X_1)\), \(\operatorname{Var}(X_2)\), \(\operatorname{Cov}(X_1, X_2)\) ve \(\rho_{X_1,X_2}\) değerlerini bulunuz. \(X_1\) ile \(X_2\) bağımsız mıdır?
(f) \(X\), \((-1, 1)\) aralığında düzgün dağılımlı olsun: \(f_X(x) = \frac{1}{2}\) (\(-1 < x < 1\)). \(Y = X^2\) için \(\operatorname{Cov}(X, Y) = 0\) olduğunu, ama \(X\) ile \(Y\)’nin bağımsız olmadığını gösteriniz.
Çözüm
(a) Marjinaller: \(f_X(0) = \frac{1}{8} + \frac{1}{4} + \frac{1}{8} = \frac{1}{2}\), \(f_X(1) = \frac{1}{2}\); \(f_Y(0) = \frac{3}{8}\), \(f_Y(1) = \frac{3}{8}\), \(f_Y(2) = \frac{1}{4}\). Buradan
\[E(X) = \frac{1}{2}, \quad E(X^2) = \frac{1}{2}, \quad \operatorname{Var}(X) = \frac{1}{2} - \frac{1}{4} = \frac{1}{4}; \qquad E(Y) = \frac{3}{8} + 2 \cdot \frac{1}{4} = \frac{7}{8}, \quad E(Y^2) = \frac{3}{8} + 4 \cdot \frac{1}{4} = \frac{11}{8}, \quad \operatorname{Var}(Y) = \frac{11}{8} - \frac{49}{64} = \frac{39}{64}.\]
Ortak dağılımdan, yalnızca \(x = 1\) satırı katkı verir: \(E(XY) = 1 \cdot 1 \cdot \frac{1}{8} + 1 \cdot 2 \cdot \frac{1}{8} = \frac{3}{8}\). Böylece
\[\operatorname{Cov}(X, Y) = \frac{3}{8} - \frac{1}{2} \cdot \frac{7}{8} = \frac{6 - 7}{16} = -\frac{1}{16}, \qquad \rho_{X,Y} = \frac{-\frac{1}{16}}{\sqrt{\frac{1}{4} \cdot \frac{39}{64}}} = \frac{-\frac{1}{16}}{\frac{\sqrt{39}}{16}} = -\frac{1}{\sqrt{39}} \approx -0{,}16.\]
\(\operatorname{Cov}(X, Y) \ne 0\) olduğundan Teorem 18.2 gereği \(X\) ile \(Y\) bağımsız olamaz. Doğrudan da görülür: \(f_{X,Y}(0, 0) = \frac{1}{8}\) ama \(f_X(0)\, f_Y(0) = \frac{1}{2} \cdot \frac{3}{8} = \frac{3}{16}\).
(b) Önerme 18.3’nin (f) maddesi (iki girdide de toplamsallık), (e) maddesi (\(-Y = (-1) Y\)), (b) ve (c) maddeleriyle
\[\operatorname{Cov}(X + Y, X - Y) = \operatorname{Cov}(X, X) - \operatorname{Cov}(X, Y) + \operatorname{Cov}(Y, X) - \operatorname{Cov}(Y, Y) = \operatorname{Var}(X) - \operatorname{Var}(Y).\]
\(\operatorname{Var}(X) = \operatorname{Var}(Y)\) ise bu sıfırdır; Tanım 18.5 gereği \(X + Y\) ile \(X - Y\) ilişkisizdir. Bu, bağımsız oldukları anlamına gelmez.
(c) Yoğunluk \(x\) ile \(y\)’de bakışımlıdır, dolayısıyla \(E(X) = E(Y)\) ve \(\operatorname{Var}(X) = \operatorname{Var}(Y)\).
\[E(X) = \int_0^1 \int_0^1 x (x + y)\, dy\, dx = \int_0^1 \left( x^2 + \frac{x}{2} \right) dx = \frac{1}{3} + \frac{1}{4} = \frac{7}{12}, \qquad E(X^2) = \int_0^1 \left( x^3 + \frac{x^2}{2} \right) dx = \frac{1}{4} + \frac{1}{6} = \frac{5}{12},\]
\[E(XY) = \int_0^1 \int_0^1 xy (x + y)\, dy\, dx = \int_0^1 \left( \frac{x^2}{2} + \frac{x}{3} \right) dx = \frac{1}{6} + \frac{1}{6} = \frac{1}{3}.\]
Böylece
\[\operatorname{Cov}(X, Y) = \frac{1}{3} - \left( \frac{7}{12} \right)^2 = \frac{48 - 49}{144} = -\frac{1}{144}, \qquad \operatorname{Var}(X) = \operatorname{Var}(Y) = \frac{5}{12} - \frac{49}{144} = \frac{60 - 49}{144} = \frac{11}{144},\]
\[\rho_{X,Y} = \frac{-\frac{1}{144}}{\frac{11}{144}} = -\frac{1}{11}.\]
(d) Bağımsızlıktan \(E(XY) = E(X)\, E(Y) = -1\) (Sonuç 18.1 (1)) ve \(\operatorname{Cov}(X, Y) = 0\). Teorem 18.4 ile
\[\operatorname{Var}(2X - 3Y) = 4 \cdot 2 + 9 \cdot 3 + 2 \cdot 2 \cdot (-3) \cdot 0 = 35.\]
Alıştırmanın (b) maddesinden \(\operatorname{Cov}(X + Y, X - Y) = \operatorname{Var}(X) - \operatorname{Var}(Y) = 2 - 3 = -1\). Son olarak Önerme 16.3’nü \(X + Y\)’ye uygularsak, \(E(X + Y) = 0\) ve \(\operatorname{Var}(X + Y) = 2 + 3 = 5\) olduğundan
\[E\big[ (X + Y)^2 \big] = \operatorname{Var}(X + Y) + [E(X + Y)]^2 = 5 + 0 = 5.\]
(e) \(\varphi(t_1, t_2) = t_1 + 2t_2 + \frac{1}{2}(t_1^2 + 2 t_1 t_2 + 4 t_2^2)\) yazalım; \(M = e^{\varphi}\), \(\varphi(0,0) = 0\), \(M(0,0) = 1\). Kısmi türevler
\[\frac{\partial \varphi}{\partial t_1} = 1 + t_1 + t_2, \qquad \frac{\partial \varphi}{\partial t_2} = 2 + t_1 + 4t_2.\]
Önerme 18.1 (b) ile
\[E(X_1) = \left. \frac{\partial M}{\partial t_1} \right|_{t_1 = t_2 = 0} = \left. (1 + t_1 + t_2)\, M \right|_{t_1 = t_2 = 0} = 1, \qquad E(X_2) = \left. (2 + t_1 + 4t_2)\, M \right|_{t_1 = t_2 = 0} = 2,\]
\[E(X_1^2) = \left. \big[ (1 + t_1 + t_2)^2 + 1 \big] M \right|_{t_1 = t_2 = 0} = 2, \qquad E(X_2^2) = \left. \big[ (2 + t_1 + 4t_2)^2 + 4 \big] M \right|_{t_1 = t_2 = 0} = 8,\]
\[E(X_1 X_2) = \left. \frac{\partial^2 M}{\partial t_1 \partial t_2} \right|_{t_1 = t_2 = 0} = \left. \big[ (1 + t_1 + t_2)(2 + t_1 + 4t_2) + 1 \big] M \right|_{t_1 = t_2 = 0} = 2 + 1 = 3.\]
Buradan \(\operatorname{Var}(X_1) = 2 - 1 = 1\), \(\operatorname{Var}(X_2) = 8 - 4 = 4\), \(\operatorname{Cov}(X_1, X_2) = 3 - 1 \cdot 2 = 1\) ve
\[\rho_{X_1,X_2} = \frac{1}{\sqrt{1 \cdot 4}} = \frac{1}{2}.\]
\(\operatorname{Cov}(X_1, X_2) \ne 0\) olduğundan bağımsız değildirler. Aynı sonuç Sonuç 18.1 (3) ile de görülür: \(M(t_1, 0)\, M(0, t_2) = \exp\big( t_1 + 2t_2 + \frac{1}{2}(t_1^2 + 4t_2^2) \big)\), ortak fonksiyondan \(e^{t_1 t_2}\) çarpanı kadar farklıdır.
(f) \(f_X\) çift fonksiyon olduğundan tek kuvvetlerin beklenen değeri sıfırdır: \(E(X) = \int_{-1}^{1} \frac{x}{2}\, dx = 0\) ve \(E(XY) = E(X^3) = \int_{-1}^{1} \frac{x^3}{2}\, dx = 0\). Önerme 18.3 (a) ile \(\operatorname{Cov}(X, Y) = 0 - 0 \cdot E(Y) = 0\). Varyanslar pozitiftir: \(\operatorname{Var}(X) = E(X^2) = \frac{1}{3}\) ve \(\operatorname{Var}(Y) = E(X^4) - [E(X^2)]^2 = \frac{1}{5} - \frac{1}{9} = \frac{4}{45}\); dolayısıyla \(\rho_{X,Y} = 0\) da tanımlıdır.
Bağımsızlık için dağılım fonksiyonlarına bakalım (Tanım 14.1). \(\left( Y \le \frac{1}{4} \right) = \left( |X| \le \frac{1}{2} \right)\) olduğundan
\[P\left( X \le \frac{1}{2},\ Y \le \frac{1}{4} \right) = P\left( -\frac{1}{2} \le X \le \frac{1}{2} \right) = \frac{1}{2}, \qquad P\left( X \le \frac{1}{2} \right) P\left( Y \le \frac{1}{4} \right) = \frac{3}{4} \cdot \frac{1}{2} = \frac{3}{8}.\]
İki taraf eşit olmadığından \(X\) ile \(Y\) bağımsız değildir. Oysa \(Y\), \(X\)’in bir fonksiyonudur; aralarındaki bağımlılık tam ve deterministiktir, ama lineer olmadığı için korelasyon katsayısı onu göremez.
\(\blacksquare\)
Bir değişkenin değeri bilindiğinde ötekinin beklenen değerinin nasıl güncellendiğini, yani koşullu dağılım üzerinden alınan beklenen değeri bir sonraki bölümde inceliyoruz: Koşullu Beklenen Değer.