13 Rastgele Vektörler ve Ortak Dağılımlar
Rastgele Değişkenin Fonksiyonunun Dağılımı bölümüyle birlikte tek bir rastgele değişkenin incelenmesini tamamladık: bir rastgele değişkenin dağılım fonksiyonunu, kesikli durumda olasılık fonksiyonunu, sürekli durumda yoğunluk fonksiyonunu tanıdık ve bu araçlarla \(X\)’e bağlı her olayın olasılığını hesaplamayı öğrendik. Ne var ki bir rastgele deneyde çoğu zaman tek bir sayı değil, birden çok sayı gözlenir. Bir hastanın boyu ile kilosu, bir parçanın çapı ile ağırlığı, üç para atışında gelen toplam tura sayısı ile ilk iki atıştaki tura sayısı aynı deneyin sonucuna bağlı büyüklüklerdir. Bu büyüklükler birbirini etkileyebildiğinden her birini ayrı ayrı incelemek yeterli değildir; birlikte davranışlarını anlatan bir araca ihtiyaç vardır.
Bu bölümde bu aracı kuruyoruz. Aynı örnek uzayda tanımlı \(n\) tane rastgele değişkeni yan yana yazıp elde edilen \((X_1, X_2, \ldots, X_n)\) nesnesine rastgele vektör diyeceğiz. Tek değişkenli kuramda yaptığımız her şeyin bir karşılığı burada da vardır: rastgele vektörün bir olasılık dağılımı, bir ortak dağılım fonksiyonu, kesikli durumda bir ortak olasılık fonksiyonu, sürekli durumda bir ortak yoğunluk fonksiyonu vardır. Yeni olan iki şey var: tek boyutta karşılığı bulunmayan dikdörtgen formülü ve ortak dağılımdan tek bir bileşenin dağılımına inmeyi sağlayan marjinal dağılım.
Kesikli durumda ortak olasılık fonksiyonunun tablo gösterimini, sürekli durumda ise ortak yoğunluğun tanım bölgesi üzerinde integral almayı iki ayrıntılı örnekle işleyeceğiz. Bağımsızlık ve koşullu dağılım kavramları bir sonraki bölümün konusudur.
13.1 Rastgele Vektör ve Olasılık Dağılımı
Bir rastgele değişken, her \(a \in \mathbb{R}\) için \((X \le a)\) kümesini olay yapan bir \(X : \Omega \to \mathbb{R}\) fonksiyonuydu (Tanım 8.1). Bunun \(n\) boyutlu karşılığında \(\Omega\)’dan \(\mathbb{R}^n\)’e giden bir fonksiyon alınır ve her bileşen için aynı anda konan eşitsizliklerin olay tanımlaması istenir.
Tanım 13.1 (Rastgele Vektör) \((\Omega, \mathcal{U}, P)\) bir olasılık uzayı ve \(X_1, X_2, \ldots, X_n : \Omega \to \mathbb{R}\) fonksiyonlar olsun.
\[(X_1, X_2, \ldots, X_n) : \Omega \to \mathbb{R}^n, \qquad \omega \mapsto \big( X_1(\omega), X_2(\omega), \ldots, X_n(\omega) \big)\]
fonksiyonu, her \((a_1, a_2, \ldots, a_n) \in \mathbb{R}^n\) için
\[\{ \omega \in \Omega : X_1(\omega) \le a_1,\ X_2(\omega) \le a_2,\ \ldots,\ X_n(\omega) \le a_n \} \in \mathcal{U}\]
koşulunu sağlıyorsa \((X_1, X_2, \ldots, X_n)\) fonksiyonuna \(n\)-boyutlu rastgele vektör (\(n\)-boyutlu rastgele değişken) denir. Rastgele vektörün aldığı değerlerin kümesi
\[D_{(X_1, \ldots, X_n)} = \{ (X_1(\omega), \ldots, X_n(\omega)) : \omega \in \Omega \} \subseteq \mathbb{R}^n\]
rastgele vektörün değer kümesidir. Yukarıdaki olay kısaca \((X_1 \le a_1, \ldots, X_n \le a_n)\) ile gösterilir.
Tanımdaki koşul ile “her bileşenin bir rastgele değişken olması” koşulu aynı şeydir. Bu, uygulamada rastgele vektör kurmanın yolunu açar: aynı deney üzerinde tanımlı rastgele değişkenleri yan yana yazmak yeter.
Lemma 13.1 (Rastgele Vektör ve Bileşenleri) \(X_1, \ldots, X_n : \Omega \to \mathbb{R}\) fonksiyonlar olsun. \((X_1, \ldots, X_n)\)’in bir rastgele vektör olması için gerek ve yeter koşul, her \(i = 1, \ldots, n\) için \(X_i\)’nin bir rastgele değişken olmasıdır.
İspat
Her \(X_i\) rastgele değişken olsun. \((a_1, \ldots, a_n) \in \mathbb{R}^n\) verildiğinde
\[(X_1 \le a_1, \ldots, X_n \le a_n) = \bigcap_{i=1}^{n} (X_i \le a_i)\]
yazılır. Sağdaki her küme \(\mathcal{U}\)’dadır ve \(\mathcal{U}\) bir \(\sigma\)-cebir olduğundan sonlu kesişimlere kapalıdır; öyleyse soldaki küme de \(\mathcal{U}\)’dadır. Demek ki \((X_1, \ldots, X_n)\) bir rastgele vektördür.
Tersine \((X_1, \ldots, X_n)\) bir rastgele vektör olsun; \(X_1\)’in rastgele değişken olduğunu gösterelim (öteki bileşenler için akıl yürütme aynıdır). \(a_1 \in \mathbb{R}\) verilsin. Her \(\omega\) için \(X_2(\omega), \ldots, X_n(\omega)\) birer gerçel sayı olduğundan yeterince büyük bir \(k \in \mathbb{N}\) için hiçbiri \(k\)’yı aşmaz; bu yüzden
\[(X_1 \le a_1) = \bigcup_{k=1}^{\infty} (X_1 \le a_1,\ X_2 \le k,\ \ldots,\ X_n \le k)\]
olur. Sağdaki kümelerin her biri rastgele vektör tanımı gereği \(\mathcal{U}\)’dadır; \(\mathcal{U}\) sayılabilir birleşimlere kapalı olduğundan \((X_1 \le a_1) \in \mathcal{U}\) bulunur. Yani \(X_1\) bir rastgele değişkendir.
\(\blacksquare\)
Tek boyutta rastgele değişken, örnek uzaydaki olasılığı gerçel sayılara taşıyordu: \(P_X(B) = P(X \in B)\) bir olasılık ölçüsüydü (Teorem 8.1). Rastgele vektör de aynı işi \(\mathbb{R}^n\) üzerinde yapar. Bu sonuç, vektörle ilgili her olasılığın \(\mathbb{R}^n\)’in Borel kümeleri üzerinde tanımlı tek bir ölçüden okunabileceğini söyler; bölümün geri kalanı bu ölçüyü elle tutulur biçimlerde (fonksiyon, tablo, integral) yazma çabasıdır.
Teorem 13.1 (Rastgele Vektörün Olasılık Dağılımı) \((\Omega, \mathcal{U}, P)\) bir olasılık uzayı ve \((X_1, \ldots, X_n)\) bir \(n\)-boyutlu rastgele vektör olsun. Her \(B \in \mathcal{B}(\mathbb{R}^n)\) için \(\{ \omega \in \Omega : (X_1(\omega), \ldots, X_n(\omega)) \in B \}\) kümesi bir olaydır ve
\[P_{(X_1, \ldots, X_n)} : \mathcal{B}(\mathbb{R}^n) \to [0,1], \qquad P_{(X_1, \ldots, X_n)}(B) = P\big( \{ \omega \in \Omega : (X_1(\omega), \ldots, X_n(\omega)) \in B \} \big)\]
fonksiyonu \(\mathcal{B}(\mathbb{R}^n)\) üzerinde bir olasılık ölçüsüdür. Bu ölçüye \((X_1, \ldots, X_n)\) rastgele vektörünün olasılık dağılımı denir.
İspat
Kısalık için \(\mathbf{X} = (X_1, \ldots, X_n)\) yazalım; \(B \subseteq \mathbb{R}^n\) için \(\mathbf{X}^{-1}(B) = \{ \omega : \mathbf{X}(\omega) \in B \}\) ters görüntü kümesidir.
Adım 1: \(\mathbf{X}^{-1}(B)\) her Borel kümesi için bir olaydır. Ters görüntüsü olay olan kümelerin sınıfını
\[\mathcal{C} = \{ B \subseteq \mathbb{R}^n : \mathbf{X}^{-1}(B) \in \mathcal{U} \}\]
ile gösterelim. Ters görüntü alma işlemi tümleyen ve birleşimle uyumludur:
\[\mathbf{X}^{-1}(B^c) = \big( \mathbf{X}^{-1}(B) \big)^c, \qquad \mathbf{X}^{-1}\Big( \bigcup_{k=1}^{\infty} B_k \Big) = \bigcup_{k=1}^{\infty} \mathbf{X}^{-1}(B_k).\]
\(\mathcal{U}\) bir \(\sigma\)-cebir olduğundan bu eşitlikler, \(\mathcal{C}\)’nin tümleyene ve sayılabilir birleşime kapalı olduğunu söyler; \(\mathbf{X}^{-1}(\mathbb{R}^n) = \Omega \in \mathcal{U}\) olduğundan \(\mathbb{R}^n \in \mathcal{C}\)’dir. Yani \(\mathcal{C}\), \(\mathbb{R}^n\) üzerinde bir \(\sigma\)-cebirdir. Öte yandan \(\mathbf{a} = (a_1, \ldots, a_n) \in \mathbb{R}^n\) için \(K(\mathbf{a}) = (-\infty, a_1] \times \cdots \times (-\infty, a_n]\) yazarsak, rastgele vektör tanımı bu biçimdeki her “köşe kümesinin” \(\mathcal{C}\)’de olduğunu söyler. Köşe kümelerinden \(\sigma\)-cebir işlemleriyle açık dikdörtgenlere ulaşılır. \(a_i < b_i\) olmak üzere yarı açık dikdörtgen
\[(a_1, b_1] \times \cdots \times (a_n, b_n] = K(\mathbf{b}) \setminus \bigcup_{i=1}^{n} K(b_1, \ldots, b_{i-1}, a_i, b_{i+1}, \ldots, b_n)\]
biçiminde yazılır: bir nokta \(K(\mathbf{b})\)’de olup sağdaki birleşimin dışında kalıyorsa her \(i\) için \(a_i < x_i \le b_i\)’dir. Açık dikdörtgen ise yarı açık dikdörtgenlerin sayılabilir birleşimidir:
\[(a_1, b_1) \times \cdots \times (a_n, b_n) = \bigcup_{k \ge k_0} \Big( a_1, b_1 - \tfrac{1}{k} \Big] \times \cdots \times \Big( a_n, b_n - \tfrac{1}{k} \Big];\]
burada \(k_0\), her \(i\) için \(b_i - \frac{1}{k_0} > a_i\) olacak kadar büyük seçilir. Demek ki her açık dikdörtgen \(\mathcal{C}\)’dedir. \(\mathcal{B}(\mathbb{R}^n)\), açık dikdörtgenlerin ürettiği en küçük \(\sigma\)-cebir olduğundan (Tanım 2.5) \(\mathcal{B}(\mathbb{R}^n) \subseteq \mathcal{C}\) elde edilir. Bu, \(P_{\mathbf{X}}(B)\)’nin her Borel kümesi için tanımlı olduğunu gösterir.
Adım 2: Kolmogorov aksiyomları. \(P\) bir olasılık ölçüsü olduğundan her \(B\) için \(P_{\mathbf{X}}(B) = P(\mathbf{X}^{-1}(B)) \ge 0\)’dır ve \(P_{\mathbf{X}}(\mathbb{R}^n) = P(\Omega) = 1\)’dir. \(B_1, B_2, \ldots \in \mathcal{B}(\mathbb{R}^n)\) ikişer ikişer ayrık olsun. Bir \(\omega\) aynı anda iki farklı \(B_k\)’ye düşemeyeceğinden \(\mathbf{X}^{-1}(B_1), \mathbf{X}^{-1}(B_2), \ldots\) olayları da ikişer ikişer ayrıktır. \(P\)’nin sayılabilir toplamsallığından
\[P_{\mathbf{X}}\Big( \bigcup_{k=1}^{\infty} B_k \Big) = P\Big( \bigcup_{k=1}^{\infty} \mathbf{X}^{-1}(B_k) \Big) = \sum_{k=1}^{\infty} P\big( \mathbf{X}^{-1}(B_k) \big) = \sum_{k=1}^{\infty} P_{\mathbf{X}}(B_k)\]
bulunur. Üç aksiyom da sağlandığından \(P_{\mathbf{X}}\) bir olasılık ölçüsüdür.
\(\blacksquare\)
Bundan böyle \(P_{(X_1, \ldots, X_n)}(B)\) yerine daha okunaklı olan \(P\big( (X_1, \ldots, X_n) \in B \big)\) yazacağız. Bölümün geri kalanında iki boyutlu rastgele vektörleri, yani \((X, Y)\) ya da \((X_1, X_2)\) çiftlerini ele alacağız. Yapılan her işlem, indis sayısını artırmaktan başka bir değişiklik gerektirmeden \(n\)-boyutlu rastgele vektörlere genişler.
13.2 Ortak Dağılım Fonksiyonu
Tek boyutta \(P_X\) ölçüsünün bütün bilgisini \(F_X(x) = P(X \le x)\) dağılım fonksiyonu taşıyordu (Tanım 9.1). İki boyutta aynı rolü, köşesi \((x,y)\) noktasında olan sol-alt çeyrek düzlemin olasılığı oynar.
Tanım 13.2 (Ortak Dağılım Fonksiyonu) \((X, Y)\) bir rastgele vektör olsun.
\[F_{X,Y} : \mathbb{R}^2 \to [0,1], \qquad F_{X,Y}(x,y) = P(X \le x,\ Y \le y) = P\big( (X,Y) \in (-\infty, x] \times (-\infty, y] \big)\]
fonksiyonuna \((X,Y)\) rastgele vektörünün dağılım fonksiyonu ya da \(X\) ile \(Y\) rastgele değişkenlerinin ortak dağılım fonksiyonu (ortak birikimli dağılım fonksiyonu) denir. Burada \((X \le x, Y \le y)\) yazımı \((X \le x) \cap (Y \le y)\) olayının kısaltmasıdır. \(X\) ve \(Y\)’nin kendi dağılım fonksiyonları \(F_X\) ve \(F_Y\)’ye bu bağlamda marjinal dağılım fonksiyonları denir.
Tek değişkenli dağılım fonksiyonunun temel özellikleri (monotonluk, sınırlar, sağdan süreklilik) burada da geçerlidir; ayrıca ortak dağılım fonksiyonundan marjinal dağılım fonksiyonları okunur. Yeni olan, bir dikdörtgenin olasılığını veren formüldür: bu formül, tek boyuttaki “\(F(b) - F(a)\)” işleminin yerini alır ve dört köşe değerinin işaretli toplamı olarak çıkar.
Önerme 13.1 (Ortak Dağılım Fonksiyonunun Özellikleri) \(F = F_{X,Y}\), \((X,Y)\) rastgele vektörünün ortak dağılım fonksiyonu olsun.
(i) \(F\) her değişkeninde azalmayandır: \(x_1 \le x_2\) ise \(F(x_1, y) \le F(x_2, y)\); \(y_1 \le y_2\) ise \(F(x, y_1) \le F(x, y_2)\).
(ii) Her sabit \(y\) için \(\lim_{x \to -\infty} F(x,y) = 0\); her sabit \(x\) için \(\lim_{y \to -\infty} F(x,y) = 0\); ayrıca \(x \to \infty\) ve \(y \to \infty\) iken \(F(x,y) \to 1\).
(iii) Marjinal dağılım fonksiyonları \(F\)’den okunur:
\[F_X(x) = \lim_{y \to \infty} F(x,y), \qquad F_Y(y) = \lim_{x \to \infty} F(x,y).\]
(iv) \(F\) her değişkeninde sağdan süreklidir.
(v) (Dikdörtgen formülü) \(a < b\) ve \(c < d\) için
\[P(a < X \le b,\ c < Y \le d) = F(b,d) - F(a,d) - F(b,c) + F(a,c).\]
Özel olarak sağ taraf her zaman \(\ge 0\)’dır.
İspat
Bütün ispatlar olasılık ölçüsünün iki özelliğine dayanır: monotonluk ve fark kuralı (Teorem 3.1) ile artan ya da azalan olay dizileri için olasılığın sürekliliği (Teorem 3.5); yani \(A_1 \subseteq A_2 \subseteq \cdots\) ise \(P(A_k) \to P(\bigcup_k A_k)\) ve \(A_1 \supseteq A_2 \supseteq \cdots\) ise \(P(A_k) \to P(\bigcap_k A_k)\).
(i) \(x_1 \le x_2\) ise \((X \le x_1, Y \le y) \subseteq (X \le x_2, Y \le y)\) olduğundan monotonluk gereği \(F(x_1,y) \le F(x_2,y)\)’dir. İkinci değişken için akıl yürütme aynıdır.
(ii) \(y\) sabit olsun ve \(A_k = (X \le -k, Y \le y)\), \(k \in \mathbb{N}\), olaylarını alalım. Bu dizi azalandır ve kesişimi boştur: \(X(\omega)\) bir gerçel sayı olduğundan yeterince büyük \(k\) için \(X(\omega) \le -k\) sağlanamaz. Süreklilikten \(F(-k, y) = P(A_k) \to P(\varnothing) = 0\) olur. \(F(\cdot, y)\) azalmayan olduğundan \(x \to -\infty\) iken limit vardır ve bu dizisel limite eşittir; yani \(\lim_{x \to -\infty} F(x,y) = 0\). İkinci limit aynı biçimde görülür. Son olarak \(B_k = (X \le k, Y \le k)\) olayları artandır ve birleşimleri \(\Omega\)’dır (her \(\omega\) için \(X(\omega)\) ve \(Y(\omega)\) sonlu sayılardır); süreklilikten \(F(k,k) = P(B_k) \to P(\Omega) = 1\). \(x \ge k\) ve \(y \ge k\) olduğunda (i) gereği \(F(k,k) \le F(x,y) \le 1\) olduğundan \(x, y \to \infty\) iken \(F(x,y) \to 1\) bulunur.
(iii) \(x\) sabit olsun. \(C_k = (X \le x, Y \le k)\) olayları artandır ve \(Y(\omega)\) sonlu olduğundan birleşimleri \((X \le x)\)’tir. Süreklilikten \(F(x,k) = P(C_k) \to P(X \le x) = F_X(x)\). \(F(x, \cdot)\) azalmayan olduğundan bu, \(\lim_{y \to \infty} F(x,y) = F_X(x)\) demektir. \(F_Y\) için aynı yol izlenir.
(iv) \(D_k = (X \le x + \frac{1}{k}, Y \le y)\) olayları azalandır ve kesişimleri \((X \le x, Y \le y)\)’dir; süreklilikten \(F(x + \frac{1}{k}, y) \to F(x,y)\). \(F(\cdot, y)\) azalmayan olduğundan bu, \(F(x^+, y) = F(x,y)\) demektir. İkinci değişken için aynı.
(v) \(E = (X \le b, Y \le d)\), \(E_1 = (X \le a, Y \le d)\), \(E_2 = (X \le b, Y \le c)\) olaylarını alalım. \(a < b\) ve \(c < d\) olduğundan \(E_1 \subseteq E\) ve \(E_2 \subseteq E\)’dir. İstenen olay, \(E\)’den \(E_1 \cup E_2\)’nin çıkarılmasıyla elde edilir:
\[(a < X \le b,\ c < Y \le d) = E \setminus (E_1 \cup E_2).\]
Gerçekten \(\omega \in E\) için “\(\omega \notin E_1\)” demek \(X(\omega) > a\) demek, “\(\omega \notin E_2\)” demek \(Y(\omega) > c\) demektir. \(E_1 \cup E_2 \subseteq E\) olduğundan fark kuralı uygulanır:
\[P(a < X \le b,\ c < Y \le d) = P(E) - P(E_1 \cup E_2).\]
\(E_1 \cap E_2 = (X \le a, Y \le c)\) olduğundan toplama kuralı (Teorem 3.2) ile \(P(E_1 \cup E_2) = F(a,d) + F(b,c) - F(a,c)\) bulunur. Yerine yazınca
\[P(a < X \le b,\ c < Y \le d) = F(b,d) - F(a,d) - F(b,c) + F(a,c)\]
elde edilir. Sol taraf bir olasılık olduğundan sağ taraf negatif olamaz.
\(\blacksquare\)
Tek boyutta azalmayan, sağdan sürekli ve sınırları \(0\) ile \(1\) olan her fonksiyon bir dağılım fonksiyonudur. İki boyutta (i)–(iv) yetmez; (v)’deki işaretli toplamın negatif olmaması ayrıca istenmelidir. Örneğin
\[G(x,y) = \begin{cases} 1, & x \ge 0,\ y \ge 0,\ x + y \ge 1 \\ 0, & \text{diğer durumlarda} \end{cases}\]
fonksiyonu her değişkeninde azalmayandır, sağdan süreklidir ve \(-\infty\)’da \(0\), \(+\infty\)’da \(1\) sınırlarına sahiptir. Ama \((0,1] \times (0,1]\) dikdörtgeni için
\[G(1,1) - G(0,1) - G(1,0) + G(0,0) = 1 - 1 - 1 + 0 = -1 < 0\]
olduğundan \(G\) hiçbir rastgele vektörün ortak dağılım fonksiyonu olamaz.
Tek boyutta olduğu gibi burada da iki ana sınıf vardır: değer kümesi sayılabilir olan kesikli vektörler ve olasılığı bir yoğunluk fonksiyonunun integraliyle verilen sürekli vektörler. Önce kesikli durumu ele alıyoruz.
13.3 Kesikli Rastgele Vektörler
Tanım 13.3 (Kesikli Rastgele Vektör) \((X_1, X_2)\) rastgele vektörünün değer kümesi \(D_{(X_1, X_2)}\) sonlu ya da sayılabilir sonsuz ise \((X_1, X_2)\)’ye kesikli rastgele vektör denir.
Bu koşul, bileşenlerin kesikli olmasıyla aynıdır. Gerçekten \(D_{X_1}\) ve \(D_{X_2}\), \(D_{(X_1,X_2)}\) kümesinin eksenlere izdüşümleridir; sayılabilir bir kümenin izdüşümü sayılabilir olduğundan kesikli bir vektörün bileşenleri kesikli rastgele değişkenlerdir (Tanım 10.1). Tersine \(X_1\) ve \(X_2\) kesikli ise \(D_{(X_1,X_2)} \subseteq D_{X_1} \times D_{X_2}\) ve iki sayılabilir kümenin çarpımı sayılabilir olduğundan \((X_1,X_2)\) kesiklidir.
Tek değişkenli kesikli durumda \(P_X\) ölçüsü, \(f_X(x) = P(X = x)\) olasılık fonksiyonuyla (Tanım 10.2) tümüyle belirleniyordu. İki boyutta aynı işi, her değer çiftinin olasılığını veren fonksiyon görür.
Tanım 13.4 (Ortak Olasılık Fonksiyonu) \((X_1, X_2)\) kesikli bir rastgele vektör olsun.
\[f_{X_1, X_2}(x_1, x_2) = P(X_1 = x_1,\ X_2 = x_2), \qquad (x_1, x_2) \in D_{(X_1, X_2)}\]
fonksiyonuna \((X_1, X_2)\) rastgele vektörünün olasılık fonksiyonu ya da \(X_1\) ile \(X_2\) rastgele değişkenlerinin ortak olasılık fonksiyonu (ortak olasılık kütle fonksiyonu) denir. \(D_{(X_1,X_2)}\) dışındaki \((x_1,x_2) \in \mathbb{R}^2\) noktalarında \(f_{X_1,X_2}(x_1,x_2) = 0\) alınır.
Aşağıdaki sonuç, ortak olasılık fonksiyonunun tek değişkenli olasılık fonksiyonunun iki koşulunu sağladığını ve tıpkı onun gibi bütün olasılık dağılımını belirlediğini söyler.
Önerme 13.2 (Ortak Olasılık Fonksiyonunun Özellikleri) \((X_1, X_2)\) kesikli bir rastgele vektör ve \(f = f_{X_1,X_2}\) onun ortak olasılık fonksiyonu olsun.
(i) Her \((x_1, x_2) \in D_{(X_1,X_2)}\) için \(f(x_1, x_2) \ge 0\)’dır.
(ii) \(\displaystyle \sum_{(x_1, x_2) \in D_{(X_1,X_2)}} f(x_1, x_2) = 1\)’dir.
(iii) Her \(B \in \mathcal{B}(\mathbb{R}^2)\) için
\[P\big( (X_1, X_2) \in B \big) = \sum_{(x_1, x_2) \in B \cap D_{(X_1,X_2)}} f(x_1, x_2).\]
İspat
\(D = D_{(X_1,X_2)}\) yazalım. (i) Her olasılık gibi \(f(x_1,x_2) = P(X_1 = x_1, X_2 = x_2) \ge 0\)’dır.
(iii) \(B\) bir Borel kümesi olsun. Her \(\omega\) için \((X_1(\omega), X_2(\omega)) \in D\) olduğundan \(\big( (X_1,X_2) \in B \big)\) olayı, \(B \cap D\)’deki noktalara göre parçalanır:
\[\big( (X_1, X_2) \in B \big) = \bigcup_{(x_1, x_2) \in B \cap D} \big( X_1 = x_1,\ X_2 = x_2 \big).\]
Sağdaki olaylar ikişer ikişer ayrıktır (bir \(\omega\), iki farklı noktaya aynı anda eşlenemez) ve \(D\) sayılabilir olduğundan birleşim sayılabilirdir. Sayılabilir toplamsallıkla
\[P\big( (X_1,X_2) \in B \big) = \sum_{(x_1,x_2) \in B \cap D} P(X_1 = x_1, X_2 = x_2) = \sum_{(x_1,x_2) \in B \cap D} f(x_1,x_2)\]
bulunur.
(ii) (iii)’te \(B = \mathbb{R}^2\) alınırsa sol taraf \(P(\Omega) = 1\), sağ taraf \(D\) üzerindeki toplamdır.
\(\blacksquare\)
(iii) maddesi, kesikli bir vektörle ilgili her olasılığın, olayın içine düşen değer çiftlerinin olasılıklarını toplayarak hesaplandığını söyler. Özel olarak ortak dağılım fonksiyonu
\[F_{X_1,X_2}(x_1, x_2) = \sum_{\substack{(u,v) \in D \\ u \le x_1,\ v \le x_2}} f_{X_1,X_2}(u,v)\]
toplamıdır.
Marjinal Olasılık Fonksiyonları
Ortak olasılık fonksiyonu elimizdeyken tek bir bileşenle ilgili olasılıklar nasıl bulunur? Örneğin \(P(X_1 = x_1)\) için \(X_2\)’nin hangi değeri aldığı önemsizdir; \(X_2\)’nin alabileceği bütün değerler üzerinden toplamak gerekir. Bu toplama işlemine marjinalleştirme denir.
Tanım 13.5 (Marjinal Olasılık Fonksiyonları) \((X, Y)\) kesikli bir rastgele vektör ve \(f_{X,Y}\) ortak olasılık fonksiyonu olsun.
\[f_X(x) = \sum_{y \in D_Y} f_{X,Y}(x,y), \quad x \in D_X; \qquad\qquad f_Y(y) = \sum_{x \in D_X} f_{X,Y}(x,y), \quad y \in D_Y\]
fonksiyonlarına sırasıyla \(X\)’in ve \(Y\)’nin marjinal olasılık fonksiyonları denir.
Adlandırma, marjinal fonksiyonların gerçekten \(X\) ve \(Y\)’nin olasılık fonksiyonları olmasını gerektirir; bunu ispatlayalım.
Önerme 13.3 (Marjinal Olasılık Fonksiyonları Birer Olasılık Fonksiyonudur) \((X,Y)\) kesikli bir rastgele vektör olsun. Her \(x \in D_X\) ve \(y \in D_Y\) için
\[f_X(x) = P(X = x), \qquad f_Y(y) = P(Y = y)\]
olur; yani \(f_X\) ve \(f_Y\), sırasıyla \(X\) ve \(Y\) kesikli rastgele değişkenlerinin olasılık fonksiyonlarıdır. Özel olarak \(f_X \ge 0\), \(f_Y \ge 0\) ve
\[\sum_{x \in D_X} f_X(x) = 1, \qquad \sum_{y \in D_Y} f_Y(y) = 1.\]
İspat
\(x \in D_X\) sabit olsun. Her \(\omega\) için \(Y(\omega) \in D_Y\) olduğundan \((X = x)\) olayı, \(Y\)’nin değerlerine göre parçalanır:
\[(X = x) = \bigcup_{y \in D_Y} (X = x,\ Y = y).\]
Farklı \(y\)’lere karşılık gelen olaylar ayrıktır ve \(D_Y\) sayılabilirdir. Sayılabilir toplamsallıkla
\[P(X = x) = \sum_{y \in D_Y} P(X = x, Y = y) = \sum_{y \in D_Y} f_{X,Y}(x,y) = f_X(x).\]
Burada \((x,y) \notin D_{(X,Y)}\) olan çiftler için \(f_{X,Y}(x,y) = 0\) olduğundan toplamı \(D_Y\)’nin tamamı üzerinden yazmak sakıncasızdır. \(X\) kesikli bir rastgele değişkendir (Lemma 13.1 ve \(D_X\)’in sayılabilirliği); olasılık fonksiyonu tanım gereği \(P(X = x)\)’tir, dolayısıyla \(f_X\) bu olasılık fonksiyonudur ve Tanım 10.2’ndaki iki koşulu sağlar. Toplamın \(1\) olduğu doğrudan da görülür: negatif olmayan terimlerin toplama sırası değiştirilebildiğinden
\[\sum_{x \in D_X} f_X(x) = \sum_{x \in D_X} \sum_{y \in D_Y} f_{X,Y}(x,y) = \sum_{(x,y) \in D_{(X,Y)}} f_{X,Y}(x,y) = 1\]
(Önerme 13.2). \(f_Y\) için ispat, \(X\) ile \(Y\)’nin rollerini değiştirerek aynen yürür.
\(\blacksquare\)
Tablo Gösterimi
Değer kümeleri sonlu olduğunda ortak olasılık fonksiyonu en rahat bir tabloyla verilir: satırlar \(X\)’in, sütunlar \(Y\)’nin değerlerini taşır; hücrelere \(f_{X,Y}(x_i, y_j)\) yazılır. Marjinaller ise satır ve sütun toplamlarıdır; tablonun kenarında (“marjında”) yer aldıkları için bu adı almışlardır.
Önerme 13.4 (Ortak Dağılım Tablosu) \((X,Y)\) kesikli bir rastgele vektör, \(D_X = \{x_1, \ldots, x_m\}\) ve \(D_Y = \{y_1, \ldots, y_n\}\) sonlu olsun. \(f = f_{X,Y}\) değerleri aşağıdaki tabloya yerleştirildiğinde her satırın toplamı o satırdaki \(x_i\) için \(f_X(x_i)\)’ye, her sütunun toplamı o sütundaki \(y_j\) için \(f_Y(y_j)\)’ye ve bütün hücrelerin toplamı \(1\)’e eşittir.
| \(X \downarrow \;/\; Y \rightarrow\) | \(y_1\) | \(y_2\) | \(\cdots\) | \(y_n\) | \(f_X(x)\) |
|---|---|---|---|---|---|
| \(x_1\) | \(f(x_1, y_1)\) | \(f(x_1, y_2)\) | \(\cdots\) | \(f(x_1, y_n)\) | \(f_X(x_1)\) |
| \(x_2\) | \(f(x_2, y_1)\) | \(f(x_2, y_2)\) | \(\cdots\) | \(f(x_2, y_n)\) | \(f_X(x_2)\) |
| \(\vdots\) | \(\vdots\) | \(\vdots\) | \(\ddots\) | \(\vdots\) | \(\vdots\) |
| \(x_m\) | \(f(x_m, y_1)\) | \(f(x_m, y_2)\) | \(\cdots\) | \(f(x_m, y_n)\) | \(f_X(x_m)\) |
| \(f_Y(y)\) | \(f_Y(y_1)\) | \(f_Y(y_2)\) | \(\cdots\) | \(f_Y(y_n)\) | \(1\) |
Son sütun, \(X\)’in değerleriyle birlikte \(X\)’in marjinal olasılık fonksiyonunu; son satır, \(Y\)’nin değerleriyle birlikte \(Y\)’nin marjinal olasılık fonksiyonunu verir.
İspat
\(i\)-inci satırın toplamı \(\sum_{j=1}^{n} f(x_i, y_j) = \sum_{y \in D_Y} f_{X,Y}(x_i, y) = f_X(x_i)\)’dir (Tanım 13.5); \(j\)-inci sütunun toplamı da aynı biçimde \(f_Y(y_j)\)’dir. Bütün hücrelerin toplamı, \(D_{(X,Y)} \subseteq D_X \times D_Y\) ve \(D_{(X,Y)}\) dışında \(f = 0\) olduğundan \(\sum_{(x,y) \in D_{(X,Y)}} f_{X,Y}(x,y) = 1\)’dir (Önerme 13.2). Son sütunun (ya da son satırın) toplamının \(1\) olması Önerme 13.3’nun sonucudur.
\(\blacksquare\)
Tablo, \(D_X \times D_Y\) çarpım kümesinin bütün hücrelerini içerir; ama \(D_{(X,Y)}\) bu çarpımın yalnızca bir alt kümesidir. Rastgele vektörün alamadığı çiftlere karşılık gelen hücrelere \(0\) yazılır. Aşağıdaki örnekte \(D_{X_1} \times D_{X_2}\)’nin \(12\) elemanı varken \(D_{(X_1,X_2)}\)’nin yalnızca \(6\) elemanı vardır. Tabloda sıfırların bulunması, iki bileşen arasında sıkı bir bağ olduğunun ilk işaretidir; bu gözlem bir sonraki bölümde bağımsızlık kavramıyla kesinleşecektir.
Örnek 13.1 (Üç Para Atışı: Toplam Tura ve İlk İki Atıştaki Tura) Düzgün bir para üç kez atılıyor. \(X_1\) üç atışta gelen tura sayısı, \(X_2\) ilk iki atışta gelen tura sayısı olsun.
a) \((X_1, X_2)\) rastgele vektörünün ortak olasılık fonksiyonunu tablo olarak oluşturunuz.
b) \(X_1\) ve \(X_2\)’nin marjinal olasılık fonksiyonlarını bulunuz.
c) \(P(X_1 = 1)\) olasılığını hem doğrudan örnek uzaydan hem de ortak olasılık fonksiyonundan hesaplayınız.
d) Üç atışta gelen tura sayısının ilk iki atıştaki tura sayısına eşit olması olasılığını bulunuz.
Çözüm
a) \(Y\) yazıyı, \(T\) turayı göstersin. Örnek uzay
\[\Omega = \{ YYY,\ YYT,\ YTY,\ YTT,\ TYY,\ TYT,\ TTY,\ TTT \}\]
sekiz elemanlıdır ve para düzgün olduğundan her sonucun olasılığı \(\frac{1}{8}\)’dir. Her sonuç için \(X_1\) (toplam tura) ve \(X_2\) (ilk iki atıştaki tura) değerlerini yazalım:
| \(\omega\) | \(YYY\) | \(YYT\) | \(YTY\) | \(YTT\) | \(TYY\) | \(TYT\) | \(TTY\) | \(TTT\) |
|---|---|---|---|---|---|---|---|---|
| \(X_1(\omega)\) | \(0\) | \(1\) | \(1\) | \(2\) | \(1\) | \(2\) | \(2\) | \(3\) |
| \(X_2(\omega)\) | \(0\) | \(0\) | \(1\) | \(1\) | \(1\) | \(1\) | \(2\) | \(2\) |
Buradan \(D_{X_1} = \{0,1,2,3\}\), \(D_{X_2} = \{0,1,2\}\) ve
\[D_{(X_1,X_2)} = \{ (0,0),\ (1,0),\ (1,1),\ (2,1),\ (2,2),\ (3,2) \}\]
okunur. Her çiftin olasılığı, o çifti veren sonuçların sayısının \(\frac{1}{8}\) katıdır. Örneğin
\[f_{X_1,X_2}(0,0) = P(X_1 = 0, X_2 = 0) = P\big( \{YYY\} \cap \{YYY, YYT\} \big) = P(\{YYY\}) = \frac{1}{8},\]
\[f_{X_1,X_2}(1,1) = P(X_1 = 1, X_2 = 1) = P(\{YTY, TYY\}) = \frac{2}{8},\]
\[f_{X_1,X_2}(2,1) = P(\{YTT, TYT\}) = \frac{2}{8}, \qquad f_{X_1,X_2}(2,2) = P(\{TTY\}) = \frac{1}{8}.\]
\(D_{(X_1,X_2)}\) dışındaki çiftler için \(f_{X_1,X_2} = 0\)’dır; örneğin \(X_1 = 0\) iken \(X_2 = 1\) olamaz. Ortak olasılık fonksiyonunun tablosu (satır ve sütun toplamlarıyla birlikte) şöyledir:
| \(X_1 \downarrow \;/\; X_2 \rightarrow\) | \(0\) | \(1\) | \(2\) | \(f_{X_1}(x_1)\) |
|---|---|---|---|---|
| \(0\) | \(\frac{1}{8}\) | \(0\) | \(0\) | \(\frac{1}{8}\) |
| \(1\) | \(\frac{1}{8}\) | \(\frac{2}{8}\) | \(0\) | \(\frac{3}{8}\) |
| \(2\) | \(0\) | \(\frac{2}{8}\) | \(\frac{1}{8}\) | \(\frac{3}{8}\) |
| \(3\) | \(0\) | \(0\) | \(\frac{1}{8}\) | \(\frac{1}{8}\) |
| \(f_{X_2}(x_2)\) | \(\frac{2}{8}\) | \(\frac{4}{8}\) | \(\frac{2}{8}\) | \(1\) |
Hücrelerin toplamı \(\frac{1+1+2+2+1+1}{8} = 1\)’dir; Önerme 13.2 sağlanır.
b) Satır toplamları \(X_1\)’in marjinal olasılık fonksiyonunu verir:
| \(x_1\) | \(0\) | \(1\) | \(2\) | \(3\) |
|---|---|---|---|---|
| \(f_{X_1}(x_1)\) | \(\frac{1}{8}\) | \(\frac{3}{8}\) | \(\frac{3}{8}\) | \(\frac{1}{8}\) |
Örneğin \(f_{X_1}(2) = f_{X_1,X_2}(2,0) + f_{X_1,X_2}(2,1) + f_{X_1,X_2}(2,2) = 0 + \frac{2}{8} + \frac{1}{8} = \frac{3}{8}\). Bu, Örnek 8.2’nde bulunan üç atıştaki tura sayısı dağılımıdır: \(f_{X_1}(x_1) = \binom{3}{x_1} \frac{1}{8}\).
Sütun toplamları \(X_2\)’nin marjinal olasılık fonksiyonunu verir:
| \(x_2\) | \(0\) | \(1\) | \(2\) |
|---|---|---|---|
| \(f_{X_2}(x_2)\) | \(\frac{1}{4}\) | \(\frac{1}{2}\) | \(\frac{1}{4}\) |
Bu da iki atışta gelen tura sayısının dağılımıdır: \(f_{X_2}(x_2) = \binom{2}{x_2} \frac{1}{4}\). İki marjinalin toplamı da \(1\)’dir.
c) Doğrudan: \((X_1 = 1) = \{YYT, YTY, TYY\}\) olduğundan \(P(X_1 = 1) = \frac{3}{8}\).
Ortak olasılık fonksiyonundan: \(X_2\)’nin bütün değerleri üzerinden toplayarak (Tanım 13.5)
\[P(X_1 = 1) = \sum_{x_2 \in D_{X_2}} f_{X_1,X_2}(1, x_2) = f_{X_1,X_2}(1,0) + f_{X_1,X_2}(1,1) + f_{X_1,X_2}(1,2) = \frac{1}{8} + \frac{2}{8} + 0 = \frac{3}{8}.\]
Bu, tablodaki \(x_1 = 1\) satırının toplamı, yani \(f_{X_1}(1) = \frac{3}{8}\)’dir; iki yol aynı sonucu verir.
d) İstenen olasılık \(P(X_1 = X_2)\)’dir. \((X_1 = X_2)\) olayı, \(B = \{ (u,v) \in \mathbb{R}^2 : u = v \}\) köşegeni için \(\big( (X_1,X_2) \in B \big)\) olayıdır; Önerme 13.2 gereği \(B \cap D_{(X_1,X_2)} = \{(0,0), (1,1), (2,2)\}\) üzerinden toplanır:
\[P(X_1 = X_2) = f_{X_1,X_2}(0,0) + f_{X_1,X_2}(1,1) + f_{X_1,X_2}(2,2) = \frac{1}{8} + \frac{2}{8} + \frac{1}{8} = \frac{1}{2}.\]
Sonuç sağduyuyla uyumludur: toplam tura sayısının ilk iki atıştaki tura sayısına eşit olması, üçüncü atışın yazı gelmesi demektir; bunun olasılığı \(\frac{1}{2}\)’dir.
\(\blacksquare\)
13.4 Sürekli Rastgele Vektörler
Tek boyutta sürekli rastgele değişken, değer kümesi sayılamayan değişkendi (Tanım 11.1); olasılık hesabını, dağılım fonksiyonu bir yoğunluğun integrali olarak yazılabilen mutlak sürekli değişkenler için yapmıştık (Tanım 11.2). İki boyutta yoğunluk, düzlem üzerinde tanımlı ve toplam kütlesi \(1\) olan negatif olmayan bir fonksiyondur; olasılıklar bu fonksiyonun bölgeler üzerindeki çift katlı integralleridir.
Tanım 13.6 (İki Değişkenli Olasılık Yoğunluk Fonksiyonu) \(f : \mathbb{R}^2 \to \mathbb{R}\) fonksiyonu
(i) her \((x_1, x_2) \in \mathbb{R}^2\) için \(f(x_1, x_2) \ge 0\),
(ii) \(\displaystyle \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} f(x_1, x_2)\,dx_1\,dx_2 = 1\)
koşullarını sağlıyorsa \(f\)’ye iki değişkenli olasılık yoğunluk fonksiyonu denir.
Tanım 13.7 (Sürekli Rastgele Vektör ve Ortak Yoğunluk) \((X_1, X_2)\) bir rastgele vektör olsun. Ortak dağılım fonksiyonu, iki değişkenli bir olasılık yoğunluk fonksiyonu \(f\) yardımıyla her \((x_1, x_2) \in \mathbb{R}^2\) için
\[F_{X_1,X_2}(x_1, x_2) = P(X_1 \le x_1,\ X_2 \le x_2) = \int_{-\infty}^{x_2} \int_{-\infty}^{x_1} f(u, v)\,du\,dv\]
biçiminde yazılabiliyorsa \((X_1, X_2)\)’ye sürekli rastgele vektör (mutlak sürekli rastgele vektör) ve \(f\)’ye \((X_1,X_2)\) rastgele vektörünün olasılık yoğunluk fonksiyonu ya da \(X_1\) ile \(X_2\)’nin ortak olasılık yoğunluk fonksiyonu denir; \(f_{X_1,X_2}\) ile gösterilir. Yoğunluğun sıfırdan farklı olduğu \(\{ (x_1,x_2) : f_{X_1,X_2}(x_1,x_2) > 0 \}\) kümesine yoğunluğun tanım bölgesi (desteği) denir; bu küme düzlemde sayılamayan bir kümedir.
Sürekli vektörlerde olasılık hesabının bütün pratiği tek bir ilkeye dayanır: bir bölgenin olasılığı, yoğunluğun o bölge üzerindeki integralidir. Aşağıdaki önerme bunu ve doğrudan sonuçlarını toplar.
Önerme 13.5 (Sürekli Rastgele Vektörde Olasılık Hesabı) \((X,Y)\) sürekli bir rastgele vektör ve \(f = f_{X,Y}\) ortak yoğunluğu olsun.
(i) \(a < b\), \(c < d\) için \(\displaystyle P(a < X \le b,\ c < Y \le d) = \int_{c}^{d} \int_{a}^{b} f(x,y)\,dx\,dy\).
(ii) Her \(B \in \mathcal{B}(\mathbb{R}^2)\) için \(\displaystyle P\big( (X,Y) \in B \big) = \iint_{B} f(x,y)\,dx\,dy\).
(iii) Her \((x_0, y_0)\) için \(P(X = x_0, Y = y_0) = 0\); daha genel olarak her doğru parçasının olasılığı \(0\)’dır. Bu yüzden (i)’deki eşitsizliklerde \(<\) ile \(\le\) birbirinin yerine kullanılabilir.
(iv) \(f\)’nin sürekli olduğu her \((x,y)\) noktasında \(\displaystyle \frac{\partial^2 F_{X,Y}}{\partial x\, \partial y}(x,y) = f(x,y)\).
İspat
(i) Dikdörtgen formülü (Önerme 13.1) ve \(F_{X,Y}\)’nin integral gösterimi kullanılır. \(F(b,d) - F(a,d)\) farkı, \(\int_{-\infty}^{d} \big( \int_{-\infty}^{b} f\,dx - \int_{-\infty}^{a} f\,dx \big) dy = \int_{-\infty}^{d} \int_{a}^{b} f\,dx\,dy\)’dir. Aynı biçimde \(F(b,c) - F(a,c) = \int_{-\infty}^{c} \int_{a}^{b} f\,dx\,dy\) olur. İkisinin farkı
\[F(b,d) - F(a,d) - F(b,c) + F(a,c) = \int_{c}^{d} \int_{a}^{b} f(x,y)\,dx\,dy\]
verir.
(ii) (i), iddiayı yarı açık dikdörtgenler için ispatlar. Dikdörtgenlerin sonlu ayrık birleşimleri için sonuç, olasılığın ve integralin toplamsallığından çıkar. Genel bir Borel kümesine geçiş, her Borel kümesine bu tür birleşimlerle istenildiği kadar iyi yaklaşılabilmesine ve iki tarafın da sayılabilir toplamsal ölçüler olmasına dayanır; iki olasılık ölçüsü \(\mathcal{B}(\mathbb{R}^2)\)’yi üreten dikdörtgenler sınıfı üzerinde çakışıyorsa bütün Borel kümelerinde çakışır. Bu ölçü teorisi sonucunu ispatsız kullanıyoruz.
(iii) \(\varepsilon > 0\) için (i) ve monotonluk gereği
\[P(X = x_0, Y = y_0) \le P(x_0 - \varepsilon < X \le x_0,\ y_0 - \varepsilon < Y \le y_0) = \int_{y_0 - \varepsilon}^{y_0} \int_{x_0 - \varepsilon}^{x_0} f\,dx\,dy\]
ve \(\varepsilon \to 0\) iken sağ taraf \(0\)’a gider (integrallenebilir bir fonksiyonun, alanı sıfıra giden bölgeler üzerindeki integrali sıfıra gider). Yatay bir doğru parçası \(\{(x, y_0) : a < x \le b\}\) için de aynı sıkıştırma \(\int_{y_0-\varepsilon}^{y_0} \int_a^b f\,dx\,dy \to 0\) verir; dikey parça için benzerdir. Eğik bir doğru parçası, toplam alanı istenildiği kadar küçük olan sonlu sayıda dikdörtgenle örtülebildiğinden onun olasılığı da \(0\)’dır. Bir dikdörtgenin kenarlarını dahil etmek ya da çıkarmak yalnızca sıfır olasılıklı doğru parçaları ekleyip çıkardığından olasılık değişmez.
(iv) \(F_{X,Y}(x,y) = \int_{-\infty}^{y} \big( \int_{-\infty}^{x} f(u,v)\,du \big) dv\) yazımında önce \(y\)’ye göre türev alınırsa analizin temel teoremi \(\frac{\partial F}{\partial y}(x,y) = \int_{-\infty}^{x} f(u,y)\,du\) verir; ardından \(x\)’e göre türev alınırsa aynı teoremle \(f(x,y)\) elde edilir. Ne var ki bu ardışık türev alma, iç integralin ikinci değişkende sürekli olmasını gerektirir; bu, \(f\)’nin yalnızca \((x,y)\)’nin bir komşuluğunda sürekli olmasından çıkmaz. Bu yüzden hesabı doğrudan dikdörtgen formülü üzerinden yürütelim: \(h, k > 0\) için Önerme 13.1 (v) ve (i) gereği
\[\frac{F(x+h, y+k) - F(x, y+k) - F(x+h, y) + F(x,y)}{hk} = \frac{1}{hk} \int_{y}^{y+k} \int_{x}^{x+h} f(u,v)\,du\,dv\]
olur ve \(f\)’nin \((x,y)\)’deki sürekliliği gereği sağ taraf \(h, k \to 0\) iken \(f(x,y)\)’ye gider. Bu, tek değişkenli \(F_X' = f_X\) ilişkisinin (Teorem 11.2) iki boyutlu karşılığıdır.
\(\blacksquare\)
Marjinal Yoğunluk Fonksiyonları
Kesikli durumda \(X\)’in olasılık fonksiyonu, ortak olasılık fonksiyonunu \(y\) üzerinden toplayarak bulunuyordu. Sürekli durumda toplamın yerini integral alır.
Tanım 13.8 (Marjinal Olasılık Yoğunluk Fonksiyonları) \((X,Y)\) sürekli bir rastgele vektör ve \(f_{X,Y}\) ortak yoğunluğu olsun.
\[f_X(x) = \int_{-\infty}^{\infty} f_{X,Y}(x,y)\,dy, \quad x \in \mathbb{R}; \qquad\qquad f_Y(y) = \int_{-\infty}^{\infty} f_{X,Y}(x,y)\,dx, \quad y \in \mathbb{R}\]
fonksiyonlarına sırasıyla \(X\)’in ve \(Y\)’nin marjinal olasılık yoğunluk fonksiyonları denir.
Ortak yoğunluk, tanım bölgesi dışında sıfır olduğundan bu integraller pratikte yalnızca tanım bölgesinin ilgili kesiti üzerinden alınır: \(f_X(x)\) için \(x\) sabitlenir ve \((x,y)\)’nin bölgede kaldığı \(y\) değerleri üzerinden integral alınır. Adlandırmanın haklı olduğunu, yani marjinal yoğunlukların gerçekten \(X\) ve \(Y\)’nin yoğunluk fonksiyonları olduğunu gösterelim.
Önerme 13.6 (Marjinal Yoğunluklar Birer Yoğunluk Fonksiyonudur) \((X,Y)\) sürekli bir rastgele vektör olsun. \(X\) ve \(Y\) yoğunluğa sahip (mutlak sürekli) rastgele değişkenlerdir ve yoğunluk fonksiyonları sırasıyla \(f_X\) ile \(f_Y\) marjinal yoğunluklarıdır; yani her \(x, y \in \mathbb{R}\) için
\[F_X(x) = \int_{-\infty}^{x} f_X(u)\,du, \qquad F_Y(y) = \int_{-\infty}^{y} f_Y(v)\,dv.\]
Özel olarak \(f_X \ge 0\), \(f_Y \ge 0\) ve \(\int_{-\infty}^{\infty} f_X(x)\,dx = \int_{-\infty}^{\infty} f_Y(y)\,dy = 1\)’dir.
İspat
\(f = f_{X,Y}\) yazalım. \(f \ge 0\) olduğundan \(f_X(x) = \int_{-\infty}^{\infty} f(x,y)\,dy \ge 0\)’dır. Önerme 13.1 (iii) gereği \(F_X(x) = \lim_{y \to \infty} F_{X,Y}(x,y)\)’dir. Yoğunluk gösterimini yazıp negatif olmayan integrandlar için integral sırasını değiştirirsek
\[F_{X,Y}(x, y) = \int_{-\infty}^{y} \int_{-\infty}^{x} f(u,v)\,du\,dv = \int_{-\infty}^{x} \left( \int_{-\infty}^{y} f(u,v)\,dv \right) du\]
olur. \(y \to \infty\) iken iç integral artarak \(\int_{-\infty}^{\infty} f(u,v)\,dv = f_X(u)\)’ya gider ve limit dış integralin içine alınabilir (artan negatif olmayan fonksiyon dizileri için limit ile integral yer değiştirir). Böylece
\[F_X(x) = \lim_{y \to \infty} F_{X,Y}(x,y) = \int_{-\infty}^{x} f_X(u)\,du.\]
Bu, \(X\)’in dağılım fonksiyonunun negatif olmayan bir fonksiyonun integrali olarak yazılabildiğini söyler; yani \(X\) mutlak sürekli bir rastgele değişkendir ve yoğunluğu \(f_X\)’tir (Tanım 11.2). \(x \to \infty\) alınırsa \(\int_{-\infty}^{\infty} f_X(u)\,du = \lim_{x \to \infty} F_X(x) = 1\) bulunur; bu aynı zamanda \(\iint f = 1\) eşitliğinin integral sırası değiştirilerek okunmasıdır. \(Y\) için ispat, değişkenlerin rolleri değiştirilerek aynen yürür.
\(\blacksquare\)
Sürekli vektörlerde yapılan hataların hemen hepsi integral sınırlarından kaynaklanır. Bir olasılık hesaplamadan önce ortak yoğunluğun tanım bölgesini düzlemde çizin, istenen olayın bölgesini üzerine tarayın ve integrali yalnızca iki bölgenin kesişimi üzerinden alın. Marjinal yoğunluk hesaplarken de \(x\)’i sabitleyip bölgeyi dikey bir doğruyla kesin; \(y\)’nin sınırları bu kesitten okunur. Bölge bir dikdörtgense sınırlar sabittir; değilse en az bir sınır öteki değişkene bağlıdır.
Örnek 13.2 (Dikdörtgen Üzerinde Sabit Ortak Yoğunluk) \(X\) ve \(Y\) rastgele değişkenlerinin ortak olasılık yoğunluk fonksiyonu
\[f_{X,Y}(x,y) = \begin{cases} c, & 0 < x < 2,\ 2 < y < 4 \\ 0, & \text{diğer durumlarda} \end{cases}\]
olsun.
a) \(f_{X,Y}\)’nin bir olasılık yoğunluk fonksiyonu olması için \(c\) ne olmalıdır?
b) \(X\) ve \(Y\)’nin marjinal olasılık yoğunluk fonksiyonlarını bulunuz.
c) \(P(X \le 1,\ Y \le 3)\) olasılığını hesaplayınız ve ortak dağılım fonksiyonunu \(0 < x < 2\), \(2 < y < 4\) için yazınız.
d) \(P(X + Y \le 3)\) olasılığını hesaplayınız.
Çözüm
Yoğunluğun tanım bölgesi \(D = (0,2) \times (2,4)\) dikdörtgenidir; alanı \(2 \cdot 2 = 4\)’tür.
a) \(f_{X,Y} \ge 0\) olması için \(c \ge 0\) gerekir. Toplam integralin \(1\) olması koşulundan (Tanım 13.6)
\[1 = \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} f_{X,Y}(x,y)\,dx\,dy = \int_{2}^{4} \int_{0}^{2} c\,dx\,dy = c \int_{2}^{4} 2\,dy = 4c\]
bulunur; öyleyse \(c = \frac{1}{4}\). Bu, dikdörtgenin alanının tersidir: \((X,Y)\), \(D\) dikdörtgeni üzerinde düzgün dağılmıştır ve \(D\) içindeki bir bölgenin olasılığı, o bölgenin alanının \(D\)’nin alanına oranıdır. Bu, daha önce gördüğümüz geometrik olasılık modelidir (Tanım 4.5).
b) \(0 < x < 2\) sabit olsun; \((x,y) \in D\) olması için \(2 < y < 4\) gerekir. Tanım 13.8 gereği
\[f_X(x) = \int_{-\infty}^{\infty} f_{X,Y}(x,y)\,dy = \int_{2}^{4} \frac{1}{4}\,dy = \frac{1}{2}, \qquad 0 < x < 2,\]
ve \(x \notin (0,2)\) için \(f_X(x) = 0\)’dır. Benzer biçimde \(2 < y < 4\) için
\[f_Y(y) = \int_{0}^{2} \frac{1}{4}\,dx = \frac{1}{2}, \qquad 2 < y < 4,\]
ve \(y \notin (2,4)\) için \(f_Y(y) = 0\). Yani
\[f_X(x) = \begin{cases} \frac{1}{2}, & 0 < x < 2 \\ 0, & \text{diğer durumlarda,} \end{cases} \qquad f_Y(y) = \begin{cases} \frac{1}{2}, & 2 < y < 4 \\ 0, & \text{diğer durumlarda.} \end{cases}\]
\(X\), \((0,2)\) üzerinde; \(Y\), \((2,4)\) üzerinde düzgün dağılmıştır. Her iki marjinalin integrali \(2 \cdot \frac{1}{2} = 1\)’dir (Önerme 13.6).
c) \((X \le 1, Y \le 3)\) olayının bölgesi \(\{x \le 1, y \le 3\}\) çeyrek düzlemidir; \(D\) ile kesişimi \((0,1] \times (2,3]\) dikdörtgenidir. Önerme 13.5 (ii) gereği
\[P(X \le 1, Y \le 3) = \int_{2}^{3} \int_{0}^{1} \frac{1}{4}\,dx\,dy = \frac{1}{4} \cdot 1 \cdot 1 = \frac{1}{4}.\]
Alan yorumuyla: kesişimin alanı \(1\), \(D\)’nin alanı \(4\); oran \(\frac{1}{4}\). Bu değer \(F_{X,Y}(1,3)\)’tür. Genel olarak \(0 < x < 2\), \(2 < y < 4\) için
\[F_{X,Y}(x,y) = \int_{2}^{y} \int_{0}^{x} \frac{1}{4}\,du\,dv = \frac{x\,(y-2)}{4}\]
bulunur; \(x = 1\), \(y = 3\) için gerçekten \(\frac{1}{4}\) çıkar. Doğrulama olarak \(\frac{\partial^2}{\partial x\,\partial y} \frac{x(y-2)}{4} = \frac{1}{4} = f_{X,Y}(x,y)\)’dir (Önerme 13.5 (iv)).
d) \((X + Y \le 3)\) olayının bölgesi \(x + y \le 3\) yarı düzlemidir. \(D\) ile kesişimini bulalım: \(y > 2\) ve \(y \le 3 - x\) olması için \(3 - x > 2\), yani \(x < 1\) gerekir. Demek ki kesişim
\[\{ (x,y) : 0 < x < 1,\ 2 < y \le 3 - x \}\]
üçgenidir; köşeleri \((0,2)\), \((1,2)\) ve \((0,3)\)’tür. İntegral
\[P(X + Y \le 3) = \int_{0}^{1} \int_{2}^{3-x} \frac{1}{4}\,dy\,dx = \frac{1}{4} \int_{0}^{1} (3 - x - 2)\,dx = \frac{1}{4} \int_{0}^{1} (1 - x)\,dx = \frac{1}{4} \cdot \frac{1}{2} = \frac{1}{8}.\]
Alan yorumuyla: dik kenarları \(1\) olan üçgenin alanı \(\frac{1}{2}\), \(D\)’nin alanı \(4\); oran \(\frac{1}{8}\).
\(\blacksquare\)
Kesikli örnekte tabloda beliren sıfırlar, iki bileşen arasında sıkı bir bağ olduğunu gösteriyordu; bu örnekte ise tersi bir durum gözlenir: ortak yoğunluk, marjinal yoğunlukların çarpımına eşittir (\(\frac{1}{4} = \frac{1}{2} \cdot \frac{1}{2}\)). Bu eşitliğin tesadüf olmadığı ve “bağımsızlık” anlamına geldiği bir sonraki bölümde gösterilecektir.
13.5 Alıştırmalar
Alıştırma 13.1 (Rastgele Vektörler ve Ortak Dağılımlar Üzerine) a) Düzgün bir zar iki kez atılıyor. \(X\) gelen sayıların en küçüğü, \(Y\) en büyüğü olsun. \((X,Y)\)’nin ortak olasılık fonksiyonunu formülle yazınız, marjinal olasılık fonksiyonlarını bulunuz ve \(P(X = Y)\) ile \(P(Y - X \le 1)\) olasılıklarını hesaplayınız.
b) \(X\) ve \(Y\) rastgele değişkenlerinin ortak olasılık fonksiyonu \(x \in \{1,2,3\}\), \(y \in \{1,2\}\) için \(f_{X,Y}(x,y) = k\,xy\) olsun. \(k\) sabitini, marjinal olasılık fonksiyonlarını ve \(P(X + Y \le 3)\) olasılığını bulunuz.
c) Örnek 13.1’taki \((X_1, X_2)\) vektörü için \(F_{X_1,X_2}(1,1)\) ve \(F_{X_1,X_2}(2,0)\) değerlerini bulunuz. Ardından \(P(0 < X_1 \le 2,\ 0 < X_2 \le 1)\) olasılığını hem dikdörtgen formülüyle hem de tablodan doğrudan hesaplayıp karşılaştırınız.
d) \((X,Y)\) rastgele vektörünün ortak dağılım fonksiyonu \(x \ge 0\), \(y \ge 0\) için \(F_{X,Y}(x,y) = (1 - e^{-x})(1 - e^{-y})\), diğer durumlarda \(0\) olsun. Marjinal dağılım fonksiyonlarını, ortak yoğunluk fonksiyonunu ve \(P(1 < X \le 2,\ 0 < Y \le 1)\) olasılığını bulunuz.
e) \(X\) ve \(Y\)’nin ortak yoğunluğu \(0 < x < 1\), \(0 < y < 2\) için \(f_{X,Y}(x,y) = k\,xy\), diğer durumlarda \(0\) olsun. \(k\)’yı, marjinal yoğunlukları, \(P(X \le \frac{1}{2},\ Y \le 1)\) ve \(P(X + Y \le 1)\) olasılıklarını bulunuz.
f) \(X\) ve \(Y\)’nin ortak yoğunluğu \(0 < x < y < 1\) için \(f_{X,Y}(x,y) = 2\), diğer durumlarda \(0\) olsun. Bunun bir yoğunluk fonksiyonu olduğunu gösteriniz, marjinal yoğunlukları bulunuz ve \(P(Y > 2X)\) olasılığını hesaplayınız.
Çözüm
a) Örnek uzay \(\{1, \ldots, 6\}^2\)’nin \(36\) elemanı eşit olasılıklıdır. \(x < y\) olan bir \((x,y)\) çifti iki sonuçtan (\((x,y)\) ve \((y,x)\)) gelir; \(x = y\) çifti tek sonuçtan gelir; \(x > y\) olamaz. Öyleyse \(x, y \in \{1, \ldots, 6\}\) için
\[f_{X,Y}(x,y) = \begin{cases} \frac{2}{36}, & x < y \\[1mm] \frac{1}{36}, & x = y \\[1mm] 0, & x > y. \end{cases}\]
Marjinaller: \(x\) sabitken \(y \in \{x, x+1, \ldots, 6\}\) olduğundan
\[f_X(x) = \frac{1}{36} + (6 - x)\frac{2}{36} = \frac{13 - 2x}{36}, \qquad x = 1, \ldots, 6;\]
\(y\) sabitken \(x \in \{1, \ldots, y\}\) olduğundan
\[f_Y(y) = \frac{1}{36} + (y - 1)\frac{2}{36} = \frac{2y - 1}{36}, \qquad y = 1, \ldots, 6.\]
Sağlama: \(\sum_{x=1}^{6} (13 - 2x) = 78 - 42 = 36\) ve \(\sum_{y=1}^{6} (2y - 1) = 36\). Olasılıklar: \(P(X = Y) = 6 \cdot \frac{1}{36} = \frac{1}{6}\). \((Y - X \le 1)\) olayı \(x = y\) olan \(6\) çift ile \(y = x + 1\) olan \(5\) çiftten oluşur: \(P(Y - X \le 1) = \frac{6}{36} + 5 \cdot \frac{2}{36} = \frac{16}{36} = \frac{4}{9}\).
b) \(\sum_{x=1}^{3} \sum_{y=1}^{2} k\,xy = k (1 + 2 + 3)(1 + 2) = 18k = 1\) olduğundan \(k = \frac{1}{18}\). Marjinaller:
\[f_X(x) = \frac{x}{18}(1 + 2) = \frac{x}{6}, \quad x = 1,2,3; \qquad f_Y(y) = \frac{y}{18}(1 + 2 + 3) = \frac{y}{3}, \quad y = 1,2.\]
\(X + Y \le 3\) koşulunu sağlayan çiftler \((1,1)\), \((1,2)\), \((2,1)\)’dir:
\[P(X + Y \le 3) = \frac{1 + 2 + 2}{18} = \frac{5}{18}.\]
c) Tabloyu kullanalım. \(F_{X_1,X_2}(1,1) = P(X_1 \le 1, X_2 \le 1)\) değeri, \(x_1 \in \{0,1\}\) ve \(x_2 \in \{0,1\}\) hücrelerinin toplamıdır: \(\frac{1}{8} + 0 + \frac{1}{8} + \frac{2}{8} = \frac{1}{2}\). \(F_{X_1,X_2}(2,0)\), \(x_1 \in \{0,1,2\}\), \(x_2 = 0\) hücrelerinin toplamıdır: \(\frac{1}{8} + \frac{1}{8} + 0 = \frac{1}{4}\).
Dikdörtgen formülü için ayrıca \(F(2,1) = \frac{1}{8} + 0 + \frac{1}{8} + \frac{2}{8} + 0 + \frac{2}{8} = \frac{3}{4}\), \(F(0,1) = \frac{1}{8} + 0 = \frac{1}{8}\) ve \(F(0,0) = \frac{1}{8}\) gerekir. Önerme 13.1 (v) ile
\[P(0 < X_1 \le 2,\ 0 < X_2 \le 1) = F(2,1) - F(0,1) - F(2,0) + F(0,0) = \frac{3}{4} - \frac{1}{8} - \frac{1}{4} + \frac{1}{8} = \frac{1}{2}.\]
Doğrudan: olay \(x_1 \in \{1,2\}\), \(x_2 = 1\) hücrelerinden oluşur; \(f(1,1) + f(2,1) = \frac{2}{8} + \frac{2}{8} = \frac{1}{2}\). İki yol uyuşur.
d) Önerme 13.1 (iii) ile \(x \ge 0\) için \(F_X(x) = \lim_{y \to \infty} (1 - e^{-x})(1 - e^{-y}) = 1 - e^{-x}\), \(x < 0\) için \(0\); simetriyle \(F_Y(y) = 1 - e^{-y}\) (\(y \ge 0\)). Ortak yoğunluk karma türevdir (Önerme 13.5 (iv)): \(x, y > 0\) için
\[f_{X,Y}(x,y) = \frac{\partial^2}{\partial x\,\partial y} \big[ (1 - e^{-x})(1 - e^{-y}) \big] = e^{-x} e^{-y} = e^{-(x+y)},\]
diğer durumlarda \(0\). Bunun negatif olmadığı ve \(\int_0^\infty \int_0^\infty e^{-(x+y)}\,dx\,dy = 1 \cdot 1 = 1\) olduğu görülür. Dikdörtgen formülüyle
\[P(1 < X \le 2,\ 0 < Y \le 1) = F(2,1) - F(1,1) - F(2,0) + F(1,0) = (1 - e^{-2})(1 - e^{-1}) - (1 - e^{-1})^2 - 0 + 0.\]
\((1 - e^{-1})\) ortak çarpanı alınırsa sonuç şu değere iner:
\[\begin{aligned} (1 - e^{-1})\big[(1 - e^{-2}) - (1 - e^{-1})\big] &= (1 - e^{-1})(e^{-1} - e^{-2}) \\ &= e^{-1}(1 - e^{-1})^2 \approx 0{,}147. \end{aligned}\]
Aynı sonuç \(\int_0^1 \int_1^2 e^{-(x+y)}\,dx\,dy = (e^{-1} - e^{-2})(1 - e^{-1})\) integralinden de çıkar.
e) \(\int_0^2 \int_0^1 k\,xy\,dx\,dy = k \cdot \frac{1}{2} \cdot 2 = k\) olduğundan \(k = 1\). Marjinaller: \(0 < x < 1\) için \(f_X(x) = \int_0^2 xy\,dy = 2x\); \(0 < y < 2\) için \(f_Y(y) = \int_0^1 xy\,dx = \frac{y}{2}\); bölge dışında \(0\). Sağlama: \(\int_0^1 2x\,dx = 1\), \(\int_0^2 \frac{y}{2}\,dy = 1\).
\[P\Big(X \le \tfrac{1}{2},\ Y \le 1\Big) = \int_0^1 \int_0^{1/2} xy\,dx\,dy = \frac{1}{8} \cdot \frac{1}{2} = \frac{1}{16}.\]
\((X + Y \le 1)\) olayının bölge ile kesişimi \(0 < x < 1\), \(0 < y \le 1 - x\) üçgenidir:
\[P(X + Y \le 1) = \int_0^1 \int_0^{1-x} xy\,dy\,dx = \int_0^1 \frac{x(1-x)^2}{2}\,dx = \frac{1}{2} \int_0^1 (x - 2x^2 + x^3)\,dx = \frac{1}{2} \Big( \frac{1}{2} - \frac{2}{3} + \frac{1}{4} \Big) = \frac{1}{24}.\]
f) Tanım bölgesi, köşeleri \((0,0)\), \((0,1)\), \((1,1)\) olan üçgendir; alanı \(\frac{1}{2}\). \(f \ge 0\) ve \(\iint f = 2 \cdot \frac{1}{2} = 1\) olduğundan \(f\) bir yoğunluk fonksiyonudur. Marjinaller: \(0 < x < 1\) sabitken \(y \in (x, 1)\) olduğundan \(f_X(x) = \int_x^1 2\,dy = 2(1 - x)\); \(0 < y < 1\) sabitken \(x \in (0, y)\) olduğundan \(f_Y(y) = \int_0^y 2\,dx = 2y\); bölge dışında \(0\). Sağlama: \(\int_0^1 2(1-x)\,dx = 1\), \(\int_0^1 2y\,dy = 1\).
\((Y > 2X)\) olayı için bölgede \(2x < y < 1\) olmalı; bu, \(x < \frac{1}{2}\) gerektirir (\(y > 2x\) zaten \(y > x\)’i sağlar). Öyleyse
\[P(Y > 2X) = \int_0^{1/2} \int_{2x}^{1} 2\,dy\,dx = \int_0^{1/2} 2(1 - 2x)\,dx = 2 \Big[ x - x^2 \Big]_0^{1/2} = 2 \Big( \frac{1}{2} - \frac{1}{4} \Big) = \frac{1}{2}.\]
Alan yorumuyla: \(y = 2x\) doğrusu üçgeni, alanları \(\frac{1}{4}\) olan iki parçaya böler; istenen olasılık \(2 \cdot \frac{1}{4} = \frac{1}{2}\)’dir.
\(\blacksquare\)
Ortak dağılımı bilmek, iki rastgele değişkenin birlikte davranışını bilmek demektir; bir sonraki bölümde bu bilgiyi iki soruya yöneltiyoruz: ortak dağılım ne zaman marjinallerin çarpımıdır ve biri gözlendiğinde ötekinin dağılımı nasıl güncellenir: Bağımsız Rastgele Değişkenler ve Koşullu Dağılımlar.