Muchas Gracias, avancé con la primera parte en el libro de Ash. Entendí que como mismo en la práctica se usó de manera intuitiva la probabilidad condicional de $$A$$ dado $$B$$ antes de ser definida; cuando hablamos de variables aleatorias podríamos pensar en el experimento de elegir un número en el $$[0,1]$$ uniforme y dado ese número ver la realización de una Bernoulli con ese parámetro, e interesarnos por la probabilidad condicional de $$Y=0$$ dado que $$X=x$$. Buscando modelar la situación podríamos verlo como una medida producto, es decir, tenemos $$(\Omega_{1},\mathbb{F}_{1},P_{X})$$, $$(\Omega_{2},\mathbb{F}_{2})$$, $$\Omega=\Omega_{1}\times\Omega_{2}$$ y $$\mathbb{F}=\mathbb{F}_{1}\times\mathbb{F}_{2}$$, $$X(w_{1},w_{2})=w_{1}$$ y $$Y(w_{1},w_{2})=w_{1}$$. Si logramos construir $$P:\Omega_{1} \times \mathbb{F}_{2} \rightarrow{[0,1]}$$ tal que sea un kernel estocástico, entonces por el teorema de la medida producto existe $$\mathbb{P}$$ en $$(\Omega,\mathbb{F})$$ tal que $$\mathbb{P}(C)=\displaystyle\int_{\Omega_{1}}P(w_{1},C(w_{1}))dP_{X}$$. Dándonos una buena idea intuitiva de lo que debe satisfacer una probabilidad condicional. Como se quiere resolver el problema de dado $$X$$ v.a $$X:(\Omega,\mathbb{F})\rightarrow{(\Omega_{1},\mathbb{F_{1}})}$$ y $$B \in \mathbb{F}$$ definir $$P(B|X=x)$$ incluso si la probabilidad de $${X=x}$$ es cero para casi toda $$x \in \Omega_{1}$$. Guíandonos por la discusión anterior parece natural pensar que la probabilidad condicional satisfaga que $$\mathbb{P}(A \times B)=\displaystyle\int_{A}P(B|X=x)dP_{X}$$ para todo $$A \in \mathbb{F_{1}}$$. Usando el teorema de Radon se demuestra que si tomo $$X:(\Omega,\mathbb{F})\rightarrow{(\Omega_{1},\mathbb{F_{1}})}$$ y $$B \in \mathbb{F}$$ fijo entonces existe una función real borel medible $$g(x)$$ en $$(\Omega_{1},\mathbb{F_{1}})$$ tal que $$\mathbb{P}(A \times B)=\displaystyle\int_{A}g(x)dP_{X}$$ que además es única $$P_{X}$$ a.s. Así dado lo anterior definimos $$P(B|X=.)=g(.)$$ [tenemos una clase de funciones, así que al fijar X=x debemos ser cuidadosos ya que depende del representante]. Se verifican además 2 cosas importantes
1-Si la $$X$$ es discreta que $$P(X=x_{i})$$ es mayor estricto que cero la $$g(x)=P(B \cap{{X=x_{i}}})/P({X=x_{i}})$$ a.s, la definición de probabilidad condicional de eventos.
2-Si tenemos $$X,Y$$ v.a con función de densidad $$f_{X,Y}$$ entonces $$g(x)=\displaystyle\int_{B(x)}f_{X,Y}(x,y)/f_{X}(x)dx$$ a.s [notando que el conjunto de $$(x,y)$$ donde $$f_{X}(x)=0$$ puede ser ignorado porque tiene medida cero]. Además si tomamos $$(\Omega_{1},\mathbb{F}_{1},f_{X})$$ y tomamos en $$(\Omega_{2},\mathbb{F}_{2})$$ el kernel estocástico como $$P(x,B)=\displaystyle\int_{B}f_{X|Y}(x,y)dx$$ por la el teorema de medida producto existe una medida que verifica que $$P(A \times B)=\displaystyle\int_{A}P(x,B)f_{X}(x)dx=\displaystyle\int_{A}\displaystyle\int_{B}f(x,y)dxdy$$ así $$f_{X.Y}(x,y)=f_{X}(x)f_{X|Y}(x,y)$$. Es decir, por la forma que se vea coincide vía la definción o el análisis vía una medida producto. Seguiré leyendo pero cualquier comentario lo valoro. Gracias.