生成模型-变分自编码器(VAE)03-1:先验【 pᶿ(z):还没看到证据x之前,你觉得隐藏原因z大概是什么样】【先验概率:在看到证据之前,我们对“待推断未知量”的认识】【VAE待推断的未知变量为z】

发布时间:2026/8/21 19:46:29
生成模型-变分自编码器(VAE)03-1:先验【 pᶿ(z):还没看到证据x之前,你觉得隐藏原因z大概是什么样】【先验概率:在看到证据之前,我们对“待推断未知量”的认识】【VAE待推断的未知变量为z】 3. 三个容易混在一起的分布先验、真实后验、近似后验3.0 这是全文最应该慢慢看的地方第一次学 VAE 最容易出错的原因通常不是不会算公式而是把三个分布混成一个。可以先用“侦探故事”理解先验pθ(z)p_\theta(z)pθ​(z)还没看到证据xxx之前你觉得隐藏原因zzz大概是什么样真实后验pθ(z∣x)p_\theta(z|x)pθ​(z∣x)看到证据xxx以后按照完整概率模型严格计算哪些zzz更可能解释它近似后验qϕ(z∣x)q_\phi(z|x)qϕ​(z∣x)真实后验太难算所以训练一个 encoder 来快速猜它。可以记成一句先验是“没看xxx前的猜测”后验是“看了xxx后的猜测”qϕq_\phiqϕ​是用神经网络近似那个难算的真实后验。理解 VAE 最关键的一步是把下面三个分布分清楚。3.1 先验pθ(z)p_{\theta}(z)pθ​(z)3.1.0 为什么叫“先验”“先验”就是 before seeing data在看到具体xxx之前对zzz的总体规定。标准 VAE 用p(z)N(0,I) p(z)\mathcal N(0,I)p(z)N(0,I)并不是说“现实世界所有隐藏因素真的天然服从标准正态”而是我们主动选择一个方便的潜空间坐标系统。训练的任务之一就是让 decoder 和 encoder 学会在这个坐标系统中工作。这是生成故事的起点。标准 VAE常设pθ(z)N(0,I). p_{\theta}(z) \mathcal{N}(0,I).pθ​(z)N(0,I).它的作用是给生成过程提供一个简单、可采样、覆盖连续潜空间的起点。