数据传输视角下的语言模型和VAE

生成式模型可以抽象成数据传输游戏:Alice要向Bob发送一些数据,而他们的目标是发送的损失 尽量小,所谓损失就是编码的位数 。 数据传输视角下的语言模型 假设Alice和Bob有一个共同的词表$\mathcal{V}$。现在,Alice要给Bob发送一段包含$n$个token的文本$\boldsymbol{x}=(x_1, \cdots, \boldsymbol{x}_n)$。 注意,Alice并非将整段文本直接发送给Bob,而是逐个token发送(与LM的工作方式一样)。假设Bob能够根据已经接收到的token预测Alice下一个将要发送的token,也就是说Bob有一个$\mathcal{V}$上的分布: $$P(x_i|x_{<i})$$ 那么发送每个token的损失就是根据条件概率分布$p$对这个token进行最优编码的位数,即条件概率的负对数,而发送这段文本的损失等价于发送所有token的损失: $$-\sum_{i=1}^{n}\log P(x_i|x_{<i})=-\log\prod_{i=1}^{n} P(x_i|x_{<i})=-\log P(\boldsymbol{x})$$ 注:以上的对数函数$\log$均以2为底。 没错,根据以上数据传输游戏的目标,我们可以推出语言模型的损失函数。这个框架同样适用于VAE。 VAE的损失函数 $$ \begin{align*} -\log P(\boldsymbol{x}) &= -\log\int P(\boldsymbol{x},\boldsymbol{z})d\boldsymbol{z} \\ &=-\log\int P(\boldsymbol{x},\boldsymbol{z})\frac{P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})}{P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})}d\boldsymbol{z} \\ &=-\log\mathop{\mathbb{E}}\limits_{ P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})} \frac{P(\boldsymbol{x},\boldsymbol{z})}{P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})} \\ &\leq -\mathop{\mathbb{E}}\limits_{ P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})}[\log P_{\boldsymbol{\phi}}(\boldsymbol{x}|\boldsymbol{z}) + \log \frac{P(\boldsymbol{z})}{P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})}] \\ &=-\mathop{\mathbb{E}}\limits_{ P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})}\log P_{\boldsymbol{\phi}}(\boldsymbol{x}|\boldsymbol{z}) + \int P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})\log\frac{P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})}{P(\boldsymbol{z})} d\boldsymbol{z} \\ &=-\mathop{\mathbb{E}}\limits_{ P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})}\log P_{\boldsymbol{\phi}}(\boldsymbol{x}|\boldsymbol{z}) + \text{KL}[P_{\boldsymbol{\theta}}(\boldsymbol{z}|\boldsymbol{x})|P(\boldsymbol{z})] \end{align*} $$ 注: 此处$P(\cdot;\boldsymbol{\theta})$代表使用参数为$\boldsymbol{\theta}$的神经网络对$P(\cdot)的$估计。另外, 带有误差项的推导可参考文献[1]中的公式9-16。 总的来说,VAE的优化目标包含两个部分,分别是在最大化样本$x$的条件概率似然,以及最小化隐变量$z$的后验分布和先验分布的KL散度。我们同样可以从数据传输的角度理解VAE。 ...

2024-02-10 · 神思豌豆

【译】深度生成建模(二)

1.1 人工智能不仅仅是决策 在思考深度生成建模之前,先看一个简单的例子:假如我们已经训练了一个对动物图像$\boldsymbol{x}\in\mathbb{Z}^D$分类的深度神经网络,图像的标签表示为$y\in\mathcal{Y}$, 其中$\mathcal{Y}$={cat, dog, horse};假设这个神经网络已训练完成且能够对一个样本进行正确分类。目前为止还不错,对吧?但如文献[1]所指出,在输入图像中添加一些噪声可能会导致完全错误的分类结果。图1.1展示了一个添加噪声改变预测标签概率的例子;然而,加入的噪声几乎没有改变图像的内容(至少对人类来说)。 ...

2023-11-10 · 神思豌豆

【译】深度生成建模(一):前言

虽然以生成式AI作为研究方向,但是对与各种生成式模型实在是一知半解,缺乏深入的认识。网络上的教程和解读纷繁多样,即使看过不少,不过大都囫囵吞枣,早已成过眼云烟。 😮‍💨 最近正好发现22年出版的《Deep Generative Modeling》(作者:Jakub M. Tomczak)一书,是个系统学习深度生成模型的好机会。秉着好记性不如烂笔头的精神,打算通读一遍并将其中的内容翻译记录下来,作为加深记忆理解之用。限于英语水平,且有些内容融合了个人看法,所做翻译未必与原文完全一致。 本书的序由机器学习领域大牛Max Welling而作,通读下来,感觉更像一篇随笔,其中没有对具体技术做深入阐述,只描述了对当前AI的一些看法,但其思考的问题和方式却值得学习借鉴,故将序言翻译整理如下: 在过去十年中,深度学习的崛起引领了人工智能领域的巨大进展,彻底改变了众多子领域,例如计算机视觉、语音识别和自然语言处理等。此时此刻,更多的领域正在被颠覆重塑,包括机器人学、无线通信以及各种自然科学。 ...

2023-10-28 · 神思豌豆