多模态
Aaron van den Oord
阿伦·范登奥德
WaveNet · VQ-VAE
Aaron van den Oord 是生成模型与表示学习研究者,代表工作包括 WaveNet 和 VQ-VAE。他研究如何直接生成复杂信号,以及怎样把连续的声音、图像转换成便于模型处理的表示。
2016 年,他与合作者发表 WaveNet,用自回归神经网络逐步预测原始音频采样点。模型根据之前的波形生成下一个采样值,而不是只预测少量手工设计的声学参数。这条路线推动了神经网络在语音合成中的应用。
在 VQ-VAE 中,编码器把输入映射到一个离散码本中的向量,解码器再从这些离散表示恢复信号。模型因而能够学习一组可复用的符号,而不是始终操作原始像素或波形。这为图像和音频的离散建模提供了重要方法。