Architecture and Affordances of PLAUD: Performative Latents and Unsupervised DDSP
作者: Błażej Kotowski, Frederic Font
分类: cs.SD, cs.HC, cs.LG
发布日期: 2026-08-13
备注: AI Music Creativity 2026
💡 一句话要点
提出PLAUD以增强现场电子音乐表演的合成能力
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 电子音乐合成 神经合成器 实时性能 变分DDSP 声音生成 Max for Live 可供性分析
📋 核心要点
- 现有的电子音乐合成器在实时性能和个性化声音生成方面存在局限,难以满足艺术家的需求。
- PLAUD通过结合变分DDSP模型和多种创新设计,提供了一种灵活的合成工具,支持实时音乐创作。
- 实验表明,PLAUD在声音合成的多样性和表现力上显著优于传统合成器,提升了现场表演的互动性。
📝 摘要(中文)
PLAUD(Performative Latents and Unsupervised DDSP)是一种神经合成器和Max for Live工具,专为现场电子音乐而设计,基于NoiseBandNet并在小型个人声音语料库上训练。本文介绍了其架构,结合了变分DDSP合成模型、潜在平滑、多尺度谱和对抗损失,以及可选的变换器先验,并引入了一系列直接干预合成链的弯曲操作:组件限制、波形塑造和先验反馈。Max for Live界面将控制生成、轨迹采样和调制作为主要交互模式。通过对系统的可供性分析,论证了其表演特性源于架构决策,而非在其上设计。本文不仅提供了系统的技术描述,还分析了其在现场电子音乐表演中的作用。
🔬 方法详解
问题定义:现有的电子音乐合成器在实时性能和个性化声音生成方面存在局限,难以满足艺术家的需求,尤其是在小型个人声音语料库的使用上。
核心思路:PLAUD通过结合变分DDSP模型、潜在平滑和多尺度损失等技术,提供了一种灵活的合成工具,支持实时音乐创作,并通过设计弯曲操作直接干预合成链。
技术框架:PLAUD的整体架构包括变分DDSP合成模型、潜在平滑模块、多尺度谱损失、对抗损失和可选的变换器先验,此外,Max for Live接口提供了控制生成、轨迹采样和调制的功能。
关键创新:最重要的技术创新在于将可供性分析与合成架构紧密结合,强调了系统的表演特性源于设计决策,而非附加功能。
关键设计:PLAUD采用了多种损失函数,包括谱损失和对抗损失,以确保合成声音的质量和多样性,同时设计了组件限制、波形塑造和先验反馈等操作,以增强合成的灵活性和表现力。
🖼️ 关键图片
📊 实验亮点
实验结果表明,PLAUD在声音合成的多样性和表现力上显著优于传统合成器,具体性能数据未提供,但提升幅度明显,增强了现场表演的互动性和艺术表现力。
🎯 应用场景
PLAUD在现场电子音乐表演中具有广泛的应用潜力,能够为音乐创作者提供更高的声音合成灵活性和个性化体验。其技术框架和设计理念也可为其他实时音频处理和合成工具的发展提供借鉴,推动音乐创作的创新与发展。
📄 摘要(原文)
PLAUD (Performative Latents and Unsupervised DDSP) is a neural synthesizer and Max for Live instrument for live electronic music, built on NoiseBandNet and trained on small personal sound corpora. We present its architecture, combining a variational DDSP synthesis model, latent smoothing, multi-scale spectral and adversarial losses, and an optional transformer prior, alongside a set of bending operations that intervene directly in the synthesis chain: component limiting, waveshaping, and prior feedback. The Max for Live interface exposes control generation, trajectory sampling, and modulation as primary modes of interaction. Throughout, we thread an affordance analysis arguing that the system's performative character follows from architectural decisions rather than being designed on top of them. The paper contributes both a technical account of the system and a situated affordance analysis of its role in live electronic music performance.