SpecEnvoy
EN·中文

音乐是怎样发出的

当你在时间线上按下播放,写下的乐谱就变成了你能听到的声音——实时,就在你的浏览器里。这看起来像魔法。其实不是,也不是什么神秘的「AI」。本页解释它到底是怎么运作的——大致的思路,随你选择讲得多深。(这里讲的是如何把音符变成声音;音符本身是怎么来的,是另一个话题。)

每种讲法都有各自的链接——复制适合对方的那一个发出去即可。
首先,最重要的一点:它不是 AI。

这里没有任何神经网络在「生成」音频。你听到的声音,是由真实乐器的真实录音回放并加以修饰而成——与电影配乐样片、采样管弦乐所用的成熟方法完全相同。唯一的「智能」,是用心的工程。

  1. 1

    读取乐谱

    每首曲子都从乐谱开始——就是音乐家读的那些线上的小圆点。程序读取这份记谱,把它变成一份简单的清单:哪个音什么时候发出。

    我们从记谱本身出发。制谱引擎(Verovio)像你读谱一样解析乐谱——音高、节奏、小节线——交出音符事件,以及一份驱动屏幕上跟随高亮的时间映射。

  2. 2

    声音来自真实乐器

    声音是真的。真正的大提琴手、小提琴手、长笛手等,在录音室里把每一个音一个一个地录了下来。我们不是在伪造音色——而是在回放真实的录音。

    音色来自真实录制的采样——由演奏者逐音录制(拉奏,如今还有拨奏),取自爱荷华大学的乐器采样库。我们把每段录音校到十二平均律、修剪起音、统一音量,让整套采样均匀一致。

  3. 3

    补齐中间的音

    我们并没有把每一个可能的音都录下来。遇到没录过的音,计算机就取最接近的那段录音,把音高稍微往上或往下挪一点——就像把磁带稍稍加速或减速。

    采样器把录音铺满整个音域,并对最接近的一段做移调,去覆盖之间的任何一个音——原理与采样管弦乐库或键盘工作站相同。我们把录音排得很密,任何一个音都不会被拉伸太远。

  4. 4

    按时演奏

    然后它把这些音按顺序、按时值奏出——就像一位极其精准的乐手(或音乐盒),在恰好正确的时刻发出每一个音,速度由你用滑块决定。

    一个传输/音序器在每个拍点触发每一个音,速度由你选择,并带一点乐句塑形——渐强渐弱、音与音之间略有交叠形成连奏——让线条会呼吸,而不是死板的节拍器。

  5. 5

    让它像在一个房间里,而不是机器人

    最后我们加上让它「活」起来的点缀:一点房间感(回响)、乐器琴身温暖的木质共鸣,以及像真人手指那样轻微的揉弦(颤音)。

    我们做「配音」:混响给出空间感,用峰值均衡还原干采样所缺的琴身/木质共鸣,一个延迟的逐音颤音(随音区渐入),加上连奏交叠——就像你混一段采样样片时会做的选择。

  6. 6

    实时,就在你的浏览器里

    这一切都在你按下播放的那一刻、在你自己的设备上发生。没有把一首成品歌曲下载下来——每一次都是现做的。也没有任何东西是 AI 凭空生成的。

    它每次播放都从乐谱实时合成——更接近实时渲染的电影配乐样片,而不是某段演奏的录音。它不是录下来的一条,也不是 AI 生成的音频。

那么——它是 AI 吗?

不是。它是真实乐器的真实录音,按时回放,再加一点回响与暖意——由用心的软件拼装而成。这就是全部的诀窍。

不是。它是一件采样乐器,由音序器经效果链演奏——是录音棚样片的日常技术,不是生成式模型。如果它打动了你,那是作曲与真实录音在起作用。

想听听看?打开音乐时间线里的任一乐器按下播放——现在你已经知道幕后发生了什么。