本文首发“腾讯游戏学堂”
本文作者:《洛克王国:世界》音频负责人 斯坦、Postred 游戏音频负责人 Luka
*开发者个人经验、感受分享,欢迎对游戏开发有兴趣的小伙伴们交流、探讨
引言
一个疯狂的目标 “手搓50000个音频素材”
洛克王国,15年前风靡全国的童年神作,如今正在蜕变为一款基于虚幻引擎的全新开放世界探索游戏。在这个奇幻世界里,生活着超过500种精灵。
我们的音频团队的目标是:为每一只精灵打造独一无二的"全方位声景"。
没有重复使用,没有Copy & Paste,没有使用AI——超过50000个音频素材,基本全部手工制作。
了解《洛克王国:世界》

洛克王国是15年前一款风靡中国的网页游戏,那时候几乎所有的孩子们,无论是小学生还是中学生,都是这款游戏的玩家。所以洛克王国拥有非常庞大的玩家基础。15年后的今天,洛克王国已经变成了一款全新的奇幻主题的开放世界探索游戏。它也包含了回合制和实时对战,可以多人游玩,在PC端和移动端都可以游玩。开发进程是基于虚幻引擎和wwise的。

接下来我做一个快速的rundown,首先我会跟大家讲述这个游戏的声音设计框架和思维模式。接下来我会带给大家许多我们设计过程中的按理和思路分析,包括语音设计,动作音效,也包括骑乘系统的设计。随后我会跟大家简单讲解一下我们一些音频实现方案和提升游戏沉浸感的创意设计。那么我们开始吧!
什么是全方位的声景?

大家先想一下这个问题,音频在开放世界游戏中会扮演什么样的角色?首先当然是可以反映视觉,可以传递信息。声音也是塑造氛围的一把好手。在动作或射击游戏中,声音在定位和导向方面发挥着巨大的作用。当然也包括给予玩家很多动态反馈等等。 这次我们会着重讨论一下最后一点,用声音来塑造角色。

什么是全方位音景?全方位音景实际上是围绕描绘对象的一个多层级多角度结构的音频系统。它包括,对话,嗓音,动作,情绪,控制交互,音乐,习惯,甚至是侧面描写等等。那么,在洛克王国里,音频也致力于用这样一个多角度的音频系统来让精灵们栩栩如生。

精灵在英文语境里可以有这些意思。

在《洛克王国》的世界里,我们已经拥有超过500个精灵,而且随着开发持续进行,这个数字仍在增长。这引出了一个关键问题:我们应当如何管理音频设计的深度与广度?为什么这个问题如此重要?
让我列举一些数字来说明。假设我们有500个精灵,实际上我们需要为它们19种不同的情绪设计声音。而每种情绪都需要嗓音设计和动作音效设计。这里的工作量就翻倍了。接着,为了避免重复,每个声音我们都需要准备3个随机采样。现在,我们需要多少素材已经很难计算了…… 但我们还有骑行系统,这让一切变得更加复杂。在这种规模下,几乎不可能覆盖所有地面材质的音效。于是,我们将其简化为了6种 !
实际上,我们曾面临过在短短一年内为300多个精灵创作声音的挑战。面对如此庞大的规模,我们并不想完全牺牲设计的深度——至少不能牺牲太多。由于这是影响玩家体验的关键,我们必须找到那个最佳的平衡点。
设计的起点:理解每一只精灵

这个世界里有19中精灵系别,例如,草,火,冰,水,机械等等。在声音的设计上我们显然需要考虑他们所属的系别。而且他们还不仅仅有一个主系别,还会有一个副系别。

另外,我们所有的精灵设计的概念也会基于生物特性进行分类。比如我们有家禽,陆地生物,啮齿动物,猫科动物,飞鸟,走鸟,灵长类等等。这些生物分类给了我们许多很棒的声音设计的参考方向,我们在保证声音呈现的创造性前提下,尽量用生物特性分类使其更合理。

基于此,并基于我们的"全面声景"理念,我们为《洛克王国:世界》总结出若干音效设计的视角。设计从两个问题出发:
1) 它们能发出什么声音?
2) 我们能为它们创造什么声音?
第一个问题引出了内部设计成果,包括:语音、动作音效和骑行音效。精灵通过语音表达情绪,我们为每只精灵的动作设计独特声音。此外,所有精灵皆可骑行,而你永远无法预知下一只精灵将如何移动。
第二个问题引出了外部设计成果 :它们或许能歌唱?或许拥有专属定制音乐?我们还可将其声音嵌入生态系统,模拟它们的生态行为。通过这一方法,我们构建了一套可靠的音效系统。这些层次相互关联,最终形成一个完整而全面的声景世界。
如何在不复制粘贴的情况下设计50000+个精灵音频素材?

我们最大的挑战是,制作超过50000个音频素材,当然是没有重复使用,没有Copy & Paste,也没有使用人工智能的情况。基本上都是手工制作。 但是在实际开发的时间限制下,这是巨大的挑战,所以我们知道我们需要一个系统化的方式去批量处理。但同时我们也需要去关注到设计的精确程度。

因此,为了确保500个生物形象都是定制化的,我们首先必须理解这些精灵。我们需要查看精灵外貌、简介和动画,然后思考:这个角色表达了什么?它会发出什么声音?以及什么样的解剖结构可能合理地产生这样的声音?

我们需要一个个给他们做“访谈”,去理解。这非常花时间。以至于可能变成一个无法完成的任务。

原有的目标是巨大的,很难从整体去思考它。那么我们可以把它拆分成三个部分,它们是
A. 创意挑战
B. 项目管理挑战
C. 团队的额外机会

挑战A!
创意挑战意思是,如何在音频层面让500多只生物变得独特呢?我们有下面几个注意事项需要关注。

注意事项1,“恐怖谷效应”是我们必须规避的三大核心陷阱之首。直接使用人声录音极易导致生物音效产生令人不适的诡异感。虽然你可能借此设计出酷炫独特的声音,但必须格外谨慎。以这只鹈鹕的两种音效为例:前者因过度拟人化而显得怪异,后者虽同样借鉴了人声模仿技巧,但采用了更具亲和力的处理手法。
坏表现 VS 好表现

注意事项2,另一个陷阱是没有概念性地使用不同的声音,这会使生物动画听起来不一致,并陷入我们所谓的“想法大杂烩”境地。

要注意,为卡通风格生物设计音效与为怪物设计音效所带来的复杂性完全不同。 写实怪物音效通常受益于密集的层次叠加,而卡通生物则更依赖于对正确层次的排序。把老鼠的吱吱声和人声混合起初可能听起来有趣,但当你第二天再听时,你可能会觉得应该尝试一些不那么“实验性”的东西了。

这是我们一个混合多重元素的例子,我们实际上是需要一个为生物而设计的听觉“调色盘”。视觉上看,生气的吉娃娃和狮子吼叫还有伤心的小猫是一个非常冒险且不一定奏效的组合。但我们评判音色组合的标准不是它们看起来有多实验性;而是凭你听到它们时的感觉。

所以,如果你看这个图表,关键思想是:要真正定义一个角色的声音身份,你需要有意识地规划它们在各种情况下的声音,而不是仅仅依赖通用的、看上去正确的声音。

这是一个游戏内真实的例子,展示了这些不同元素如何组合以产生一致的结果

面对50,000多个资源制作时,人们的本能可能是依赖庞大的数字音效库来节省时间。但为了实现每个精灵听起来都独一无二的元目标,我们必须走一条不同的路。我们决定:不仅仅是设计,我们也需要为每个精灵录制定制的动作音效。如果你有一个专门的拟音棚,就像我们一样,那会有巨大帮助。捕捉真实的表演可以大大节省时间,并给你音效库根本无法提供的结果。同样的原则也适用于精灵语音。

实验性配音(又称“模仿”)、动物录音、乐器、合成器以及它们的组合——所有这些在设计语音时都非常有用。最终目标是创造一个可信的动物,你可能会尝试使用真实的动物录音, 但是

动物不会按指令表演情绪。自己录制动物也不能完全解决这个问题。野生动物的发声比人们预期的要少。只在特定条件下发声。当你需要广泛的情感范围时,素材就不够用了。有些发声在情感上是有限的。猫可以表达悲伤或攻击性。但恐惧常常表现为沉默。快乐也可能很难表现。这是我们特别需要注意的一点。

注意事项3,需要横向和纵向的差异化

横向是指同一物种内的差异化——狐狸是好例子。游戏中有五种狐狸精灵:迅狐、冰霜狐、暗影狐、九尾狐和淘气狐……这里是5个狐狸的例子。事实上我们很难找到足够的可用狐狸素材来应对五种狐狸类型(每种有三个进化阶段)超过30种的情感。而且音效库的录音差异很大。不同的个体。不同的空间,噪音,混响,它们不匹配。所以你应该改变方法——不是“收集更多样本”,而是了解狐狸的发声原理,再去模仿它。这是个非常有趣的话题。
这是一些关于横向差异的实际例子

纵向是指,每个精灵有2-4个进化阶段,关键的问题时:物种的特征需要保持连续,并且能够跟随年龄的增长而产生合适的变化。1阶段大约是3岁的幼童,2阶段进化大约是7-11岁的小孩,三阶段进化可能就是14-21岁的年轻人。
这是一些关于纵向差异的展示例子

解决这些问题的方案是,在大规模制作之前需要锁定精灵的声音身份特征。然后:限制创新范围,以避免出现“杂乱无章的创意组合”,在横向和纵向都需要设计方案,最后,消灭声音恐怖谷效应。那么挑战A就解决了!

挑战B!
主要挑战就落在了项目经理的头上:如何构建工作流程,以确保产出与团队其他部分保持一致……同时又不阻碍创作节奏?

这就是我们的起点——我们最初以为会为500个精灵中的每一个都制作的 “精灵个性档案” 的最初草案。...基本上这些就是我前面提到的“深入剖析”笔记。如您所见,它包含大量个性参数,当时我们觉得这可以详尽地刻画每个生物,并早期就降低音效设计的复杂性。...但它并没有成功。 这种“科学”的方法彻底失败了:有些音效设计师喜欢用这些个性描述来指导声音参数设定,但另一些人则觉得困惑,因为参数不够一致。当这种情况发生时,人们不得不依靠自己的直觉,这耗费了额外的心力,并最终导致了更多的麻烦。这并不是因为创意简报不好,而是因为我们起步太快、搞得太复杂,并且忽视了我们真正需要完成角色数量是巨大的。

好的,第二次尝试 :我们决定从一开始就保持超级简单,这样我们就可以非常快速地进行原型设计,并且在制作管线中尽可能早地建立与创意主导团队的反馈循环。 让我们回归核心——情感核心,有多种体系可以用来表现任何个体的情感构成,有更简单的“情绪轮”,更全面的36级情感图谱……又开始变复杂了!这里也变得很难去把这个方案带入大批量的音频设计中去。

所以我们很快就把这些都抛掉了。所以现在,我们的核心问题是 :“我们真正能依赖的最少量的特质是什么?“这就是最具区分度的3种情感状态: 1. 快乐,2. 愤怒,3. 悲伤 ……然后它就像魔法一样奏效了——简短的声音demo,或者我们称之为 “情感小样” ,每个精灵的个性确实在这3种动画下显现出来。

每一只都有一个情感小样。这也让音效设计师乐于进行实验,而不用担心浪费时间。而对于创意负责人来说,评审过程变得更加“轻量” 和迭代化。现在我们可以在投入全部精力进行量产之前,用少得多的时间来征求并落实多方的反馈。

一起品尝下?

有了这个新流程,我们现在可以对付主要的“野兽”了——每个生物所需的分支音效组合这个大难题。每个生物都有多个动画需要设计,总共36种声音,不包括变化版本。由于此时我们已经与项目创意负责人就生物的“灵魂”达成了一致,我们不再害怕投入全部制作时间,因为大规模的返工变得极为罕见。

总结下来,这就是我们的工作管线。

获得反馈是一回事,但真正理解对方实际意味着什么则是完全不同的。你真的需要深入挖掘,弄清楚从收到的反馈中该保留什么,该舍弃什么。如果不这样做,你就是在自找麻烦和代价高昂的错误。比如,如果有人只是说“挺好的”,你可能会以为你的声音设计搞定了。但他们实际的意思可能是——“目前看来还行。”这个小误解可能会让你直接回到绘图板,重做你以为已经完成的一切!所以我们非常依赖于早期的反馈,打分,就像在学校里一样。

那么,我们两个团队之间怎么交流呢?
我们主要关注于以下三个要点:
1.反馈评价
2.对关键的故事精灵用更多的机会和时间进行尝试实验。
3.创意灵活程度,从更开放的思路到严格的设计方向,声音设计师能够进行多少程度的试验和创新呢?然后剩下则是一些常规的信息,包括参考,描述,视频,交付时间,制作状态,评论,资产数量,设计人等等。

我们把所有信息整合后,就变成了一个非常有用且高效的批处理反馈表格。

那么,让我总结一下我们在项目管理方面学到的经验:早期反馈是非常必要的,而定义核心的、精简的低成本原型是建立最佳反馈循环的关键。 挑战B也告一段落!

挑战C!
第三个挑战来自于我们因为建立了如此强大、可扩展的基础而获得的一个机会,为更高阶的系统设计音效,比如宠精灵骑行和精灵歌唱。

宠物骑行是《洛克王国》的一个标志性特性这是玩家与精灵建立联系的核心方式。并且有多种步态类型。

在规划宠物骑行时,重要的是要考虑精灵的体型、速度和移动方式。这些声音在游戏过程中不断被听到,它们共同定义了每个精灵的整体骑行氛感受。

我们没有直接复用精灵的动作声音,因为为了让精灵的骑行体验对玩家来说尽可能好,我们需要真正捕捉到诸如精灵的重量、精灵的步态表现这些因素。
不好的脚步声会分散玩家的注意力,让他们的体验不具备沉浸感

最后到了回顾复盘环节,确认各个步骤没有问题,在最终交付之前经历可靠性验证。

打下的坚实基础和周密规划带来的回报是,我们可以将节省下来的生产时间转化为复杂的新机制,这对玩家来说是非常有价值的。

最终总结:
当我们启动这个项目时,挑战显得巨大无比 !:
500 个生物,每一个都独一无二,而且每一个本身都是一个完整的项目。 因此,让我们反思一下:
如果你有 3 项任务——你会把它们安排进日程表;
如果你有 10 项任务——你会为此专门空出一周时间; 但是,如果你有 500 项任务,你就会明白必须彻底重新思考你的整个方法。
对我们而言,“完美的工作流程”意味着:
1. 让早期反馈循环真正运转起来;
2. 找到尽可能小的探索形式;
3. 为核心声音素材选择合适的声音设计技术,例如真实的表演捕捉。
最终,这种方法真正为我们带来的是时间。是时间和自由,让我们能更深入地钻研那些真正关乎质量的细节。而这,对任何音效师来说才是真正的回报——得以真正品味精心雕琢出美妙声音的这份工作。
沉浸式设计:用100%素材做到200%效果

现在,让我们进入声音景观系统中更具创意、更有趣的层面。这就是沉浸式设计!它包括四个方面,让我们从第一个方面开始:增强语音多样性。在我们的游戏中,玩家捕捉更多精灵的动机是持续游戏体验的关键。我们应该做些什么来激发这种动机呢?

当然,我们想要更进一步——利用100%的素材,实现150%甚至200%的效果。我们引入了两种方法: 基于性格的语音触发频率和语音变化。这些方法使得拥有相同音频素材的同一种精灵,仍然能呈现出不同的音频表现,让每一个个体都感觉独特。
精灵的性格系统会影响其行为、属性和面部表情——现在我们把声音也加入了这份清单。总共有25种个性。其中六种会影响面部表情,它们也拥有定制的语音触发限制。例如,淘气的精灵语音触发冷却时间非常短,让它们听起来吵闹、喋喋不休。害羞或胆小的精灵则更安静,倾向于触发更多负面情绪。我们使用配置表将个性与触发频率关联起来,这创造了一种有趣的动态。
另一方面,每个精灵都有自己的“嗓音属性”,实际上就是音高。我们随机分配一个从-100到100的音高值,0代表原始音高。由于音色的多样性,每个精灵都将拥有自己独特的音高曲线。
实际上,我们在这里还加入了一个奖励系统:当玩家获得一个拥有最高或最低音高的精灵时,他们会赢得一个徽章或奖章。这使得这个精灵变得稀有且有价值,从而可以刺激玩家去捕捉更多。这就是我们为了激发动机所做的一些事情。
下方是一个简单的流程图,说明了这两种设计在逻辑上是如何运作的。

之后,我们加入了精灵的唱歌行为。精灵的鸣唱设计是其嗓音设计的音乐性延伸。这不仅仅是简单的音效设计;我们需要它能反映精灵的嗓音特征,同时最大化其音乐表现力。这实际上给了我们很大的自由探索空间。
在我们的鸣唱设计中,我们有两个主要方向:是应该让它们听起来更像真实的乐器?还是更接近它们原始的嗓音?实际上,我们通常会以特定比例混合两者。左边这个叫“圆号鱼”的精灵,其自身的概念设计就带有乐器属性,所以它的鸣唱听起来几乎完全是乐器声。
更像乐器的设计 VS 更具创意的设计
对于其他用自己带有特殊嗓音特质的喉咙来“唱歌”的精灵,我们更多地遵循它们原有的声音,但仍会加入一些乐器元素作为铺垫。
早期设计-松鼠之歌
我还想分享一个早期的设计。那时,我们被要求设计一个松鼠的歌曲,但我们当时非常忙,只想先做一个快速版本。所以,我们取了一个松鼠的声音样本,把它切碎,然后用MIDI写了一段旋律。听起来是视频里这样的 。你能听出我们只是加了一些效果和琶音器。它非常粗糙,听起来不像一个生物。
更新后的松鼠之歌
但是!尽管表现不佳,我们实际上却从玩家那里得到了很多积极的反馈。他们注意到了它,并且觉得有趣,不管它听起来是好是坏。所以我们知道这是一个值得投入的特性。于是我们回过头来,迭代并重新设计了新的松鼠之歌,并且还配了不同的合奏版本。

所以我们有:独唱、完整合奏和部分合奏。它们也能适应不同的合奏组。这是一个很大的设计量。因此,我们倾向于为那些合适且可能受玩家欢迎的精灵设计唱歌行为。这可以最大化玩家的享受。

加入唱歌行为后,我们现在实际上需要一个整体的音频系统集成到精灵生态中。比如这里我们有一些特定的生态行为音效设计。下面是一些例子:武者鸡在练功,海豹把小的海豹只像球一样玩耍,还有精灵唱歌可能会吸引附近的其他精灵!这种互动不仅发生在单个精灵之间——它们也可以发生在个体之间,甚至跨越不同物种。到目前为止,如果我们将语音、动作、鸣唱和生态音效与状态机(也称为行为树)结合起来,那么我们就会得到一个栩栩如生的精灵生态音频表表现。

每个精灵都有自己的行为状态,在不同的动作之间循环,比如四处闲逛、触发情绪、互相争斗等等。这里有一个展示生态时刻的视频——它们也可能听起来很有趣。

至此,我们对精灵的塑造已经相当全面了。但还有一个层面可以进一步深化设计,那就是音乐。当然,为所有精灵定制音乐是不可行的。从我们庞大的角色库中,我们只能选择最具代表性的那些来进行最后的润色。我们为它们设计场景音乐、战斗音乐、故事音乐,甚至旋律动机。让我们看一些例子。
这个精灵名叫“鸭吉吉”,英文是类似“Duckie”或“Duckieky”的名字,它是我们的吉祥物。它的关键词是:笨拙、吵闹、搞笑。所以在它的领地音乐中,我们设计了长号、哇音钢琴和轻松愉快的旋律。
与之形成对比的是“彩蝶鲨”。它温柔、优雅、美丽、快乐。这是我们为它的领地创作的音乐。 我们用音乐来强化和巩固精灵的角色设计,为玩家创造独特的记忆。

我们也为关键的故事精灵创作了抓耳的音乐。例如,这只独角兽!它拥有人形和精灵形态。他善良友好,深受玩家和洛克王国居民的喜爱。对于这样一个角色,我们需要一个强有力的主导动机,以在不同情境中强化其形象。又因为他拥有一支魔法笛子,我们赋予了他一段优美且抓耳的旋律。
我们将这个动机融入了场景音乐、战斗音乐和故事音乐中。我们甚至将它加入了NPC的行为中:有时村民们会用他的旋律练习吹笛子——但吹得很糟糕!所以用其他方面来表现这个角色是很好的方法,这也就是我们说的侧面描绘。这样,一个角色的塑造就圆满完成了。

到现在,我们已经完成了整个系统。我们一层一层地构建它,从动作和语音开始。扩展到骑行互动。然后将音频嵌入生态系统,并在此基础上加入鸣唱行为和音乐。从下到上,意味着从通用到定制。

但请不要忘记了,这下面还有两个支柱。一是团队之间的紧密协作,以支撑如此大规模的设计。
二是所有设计师们丰富且无穷的创造力,推动着车轮不断向前。 这就是我们的使命: 为超过 500 种生物打造全方位的声景。