挑战

大多数空间音频系统都假设听众是静止的,或者依赖于范围有限且经常发生遮挡的基于摄像机的追踪。这些限制使得它们不适用于大型物理空间,如展览、装置或建筑漫游。

挑战在于,如何在不使用虚拟现实(VR)头显的情况下,为在现实世界环境中自由移动的移动听众提供准确、低延迟的空间音频渲染。

挑战

大多数空间音频系统都假设听众是静止的,或者依赖于范围有限且经常发生遮挡的基于摄像机的追踪。这些限制使得它们不适用于大型物理空间,如展览、装置或建筑漫游。

挑战在于,如何在不使用虚拟现实(VR)头显的情况下,为在现实世界环境中自由移动的移动听众提供准确、低延迟的空间音频渲染。

技术洞察

早期的探索主要集中在现有的空间音频工具链上,包括 Max/MSP 中的 ICST Ambisonics 工具,这些工具提供了强大的高阶 Ambisonics 处理和精确的 3D 声场控制。

虽然这些工具在受控或固定的聆听场景中表现良好,但事实证明它们很难整合到有移动聆听者的环境中。为了保持准确的空间感知,需要相对于聆听者重新定位整个声场,这在移动过程中引入了显著的计算开销和延迟。

这一探索揭示了一个根本性的局限性:许多空间音频系统优先考虑的是声场表征,而非聆听者的移动性。空间渲染之所以无法做到准确,并不是因为音频算法的问题,而是因为无法在真实空间中可靠且持续地更新聆听者的位置。

由此可见,空间音频的质量既取决于追踪基础设施,也取决于渲染技术。要支持大型、可步行的环境,必须围绕精确、低延迟的位置追踪来设计系统,而不是基于摄像头或固定的假设。


解决方案

位置追踪

该系统采用三角定位布局的超宽带(UWB)基站,以及由微控制器控制的便携式超宽带标签。通过计算信号飞行时间,系统能够在长达数十米的空间内,持续高精度地估计听众的位置。

数据传输

听众的位置数据通过优化的 UDP 协议无线传输至 Unity。数据包被尽可能压缩,且更新间隔受到严格控制,从而在移动过程中保持低延迟和稳定的实时性能。

空间音频渲染

利用 Unity 和 Steam Audio,结合动态听众定位来渲染基于对象的空间声音。随着听众的移动,系统会利用基于 HRTF 的双耳渲染实时重新计算空间参数,如方向、距离和房间效果。

可扩展的空间设计

声源作为独立的虚拟对象分布在虚拟场景中,从而实现灵活的空间合成。该系统可从小型房间扩展到大型环境,支持多区域布局和复杂的空间叙事。

成果

该框架在面积不断增大的房间中进行了测试,表明在较大的环境中,空间清晰度和沉浸感得到了显著提高。用户反馈称,身体移动与感知到的声音位置之间存在强大而直观 improve的联系。

Movable

Movable 是一个交互式三维音频框架,它将超宽带(UWB)定位技术与实时空间音频渲染相结合。通过使用 UWB 标签和基站追踪听众的物理位置,系统可在 Unity 中结合 Steam Audio 动态更新基于对象的音频渲染。当用户在空间中移动时,其物理移动将直接影响对声音的感知。

2024年

2024年

角色

音乐技术

角色

音乐技术

客户

清华大学

客户

清华大学

时间线

6个月

时间线

6个月

Movable

Movable 是一个交互式三维音频框架,它将超宽带(UWB)定位技术与实时空间音频渲染相结合。通过使用 UWB 标签和基站追踪听众的物理位置,系统可在 Unity 中结合 Steam Audio 动态更新基于对象的音频渲染。当用户在空间中移动时,其物理移动将直接影响对声音的感知。

2024年

角色

音乐技术

客户

清华大学

时间线

6个月