Odsłuch słuchawkowy - technologia binauralna dla różnych formatów dźwięku przestrzennego
Dźwięk binauralny pozwala stworzyć realistyczną scenę akustyczną w odsłuchu słuchawkowym. Realistyczna lokalizacja źródeł dźwięku, rozwój w dziedzinie personalizacji HRTF i rosnąca popularność formatów przestrzennych napędzają dynamiczny rozwój tej technologii.

Spis treści
1. Wprowadzenie
Dźwięk przestrzenny od dawna stanowi jedno z wyzwań w realizacji dźwięku. Już od momentu pierwszych nagrań stereofonicznych inżynierowie poszukiwali metod, które pozwolą wierniej odtworzyć wrażenie obecności w realnej przestrzeni akustycznej. Przełomem w tym obszarze okazał się rozwój technologii binauralnych, umożliwiających przeniesienie pełnego obrazu przestrzennego do popularnego systemu odsłuchowego, jakim są słuchawki [1].
Sygnał stereofoniczny oraz przestrzenny przygotowywany jest z myślą o odsłuchu przez zestaw głośnikowy, gdzie fale z dwóch lub większej liczby źródeł docierają do obu uszu słuchacza, ulegając sumowaniu oraz zmianom wynikającym z charakterystyki głowy i małżowin usznych. Zjawisko to opisuje funkcja przeniesienia głowy HRTF (Head Related Transfer Function) [2]. W przypadku sygnału binauralnego wpływ ten zostaje uwzględniony już na etapie przygotowania materiału, co umożliwia wierne odtworzenie trójwymiarowej sceny akustycznej w odsłuchu słuchawkowym.

Rys. 1. Porównanie odsłuchu stereo i słuchawkowego. W odsłuchu przy zastosowaniu zestawu głośnikowego dźwięk z każdego urządzenia dociera do obu uszu, a dodatkowo ma na niego wpływ kształt głowy i małżowiny. W odsłuchu słuchawkowym sygnał danego kanału trafia bezpośrednio do jednego ucha.
Dzisiejszy kontekst rozwoju technologii audio sprzyja popularyzacji odsłuchu binauralnego. Powszechność słuchawek, rosnąca dostępność treści w formatach przestrzennych, a także coraz większe znaczenie aplikacji VR i AR sprawiają, że technika binauralna staje się jednym z kluczowych kierunków w badaniach i produkcji dźwięku [3]. Co więcej, dynamiczny postęp w dziedzinie modelowania percepcji i personalizacji odsłuchu wskazuje, że przyszłość dźwięku przestrzennego w dużej mierze będzie kształtowana właśnie przez technologie binauralne [4,5].
Wideo 1. Kosmiczny spacer na YT wzorowany na treningu NASA
2. Podstawy percepcji lokalizacji źródła dźwięku
Zdolność człowieka do lokalizacji źródeł dźwięku opiera się na analizie subtelnych różnic pomiędzy sygnałami docierającymi do lewego i prawego ucha [1]. Najważniejszą rolę pełnią tu różnice czasowe (ang. ITD – Interaural Time Difference) oraz różnice poziomu dźwięku (ang. ILD – Interaural Level), które są podstawowymi wskazówkami w procesie lokalizacji [6].

Rys. 2. Międzyuszna różnica czasu i poziomu dla danej pozycji źródła dźwięku. Dźwięk dociera do uszu w innym momencie oraz ma inny poziom.
Kolejnym czynnikiem są wskazówki spektralne, które powstają dzięki unikalnemu kształtowi głowy i małżowin usznych. Ich obecność pozwala odróżniać dźwięki dochodzące z góry i z dołu, a także rozróżniać źródła znajdujące się przed i za słuchaczem. Bez tych dodatkowych informacji scena akustyczna byłaby znacznie uboższa. HRTF jest próbą odwzorowania tego wpływu na sygnał dobiegający z danego kierunku [2,5].

Rys. 3. Wpływ HRTF na sygnał docierający do słuchacza
Istotne znaczenie ma również ruch głowy. Nawet niewielkie jej obroty dostarczają mózgowi nowych wskazówek, które pozwalają rozstrzygać niejednoznaczne sytuacje i poprawiają precyzję lokalizacji [7].
Mimo wysokiej czułości ludzkiego układu słuchowego, istnieją pewne ograniczenia. Trudności pojawiają się zwłaszcza przy rozróżnianiu źródeł z przodu i z tyłu, a także przy określaniu wysokości dźwięku w pionie. W takich przypadkach pomocne okazują się właśnie wskazówki spektralne i ruch głowy, które redukują niepewność percepcyjną [1,8]. Te przesłanki mogą występować w słuchawkowych systemach interaktywnych, gdzie pozycja dźwięku jest dynamicznie zmieniana wraz z ruchami głowy.
3. HRTF i podstawy technologii binauralnej
Kluczowym elementem pozwalającym na realistyczne odwzorowanie przestrzeni dźwiękowej w odsłuchu binauralnym jest funkcja przeniesienia głowy – HRTF (Head-Related Transfer Function) [9]. Opisuje ona sposób, w jaki kształt głowy, małżowin usznych oraz torsu wpływa na fale akustyczne docierające do błony bębenkowej. Każdy człowiek posiada unikalną charakterystykę HRTF, co oznacza, że te same dźwięki będą inaczej odbierane w zależności od anatomii słuchacza [2].
W praktyce HRTF można traktować jako zestaw filtrów akustycznych przypisanych do różnych kierunków w przestrzeni. Jeśli dźwięk dociera z określonego kąta, zostaje odpowiednio przekształcony – zmienia się jego barwa, natężenie oraz czas dotarcia do poszczególnych uszu [1].
Jedną z metod pomiaru HRTF są nagrania wykonywane z użyciem „sztucznej głowy” – manekina o realistycznych proporcjach anatomicznych [3]. Choć rozwiązanie to dostarcza uniwersalnych danych, nie oddaje indywidualnych różnic. Coraz większe znaczenie zyskują badania nad personalizacją HRTF, obejmującą m.in. skanowanie kształtu uszu lub obliczenia oparte na algorytmach uczenia maszynowego [4,8].

Rys. 4. Sztuczna głowa - https://commons.wikimedia.org/wiki/File:Georg_Neumann_Ku_100_Dummy_Head.jpg
Wideo 2. Nagranie koncertu ze wstępem o sztucznej głowie wykorzystywanej do rejestracji
Czy wiesz, że… ?
Jedną z metod pomiaru HRTF są nagrania wykonywane z użyciem „sztucznej głowy” – manekina o realistycznych proporcjach anatomicznych [3].
4. Historia i rozwój technologii binauralnej
Pierwsze badania nad dźwiękiem binauralnym sięgają początków XX wieku [3]. W latach 30. i 40. XX wieku powstawały prototypy urządzeń przypominających późniejsze „sztuczne głowy”, umożliwiające wierniejsze odwzorowanie wrażeń przestrzennych w słuchawkach.
Szersze zainteresowanie technologią binauralną nastąpiło w latach 70., kiedy pojawiły się pierwsze komercyjne nagrania binauralne, wykorzystywane w muzyce eksperymentalnej i testach psychoakustycznych [3]. Kolejny etap rozwoju to lata 90. – wraz z upowszechnieniem cyfrowego przetwarzania sygnału (DSP) możliwa stała się symulacja przestrzeni akustycznej w czasie rzeczywistym, co znalazło zastosowanie m.in. w grach komputerowych [3].
Obecnie technologia dźwięku przestrzennego, w tym dźwięk binauralny, staje się integralnym elementem codziennych praktyk produkcyjnych i odsłuchowych. Dominacja słuchawek w słuchaniu muzyki, oglądaniu filmów czy korzystaniu z gier komputerowych sprawia, że technologia ta znajduje naturalne środowisko rozwoju. Współczesne systemy audio umożliwiają renderowanie różnych formatów przestrzennych – od klasycznego stereo, poprzez rozwiązania obiektowe (np. Dolby Atmos), aż po ambisonię – do postaci sygnału binauralnego przeznaczonego dla słuchawek [10].
Wideo 3. 3D Audio Post-Production (with DELTA Soundworks)

Rys. 5. Najważniejsze etapy rozwoju technologii binauralnej
Każde z tych podejść ma swoje miejsce: konwersja stereo pozwala w prosty sposób wzbogacić tradycyjne nagrania, Dolby Atmos zapewnia precyzyjne pozycjonowanie obiektów dźwiękowych, a ambisonia oferuje elastyczne odwzorowanie sferycznego pola dźwiękowego, szczególnie w aplikacjach VR i grach [11].
Wideo 3. Render binauralny z Dolby ATMOS z wizualizacją obiektów
5. Interaktywność i immersja
Jednym z kluczowych atutów odsłuchu binauralnego jest zdolność do tworzenia wrażenia immersji. W odróżnieniu od tradycyjnych systemów stereo, scena dźwiękowa w binauralu rozciąga się wokół słuchacza, obejmując także kierunki z tyłu i z góry [1].
W klasycznym odsłuchu słuchawkowym scena akustyczna porusza się wraz z głową słuchacza. Systemy interaktywne rozwiązują ten problem: scena zostaje „przypisana” do przestrzeni, a nie do głowy użytkownika. Dzięki śledzeniu ruchu głowy i bieżącej aktualizacji renderowania dźwięku, źródła pozostają nieruchome w otoczeniu [7].
Badania psychoakustyczne pokazują, że nawet niewielkie mikroruchy głowy dostarczają mózgowi dodatkowych wskazówek, poprawiając rozróżnianie kierunku przód–tył oraz ogólną precyzję lokalizacji [6].
Co istotne, ta interaktywność nie jest ograniczona do laboratoriów – coraz częściej korzysta się z urządzeń używanych na co dzień, np. słuchawek bezprzewodowych podłączonych do smartfonu, które dzięki czujnikom ruchu obsługują dynamiczny rendering binauralny [10].

Rys. 6. Nowoczesne słuchawki z czujnikami ruchu. https://commons.wikimedia.org/wiki/File:AirPods_%28cropped%29.jpg
6. Technologia binauralna dla różnych formatów dźwięku przestrzennego
Aby możliwy był odsłuch dźwięku 3D w słuchawkach, nagrania w formatach przestrzennych muszą zostać przeliczone („wyrenderowane”) do postaci binauralnej. Proces ten odbywa się w rendererze binauralnym, czyli oprogramowaniu lub module sprzętowym, który interpretuje informacje przestrzenne i odwzorowuje je w dwóch kanałach słuchawkowych z uwzględnieniem HRTF. W praktyce funkcjonuje wiele wariantów rendererów, różniących się zakresem obsługiwanych formatów, algorytmami oraz jakością modelowania percepcji słuchowej.
W systemach obiektowych, takich jak Dolby Atmos, dźwięk jest opisywany jako zbiór obiektów dźwiękowych przypisanych do konkretnych pozycji w przestrzeni. Renderer binauralny przekształca te informacje w odpowiednie sygnały HRTF dla każdego ucha, zachowując możliwość precyzyjnego pozycjonowania źródeł. Oprócz obiektów przestrzennych Atmos zawiera także tzw. bed tracks – warstwy dźwięku tła (np. muzyki, efektów ogólnych), które są renderowane jako scena dźwiękowa.
Innym podejściem jest ambisonia, w której całe pole dźwiękowe wokół słuchacza opisywane jest matematycznie w postaci współczynników sferycznych. Renderer konwertuje ten opis na sygnał binauralny, umożliwiając swobodne „obracanie” sceny wraz z ruchem głowy. To rozwiązanie szczególnie często stosowane jest w wirtualnej i rozszerzonej rzeczywistości, gdzie dynamika otoczenia wymaga elastycznego i interaktywnego renderowania.
W grach komputerowych coraz częściej stosuje się renderowanie obiektowe w czasie rzeczywistym. Każdy efekt dźwiękowy – krok, strzał, dźwięk otoczenia – traktowany jest jako odrębny obiekt akustyczny. Renderer binauralny odpowiada za to, by w słuchawkach gracza znalazł się on w odpowiednim miejscu przestrzeni, reagując na zmieniającą się pozycję postaci i ruchy głowy użytkownika.
Dzięki tym rozwiązaniom formaty przestrzenne stają się kompatybilne z powszechnie używanym sprzętem słuchawkowym, a jakość odbioru zależy od klasy renderera, poziomu personalizacji HRTF i możliwości obliczeniowych systemu. W efekcie nawet złożone wielokanałowe nagrania mogą być wiernie odtworzone w dwóch kanałach dedykowanych do odsłuchu binauralnego.
7. Aktualne trendy, wyzwania i perspektywy
Rozwój technologii binauralnych przyspiesza w wielu obszarach jednocześnie. Szczególnie dynamicznie rozwija się personalizacja HRTF [4]. Nowoczesne systemy wykorzystują skanowanie 3D uszu lub algorytmy uczenia maszynowego [9,5].
Wideo 4. Personalizacja HRTF – Genelec
Równolegle obserwujemy rosnącą obecność treści binauralnych w streamingu. Apple Music, Tidal czy Netflix udostępniają coraz więcej treści w formatach przestrzennych, które można odsłuchiwać na zwykłych słuchawkach [10].

Rys. 9. Streaming w formatach przestrzennych
W środowisku produkcyjnym rośnie znaczenie ambisonii, czyli opisu pola akustycznego w formie matematycznej [11]. Ambisonia znajduje zastosowania w grach i projektach VR, gdzie możliwość „obracania” sceny akustycznej wraz z ruchem użytkownika jest kluczowa.
Technologie binauralne zyskują znaczenie także w edukacji i terapii. Immersyjny dźwięk wspiera proces uczenia się w środowiskach symulacyjnych (np. w szkoleniach medycznych), a także w rehabilitacji słuchu i terapii psychologicznej [5,8].
Mimo intensywnego rozwoju, przed binauralnością stoją wyzwania: różnice indywidualne w percepcji, trudności w personalizacji HRTF [2], nakład obliczeniowy renderowania [7] czy problemy kompatybilności formatów. Wciąż aktualne są też ograniczenia percepcyjne (np. kierunek przód–tył, wysokość źródła) [6,8].
Patrząc w przyszłość, binauralność ma ogromny potencjał. Integracja z VR, AR i metaverse może sprawić, że stanie się kluczowym elementem wirtualnych światów [10]. Prace nad standaryzacją formatów i tworzeniem baz HRTF mogą ułatwić jej powszechne wdrożenie [9]. Zastosowania praktyczne obejmują edukację, rehabilitację, koncerty online, kino domowe i aplikacje mobilne [5].
Bibliografia
[1] Blauert, J. (1997). Spatial Hearing: The Psychophysics of Human Sound Localization. MIT Press.
[2] Møller, H., Sørensen, M. F., Jensen, C. B., & Hammershøi, D. (1995). Head-related transfer functions of human subjects. Journal of the Audio Engineering Society, 43(5), 300–321.
[3] Begault, D. R. (2000). 3-D Sound for Virtual Reality and Multimedia. NASA Ames Research Center.
[4] Lindau, A., Weinzierl, S., & Vorländer, M. (2014). Perceptual evaluation of headphone auralization of rooms captured with spherical microphone arrays. Journal of the Acoustical Society of America, 136(3), 1239–1252.
[5] Małecki, P., Stefańska, J., & Szydłowska, M. (2024). Assessing spatial audio in immersive systems. Archives of Acoustics, 49(1), 45–56. doi:10.24425/aoa.2024.148798
[6] Middlebrooks, J. C., & Green, D. M. (1991). Sound localization by human listeners. Annual Review of Psychology, 42(1), 135–159. https://doi.org/10.1146/annurev.ps.42.020191.001031
[7] Wierstorf, H., Geier, M., Ahrens, J., & Spors, S. (2015). A free database of head-related impulse response measurements in the horizontal plane with multiple distances. AES Convention Papers.
[8] Nowak, P., & Zera, J. (2018). Analiza wskazówek lokalizacyjnych w warunkach odsłuchu słuchawkowego. Archives of Acoustics, 43(4), 591–601.
[9] Algazi, V. R., Duda, R. O., Thompson, D. M., & Avendano, C. (2001). The CIPIC HRTF database. Proceedings of the IEEE Workshop on Applications of Signal Processing to Audio and Acoustics.
[10] Dolby Laboratories. (2022). Dolby Atmos for Headphones. Retrieved from https://www.dolby.com
[11] Zotter, F., & Frank, M. (2019). Ambisonics: A Practical 3D Audio Theory for Recording, Studio Production, Sound Reinforcement and Virtual Auditory Display. Springer.
