Evaluation of Data Augmentation Techniques of Room Impulse Responses for improved AI-based estimations
Zusammenfassung:
Überwachtes Training neuronaler Netze benötigt eine Vielzahl von Daten damit das entstehende Model gut generalisiert ohne überangepasst sein. In der Raumakustik stellt dies oftmals eine Hürde für maschinelles Lernen dar, da der Ausgangspunkt für viele Schätzungen Messungen der Raumimpulsantwort (RIA) ist. RIAs sind meist nur in kleinen Datensätzen vorhanden und enthalten nicht immer die benötigten Annotationen. In diesem Beitrag werden mögliche Verfahren zur Erweiterung von Datensätzen beleuchtet, die dieses Problem lindern sollen. Neben der offensichtlichen Erweiterung mittels synthetischer Daten durch Raumsimulationen (z.B. Spiegelschallquellenmodel) fokussiert sich dieser Beitrag auf die Adaption gängiger Augmentationsverfahren aus dem Audiobereich, wie dem Hinzufügen von Rauschen, Pitch-Shift, Time-Stretch, Masking oder Mixup. Zudem werden RIA-spezifische Ansätze beleuchtet. Hierzu gehören neben der Variation des Direct-to-Reverberant Ratio (DRR) auch Modifizierung der Nachhallzeit und die Modifizierung der Direct-to-Reverberant Gap. Alle Verfahren wurden anhand zweier raumakustischer Schätzaufgaben überprüft, der DRR Schätzung und der Schätzung der Nachhallzeit. Die Ergebnisse variieren stark je nach Verfahren, können vereinzelt jedoch zu Verbesserungen von bis zu 70% führen.