Оценка разборчивости речи в архитектурной и электроакустике не сводится к простому измерению уровня звукового давления или времени реверберации. Речь — это сложный информационный сигнал, и помещение (или система звукоусиления) выступает в роли канала передачи, который вносит искажения.
Когда мы проектируем лекционный зал, диспетчерскую, аэропорт или систему оповещения о пожаре (СОУЭ), главный вопрос звучит так: «Будет ли каждое слово понято слушателем?».
Время реверберации (T30) или уровень звукового давления (SPL) не дают прямого ответа на этот вопрос. Единственным объективным, математически строгим и признанным на международном уровне параметром, который связывает физику звукового поля с человеческим слухом, является STI (Speech Transmission Index — Индекс передачи речи)
В программном комплексе AFMG EASE 4.4 для объективного и математически строгого описания этих искажений используется аппарат Модуляционных передаточных функций (MTF), на базе которого вычисляются индексы STI (Speech Transmission Index) и его упрощенная версия RASTI.
Ниже подробно рассмотрена физическая и математическая суть этих параметров, алгоритмы их расчета и особенности реализации в среде EASE 4.4, без привязки к конкретным типам помещений.
Речь как амплитудно-модулированный сигнал
Акустический сигнал речи можно представить не просто как набор частот, а как высокочастотную несущую (заполняющую определенные октавные полосы), амплитуда которой постоянно и быстро изменяется. Эти низкочастотные изменения огибающей сигнала (в диапазоне от 0.63 Гц до 12.5 Гц) называются речевыми модуляциями. Именно они несут основную информацию о согласных и гласных звуках.
Помещение как фильтр нижних частот для модуляций
Когда звуковая волна распространяется в помещении, прямой сигнал интерферирует с отражениями. Реверберационный процесс «размывает» звуковую энергию во времени. С точки зрения теории информации, помещение действует как фильтр нижних частот для речевых модуляций:
MTF (Modulation Transfer Function) — это математическая функция, которая количественно описывает, как помещение ослабляет глубину модуляции на каждой из 14 частот модуляции (F) в каждой из 7 октавных полос аудиоспектра.
Значение MTF (m) лежит в диапазоне от 0 до 1:
Математическое определение MTF
В EASE 4.4 MTF вычисляется непосредственно из рассчитанной импульсной характеристики (IR) помещения для каждой октавной полосы с помощью преобразования Фурье m(F), где F — частота модуляции (от 0.63 до 12.5 Гц).
Частота модуляции F | Безэховая камера | Лекционный зал (T30=0.6с) | Концертный зал (T30=2.0с) | Собор (T30=5.0с) |
0.63 Гц | 1.00 | 0.98 | 0.95 | 0.88 |
1.0 Гц | 1.00 | 0.97 | 0.93 | 0.82 |
2.0 Гц | 1.00 | 0.95 | 0.85 | 0.65 |
4.0 Гц | 1.00 | 0.90 | 0.70 | 0.35 |
8.0 Гц | 1.00 | 0.82 | 0.50 | 0.15 |
12.5 Гц | 1.00 | 0.75 | 0.35 | 0.05 |
STI — это итоговый безразмерный коэффициент (от 0 до 1), который интегрирует значения MTF по всем частотным полосам и частотам модуляции, применяя психоакустические весовые коэффициенты. Алгоритм расчета STI, реализованный в EASE 4.4, строго соответствует международному стандарту IEC 60268-16.
Пошаговый алгоритм расчета STI в EASE 4.4
Шаг 1. Частотное разбиение Аудиоспектр речи разбивается на 7 октавных полос (от 125 Гц до 8000 Гц).
Шаг 2. Учет спектра голоса (14 полос) Каждая из 7 октав делится на две подполосы с разными весовыми коэффициентами: α (имитирует спектр мужского голоса) и β (имитирует спектр женского голоса). Таким образом, расчет ведется для 14 частотных полос.
Шаг 3. Расчет кажущегося соотношения сигнал/шум (SNRapp) Для каждой из 14 полос и каждой из 14 частот модуляции значение MTF пересчитывается в эквивалентное соотношение сигнал/шум в децибелах:
Шаг 4. Ограничение (Clip-функция) Психоакустические исследования показали, что человеческий слух не может извлечь полезную информацию из речи, если шум превышает полезный сигнал более чем на 15 дБ. Аналогично, улучшение соотношения сигнал/шум выше +15 дБ не приводит к дальнейшему росту разборчивости. EASE 4.4 жестко ограничивает (клиппирует) все значения SNRapp диапазоном от -15 дБ до +15 дБ.
Шаг 5. Расчет индекса передачи (TI) Ограниченное значение SNRapp переводится в локальный индекс передачи (Transmission Index) для каждой полосы, который теперь строго лежит в диапазоне от 0 до 1:
Шаг 6. Итоговое усреднение Все полученные значения TI (всего их 196: 7 октав × 2 голоса × 14 частот модуляции) усредняются с учетом весовых коэффициентов важности каждой полосы для восприятия речи. Результатом является финальное значение STI.
В EASE 4.4 расчет может вестись в двух вариантах:
Математика учета шума
Фоновый шум действует аналогично реверберации — он снижает глубину речевых модуляций, «заполняя» паузы между звуками. В EASE 4.4 эффективная MTF с учетом шума (Mtot) рассчитывается путем комбинации MTF, обусловленной реверберацией (Mrev), и MTF, обусловленной шумом (Mnoise).
Если уровень фонового шума задан в виде спектра (в дБ по октавным полосам), программа вычисляет снижение модуляции из-за шума и объединяет его с реверберационным снижением. Это приводит к падению значения SNRapp на Шаге 3, что неизбежно снижает итоговый индекс STI+N по сравнению с «чистым» STI.
RASTI был разработан в 1980-х годах как компромисс между точностью полного STI и вычислительными ограничениями портативных измерительных приборов того времени.
Отличия RASTI от полного STI
RASTI — это упрощенная и более быстрая версия STI. Она использует только 2 октавные полосы (500 Гц и 2000 Гц, наиболее важные для разборчивости речи) и 9 частот модуляции (от 0.63 Гц до 4.0 Гц). Всего получается 2×9=18 значений.
Почему RASTI устарел?
Несмотря на скорость, RASTI имеет критические методологические недостатки:
Статус в AFMG EASE 4.4: Программа сохраняет возможность расчета RASTI исключительно для обеспечения обратной совместимости со старыми проектами, архивными данными и некоторыми устаревшими локальными нормативами. Для современного проектирования и прохождения экспертиз необходимо использовать только полный алгоритм STI.
В среде EASE 4.4 расчет параметров разборчивости речи является автоматизированным пост-процессингом, неразрывно связанным с основным акустическим моделированием.
Расчет STI в AFMG EASE 4.4 позволяет напрямую доказать соответствие проекта строгим нормативным требованиям:
Значение STI | Качественная оценка | Субъективное восприятие | Применение |
0.75 – 1.00 | Отлично | Превосходная разборчивость, низкая утомляемость | Студии вещания, залы суда, операционные |
0.60 – 0.75 | Хорошо | Высокая разборчивость, комфортное восприятие | Лекционные залы, классы, театры, диспетчерские |
0.50 – 0.60 | Удовлетворительно | Речь понятна, но требует концентрации | Многофункциональные залы, музеи, церкви |
0.45 – 0.50 | Плохо | Разборчивость на пределе, минимум для СОУЭ | Вокзалы, аэропорты, арены (высокий фон) |
0.30 – 0.45 | Очень плохо | Понятно менее 70% слов | Бассейны, производственные цеха |
< 0.30 | Катастрофически | Речь неразборчива | Соборы, пещеры, открытые стадионы |
Если расчет показал STI ниже целевого значения, инженер использует EASE 4.4 для поиска решения. Вот типичные сценарии:
Сценарий А: Низкий STI из-за реверберации (Архитектурная проблема)
Сценарий Б: Низкий STI из-за эха (Геометрическая проблема)
Сценарий В: Низкий STI+Noise из-за шума (Электроакустическая проблема)
Параметры T30, C50 и C80 описывают физику помещения. Параметр STI описывает восприятие человека.
Использование полного алгоритма STI (на базе MTF) в AFMG EASE 4.4 позволяет инженерам отказаться от догадок и перейти к точному математическому прогнозированию. Вы точно знаете, как каждое отражение, каждый децибел шума и каждая частотная модуляция повлияют на способность слушателя разобрать слово.
Отказ от устаревшего RASTI в пользу полного STI — это не просто дань моде, а требование современных стандартов и залог того, что спроектированная система будет работать безупречно в реальных условиях.
Переход от субъективных оценок разборчивости к математическому аппарату MTF и STI стал революцией в акустике. AFMG EASE 4.4, реализующая алгоритм IEC 60268-16, позволяет инженерам точно прогнозировать, как реверберационные процессы и фоновые шумы повлияют на передачу речевых модуляций.
Понимание физической сути MTF и строгости алгоритма вычисления STI (включая клиппирование и весовые коэффициенты) необходимо для корректной интерпретации результатов расчета и принятия обоснованных проектных решений по оптимизации акустики помещений и систем звукоусиления. Использование устаревшего RASTI в современных задачах не рекомендуется из-за его низкой информативности и несоответствия актуальным международным стандартам.