Белгородские ученые создали программу мониторинга тревожных ситуаций

Исследователи института инженерных и цифровых технологий Белгородского государственного университета (БелГУ) разработали программный модуль, который в автоматическом режиме распознает тревожные аудиосигналы в городском шуме, мгновенно выделяя из него звуки выстрелов, бьющегося стекла и другие сигналы, указывающие на опасные действия. Получено свидетельство о государственной регистрации программы для ЭВМ.

Программа анализирует спектрограммы аудиосигнала с помощью сверточных нейронных сетей. Искусственный интеллект видит звук как графический отпечаток и учится безошибочно считывать с него признаки опасности.

«Мы реализуем проект по распознаванию эмоций в речи. А когда возникло направление по распознаванию агрессии по речевому сигналу, возникла идея сделать что-то актуальное для безопасности — распознавание тревожных звуков. Так что работа над проектом дала дополнительные прикладные результаты», — рассказала руководитель группы разработчиков программного модуля, заведующая кафедрой автоматизированных систем и технологий БелГУ Татьяна Балабанова.

Главное преимущество программного модуля — устойчивость к помехам. Нейросеть обучали на датасете из более чем 250 естественных шумов: пение петухов, шум машин, человеческие голоса. Разработчики добились того, что нейросеть устойчива к акустическим иллюзиям, на которые может попасться классический частотный анализ.

«Например, наша программа не путает звуки бьющегося стекла и посторонние звуки, даже если они похожи. Некоторые проезжающие автомобили издают звуки, очень похожие на выстрелы, наша программа четко это разграничивает», — подчеркнула Татьяна Балабанова.

Еще один стратегический плюс — возможность интеграции программного модуля в существующую инфраструктуру. Повсеместно установленные камеры видеонаблюдения в подавляющем большинстве оснащены микрофонами. Именно по звуку программа способна «засечь» опасное действие даже там, где камера бессильна — в «слепой зоне», за углом или в толпе. Объем софта составляет около 200 Мб, что позволяет развернуть систему на обычном персональном компьютере со звуковой картой, без суперкомпьютеров и закупки специализированного «железа».

Сейчас перед разработчиками стоит задача перевести модуль из режима фрагментарного анализа в режим непрерывного мониторинга потока аудиоданных. К концу 2026 года систему планируют протестировать в естественной городской среде, чтобы подтвердить ее эффективность в режиме реального города.

В дальнейшем ученые намерены добавить в программу способность обнаруживать агрессивную речь и крик, чтобы система предупреждала об опасности еще на стадии назревающего конфликта.

«Крики и агрессивная речь почти всегда предшествуют каким-то опасным действиям, поэтому в дальнейшем мы планируем добавить в программный модуль детекцию выкриков, агрессивной речи, — объяснила ученый.

По оценкам разработчиков, система сможет найти применение в многослойной системе превентивной безопасности аэропортов, вокзалов, учебных заведений и при организации массовых мероприятий.