Исследователи института инженерных и цифровых технологий Белгородского государственного университета разработали программу ЭВМ «Автоматизированная система мониторинга тревожных ситуаций», которая анализирует спектрограммы аудиосигнала с помощью свёрточных нейронных сетей. Искусственный интеллект видит звук как графический отпечаток и учится безошибочно считывать с него признаки опасности.
Руководитель группы разработчиков программного модуля, заведующая кафедрой автоматизированных систем и технологий Татьяна Балабанова поясняет, что идея программы органично выросла из научного задела, созданного в рамках программы «Приоритет-2030».
Мы реализуем проект по распознаванию эмоций в речи. А когда возникло направление по распознаванию агрессии по речевому сигналу, возникла идея сделать что-то актуальное для безопасности – распознавание тревожных звуков. Так что работа над проектом дала дополнительные прикладные результаты, – рассказала Татьяна Балабанова.
Главное преимущество программного модуля – устойчивость к помехам. Нейросеть обучали на датасете из более чем 250 естественных шумов: пение петухов, шум машин, человеческие голоса. Разработчики добились того, что нейросеть устойчива к акустическим иллюзиям, на которые может попасться классический частотный анализ.
Например, наша программа не путает звуки бьющегося стекла и посторонние звуки, даже если они похожи. Некоторые проезжающие автомобили издают звуки, очень похожие на выстрелы, наша программа чётко это разграничивает, – подчёркивает Татьяна Балабанова.
Стоит отметить, что задача распознавания опасных звуков не нова. В США существует аналогичная система ShotSpotter, которую используют правоохранительные органы некоторых штатов. Принципы работы зарубежного аналога не раскрывают, но университетская разработка – это чисто программное решение на облегчённых свёрточных нейросетях. Объём софта составляет около 200 Мб, что позволяет развернуть систему на обычном персональном компьютере со звуковой картой, без суперкомпьютеров и закупки специализированного «железа».
Ещё один стратегический плюс – возможность интеграции программного модуля в существующую инфраструктуру. Повсеместно установленные камеры видеонаблюдения в подавляющем большинстве оснащены микрофонами. Именно по звуку программа способна «засечь» опасное действие даже там, где камера бессильна – в «слепой зоне», за углом или в толпе.
Работу как дипломный проект начала Анастасия Кузичкина, сегодня её продолжает третьекурсник Георгий Канцибер. Перед разработчиками стоит амбициозная задача перевести модуль из режима фрагментарного анализа в режим непрерывного мониторинга потока аудиоданных. К концу 2026 года систему планируют вывести на тесты в естественной городской среде, чтобы подтвердить её эффективность в режиме реального города.
Учёные не намерены останавливаться на достигнутом. В перспективе – добавить способность обнаруживать агрессивную речь и крик, чтобы система предупреждала об опасности ещё на стадии назревающего конфликта.
Крики и агрессивная речь почти всегда предшествуют каким-то опасным действиям, поэтому в дальнейшем мы планируем добавить в программный модуль детекцию выкриков, агрессивной речи, – говорит Татьяна Балабанова
Разработка сможет найти применение в многослойной системе превентивной безопасности аэропортов, вокзалов, учебных заведений и при организации массовых мероприятий.
Источник: Минобрнауки России


