Белгородские ученые создали программу, которая мгновенно выделяет звуки выстрелов, бьющегося стекла и способна «засечь» опасное действие

Белгородские ученые создали программу, которая мгновенно выделяет звуки выстрелов, бьющегося стекла и способна «засечь» опасное действие

Исследователи института инженерных и цифровых технологий Белгородского государственного университета разработали программу ЭВМ «Автоматизированная система мониторинга тревожных ситуаций», которая анализирует спектрограммы аудиосигнала с помощью свёрточных нейронных сетей. Искусственный интеллект видит звук как графический отпечаток и учится безошибочно считывать с него признаки опасности.

Руководитель группы разработчиков программного модуля, заведующая кафедрой автоматизированных систем и технологий Татьяна Балабанова поясняет, что идея программы органично выросла из научного задела, созданного в рамках программы «Приоритет-2030».

Мы реализуем проект по распознаванию эмоций в речи. А когда возникло направление по распознаванию агрессии по речевому сигналу, возникла идея сделать что-то актуальное для безопасности – распознавание тревожных звуков. Так что работа над проектом дала дополнительные прикладные результаты, – рассказала Татьяна Балабанова.

Главное преимущество программного модуля – устойчивость к помехам. Нейросеть обучали на датасете из более чем 250 естественных шумов: пение петухов, шум машин, человеческие голоса. Разработчики добились того, что нейросеть устойчива к акустическим иллюзиям, на которые может попасться классический частотный анализ.

Например, наша программа не путает звуки бьющегося стекла и посторонние звуки, даже если они похожи. Некоторые проезжающие автомобили издают звуки, очень похожие на выстрелы, наша программа чётко это разграничивает, – подчёркивает Татьяна Балабанова.

Стоит отметить, что задача распознавания опасных звуков не нова. В США существует аналогичная система ShotSpotter, которую используют правоохранительные органы некоторых штатов. Принципы работы зарубежного аналога не раскрывают, но университетская разработка – это чисто программное решение на облегчённых свёрточных нейросетях. Объём софта составляет около 200 Мб, что позволяет развернуть систему на обычном персональном компьютере со звуковой картой, без суперкомпьютеров и закупки специализированного «железа».

Ещё один стратегический плюс – возможность интеграции программного модуля в существующую инфраструктуру. Повсеместно установленные камеры видеонаблюдения в подавляющем большинстве оснащены микрофонами. Именно по звуку программа способна «засечь» опасное действие даже там, где камера бессильна – в «слепой зоне», за углом или в толпе.

Работу как дипломный проект начала Анастасия Кузичкина, сегодня её продолжает третьекурсник Георгий Канцибер. Перед разработчиками стоит амбициозная задача перевести модуль из режима фрагментарного анализа в режим непрерывного мониторинга потока аудиоданных. К концу 2026 года систему планируют вывести на тесты в естественной городской среде, чтобы подтвердить её эффективность в режиме реального города.

Учёные не намерены останавливаться на достигнутом. В перспективе – добавить способность обнаруживать агрессивную речь и крик, чтобы система предупреждала об опасности ещё на стадии назревающего конфликта.

Крики и агрессивная речь почти всегда предшествуют каким-то опасным действиям, поэтому в дальнейшем мы планируем добавить в программный модуль детекцию выкриков, агрессивной речи, – говорит Татьяна Балабанова

Разработка сможет найти применение в многослойной системе превентивной безопасности аэропортов, вокзалов, учебных заведений и при организации массовых мероприятий.

Источник: Минобрнауки России

Ученые изучили глубину проникновения солнечного ветра в минералы лунного грунта
Ириски и риски: ученые выяснили, почему любители сладкого чаще делают импульсивный выбор