Голосовая аутентификация в дипломе: учёт состояния говорящего как фактор защиты
В марте 2026 года учёные ОмГТУ представили метод голосовой аутентификации, который анализирует не только голосовые характеристики, но и психоэмоциональное состояние человека. Это значит, что система способна отличить запись спокойной речи от взволнованной — даже если говорит один и тот же человек. Для ИТ-дипломов такой подход открывает сразу несколько перспективных направлений: от проектирования многофакторных систем до разработки алгоритмов анти-спуфинга.
Ниже — как техническую новость превратить в защищённую ВКР, какие задачи ставить и какие метрики собирать.
- Ссылка на статью ОмГТУ указана во введении или обзоре литературы
- Каждая задача подтверждена результатом (таблица, график, код)
- Присутствует схема архитектуры (UML-диаграмма компонентов или последовательности)
- Метрики EER, FAR, FRR рассчитаны и интерпретированы
- Работа проверена на соответствие ГОСТ 34.602-89 (ТЗ) или ГОСТ Р ИСО/МЭК 25010 (качество ПО)
- В приложении есть скриншоты интерфейса или логи тестирования
Темы ВКР на основе разработки ОмГТУ
1. Система голосовой аутентификации с учётом эмоционального контекста
Актуальность: существующие решения (например, VoiceIt или Microsoft Speaker Recognition) не учитывают эмоциональную вариативность, что приводит к ложным отказам при стрессе. Метод омских учёных показывает, что учёт состояния снижает EER на 12–15%.
Цель: разработать прототип системы, которая классифицирует эмоцию (спокойствие / тревога / радость) и использует эту метку при сравнении голосовых слепков.
Задачи:
- Собрать и размеченный датасет (например, RAVDESS + собственная запись)
- Спроектировать пайплайн: извлечение MFCC → DNN-классификатор эмоций → i-векторное сравнение
- Реализовать REST API на FastAPI для интеграции с веб-интерфейсом
- Провести нагрузочное тестирование (1000 запросов, RTO ≤ 2 с)
Структура: Глава 1 — обзор биометрических методов и стандартов ISO/IEC 19795; Глава 2 — архитектура, диаграммы прецедентов, схема БД; Глава 3 — реализация и оценка точности.
2. Анализ влияния шума на качество голосовой аутентификации в гетерогенной среде
Актуальность: в статье подчёркивается, что состояние говорящего — не единственный фактор; шум (улица, офис, ветер) деградирует точность. При проектировании реальных систем этот аспект часто упускают.
Цель: экспериментально оценить ухудшение метрик FAR/FRR при разных SNR (20, 10, 0 дБ) и предложить метод компенсации (фильтрация + обучение на зашумлённых данных).
Задачи:
- Подготовить чистый и зашумлённый датасеты (NOISEX-92 + собственные записи)
- Реализовать baseline (GMM-UBM) и предложенный pipeline (x-вектор + адаптивная фильтрация)
- Построить ROC-кривые для каждого уровня шума
- Оценить вычислительную сложность (flops) — обосновать целесообразность для edge-устройств
Структура: Глава 1 — теория акустического моделирования; Глава 2 — план эксперимента, инструментарий (Python, librosa, Kaldi); Глава 3 — результаты и рекомендации по внедрению.
3. Прототип голосовой аутентификации для IoT с защитой от спуфинга
Актуальность: метод ОмГТУ потенциально устойчив к атакам повторного воспроизведения, так как динамика эмоции сложна для имитации. Это можно развить в дипломе.
Цель: разработать embedded-систему на Raspberry Pi, которая выполняет голосовую аутентификацию с анти-спуфинг-модулем (Live Voice Detection).
Задачи:
- Выбрать микропроцессорную платформу и аудио-модуль (ReSpeaker или USB-микрофон)
- Портировать lite-версию модели (TFLite или ONNX) на устройство
- Реализовать детектор атаки: проверка на естественные паузы, спектральные аномалии
- Сравнить время выполнения на RPi 4 и RPi 5
Структура: Глава 1 — обзор IoT-биометрии и спуфинг-атак; Глава 2 — архитектура «облако + edge»; Глава 3 — экономическая оценка (TCO, срок окупаемости).
Применяем статью в разделах диплома
Аналитическая глава: почему GMM-UBM уступает DNN
В вашем обзоре нужно сравнить классические методы (Gaussian Mixture Model — Universal Background Model) и современные нейросетевые подходы. Разработка ОмГТУ базируется на DNN-экстракторах — это аргумент в пользу выбора глубокого обучения. Совет: включите таблицу сравнения:
| Критерий | GMM-UBM | DNN (x-вектор) | Метод ОмГТУ |
|---|---|---|---|
| EER (чистая речь) | 7.2% | 4.8% | 3.9% |
| Чувствительность к эмоциям | высокая | средняя | низкая (учёт состояния) |
| Размер модели | 10 МБ | 40 МБ | 55 МБ |
| Скорость инференса (CPU) | 8 мс | 25 мс | 32 мс |
Проектная часть: архитектура и интеграция
Что заимствуем из статьи: концепцию двухэтапного анализа — сначала детектор состояния (эмоции), затем голосовое сравнение. В вашей ВКР это можно реализовать как последовательность микросервисов:
- Audio Preprocessor: нормализация, удаление шума (MLS-фильтр)
- Emotion Predictor: CNN с архитектурой VGG-like, обученный на RAVDESS
- Voice Comparator: x-vector + PLDA, порог принятия решения адаптируется под эмоцию
- API Gateway: оркестрация, кэширование результатов
Добавьте UML-диаграмму последовательности для сценария «аутентификация после неудачной попытки». Укажите, как учитывается требование ГОСТ 34.602-89 к ТЗ: «система должна обеспечивать вероятность ложного доступа не более 0.001».
Тестирование и метрики
Кроме стандартных FAR/FRR, для дипломов с уклоном в безопасность потребуются:
- RTO (Recovery Time Objective) — время восстановления пайплайна после сбоя (≤ 2 мин)
- RPO (Recovery Point Objective) — потеря данных при отказе не более 1 минуты
- Нагрузочное тестирование: JMeter или Locust — 1000 виртуальных пользователей, аптайм 99.5%
Пример из статьи: «система ОмГТУ обрабатывает запрос за 1.2 с на GPU Nvidia T4». Сравните с вашей реализацией — даже если показатели скромнее, это показывает понимание ограничений.
Чему вы научитесь, сделав такой диплом
- Проектировать пайплайны обработки аудио в реальном времени
- Обосновывать выбор стека (Python vs C++, ONNX vs TensorRT) с метриками
- Строить ROC-кривые, считать DET-кривые — обязательный навык для биометрических систем
- Оформлять техническую документацию по ГОСТ 34.602-89 и ISO/IEC 25010
- Проводить экономическое обоснование (TCO, NPV) — для комиссии это сильный плюс
- Подмена терминов «аутентификация» и «верификация». Исправляется на этапе постановки задачи: аутентификация — 1:N, верификация — 1:1. В статье ОмГТУ речь об аутентификации.
- Отсутствие анти-спуфинг-модуля. Даже простой детектор жизни (обнаружение микро-пауз) повышает доверие комиссии.
- Игнорирование требований к данным. Нельзя просто скачать датасет — нужно обосновать, почему он репрезентативен (пол, возраст, язык). Используйте стандарт ISO/IEC 24745.
FAQ: частые вопросы студентов
Сложно ли реализовать учёт эмоций с нуля?
Можно взять предобученную модель (например speechbrain/emotion-recognition-wav2vec2) и дообучить на своих данных. Основная работа — не в написании нейросети, а в интеграции. Код займёт 300–400 строк.
Обязательно ли писать код? Или можно сделать чисто исследовательскую работу?
Зависит от вуза. Для «Архитектуры ПО» код обязателен (prototype, REST API). Для «Информационной безопасности» допустимо исследование с расчётами, но лучше подкрепить прототипом.
Где брать размеченные данные для диплома?
Открытые датасеты: RAVDESS, CREMA-D, TESS. Если нет эмоциональной разметки — используйте VoxCeleb (только голос). Для имитации состояния можно привлечь тестовую группу из 5–10 человек.
Как оформить UML-диаграммы, чтобы не придрались?
Используйте PlantUML или Draw.io. Минимум: диаграмма прецедентов (Use Case), диаграмма последовательности (Sequence) для основного сценария, диаграмма развёртывания (Deployment). Подпишите каждый элемент и укажите версию документа.
Источник: В Омском политехе разработали систему голосовой аутентификации (опубликовано 2026-03-16)
```