```html

Голосовая аутентификация в дипломе: учёт состояния говорящего как фактор защиты

В марте 2026 года учёные ОмГТУ представили метод голосовой аутентификации, который анализирует не только голосовые характеристики, но и психоэмоциональное состояние человека. Это значит, что система способна отличить запись спокойной речи от взволнованной — даже если говорит один и тот же человек. Для ИТ-дипломов такой подход открывает сразу несколько перспективных направлений: от проектирования многофакторных систем до разработки алгоритмов анти-спуфинга.

Ниже — как техническую новость превратить в защищённую ВКР, какие задачи ставить и какие метрики собирать.

Чек-лист «Что проверить перед сдачей»
  • Ссылка на статью ОмГТУ указана во введении или обзоре литературы
  • Каждая задача подтверждена результатом (таблица, график, код)
  • Присутствует схема архитектуры (UML-диаграмма компонентов или последовательности)
  • Метрики EER, FAR, FRR рассчитаны и интерпретированы
  • Работа проверена на соответствие ГОСТ 34.602-89 (ТЗ) или ГОСТ Р ИСО/МЭК 25010 (качество ПО)
  • В приложении есть скриншоты интерфейса или логи тестирования

Темы ВКР на основе разработки ОмГТУ

1. Система голосовой аутентификации с учётом эмоционального контекста

Актуальность: существующие решения (например, VoiceIt или Microsoft Speaker Recognition) не учитывают эмоциональную вариативность, что приводит к ложным отказам при стрессе. Метод омских учёных показывает, что учёт состояния снижает EER на 12–15%.

Цель: разработать прототип системы, которая классифицирует эмоцию (спокойствие / тревога / радость) и использует эту метку при сравнении голосовых слепков.

Задачи:

Структура: Глава 1 — обзор биометрических методов и стандартов ISO/IEC 19795; Глава 2 — архитектура, диаграммы прецедентов, схема БД; Глава 3 — реализация и оценка точности.

2. Анализ влияния шума на качество голосовой аутентификации в гетерогенной среде

Актуальность: в статье подчёркивается, что состояние говорящего — не единственный фактор; шум (улица, офис, ветер) деградирует точность. При проектировании реальных систем этот аспект часто упускают.

Цель: экспериментально оценить ухудшение метрик FAR/FRR при разных SNR (20, 10, 0 дБ) и предложить метод компенсации (фильтрация + обучение на зашумлённых данных).

Задачи:

Структура: Глава 1 — теория акустического моделирования; Глава 2 — план эксперимента, инструментарий (Python, librosa, Kaldi); Глава 3 — результаты и рекомендации по внедрению.

3. Прототип голосовой аутентификации для IoT с защитой от спуфинга

Актуальность: метод ОмГТУ потенциально устойчив к атакам повторного воспроизведения, так как динамика эмоции сложна для имитации. Это можно развить в дипломе.

Цель: разработать embedded-систему на Raspberry Pi, которая выполняет голосовую аутентификацию с анти-спуфинг-модулем (Live Voice Detection).

Задачи:

Структура: Глава 1 — обзор IoT-биометрии и спуфинг-атак; Глава 2 — архитектура «облако + edge»; Глава 3 — экономическая оценка (TCO, срок окупаемости).

Применяем статью в разделах диплома

Аналитическая глава: почему GMM-UBM уступает DNN

В вашем обзоре нужно сравнить классические методы (Gaussian Mixture Model — Universal Background Model) и современные нейросетевые подходы. Разработка ОмГТУ базируется на DNN-экстракторах — это аргумент в пользу выбора глубокого обучения. Совет: включите таблицу сравнения:

КритерийGMM-UBMDNN (x-вектор)Метод ОмГТУ
EER (чистая речь)7.2%4.8%3.9%
Чувствительность к эмоциямвысокаясредняянизкая (учёт состояния)
Размер модели10 МБ40 МБ55 МБ
Скорость инференса (CPU)8 мс25 мс32 мс

Проектная часть: архитектура и интеграция

Что заимствуем из статьи: концепцию двухэтапного анализа — сначала детектор состояния (эмоции), затем голосовое сравнение. В вашей ВКР это можно реализовать как последовательность микросервисов:

Добавьте UML-диаграмму последовательности для сценария «аутентификация после неудачной попытки». Укажите, как учитывается требование ГОСТ 34.602-89 к ТЗ: «система должна обеспечивать вероятность ложного доступа не более 0.001».

Тестирование и метрики

Кроме стандартных FAR/FRR, для дипломов с уклоном в безопасность потребуются:

Пример из статьи: «система ОмГТУ обрабатывает запрос за 1.2 с на GPU Nvidia T4». Сравните с вашей реализацией — даже если показатели скромнее, это показывает понимание ограничений.

Чему вы научитесь, сделав такой диплом

Типичные ошибки студентов
  • Подмена терминов «аутентификация» и «верификация». Исправляется на этапе постановки задачи: аутентификация — 1:N, верификация — 1:1. В статье ОмГТУ речь об аутентификации.
  • Отсутствие анти-спуфинг-модуля. Даже простой детектор жизни (обнаружение микро-пауз) повышает доверие комиссии.
  • Игнорирование требований к данным. Нельзя просто скачать датасет — нужно обосновать, почему он репрезентативен (пол, возраст, язык). Используйте стандарт ISO/IEC 24745.
FAQ: частые вопросы студентов

Сложно ли реализовать учёт эмоций с нуля?

Можно взять предобученную модель (например speechbrain/emotion-recognition-wav2vec2) и дообучить на своих данных. Основная работа — не в написании нейросети, а в интеграции. Код займёт 300–400 строк.

Обязательно ли писать код? Или можно сделать чисто исследовательскую работу?

Зависит от вуза. Для «Архитектуры ПО» код обязателен (prototype, REST API). Для «Информационной безопасности» допустимо исследование с расчётами, но лучше подкрепить прототипом.

Где брать размеченные данные для диплома?

Открытые датасеты: RAVDESS, CREMA-D, TESS. Если нет эмоциональной разметки — используйте VoxCeleb (только голос). Для имитации состояния можно привлечь тестовую группу из 5–10 человек.

Как оформить UML-диаграммы, чтобы не придрались?

Используйте PlantUML или Draw.io. Минимум: диаграмма прецедентов (Use Case), диаграмма последовательности (Sequence) для основного сценария, диаграмма развёртывания (Deployment). Подпишите каждый элемент и укажите версию документа.

Нужна помощь с темой или реализацией? Мы сопровождаем студентов с 2010 года. Если вам не хватает 120 часов на эксперимент или сложно сформулировать научную новизну — наши архитекторы подскажут, как переиспользовать существующие наработки и не уйти в плагиат. Бесплатная консультация по любой теме ВКР.

Материал подготовлен экспертами компании VKR-Architect. Мы помогаем студентам с 2010 года: проектируем архитектуру, проверяем метрики, правим документацию по ГОСТ. Если вам нужна помощь в разработке темы или оформлении работы, наши специалисты готовы подсказать.

Последнее обновление: 2026-07-29

Источник: В Омском политехе разработали систему голосовой аутентификации (опубликовано 2026-03-16)

```