LIVE
Новость

Омские студенты создали ИИ-диктофон с полной обработкой данных на устройстве

По данным TV BRICS со ссылкой на сайт вуза, решение транскрибирует речь, индексирует записи и поддерживает поиск по ключевым словам без обращения к облачным сервисам.

Яков Новиков·обновлено 24 августа 2026 г.

Омские студенты создали ИИ-диктофон с полной обработкой данных на устройстве

Студенты Омского государственного технического университета представили прототип ИИ-диктофона, который ведёт полный цикл обработки голоса на самом устройстве. По данным TV BRICS со ссылкой на сайт вуза, решение транскрибирует речь, индексирует записи и поддерживает поиск по ключевым словам без обращения к облачным сервисам. Для ниши разговорного AI это конкретный пример переноса ASR-пайплайна из серверной в edge-сегмент — с понятными продуктовыми последствиями.

Логика пайплайна

Пользовательский флоу разбит на три шага: захват аудио, локальная транскрибация, индексация. На первом этапе приложение (его тестировали на смартфоне) пишет звук и параллельно прогоняет его через on-device ASR. На втором — модель возвращает текст и таймкоды, которые сохраняются вместе с аудиодорожкой. На третьем — текстовый слой разбирается на токены и ложится в индекс для последующего поиска.

Ключевое архитектурное решение — отказ от облака. ИИ «живёт» непосредственно на устройстве, поэтому сырой звук и расшифровки не покидают замкнутый контур. Для продукта это даёт три измеримых эффекта: стабильная latency без зависимости от сети, нулевой риск утечки персональных данных и работоспособность в сценариях без стабильного интернета.

Что это меняет для метрик

Перенос распознавания на устройство снимает классический edge-кейс — отказ сценария при потере связи. В привычных облачных диктофонах именно сетевая ошибка останавливает транскрибацию: запись копится, текст не появляется, конверсия use-case проседает. Локальный инференс убирает эту развилку и возвращает сценарий в зону выполнения.

Дальше — поиск. Индексируемая структура превращает диктофон из аудио-черновика в полноценный персональный слой заметок: пользователь находит запись не по памяти, а по точному термину. Для голосовых ассистентов и TTS-сценариев это означает, что накопленный речевой материал становится пригодным для последующего клонирования, ресинтеза или обучения персонализированных голосовых моделей — при сохранении приватности.

Что отслеживать

  • Конкретная модель на устройстве — от неё зависят список поддерживаемых языков и качество распознавания.
  • Размер дистрибутива и потребление RAM при потоковом ASR.
  • Энергопотребление в фоне — длительное распознавание заметно съедает батарею смартфона.
  • Метрики качества (WER, latency на типичной фразе) и готовность к выходу за пределы студенческого прототипа.