AI Voice Assistant на NVIDIA Jetson
Технологический стек
- Python
- Flask
- Faster Whisper
- CUDA
- NVIDIA Jetson
- Docker
- Local LLM
- Nginx
- Bitrix24 API
Задача
Для онлайн-встреч требовался локальный процесс записи, транскрибации и последующей AI-обработки. Решение должно было работать на доступном NVIDIA Jetson и предоставляться как защищённый внутренний сервис.
Что я сделал
- Создал Flask MVP для записи встреч и транскрибации аудио через Faster Whisper.
- Перенёс пайплайн на NVIDIA Jetson, задействовал CUDA и упаковал сервис в Docker.
- Добавил авторизованный HTTPS-доступ, экспорт транскриптов в TXT, обработку локальной LLM и интеграцию с Bitrix24.
Архитектура
meeting audio → recording service → Faster Whisper transcription → stored transcript → local LLM / Bitrix24 workflow
Браузеры предоставляют доступ к микрофону только в защищённом контексте, поэтому приложение публиковалось по HTTPS. DNAT направлял порты 80 и 443 на Nginx, чтобы выпустить SSL-сертификат и передавать голосовой интерфейс через TLS. Контейнеризация обеспечивала воспроизводимость speech- и application-зависимостей на edge-устройстве.
Результат
- Выполнены end-to-end развёртывание и проверка на Jetson.
- Получен защищённый внутренний сервис транскрибации с точками интеграции для AI-обработки и бизнес-системы.